Volver a la lista

Estadística del valor E de BLAST: Convierte alineamientos en probabilidades con la distribución de valores extremos de Gumbel

Por qué el puntaje de alineamiento en sí no tiene significado y por qué el valor E es decisivo. Cómo las estadísticas de Karlin-Altschul y la distribución de valores extremos de Gumbel convierten los alineamientos en probabilidades. Cómo establecer umbrales de valor E en la práctica.

Intermedio
|
15min
|
Verificado (2026-07-19)
E-valueKarlin-AltschulGumbel distributionstatistical significance
Progreso0/120 (0%)

¿Por qué es necesaria esta sección?

En la sección anterior sobre M10, analizamos cómo BLAST encuentra alineamientos candidatos. Sin embargo, queda una pregunta fundamental: ¿es significativa una puntuación de alineamiento de 200? ¿Deberíamos ignorar secuencias que coinciden apenas con un puntaje de 3? ¿Qué pasa con 100 o 500?

La respuesta es que la puntuación de alineamiento en sí misma carece de significado; lo importante es la probabilidad de obtener esa puntuación por azar. Esta probabilidad se mide mediante el valor E (Expect value). Esta estadística, establecida a principios de la década de 1990 por Samuel Karlin y Stephen Altschul, es fundamental para interpretar los resultados de BLAST.

En esta sección, definimos, derivamos y establecemos los umbrales prácticos del valor E. Además, explicaremos de manera elegante cómo surge la distribución de valores extremos de Gumbel en este contexto.

Definición: ¿qué es el valor E?

E representa el número esperado de alineamientos obtenidos por azar que alcanzan o superan la puntuación S en una base de datos de un tamaño dado.

E=KmneλSE = K \cdot m \cdot n \cdot e^{-\lambda S}
  • m: longitud de la consulta (query)
  • n: tamaño total de la base de datos
  • λ\lambda: constante de escala de la puntuación de alineamiento (BLOSUM62 con gaps: λ0.267\lambda \approx 0.267)
  • K: constante que depende de los parámetros de búsqueda (BLOSUM62 con gaps: K0.041K \approx 0.041)

El significado es el siguiente.

  • E = 0.001: Una puntuación de alineamiento con este valor ocurre por azar solo una vez cada 1000 intentos. Es altamente significativo.
  • E = 1: Es probable que aparezca al menos uno por casualidad. No tiene significancia estadística.
  • E = 100: Incluso por azar, pueden aparecer hasta 100 casos. Carece completamente de significado.

Convencionalmente, se utiliza frecuentemente E < 10⁻⁵ como umbral de significancia. Sin embargo, esto depende del propósito específico.

¿Por qué aparece la distribución extrema de Gumbel?

Este es el aspecto más elegante de esta sección.

Al realizar múltiples intentos de alineamiento local en pares de secuencias aleatorias, cada puntuación de alineamiento sigue una determinada distribución. En particular, lo que nos interesa es la distribución del valor máximo. Es decir, "¿cuál es la puntuación de alineamiento más alta que se puede obtener por casualidad en esta base de datos?".

Según los resultados de la estadística de valores extremos, bajo condiciones muy amplias, la distribución del valor máximo converge a uno de tres tipos. Entre ellos, la distribución de Gumbel se aplica a las puntuaciones de alineamiento de BLAST.

P(SmaxS)1eKmneλSP(S_{\max} \ge S) \approx 1 - e^{-K m n e^{-\lambda S}}

Dado que 1exx1 - e^{-x} \approx x cuando KmneλSKmne^{-\lambda S} es pequeño,

P(SmaxS)KmneλS=EP(S_{\max} \ge S) \approx K m n e^{-\lambda S} = E

Es decir, el valor E es exactamente una aproximación de esta probabilidad. Además, al extraer múltiples alineamientos, se aplica la aproximación de Poisson.

P(k o maˊs alineamientos por azar)=1i=0k1EieEi!P(\text{k o más alineamientos por azar}) = 1 - \sum_{i=0}^{k-1} \frac{E^i e^{-E}}{i!}

Constantes de Karlin-Altschul K y λ\lambda

Los valores K y λ\lambda se determinan según la matriz de puntuación de alineamiento utilizada (como BLOSUM62) y las penalizaciones por huecos. Se calculan mediante dos ecuaciones derivadas por Karlin-Altschul.

λ\lambda define el escalado logarítmico del cociente de verosimilitud de la puntuación de alineamiento. Su significado radica en establecer la base del logaritmo, y en la mayoría de los casos prácticos se calcula automáticamente. K es una constante que determina el número esperado de alineamientos.

En los resultados de BLAST, estos dos valores se muestran explícitamente.

text
Lambda      K
0.267    0.041

Con estos dos valores, es posible convertir la puntuación de alineamiento a un valor E.

Cálculo del valor E en Python

python
import math
def evalue_from_score(score: float, m: int, n: int,
K: float = 0.041, lam: float = 0.267) -> float:
"""E-value para alineamiento con huecos de BLOSUM62."""
return K * m * n * math.exp(-lam * score)
# Significancia de una puntuación de 100 al buscar nr (5 × 10^11 pb)
# con la consulta BRCA1 (2000 pb)
m = 2000
n = int(5e11)
for score in [50, 100, 150, 200, 300]:
e = evalue_from_score(score, m, n)
print(f"Score {score}: E = {e:.2e}")
# Score 50: E = 1.20e+08
# Score 100: E = 3.35e-02
# Score 150: E = 9.34e-12
# Score 200: E = 2.61e-21
# Score 300: E = 2.03e-40

Observaciones:

  • Una puntuación de 50 aparece aproximadamente 100 millones de veces por casualidad; carece de significado biológico.
  • El umbral de significancia se encuentra cerca de una puntuación de 100.
  • Las puntuaciones de 150 en adelante son claramente significativas.

El hecho de que el E-value sea una función exponencial de la puntuación surge naturalmente de la derivación basada en la distribución de Gumbel.

Puntuación en bits — puntuación normalizada

Los resultados de BLAST incluyen, junto con la puntuación bruta (raw score), la puntuación en bits.

S=λSlnKln2S' = \frac{\lambda S - \ln K}{\ln 2}

La ventaja de la puntuación en bits es que λ\lambda y K están normalizados. Es decir, representan el valor teórico de la información del alineamiento independientemente del tamaño de la base de datos.

La relación entre el valor E y la puntuación en bits es la siguiente:

E=mn2SE = mn \cdot 2^{-S'}

Una puntuación en bits de 40 significa que hay 40 bits de información por cada coincidencia. Una puntuación en bits superior a 100 indica una significancia clara.

Pruebas múltiples — Cuanto mayor es la base de datos, mayor es el valor E

Para la misma puntuación de alineamiento, el valor E aumenta automáticamente al incrementarse el tamaño de la base de datos. Por ejemplo, si se multiplica n por 10, el valor E también se multiplica por 10. Esto es una manifestación natural del problema de las pruebas múltiples.

Un alineamiento que fue significativo en una base de datos pequeña podría explicarse por casualidad en una base de datos más grande. Por lo tanto, el umbral del valor E debe ajustarse junto con el tamaño de la base de datos.

  • nr (5 × 10¹¹ pb): Es habitual un valor E < 10⁻⁵
  • refseq_rna (100 veces más pequeña): Si se desea mantener la misma significancia, podría relajarse a un valor E < 10⁻³
  • Base de datos de autoalineamiento (1 × 10⁸): Un valor E < 10⁻² aproximadamente

Esto es análogo al ajuste de Benjamini-Hochberg tratado en DESeq2 de M09. A medida que aumenta el número de pruebas, los umbrales de significancia deben ajustarse (hacerse más estrictos).

Práctica — Interpretación del valor E en los resultados de NCBI BLAST

Observemos los siguientes campos de los resultados obtenidos al buscar una secuencia de interés en la web de NCBI BLAST.

  • Score (Bits): puntuación en bits
  • E value: número esperado de coincidencias por azar
  • Identities: porcentaje de identidad
  • Query cover: porcentaje de la consulta que se ha alineado

Un E value muy pequeño (por ejemplo, 0.0 o del orden de 1e-100) indica una coincidencia fuerte. Si el E value está cerca de 1, debe interpretarse con cautela.

Trampas prácticas frecuentes

  • Obsesión por el valor absoluto del E-value: La diferencia práctica entre un E = 10⁻⁴ y uno de 10⁻⁵ puede no ser significativa. Evalúe junto con la puntuación en bits.
  • Bases de datos de baja calidad: Si la base de datos contiene secuencias contaminadas, la significancia del E-value se distorsiona. Las bases de datos curadas como RefSeq y UniProt tienen mayor fiabilidad.
  • E-value de PSI-BLAST: PSI-BLAST construye un perfil mediante búsquedas iterativas y amplía las coincidencias. En este proceso, el E-value se recalcula en cada iteración. Con muchas iteraciones, la línea entre coincidencias reales y fortuitas se vuelve difusa.
  • E-value de búsquedas traducidas (tblastn · blastx): Dado que se examinan las seis marcos de lectura (tres hacia adelante y tres hacia atrás), el número efectivo de comparaciones (m) se multiplica por seis. Esto debe tenerse en cuenta al interpretar el E-value.

Mapeo CS

  • Estadística de valores extremos: El primo de la ley de los grandes números. El hecho de que el puntaje máximo ordenado converja a una distribución de Gumbel es una teoría general sobre la distribución de valores extremos que emerge cuando el tamaño de la muestra aumenta.
  • Pruebas múltiples: Las pruebas DESeq2 para 20 000 genes, el tamaño de la base de datos en BLAST y el número de píxeles en una imagen se rigen por el mismo principio. Cuantas más pruebas se realicen, más estricto debe ser el umbral.
  • Razón de verosimilitud logarítmica e información: La definición del puntaje bit coincide exactamente con la cantidad de bits en la teoría de la información. Aquí permanece viva la base de las teorías de comunicación, búsqueda y compresión.

Ramas hacia el siguiente capítulo

  • Siguiente capítulo (M12): Construcción de un servidor BLAST local — Búsqueda local con tus propios datos.
  • Dos capítulos después (M13): Tries de sufijos y arreglos — Refinamiento de las estructuras de datos del índice de BLAST.
  • Seis capítulos después (M17): DIAMOND — Aceleración 100 veces mayor para la búsqueda a gran escala de proteínas.
  • Dieciocho capítulos después (S19): DESeq2 y Benjamini-Hochberg — Manejo ortodoxo del problema de las pruebas múltiples.

Para profundizar más

El texto principal es una narrativa reconstruida por BPD. Para profundizar, consulta lo siguiente.

  • MIT 7.91J — Profesora Christopher Burge de Local Alignment Statistics (con subtítulos). Deriva matemáticamente con rigor las estadísticas de Karlin-Altschul.
  • Artículo original: Karlin, S. & Altschul, S. F. (1990), Methods for assessing the statistical significance of molecular sequence features, PNAS 87, 2264–2268. El origen de la teoría del valor E.
  • Artículo original: Altschul, S. F. et al. (1997), Gapped BLAST and PSI-BLAST, Nucleic Acids Res 25, 3389–3402. Consolidación en la práctica profesional.
  • Libro de referencia: Ewens & Grant Statistical Methods in Bioinformatics, capítulo 7. Texto canónico.
  • Manual de NCBIBLAST Statistics. Interpretación práctica de los parámetros.

Observa varios resultados de BLAST de NCBI y desarrolla una intuición sobre en qué umbral el valor E se vuelve significativo. Esto te llevará a comprender naturalmente por qué es necesario el servidor de BLAST local del módulo M12.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...