¿Por qué es necesaria esta sección?
En las secciones anteriores sobre alineamiento (M06~M08), hemos utilizado convencionalmente los puntajes de coincidencia +1 y discrepancia -1. Sin embargo, nunca nos hemos preguntado cómo se determinan realmente estos números. ¿Qué valores debemos utilizar para medir adecuadamente la similitud evolutiva real entre dos secuencias? Y, además, ¿de dónde se derivan dichos valores?
En esta sección abordamos el método para derivar puntajes de alineamiento a partir de probabilidades evolutivas observadas. El resultado son las matrices PAM (1978, Margaret Dayhoff) y las matrices BLOSUM (1992, Steven Henikoff · Jorja Henikoff). La respuesta a por qué la BLOSUM62, que es la base predeterminada de herramientas como BLAST y los alineadores de proteínas, se denomina "62" y por qué está construida con ese número específico, es el objetivo de esta sección.
Idea — Razón de verosimilitud logarítmica (Log Odds)
¿Cómo medimos si la alineación de dos aminoácidos a y b refleja una relación evolutiva o es simplemente casual?
- Hipótesis de relación (evolutiva): Las dos secuencias derivan de un ancestro común, y
aybson el resultado de sustituciones desde ese ancestro. Denotamos esta probabilidad como . - Hipótesis de no relación (casual): Las dos secuencias no están relacionadas, y la coexistencia de
aybse debe al producto de sus frecuencias en estado estacionario. Denotamos esta probabilidad comof_a f_b.
Definimos el puntaje de alineamiento como la razón de verosimilitud logarítmica entre estas dos probabilidades.
es una constante de escala (que generalmente tiene el significado de definir la base del logaritmo). Con esta definición, la suma de los puntajes equivale a la razón de verosimilitud logarítmica total del alineamiento. Un puntaje de alineamiento alto indica que la hipótesis de relación es mucho más plausible que la hipótesis de no relación.
Esta definición reemplaza naturalmente los valores fijos de coincidencia +1 y discrepancia -1. Ahora queda determinar cómo extraer y f_a a partir de datos reales.
PAM — Perspectiva evolutiva
Margaret Dayhoff siguió el siguiente procedimiento en 1978:
- Recopilar pares de proteínas alineadas de especies muy cercanas. Con una similitud de secuencia superior al 85%.
- Contar las sustituciones observadas para crear la matriz de probabilidad de sustitución
M. - Definir que
Mrepresenta exactamente "el tiempo evolutivo de 1 PAM (Mutación Aceptada)". 1 PAM ≈ el tiempo necesario para que se sustituya 1 posición de cada 100. - Derivar la matriz de puntajes de alineamiento para el tiempo evolutivo de
kPAM utilizando la razón de verosimilitud logarítmica deM^k. PAM1 es para especies muy cercanas, PAM120 para intermedias y PAM250 para especies distantes.
Aquí se huele intensamente a cadenas de Markov. Multiplicar M varias veces corresponde al desplazamiento de estado en una cadena de Markov con k pasos. Esto es una extensión del modelo Jukes-Cantor de M03 al nivel de aminoácidos.
BLOSUM — Una perspectiva observacional
Steven y Jorja Henikoff siguieron el siguiente procedimiento en 1992:
- Recopilar regiones cortas alineadas localmente de la base de datos de bloques de proteínas bien curada (BLOCKS).
- Fusionar las secuencias con una similitud superior a un umbral específico (por ejemplo, 62%) en un solo clúster para eliminar sesgos.
- Observar directamente la frecuencia de pares de aminoácidos entre clústeres como . Utilizar únicamente las observaciones, sin extensiones de Markov como
M^k. - Construir matrices de puntuación de alineación mediante el logaritmo de la razón de verosimilitud (log-odds).
Lo obtenido con un umbral del 62% es BLOSUM62. Un umbral más bajo (por ejemplo, BLOSUM45) se aplica a relaciones filogenéticas lejanas, mientras que uno más alto (por ejemplo, BLOSUM80) se aplica a relaciones cercanas.
Dado que BLOSUM no requiere la suposición de Markov, es teóricamente más robusto y tiene un mejor rendimiento en la práctica que PAM. Esta es la razón por la cual BLOSUM62 es la base de BLAST.
Algunos valores reales de BLOSUM62
Se muestran algunos en una tabla (dado que es una matriz simétrica, solo se muestra la mitad).
| A | R | N | D | C | E | |
|---|---|---|---|---|---|---|
| A | 4 | −1 | −2 | −2 | 0 | −1 |
| R | 5 | 0 | −2 | −3 | 0 | |
| N | 6 | 1 | −3 | 0 | ||
| D | 6 | −3 | 2 | |||
| C | 9 | −4 | ||||
| E | 5 |
Destacan varias observaciones:
- La diagonal (coincidencia consigo mismo) es siempre positiva, pero su magnitud varía según el aminoácido. W (triptófano) tiene 11 y C (cisteína) tiene 9, valores particularmente altos debido a que evolutivamente son poco propensos a cambiar.
- Los pares de aminoácidos con propiedades químicas similares (por ejemplo, D↔E, ambos ácidos) tienen puntuaciones positivas (2). Son posiciones físicamente químicamente intercambiables.
- Los pares con propiedades completamente diferentes (por ejemplo, C↔E) tienen valores muy negativos (−4), lo que indica que la probabilidad de observar esta sustitución es menor que por azar.
Ahora se intuye de dónde provienen estos números: se derivan del logaritmo de la razón de verosimilitud a partir de las frecuencias de sustitución observadas.
Cargar BLOSUM62 con Python y puntuar alineaciones
# Cargar BLOSUM62 (con Biopython)from Bio.Align import substitution_matricesblosum62 = substitution_matrices.load("BLOSUM62")
def score_alignment(x: str, y: str) -> int: """Puntuación de un alineamiento simple sin huecos; las longitudes deben coincidir.""" assert len(x) == len(y) return sum(blosum62[a, b] for a, b in zip(x, y))
# Ejemploprint(score_alignment("WEAT", "WEAK")) # 11 + 5 + 4 + 5 = 25print(score_alignment("WEAT", "MEAL")) # -2 + 5 + 4 + -1 = 6Al comparar ambos alineamientos, el primero presenta una similitud mucho mayor: en la última posición T↔K conserva cierta similitud fisicoquímica, a diferencia de T↔L. La diferencia de puntuación lo refleja.
Verificación con Rosalind
El problema de Rosalind relacionado con BLOSUM pide calcular una puntuación de alineamiento con BLOSUM62. Se obtiene la respuesta al añadir al código anterior una penalización de hueco (por convención, apertura -11 y extensión -1, el estándar de BLOSUM62).
¿Cuándo usar PAM y BLOSUM?
| Situación | Recomendación |
|---|---|
| Especies cercanas (similitud ≥80%) | BLOSUM80 · PAM30 |
| Distancia intermedia (similitud del 40~60%) | BLOSUM62 (predeterminada en BLAST) |
| Especies distantes (similitud del 20~40%) | BLOSUM45 · PAM250 |
| Especies muy distantes (similitud <20%) | PAM250 |
Por regla general, BLOSUM62 es la opción predeterminada. Se utiliza salvo que exista un motivo concreto para elegir otra matriz.
Errores comunes en la práctica
- Uso erróneo de BLOSUM para alinear ADN: BLOSUM y PAM son exclusivas del alineamiento de proteínas (20 aminoácidos). Para alinear ADN (cuatro nucleótidos) se emplean otras matrices, como NUC.4.4.
- Coherencia entre matriz y penalización de huecos: por convención, BLOSUM62 se usa con apertura de hueco −11 y extensión −1. Otras combinaciones alteran considerablemente el alineamiento e impiden calcular correctamente su significación estadística (valor E).
- Alineamiento tras traducir frente a alineamiento de ADN: en secuencias codificantes de especies evolutivamente distantes, es más preciso traducirlas y alinear las proteínas que alinear directamente el ADN. tblastn y blastx funcionan según este principio.
- Interpretación equivocada de PAM: PAM1 es una unidad de distancia evolutiva, no de similitud. PAM250 sirve para relaciones distantes porque representa el transcurso de 250 unidades de tiempo evolutivo.
Conexiones con la informática
- Razón de verosimilitud logarítmica (Log-Likelihood Ratio): concepto central de la teoría de la información y la estadística. La relación señal-ruido en comunicaciones y la actualización de probabilidades previas en el diagnóstico médico responden al mismo principio.
- Cadena de Markov: la extensión
M^kde una matriz PAM es una transición de estados de Markov. También constituye la raíz de los HMM de M18~M21. - Inferencia de parámetros a partir de observaciones: BLOSUM transforma las frecuencias observadas en puntuaciones mediante razones de verosimilitud logarítmicas. Es una aplicación real de la estimación de máxima verosimilitud (MLE); el mismo razonamiento reaparece después en GATK, DESeq2 y otras herramientas.
Continuación en la siguiente sección
- Próximo artículo (M10): BLAST — heurística de alineamiento local que utiliza BLOSUM62.
- Dos capítulos después (M11): Valor E de BLAST — Significancia estadística del puntaje de alineamiento. El hecho de que los puntajes BLOSUM sean log-verosimilitud se utiliza aquí de manera decisiva.
- Nueve capítulos después (M18~M21): HMM — Modelo de probabilidad de transición de estados. El pensamiento markoviano de PAM se extiende.
- Dieciséis capítulos después (M25): Alineamiento múltiple de secuencias — Descubrimiento de regiones de similitud local en múltiples secuencias mediante BLOSUM62.
Para profundizar más
El texto principal es una narrativa reconstruida por la propia BPD. Para profundizar, consulte lo siguiente:
- MIT 7.91J — Profesora Christopher Burge Substitution Matrices and Alignment Scoring (subtítulos completos, traducción automática superior al 95%). Aborda rigurosamente las matemáticas de la derivación de la log-verosimilitud.
- UCSD CSE 182 — Profesor Pavel Pevzner BLOSUM and PAM: Substitution Matrices. Examina en detalle el algoritmo de los esposos Henikoff.
- Artículo original: Henikoff, S. & Henikoff, J. G. (1992), Amino acid substitution matrices from protein blocks, PNAS 89, 10915–10919. El artículo fundacional de BLOSUM.
- Artículo original: Dayhoff, M. O. et al. (1978), A model of evolutionary change in proteins. Atlas of Protein Sequence and Structure. El artículo fundacional de PAM.
- Libro de texto de referencia: Durbin et al. Biological Sequence Analysis Capítulo 2.
Resuelva los problemas relacionados con BLOSUM y los problemas estadísticos para prepararse para M11 en Rosalind. Además, introduzca dos proteínas de su interés en BLAST y observe el puntaje de alineamiento y el valor E utilizando BLOSUM62. Esto le permitirá comprender naturalmente el principio de BLAST del siguiente capítulo, M10.