¿Por qué las secuencias de tres o más son un tema diferente?
En los apartados M06 a M09 se trató el alineamiento por pares entre dos secuencias. Se utilizó la técnica de llenado de rejilla de Needleman-Wunsch. Sin embargo, en la práctica es mucho más frecuente necesitar alinear múltiples secuencias simultáneamente. Esto es esencial en estudios de evolución de familias de proteínas, reconstrucción de filogenias y entrenamiento de perfiles HMM. Lo que se requiere en estos casos es el alineamiento múltiple de secuencias (Multiple Sequence Alignment, MSA).
En esta sección se aborda por qué no basta con realizar alineamientos por pares múltiples veces, cómo funciona la estrategia de alineamiento progresivo propuesta inicialmente por ClustalW y por qué MAFFT se ha convertido en el estándar actual. Se inicia así el Micro §M.6.
¿Por qué no sirve hacer múltiples alineamientos por pares?
Si tenemos tres secuencias A, B y C, ¿qué ocurre si realizamos por separado los alineamientos A-B, B-C y A-C? Los tres resultados son contradictorios entre sí.
Por ejemplo, en el alineamiento A-B podría aparecer un hueco en la quinta posición de A, mientras que en el alineamiento A-C esa quinta posición de A podría conservar su carácter original. Para incluir las tres secuencias en una única tabla de alineamiento, las posiciones de los huecos deben ser consistentes.
El método exacto consistiría en llenar un espacio de N dimensiones. Es una extensión del algoritmo de Needleman-Wunsch. Para tres secuencias se usa un espacio tridimensional, para cuatro uno cuatridimensional y para N secuencias uno de N dimensiones. La complejidad temporal y espacial explota a O(L^N). Con solo cinco secuencias de 500 pb cada una, el cálculo resulta imposible.
El MSA exacto es NP-completo. Por ello, todas las herramientas prácticas utilizan algoritmos aproximados. El alineamiento progresivo es el ejemplo más representativo.
Alineamiento progresivo — Estrategia de 3 pasos
La estrategia propuesta por ClustalW (1994, Higgins et al.) es la siguiente:
- Matriz de distancias: Calcular los puntajes (o distancias) de los alineamientos por pares entre todos los pares de secuencias.
- Árbol guía: Construir un filogenia a partir de la matriz de distancias (generalmente mediante métodos NJ o UPGMA).
- Fusión progresiva: Recorrer el árbol guía desde las hojas hacia la raíz, fusionando secuencialmente los alineamientos de las secuencias o grupos más cercanos primero.
La idea central es: alinear primero los elementos más cercanos y mantener ese alineamiento mientras se añaden las secuencias más distantes. De este modo, no es necesario expandir el espacio multidimensional y cada fusión se resuelve mediante un único alineamiento por pares.
Ejemplo sencillo para familiarizarse
Cuatro secuencias, cada una de 6 pb.
S1: ACGTAC
S2: ACGTAG
S3: ACCTAG
S4: TCCTAGPaso 1: Cálculo de distancias
Calcule las puntuaciones de alineación por pares (por ejemplo, utilizando un esquema de distancia de edición con coincidencia = -1 y no coincidencia = +1) para los seis pares.
| S1 | S2 | S3 | S4 | |
|---|---|---|---|---|
| S1 | 0 | 1 | 2 | 3 |
| S2 | 1 | 0 | 1 | 2 |
| S3 | 2 | 1 | 0 | 1 |
| S4 | 3 | 2 | 1 | 0 |
Paso 2: Construcción del árbol guía
Agregue los pares más cercanos según la matriz de distancias, utilizando el método de Neighbor-Joining (NJ). El resultado aproximado es:
((S1, S2), (S3, S4))Paso 3 — Fusión progresiva:
- Alinear el par más cercano: alineación de S1-S2 →
ACGTAC / ACGTAG - Alinear otro par: alineación de S3-S4 →
ACCTAG / TCCTAG - Fusionar los dos grupos de alineación (alineación entre perfiles)
ACGTAC
ACGTAG
ACCTAG
TCCTAGAsí se completa un MSA. Dado que cada paso es un alineamiento por pares (algoritmo N-W), la escala computacional es manejable.
Alineamiento de perfiles
En el tercer paso de la fusión progresiva, al combinar dos grupos de alineamientos, cada grupo ya contiene múltiples secuencias alineadas. Esto se resume en un perfil por columna (frecuencia de aminoácidos en cada columna), y se alinean los perfiles entre sí.
La puntuación del alineamiento entre el perfil A y el perfil B se define como el producto escalar de los vectores de probabilidad por columna (o la suma de las razones de probabilidades logarítmicas). La estructura básica del llenado de la matriz de Needleman-Wunsch se mantiene, y solo se amplía la función de puntuación.
Gracias a este truco, cada paso de fusión mantiene la complejidad temporal y espacial de O(mn) del alineamiento por pares, independientemente del tamaño del grupo.
Limitaciones del alineamiento progresivo: "Una vez que se introduce un hueco, siempre permanece"
ClustalW tiene una debilidad importante: los huecos introducidos incorrectamente al principio nunca se corrigen posteriormente. Si se fusionaron en un orden incorrecto según el árbol guía, esos huecos persisten.
Se han propuesto dos enfoques para resolver este problema:
Refinamiento iterativo (MUSCLE, T-Coffee): Después de crear el MSA inicial, se extrae una secuencia a la vez, se realinea y se vuelve a insertar. Se repite el proceso.
Puntuación basada en la consistencia (T-Coffee, ProbCons): Se optimiza conjuntamente la consistencia de las puntuaciones del alineamiento por pares (la concordancia entre las puntuaciones obtenidas a través de otras secuencias y las puntuaciones directas).
MAFFT: el estándar actual
MAFFT, desarrollado por Katoh & Standley(NAR 2013), es actualmente el estándar de facto. Hay tres razones:
- Optimización FFT: Las secuencias se convierten en vectores de densidad de volumen y luego se calcula la similitud a alta velocidad mediante la Transformada Rápida de Fourier. El alineamiento por pares se guía a partir de una matriz precalculada.
- Múltiples modos:
--autoselecciona automáticamente el algoritmo según el número y la longitud de las secuencias (FFT-NS-2, L-INS-i, etc.). - Refinamiento iterativo: Después de procesar rápidamente grandes cantidades de secuencias con FFT, si se requiere mayor precisión, se utiliza la opción de refinamiento iterativo(
--maxiterate 1000 --localpair).
Recomendaciones prácticas:
- Menos de cientos de secuencias + prioridad a la precisión:
mafft --localpair --maxiterate 1000 input.fasta > out.fasta(L-INS-i) - Miles a decenas de miles de secuencias + prioridad a la velocidad:
mafft --auto input.fasta > out.fasta - Conjunto de datos muy grande: partición mediante la opción
mafft --retree 1 --parttree
Ejercicio práctico: MAFFT CLI
# Instalación (Colab o Ubuntu)sudo apt-get install mafftmafft --version
# Alineamiento pequeño (hasta 10 secuencias)mafft --localpair --maxiterate 1000 my_proteins.fasta > my_msa.aln
# Alineamiento grande (modo auto)mafft --auto my_proteins.fasta > my_msa.aln
# Guardar en formato Stockholm compatible con HMMERmafft --auto --outputformat stockholm my_proteins.fasta > my_msa.stoAl abrir el archivo de alineación resultante, se puede observar que se han insertado huecos (-) antes de las secuencias, lo que permite que cada columna represente posiciones homólogas. Al visualizarlo con un visor como Jalview, las regiones conservadas y las regiones variables se hacen evidentes mediante colores.
Evaluación de la calidad de la alineación
El MSA es un problema sin una respuesta única (un MSA exacto es NP-completo). No obstante, existen conjuntos de referencia (benchmarks).
- BAliBASE: Un conjunto de MSA de referencia curado manualmente. El benchmark estándar para nuevos algoritmos.
- Puntuación SP: sum-of-pairs, la proporción de pares que coinciden con la referencia.
- Puntuación TC: la proporción de columnas que coinciden exactamente (más estricta).
MAFFT L-INS-i se sitúa en el nivel superior (top-tier) en BAliBASE. ClustalW es una herramienta heredada (legacy) (es rápida, pero su precisión disminuye).
Complejidad
- Cálculo de distancia por pares: N secuencias × O(L²) = O(N² × L²). Esta etapa es el cuello de botella real.
- Construcción del árbol guía: O(N³) (NJ) o O(N² log N) (fast NJ).
- Fusión progresiva: N-1 fusiones por pares = O(N × L²).
- Total: O(N² × L²).
La optimización FFT de MAFFT reduce el factor constante del cálculo por pares varias veces. En la práctica, 1000 secuencias × longitud de 500 bp se procesan en minutos en un portátil.
Por qué el MSA es la materia prima de todo lo posterior
El alineamiento múltiple de secuencias no es un fin en sí mismo, sino la entrada para otros análisis.
- Árboles filogenéticos: Los patrones de variación por columna del MSA son la materia prima del árbol filogenético (M26~M28).
- Perfil HMM: Los HMM de dominios aprenden las probabilidades de emisión y transición a partir del MSA (M21).
- Análisis de conservación: Predicción de sitios funcionales mediante el grado de conservación por columna.
- MSA de AlphaFold2: Materia prima decisiva para la predicción de la estructura de proteínas (F02).
La calidad del MSA determina el límite superior de todos los análisis posteriores. Si la alineación es incorrecta, todo lo construido sobre ella se verá afectado.
Mapeo CS — Recorrido voraz de árboles
Es una combinación del algoritmo voraz (greedy) y el recorrido de árboles de DryBench.
- Voraz: Selección de un óptimo local (el par más cercano) en cada etapa.
- Recorrido de árboles: El orden de fusión se determina mediante el post-orden del árbol guía.
- Fusión progresiva: Una vez determinada la alineación, no se puede modificar (de ahí el dicho "una vez un hueco, siempre un hueco").
La trampa de este algoritmo es clara: una cadena de óptimos locales puede no ser el óptimo global. El refinamiento iterativo (Iterative refinement) es un intento de escapar parcialmente de esta trampa a posteriori.
Calificación en Rosalind
La propia AAM no presenta problemas en Rosalind, pero con ejercicios como MULT(BA5G) se puede realizar una guía manual del llenado de la cuadrícula para una alineación de tres vías. Este ejercicio práctico permite comprender la necesidad del alineamiento progresivo.
Ramas que conducen al siguiente capítulo
- Siguiente capítulo (M26): Basado en distancias filogenéticas — NJ, UPGMA — Convertir la información de las columnas de la AAM en una matriz de distancias para construir un árbol.
- Dos capítulos después (M27): Parsimonia — Fitch, Sankoff — Evaluar el árbol basándose en el número mínimo de mutaciones.
- Tres capítulos después (M28): Máxima verosimilitud — IQ-TREE, RAxML — Construir el árbol que maximiza la verosimilitud estadística.
La secuencia de operaciones desde la AAM hasta la filogenia se describe en los capítulos M25 a M28. La AAM es la fase de preparación de los datos, y los tres capítulos siguientes presentan las tres principales estrategias de algoritmos para la construcción de árboles.
Para profundizar más
- Thompson, Higgins, Gibson (1994), CLUSTAL W: improving the sensitivity of progressive multiple sequence alignment, NAR — Artículo original de ClustalW. Sigue siendo relevante en la actualidad.
- Katoh & Standley (2013), MAFFT multiple sequence alignment software version 7, NAR — Artículo sobre MAFFT v7. Ofrece el máximo rendimiento en la práctica.
- Edgar (2004), MUSCLE: multiple sequence alignment with high accuracy and high throughput, NAR — Artículo original de MUSCLE. Representa la esencia del refinamiento iterativo.
- EMBL-EBI Training — Lista de reproducción práctica de AAM (con subtítulos completos).
- MIT 7.91J — Capítulo sobre AAM del profesor Christopher Burge. Analiza las limitaciones del alineamiento progresivo mediante diagramas.
Alinee 100 homólogos de una familia de proteínas bien conocida con MAFFT (por ejemplo, hemoglobina o p53). Abra el resultado en Jalview y verifique visualmente qué columnas están conservadas; esta es la práctica principal de este capítulo.