Volver a la lista

AlphaFold-Multimer: Principios de la predicción de la estructura de complejos proteicos (multímeros)

Las proteínas no trabajan solas. Se explican los principios de AlphaFold-Multimer para predecir la estructura de complejos proteicos formados por la unión de varias cadenas, así como las métricas TM-score e ipTM para evaluar la calidad de la predicción.

Avanzado
|
22min
|
Verificado (2026-07-29)
AlphaFold-Multimerprotein complexTM-scoreipTM
Progreso0/120 (0%)

F04 Más allá de la cadena única — Las proteínas no trabajan solas

AlphaFold2·3·ColabFold, tratados en F01~F04, se centraron fundamentalmente en la predicción de estructuras de cadena única (monómero). Sin embargo, dentro de la célula, muchas funciones biológicas ocurren en complejos (complex) donde varias proteínas se unen entre sí — unión anticuerpo-antígeno, reacción enzima-sustrato, unión receptor-proteína de señalización — . Por muy precisa que sea la predicción de una cadena única, cómo encajan realmente dos cadenas es un problema aparte.

El tema de este episodio no es la unión de candidatos a fármacos de molécula pequeña (small-molecule ligands), sino los complejos entre proteínas. La predicción integrada que abarca ligandos de moléculas pequeñas y ácidos nucleicos corresponde a AlphaFold3, tratado en F03; AlphaFold-Multimer es una extensión anterior especializada en ensamblar múltiples cadenas proteicas.

AlphaFold-Multimer (Evans et al., 2021, bioRxiv preprint) es una versión de la arquitectura de AlphaFold2 extendida para entradas de múltiples cadenas. En este episodio, abordaremos qué cambia al transformar un modelo de cadena única para su uso en complejos, y las métricas para medir objetivamente la calidad de la estructura del complejo predicho.

Extensión a múltiples cadenas y la matemática para medir la calidad del alineamiento

Codificación de posición relativa: Distinguir entre "la misma cadena" y "cadenas diferentes"

Para un modelo de cadena única, basta con codificar la posición de los residuos como un único índice de secuencia continua. Sin embargo, si se concatenan dos cadenas diferentes y se introducen como una sola entrada, el modelo podría confundirse y pensar que "el último residuo de la cadena A y el primer residuo de la cadena B están adyacentes en la secuencia, pero son polipéptidos totalmente distintos". AlphaFold-Multimer codifica la información de identificación de cadena (chain ID) junto con la codificación de posición, para distinguir explícitamente si "el residuo A pertenece a la misma cadena que el residuo B o no". Además, utiliza una estrategia de recorte (cropping) que incluye múltiples cadenas durante el entrenamiento, permitiendo que el modelo interactúe con interfaces entre cadenas de manera suficiente en los datos de entrenamiento.

Métrica para medir la calidad de la predicción: TM-score

La métrica tradicional para medir qué tan similares son dos estructuras (la estructura predicha y la estructura experimental) es el RMSD (desviación cuadrática media), pero el RMSD tiene la desventaja de que su valor total puede verse fácilmente afectado por un gran error en una región flexible (como un bucle o loop). El TM-score (Zhang & Skolnick, 2004) complementa esto, habiendo sido diseñado para asignar puntuaciones generosas a los residuos bien alineados y ser más permisivo con los residuos que presentan grandes desajustes.

TM-score=1Lrefi=1Laligned11+(di/d0)2,d0=1.24Lref1531.8\text{TM-score} = \frac{1}{L_{\text{ref}}} \sum_{i=1}^{L_{\text{aligned}}} \frac{1}{1 + (d_i/d_0)^2}, \quad d_0 = 1.24\sqrt[3]{L_{\text{ref}} - 15} - 1.8

did_i es la distancia entre el ii-ésimo par de residuos alineados (dada una superposición estructural óptima y un alineamiento de residuos), y d0d_0 es la distancia de normalización determinada por la longitud de referencia de la proteína LrefL_{\text{ref}}. El cálculo real del TM-score incluye el proceso de encontrar la superposición de cuerpo rígido (rigid-body superposition) óptima que maximiza este valor; la ecuación anterior representa el puntaje bajo la suposición de que dicha alineación óptima ya ha sido proporcionada. El término (di/d0)2(d_i/d_0)^2 en el denominador refleja el error por residuo al cuadrado, mientras que la fórmula está diseñada para que el valor total se sature entre 0 y 1, evitando que uno o dos errores grandes afecten drásticamente el puntaje total (no obstante, los residuos no alineados también se incluyen en el denominador LrefL_\text{ref}, por lo que si hay muchos de ellos, el puntaje seguirá siendo bajo).

Ejemplo de cálculo manual: cómo disminuye la contribución al TM-score por residuo según la distancia

Para una longitud de proteína de referencia Lref=100L_{\text{ref}}=100, primero calculamos d0d_0.

d0=1.241001531.8=1.248531.81.24×4.3971.85.4521.8=3.652A˚d_0 = 1.24\sqrt[3]{100-15} - 1.8 = 1.24\sqrt[3]{85} - 1.8 \approx 1.24 \times 4.397 - 1.8 \approx 5.452 - 1.8 = 3.652\text{Å}

Tomando como referencia este d03.65d_0 \approx 3.65Å, comparemos las contribuciones individuales de tres residuos con errores de alineación did_i de 0.5Å (muy preciso), 3.65Å (igual a d0d_0) y 10Å (desalineación significativa).

di=0.5:11+(0.5/3.652)2=11.018750.982d_i=0.5: \frac{1}{1+(0.5/3.652)^2} = \frac{1}{1.01875} \approx 0.982

di=3.652:11+(3.652/3.652)2=12=0.500d_i=3.652: \frac{1}{1+(3.652/3.652)^2} = \frac{1}{2} = 0.500

di=10:11+(10/3.652)2=11+7.4970.118d_i=10: \frac{1}{1+(10/3.652)^2} = \frac{1}{1+7.497} \approx 0.118

En el punto donde la distancia es igual a d0d_0, la contribución es exactamente 0.5, y aunque la distancia aumente más allá de ese punto, el valor simplemente converge suavemente hacia 0 sin volverse negativo ni divergir. Si se utilizara RMSD, un solo error de 10Å elevaría significativamente el promedio general; sin embargo, el TM-score limita naturalmente la influencia de estos grandes errores locales.

Indicador específico para complejos: ipTM

El pTM (predicted TM-score) es una puntuación de confianza que el modelo estima por sí mismo sobre "qué tan similar será toda la estructura predicha a la estructura real según el criterio del TM-score", basándose en la información de error predicho (PAE, Predicted Aligned Error). Sin embargo, como el pTM proporciona un único valor para todo el complejo, no logra identificar por separado los casos en los que "la estructura interna de cada cadena es correcta, pero la disposición de la interfaz entre cadenas es completamente errónea". AlphaFold-Multimer calcula por separado el ipTM (interface predicted TM-score) —una medida de confianza que estima "qué tan preciso será el posicionamiento relativo de las otras cadenas al fijar una cadena" utilizando el PAE entre cadenas— y la puntuación final de clasificación (ranking score) refleja ambas métricas.

Ranking Score=0.8×ipTM+0.2×pTM\text{Ranking Score} = 0.8 \times \text{ipTM} + 0.2 \times \text{pTM}

Esta ponderación de 8:2 es un diseño empírico para clasificar los modelos y no implica una base cuantitativa de que "la interfaz sea biológicamente 4 veces más importante que el plegamiento interno de la cadena". No obstante, dado que el principal interés en la predicción de complejos radica en "cómo se entrelazan realmente las dos cadenas" más que en el "plegamiento interno de la cadena", la dirección de asignar un mayor peso a la interfaz es coherente con dicho objetivo.

Práctica en R: Reproducción del cálculo de la contribución por residuo del TM-score

r
# Reproducir en código el cálculo manual anterior de TM-score
L_ref <- 100
d0 <- 1.24 * (L_ref - 15)^(1/3) - 1.8

tm_contribution <- function(d, d0) 1 / (1 + (d / d0)^2)

distances <- c(0.5, d0, 10)
for (d in distances) {
  cat(sprintf("d=%.3f -> contribución=%.3f\n", d, tm_contribution(d, d0)))
}

# Ejemplo de cálculo de la puntuación de clasificación del complejo
ranking_score <- function(iptm, ptm) 0.8 * iptm + 0.2 * ptm
cat(sprintf("ipTM=0.85, pTM=0.90 -> Ranking Score=%.3f\n", ranking_score(0.85, 0.90)))

Mapeo de CS

  • Codificación posicional relativa (Relative Positional Encoding): Añadir información de identificación de cadenas a la codificación posicional sigue el mismo principio de diseño que las técnicas en las que los Transformers codifican no solo la posición absoluta de los tokens, sino también distinciones estructurales como los límites de oraciones o documentos.
  • Diseño de métricas de calidad de alineamiento (Alignment Scoring): Que el TM-score sature el error de distancia mediante una función sigmoidea para hacerlo robusto frente a valores atípicos refleja la misma lógica que utilizar la pérdida de Huber, menos sensible a valores atípicos, en lugar del error cuadrático medio (MSE) en el diseño de funciones de pérdida.
  • Optimización ponderada de múltiples objetivos (Weighted Multi-objective Scoring): Combinar ipTM y pTM con una ponderación de 8:2 para generar una única puntuación de clasificación es una solución práctica de optimización multiobjetivo que compensa varios objetivos en un solo escalar para establecer un ranking.

Defectos frecuentes

  • Confundir un ipTM bajo con un pTM alto: Una predicción con un pTM global alto pero un ipTM bajo significa que "la estructura interna de cada cadena es correcta, pero la disposición de la interfaz no es confiable". En estudios de complejos, se debe verificar primero el ipTM en lugar del pTM.
  • Especificación incorrecta de la estequiometría: Si se introduce un complejo que se une realmente en una proporción 2:1 como si fuera 1:1, el modelo intentará ajustar la estructura a una composición incorrecta desde el inicio, lo que hace que el resultado carezca de sentido.
  • Interpretar un ipTM bajo como "evidencia de que no hay unión": AlphaFold-Multimer no es un clasificador para determinar si existe unión, sino un modelo de predicción estructural. Un ipTM bajo indica principalmente que "el modelo no tiene confianza en la disposición relativa", y las causas pueden ser diversas: falta de MSA, suposiciones estequiométricas incorrectas, cambios conformacionales reales, regiones desordenadas u otros socios de unión competitivos. No se debe concluir definitivamente que "este complejo no se une de manera estable" basándose únicamente en un ipTM bajo; para determinar la unión, es necesario complementar con métricas basadas en mediciones reales como DockQ o con validación experimental.

Para profundizar más

Este texto ha sido reestructurado directamente por el equipo de investigación de BPD. Profundice consultando el artículo original y los materiales oficiales.

  • Artículo original de AlphaFold-Multimer: Evans et al. (2021), Protein complex prediction with AlphaFold-Multimer, bioRxiv 2021.10.04.463034 (preprint).
  • Artículo original de TM-score: Zhang & Skolnick (2004), Scoring function for automated assessment of protein structure template quality, Proteins.
  • Resultados oficiales de la categoría de ensamblaje de CASP15: predictioncenter.org/casp15 — Dado que el número exacto de objetivos, las métricas de evaluación y las clasificaciones no se tratan en esta sección, se debe consultar la fuente original al citar.

Se ha completado la serie F1.1 (predicción de estructuras de proteínas). Si la serie AlphaFold se centró en "predecir estructuras ya plegadas", las siguientes cinco partes abordarán problemas aún más abiertos: desde el diseño de novo de nuevas secuencias desde cero hasta el área de la simulación de uniones y movimientos mediante docking y dinámica molecular.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...