Volver a la lista

Predicción del efecto de las mutaciones: Por qué no se deben comparar las puntuaciones de ESM/AlphaMissense con las de ProteinMPNN

Explica por qué las predicciones de efecto de variantes de ESM·AlphaMissense y los puntajes de ajuste condicional de residuos basados en el esqueleto de ProteinMPNN no son puntuaciones clínicas idénticas.

Avanzado
|
22min
|
Verificado (2026-07-29)
AlphaMissenseProteinMPNNvariant effectpathogenicity
Progreso0/120 (0%)

F13 Siguiente pregunta — ¿Qué herramientas se utilizan realmente en la práctica clínica?

En F11 vimos las puntuaciones zero-shot de la familia ESM. Aquí comparamos ESM1v basado en probabilidades de secuencia, AlphaMissense para predicción de patogenicidad y ProteinMPNN, cuyo propósito original es diferente. Los dos primeros se evalúan en la literatura de predicción del efecto de variantes, mientras que ProteinMPNN es un modelo de diseño de secuencias con backbones fijos. El punto clave es no tratar a las tres herramientas como equivalentes para la predicción clínica.

Principio — Resolver el mismo problema con tres tipos de información diferentes

ESM1v: Información evolutiva pura de la secuencia

El enmascaramiento marginal tratado en F11 es representado típicamente por ESM1v (una variante especializada en el efecto de variantes de la familia ESM-1). La ventaja es que no se requiere información estructural alguna, lo que permite su aplicación directa a proteínas cuya estructura no se conoce. La desventaja es que depende únicamente de señales indirectas como la conservación evolutiva.

AlphaMissense: Combinación de predicción estructural e información evolutiva

AlphaMissense (DeepMind, 2023) es un modelo entrenado para predecir la patogenicidad missense utilizando una red derivada de AlphaFold e información evolutiva. Simplificarlo diciendo que "se adjuntó un cabezal de clasificación al archivo de estructura 3D final creado por AlphaFold" sería inexacto. El pipeline público utiliza bases de datos genéticas para el MSA y, al realizar recortes espaciales (spatial cropping), puede hacer referencia a las estructuras de la Base de Datos de AlphaFold.

Ppathogenic=gψ(informacioˊn evolutiva de secuencia,contexto de estructura predicha)P_{\text{pathogenic}} = g_\psi\left(\text{información evolutiva de secuencia}, \text{contexto de estructura predicha}\right)

gψg_\psi es una notación conceptual. El repositorio público proporciona la implementación y el pipeline, pero no proporciona los pesos aprendidos. En su lugar, despliega predicciones precalculadas para aproximadamente 71 millones de sustituciones missense humanas, por lo que consultar la tabla de predicciones públicas es una opción viable.

ProteinMPNN: El problema inverso con dirección opuesta

Mientras que los dos modelos anteriores abordaron "qué tan dañina es esta variante" (problema directo: secuencia → efecto), ProteinMPNN (Baker Lab, 2022) resuelve la dirección opuesta — "qué secuencia es buena para mantener estable esta estructura" (problema inverso: estructura → secuencia, plegamiento inverso).

P(secuenciaestructura backbone fija)P(\text{secuencia} \mid \text{estructura backbone fija})

Es posible analizar la probabilidad condicional de ProteinMPNN como un proxy para fines de investigación sobre la adecuación de residuos en una cadena principal fija. Sin embargo, no se debe denominar esto predicción de estabilidad termodinámica validada (ΔΔG\Delta\Delta G) ni puntuación de patogenicidad clínica. ProteinMPNN no es una herramienta entrenada con etiquetas de enfermedad ni criterios clínicos.

Ejemplo de cálculo manual: Comparación justa de tres modelos mediante ROC-AUC

El rendimiento de los predictores del efecto de las variantes suele compararse mediante ROC-AUC (Receiver Operating Characteristic - Area Under Curve). El ROC-AUC es la probabilidad de que una variante patogénica seleccionada al azar reciba una puntuación más alta (interpretada como más dañina) que una variante benigna seleccionada al azar, cuando se ordenan las variantes según la puntuación del modelo en un conjunto de referencia con etiquetas conocidas de patogenicidad/benignidad.

Como ejemplo sencillo, supongamos que hay 2 variantes patogénicas (puntuaciones 0.9, 0.6) y 2 variantes benignas (puntuaciones 0.7, 0.3). Hay 2×2=42\times2=4 pares posibles (patogénica, benigna).

Puntuación patogénicaPuntuación benigna¿Patogénica > Benigna?
0.90.7
0.90.3
0.60.7No
0.60.3

ROC-AUC=34=0.75\text{ROC-AUC} = \frac{3}{4} = 0.75

Un modelo perfecto tiene un ROC-AUC de 1.0, mientras que una predicción aleatoria es 0.5. Las diferentes puntuaciones pueden compararse como rendimiento de clasificación bajo la premisa de evaluarlas en el mismo conjunto de datos y con las mismas etiquetas. Dado que el objetivo original de ProteinMPNN es diferente, este ejemplo por sí solo no permite concluir que sea equivalente a un predictor clínico.

Práctica: Consulta de predicciones públicas de AlphaMissense

python
# Dado que AlphaMissense ha calculado y publicado previamente las predicciones para todo el proteoma humano,
# en la mayoría de los casos, consultar la base de datos pública es suficiente en lugar de ejecutar el modelo directamente.
import pandas as pd
# Descargue y utilice el TSV (gzip) distribuido desde el repositorio oficial (se recomienda filtrar por genes de interés debido al gran tamaño)
# Consulte la URL de descarga según las instrucciones en https://github.com/google-deepmind/alphamissense
df = pd.read_csv("AlphaMissense_aa_substitutions.tsv.gz", sep="\t", compression="gzip")
# Primero, verifique las columnas y el sistema de identificadores del repositorio oficial.
print(df.columns.tolist())
# Filtra solo las filas que coincidan con el transcrito/isoforma, las coordenadas genómicas y la variante de proteína.

Dado que se trata de un archivo grande, para procesarlo dentro de los límites de disco y memoria del plan gratuito de Colab, debe considerarse filtrar en streaming solo los genes necesarios (por ejemplo, mediante la lectura por fragmentos pandas).

Mapeo CS

  • Problema inverso: ProteinMPNN, que resuelve "estructura → secuencia", es un ejemplo típico de problema inverso, donde se remonta a la causa a partir de los resultados observados. Pertenece a la misma clase matemática que la reconstrucción de imágenes TC o la restauración de señales en otras áreas científicas.
  • Fusión multi-fuente: El hecho de que AlphaMissense refleje conjuntamente la información de evolución de secuencias y el contexto estructural es una forma de fusión de características, donde se combinan conjuntos distintos de características para mejorar el rendimiento de un predictor único, similar al ensembles o fusión de características.
  • ROC-AUC: Es el indicador estándar para evaluar clasificadores binarios; mide el rendimiento basado en rangos sin depender del umbral, lo cual coincide exactamente con la metodología de evaluación general del aprendizaje automático.

Defectos frecuentes

  • Sumar o promediar directamente las puntuaciones de los tres modelos: El log-odds ratio de ESM1v, la probabilidad de AlphaMissense y el puntaje de estabilidad de ProteinMPNN tienen escalas y significados diferentes. En lugar de un promedio simple, se requiere normalizar y combinar los rangos (rank) de cada modelo o realizar un aprendizaje de ensembles separado.
  • Identificar patogenicidad con inestabilidad estructural: Una variante que hace inestable la estructura según ProteinMPNN no siempre es clínicamente patogénica. Algunas variantes patogénicas actúan dañando directamente sitios funcionales (sitios activos, interfaces de unión) independientemente de la estabilidad estructural.
  • Usar las predicciones de AlphaMissense como prueba diagnóstica definitiva: Aunque es accesible por ser una base de datos pública, sigue siendo una predicción computacional. Para la toma de decisiones clínicas, es indispensable combinarla con un pipeline de genética clínica validado y el juicio de expertos.
  • Asumir que los pesos están publicados: El repositorio proporciona la implementación de referencia, pero no ofrece los pesos entrenados. Debe distinguirse entre consultar tablas de predicción públicas y realizar nuevas inferencias.

Para profundizar más

El texto ha sido reescrito directamente por el equipo de investigación de BPD. Profundice consultando los artículos originales y los materiales oficiales.

  • Artículo original de AlphaMissense: Cheng et al. (2023), Accurate proteome-wide missense variant effect prediction with AlphaMissense, Science 381(6664).
  • Artículo original de ProteinMPNN: Dauparas et al. (2022), Diseño robusto de secuencias de proteínas basado en aprendizaje profundo utilizando ProteinMPNN, Science 378(6615).
  • Artículo original de ESM1v: Consulte a Meier et al. (2021) en F11.

En el próximo episodio F15, volveremos a abordar ProteinMPNN y lo combinaremos con RFdiffusion para cubrir un flujo de trabajo de diseño de novo que crea proteínas inexistentes en la naturaleza desde cero.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...