Volver a la lista

Práctica de Evo 2: Estimar variantes de BRCA1 en modo zero-shot sin experimentos

Se aborda el procedimiento para estimar la patogenicidad de las variantes de BRCA1 mediante la verosimilitud logarítmica autoregresiva de Evo 2 sin necesidad de experimentación, así como los métodos de validación comparativa con AlphaMissense y ClinVar.

Avanzado
|
22min
|
Verificado (2026-07-29)
BRCA1zero-shotpathogenicity predictionClinVar
Progreso0/120 (0%)

Hora de verificar la teoría de F19 manualmente

En F19, vimos el principio de que Evo 2 puede puntuar la "naturalidad" de una secuencia variante mediante la verosimilitud logarítmica autorregresiva. En este episodio, aplicaremos ese principio a un caso con relevancia clínica real: la predicción de la patogenicidad de las variantes del gen BRCA1. El BRCA1 es un gen directamente relacionado con el riesgo de cáncer de mama y de ovario, y es un ejemplo representativo donde la determinación de la patogenicidad de una variante influye en las decisiones clínicas reales.

El principio — Lo que significa estimar la patogenicidad sin experimentos

Lo que significa zero-shot

Retomemos el término zero-shot, que también apareció al tratar AlphaMissense o ESM1v en F14. Aquí, zero-shot significa que, para la tarea de "predicción de la patogenicidad de las variantes de BRCA1", se reutiliza la puntuación de verosimilitud logarítmica obtenida únicamente mediante el preentrenamiento, sin pasar por ningún proceso de aprendizaje supervisado (supervised fine-tuning) adicional, como una señal de patogenicidad directa.

Puntuacioˊn de patogenicidad(v)logPEvo2(secuencia variante vcontexto circundante)\text{Puntuación de patogenicidad}(v) \approx -\log P_{\text{Evo2}}(\text{secuencia variante } v \mid \text{contexto circundante})

Esto se basa en la premisa de que cuanto menor sea la verosimilitud logarítmica (es decir, cuanto más "antinatural" juzgue el modelo esa secuencia), mayor es la probabilidad de que se altere la función normal evolutivamente conservada. Esta premisa es una extensión de la antigua intuición (que aparece repetidamente en F19 y F14) de que la conservación evolutiva equivale a la importancia funcional.

En qué se diferencia de AlphaMissense de F14

AlphaMissense de F14 es un modelo entrenado a nivel de secuencia y estructura de proteínas, mientras que Evo 2 trata la propia secuencia de ADN como entrada primaria. Esta diferencia es importante en la práctica. Evo 2 puede clasificar por orden de prioridad las variantes no codificantes situadas no solo en regiones codificantes de proteínas, sino también en intrones, sitios de splicing y regiones reguladoras, utilizando el mismo marco de puntuación de secuencias. Sin embargo, se requiere una validación aparte para determinar si dicha puntuación es clínicamente válida en cada región, enfermedad y tarea de evaluación. Por el contrario, AlphaMissense está especializado en variantes missense que alteran las proteínas.

aˊmbito de aplicacioˊn de AlphaMissenseregioˊn codificante de proteıˊnas\text{ámbito de aplicación de AlphaMissense} \subset \text{región codificante de proteínas} secuencias puntuadas por Evo 2=contexto de ADN que incluye regiones codificantes y no codificantes\text{secuencias puntuadas por Evo 2} = \text{contexto de ADN que incluye regiones codificantes y no codificantes}

Debido a esta diferencia, en la práctica es más seguro utilizar ambas herramientas como medios de validación complementarios en lugar de verlas como competidoras.

Ejemplo de cálculo manual: Interpretar la diferencia de verosimilitud logarítmica como una razón de probabilidades

Supongamos que Evo 2 asigna una verosimilitud logarítmica de 2.1-2.1 a la secuencia de referencia y de 5.8-5.8 a una secuencia variante específica. La diferencia entre las dos verosimilitudes logarítmicas es

ΔlogP=(5.8)(2.1)=3.7\Delta \log P = (-5.8) - (-2.1) = -3.7

Al convertir esto en una razón de verosimilitud (likelihood ratio)

P(mutacioˊn)P(referencia)=e3.70.0247\frac{P(\text{mutación})}{P(\text{referencia})} = e^{-3.7} \approx 0.0247

Esto significa que, según el modelo, la "naturalidad" de que aparezca esta secuencia variante es apenas aproximadamente el 2,5 % de la de la secuencia de referencia. Este valor en sí mismo no es una probabilidad clínica de patogenicidad, pero constituye una señal útil para clasificar (ranking) relativamente varias variantes.

Práctica: Validar candidatos de variantes de BRCA1 comparándolos con ClinVar

python
# Como la inferencia real con Evo 2 requiere una GPU grande o una API, aquí reproducimos
# la estructura de la práctica y la lógica de validación. En un caso real, sigue las instrucciones
# vigentes de la demostración/API oficial de Evo 2 y conecta la llamada real en la función de puntuación.
import pandas as pd
def evo2_pathogenicity_rank(variants: list[dict], score_fn) -> pd.DataFrame:
"""
variants: [{"id": "BRCA1_c.68_69delAG", "ref_seq": "...", "alt_seq": "..."}]
score_fn: (seq) -> float, función de log-verosimilitud de un modelo de la familia Evo 2
"""
rows = []
for v in variants:
ll_ref = score_fn(v["ref_seq"])
ll_alt = score_fn(v["alt_seq"])
rows.append({
"variant_id": v["id"],
"delta_log_likelihood": ll_alt - ll_ref,
})
df = pd.DataFrame(rows).sort_values("delta_log_likelihood")
return df # Cuanto menor (más negativo), más perjudicial considera el modelo la variante
# Comparar con las etiquetas públicas de patogenicidad de ClinVar y calcular cuánto coincide
# la clasificación del modelo con la clasificación clínica real (por ejemplo, AUROC) es la validación clave.
# Los datos de ClinVar pueden descargarse gratuitamente del FTP oficial de NCBI.

Este procedimiento de validación —contrastar las puntuaciones del modelo con las etiquetas patogénicas/benignas que tienen un estado de revisión claro en ClinVar, y tratar por separado las clasificaciones conflictivas o no resueltas— es un paso obligatorio antes de implementar cualquier nueva herramienta zero-shot en la práctica clínica.

Mapeo CS

  • Predicción de patogenicidad como detección de anomalías: La lógica central de los algoritmos de detección de anomalías consiste en puntuar el grado de desviación respecto a una distribución normal (secuencias evolutivamente conservadas) para identificar valores atípicos.
  • Clasificación por rangos y ajuste del umbral: Confiar en el rango relativo en lugar de la puntuación absoluta, y ajustar el umbral (threshold) con datos de etiquetas previos al despliegue real, es una práctica estándar en la validación de clasificadores de aprendizaje automático.
  • Ensemble de múltiples herramientas: Consultar conjuntamente AlphaMissense de F14 y Evo 2 de F20 sigue la misma lógica que una estrategia de ensemble (conjunto), que sintetiza las señales de varios modelos entrenados bajo supuestos distintos.

Defectos frecuentes

  • Confundir puntuaciones de log-odds con probabilidades clínicas: Las puntuaciones zero-shot de Evo 2 no son valores de probabilidad validados clínicamente, sino señales de rango relativo. La interpretación clínica real debe realizarse junto con sistemas establecidos de clasificación de variantes, como las directrices ACMG/AMP.
  • Sacar conclusiones basándose únicamente en la puntuación de una sola herramienta: En genes con gran impacto clínico, como BRCA1, es necesario contrastar los resultados de AlphaMissense, la evidencia acumulada de ClinVar y los resultados de experimentos funcionales. No se debe confirmar la patogenicidad basándose exclusivamente en la puntuación individual de Evo 2.

Para profundizar más

El texto ha sido reescrito directamente por el equipo de investigación de BPD. Profundice consultando el artículo original y los materiales oficiales.

  • Benchmark zero-shot de Evo 2 y BRCA1: Brixi et al. (2026), Genome modelling and design across all domains of life with Evo 2, Nature 649, 749–758. doi:10.1038/s41586-026-10176-5; verifique junto con los materiales oficiales de modelos y código del Arc Institute.
  • ClinVar: Landrum et al., ClinVar: improving access to variant classifications and supporting evidence, Nucleic Acids Research. Base de datos gratuita oficial de NCBI.
  • Guías de clasificación de variantes ACMG/AMP: Richards et al. (2015), Standards and guidelines for the interpretation of sequence variants, Genetics in Medicine.

Se ha completado F1.4 (Fundamentos de modelos de ADN/ARN, F16~F20). En los siguientes cinco capítulos (F21~F25), desplazaremos la atención de las secuencias genómicas a los transcriptomas de célula única (transcriptómica de célula única), comenzando por scGPT, que aborda las células mismas como modelos de lenguaje.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...