Volver a la lista

Evo 1 frente a Evo 2: Un modelo de fundación genómica que abarca 1 millón de pares de bases en un solo contexto

Comparamos Evo 1 y Evo 2, que se han expandido desde genomas bacterianos hasta eucariotas, desde las perspectivas de arquitectura, datos de entrenamiento y longitud del contexto.

Avanzado
|
22min
|
Verificado (2026-07-29)
Evo 1Evo 2genome-scale modelingStripedHyena 2
Progreso0/120 (0%)

No es una expansión de HyenaDNA, sino la siguiente generación

En F18, vimos cómo HyenaDNA reduce el coste cuadrático de la atención mediante convoluciones largas. Evo (2024, Arc Institute) y su sucesor Evo 2 (2026) expanden esta línea, con el intento de capturar no solo genes individuales o niveles de operones, sino el genoma completo dentro de un mismo contexto. En F19, comparamos estas dos generaciones y abordamos la pregunta de "hasta qué punto debe extenderse el contexto para poder captar señales verdaderamente significativas".

Principio — Contexto ampliado y alcance de aprendizaje extendido a través de las generaciones

Evo 1 — Preentrenamiento con genomas de bacterias, fagos y plásmidos

Evo 1 se basa en la arquitectura StripedHyena y realizó un preentrenamiento a gran escala con genomas de organismos unicelulares. StripedHyena es una estructura híbrida que combina la convolución larga de Hyena con la atención, buscando simultáneamente el procesamiento de contextos largos y la precisión local.

bloque StripedHyena=capa Hyenacontexto largo, bajo coste + capa de atencioˊnprecisioˊn local\text{bloque StripedHyena} = \underbrace{\text{capa Hyena}}_{\text{contexto largo, bajo coste}} \ + \ \underbrace{\text{capa de atención}}_{\text{precisión local}}

Evo 1 pudo manejar contextos de decenas a cientos de miles de pares de bases manteniendo una resolución de un solo nucleótido, lo que significa que podía modelar de una sola vez un operón completo o estructuras reguladoras que abarcan múltiples genes.

Evo 2 — Hasta eucariotas, y con un contexto aún más largo

Evo 2 expandió el alcance de los datos de entrenamiento desde bacterias, arqueas y fagos hasta humanos, plantas, otros eucariotas y metagenomas, y también actualizó su arquitectura a StripamenteHyena 2. Según los anuncios oficiales, las variantes de 7B y 40B procesan un contexto de hasta 1 millón de nucleótidos en una sola pasada hacia adelante (forward pass).

Por qué es necesario un contexto a escala genómica — Verificación mediante cálculo manual

Comparemos el contexto de aproximadamente 200,000 bp que manejaba Enformer en F18 con el contexto de 1,000,000 bp que busca Evo 2. Para un cálculo conceptual, si asumimos que un gen incluye intrones y tiene aproximadamente 27 kb (27,000 bp):

1,000,00027,00037 genes\frac{1{,}000{,}000}{27{,}000} \approx 37\text{ genes}

Es decir, teóricamente significa que se pueden incluir en un solo contexto decenas de genes adyacentes y todas las regiones reguladoras entre ellos. El argumento central de la línea Evo es que solo a esta escala el modelo puede ver "de un vistazo" las interacciones potenciador-promotor de larga distancia o la lógica reguladora a nivel de clústeres genéticos.

Preentrenamiento autorregresivo — Predicción de la siguiente base

La familia Evo se preentrena mediante un enfoque autoregresivo que predice el siguiente nucleótido de izquierda a derecha, a diferencia del masked language modeling de F16 y F17.

P(x1,x2,,xn)=i=1nP(xix1,,xi1)P(x_1, x_2, \ldots, x_n) = \prod_{i=1}^{n} P(x_i \mid x_1, \ldots, x_{i-1})

Esta función de objetivo proporciona la ventaja adicional de poder generar secuencias directamente: el modelo Evo preentrenado puede utilizarse no solo para tareas de discriminación (clasificación), sino también para generar nuevas secuencias de ADN.

Práctica: estimar el impacto de las variantes mediante probabilidades autoregresivas (código conceptual)

python
# La inferencia real con Evo/Evo 2 requiere una GPU grande. En el nivel gratuito de Colab,
# resulta más práctico usar una demostración pequeña o un endpoint de API del repositorio oficial.
# Aquí solo reproducimos el concepto de estimar el efecto de una variante con un modelo autorregresivo.
def log_likelihood_ratio(seq_ref: str, seq_alt: str, score_fn) -> float:
"""
Compara la log-verosimilitud del modelo para la secuencia de referencia y la variante.
Se supone que score_fn(seq) -> float devuelve la log-verosimilitud asignada por el modelo autorregresivo.
"""
ll_ref = score_fn(seq_ref)
ll_alt = score_fn(seq_alt)
return ll_alt - ll_ref # Cuanto más negativo, menos natural considera el modelo la variante
# Si se conecta en score_fn la función de cálculo de log-verosimilitud de un modelo Evo real,
# funciona con el mismo principio que la práctica de patogenicidad zero-shot de BRCA1 de F20.

Este principio aplica la misma lógica discutida en F14 sobre la predicción de efectos de variantes zero-shot de la familia ESM a las secuencias de ADN. Se basa en la suposición de que las variantes más cercanas a la secuencia natural (a las cuales el modelo asigna una mayor probabilidad) tienen mayor probabilidad de ser menos disruptivas desde el punto de vista evolutivo.

Mapeo CS

  • Modelo de generación autoregresiva: La estructura que aprende mediante la predicción del siguiente token y genera secuencias a partir de su distribución de probabilidades pertenece al mismo linaje que los modelos de lenguaje GPT en el procesamiento del lenguaje natural.
  • Aparición recurrente de arquitecturas híbridas: Tanto Enformer en F18 como StripedHyena/StripedHyena 2 en F19 comparten la característica de haber optado por una estructura mixta que no depende exclusivamente de la atención pura. Este es un ejemplo que muestra, desde la perspectiva del diseño de sistemas, que es difícil satisfacer todos los requisitos con una única operación.
  • Detección de anomalías mediante comparación de log-verosimilitud: Interpretar el hecho de que la log-verosimilitud de la secuencia variante sea menor que la de la secuencia de referencia como una "señal de que el modelo la considera menos natural" es metodológicamente idéntico a las técnicas que cuantifican la desviación de la distribución normal en la detección de anomalías.

Defectos frecuentes

  • Confundir la longitud del contexto con intuición biológica: El hecho de que un modelo pueda recibir 1 millón de pares de bases (bp) como entrada es distinto a que utilice significativamente toda la información de ese rango completo. Debe verificarse mediante experimentos de validación si realmente se aprovechan las señales de larga distancia.
  • Confundir Evo 1 con Evo 2: Estos dos modelos difieren en el alcance de los datos de entrenamiento (solo procariotas frente a inclusión de eucariotas) y en su arquitectura. Para tareas relacionadas con humanos, debe elegirse la familia Evo 2; para tareas de genomas microbianos, se debe verificar el rango del benchmark del artículo original antes de seleccionar.

Para profundizar más

El texto ha sido reconstruido directamente por el equipo de investigación de BPD. Profundice consultando el artículo original y los materiales oficiales.

  • Artículo original de Evo 1: Nguyen et al. (2024), Sequence modeling and design from molecular to genome scale with Evo, Science 386(6723), 746. doi:10.1126/science.ado9336.
  • Artículo original de Evo 2: Brixi et al. (2026), Genome modelling and design across all domains of life with Evo 2, Nature 649, 749–758. doi:10.1038/s41586-026-10176-5.
  • Antecedentes de la arquitectura StripedHyena: Poli et al., investigación posterior a la serie Hyena.

En el siguiente capítulo (F20), practicaremos manualmente la predicción de patogenicidad zero-shot de variantes de BRCA1 utilizando Evo 2.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...