Herramientas de IA
IA para biocienciasIntermedio

Evo 2

Modelo fundacional genómico de escala extrema de Arc Institute, Stanford y NVIDIA para analizar y diseñar secuencias de ADN, ARN y proteínas.

Evo 2 es un modelo fundacional genómico de gran escala publicado por Arc Institute en colaboración con Stanford y NVIDIA. Trata las secuencias de ADN, ARN y proteínas como un lenguaje común para analizarlas y diseñarlas. Se entrenó con más de 9 billones de bases de organismos de todos los dominios, incluidas bacterias y arqueas. Su arquitectura StripedHyena 2 mantiene precisión a nivel de base y procesa hasta 1 millón de tokens de información genómica.

Los modelos biológicos basados en atención se vuelven costosos cuadráticamente con la longitud de la secuencia y suelen limitarse a contextos cortos. Evo 2 sustituye ese cuello de botella por una arquitectura híbrida de modelos de espacio de estados implícitos y convoluciones, permitiendo estudiar regiones no codificantes extensas e interacciones de largo alcance entre potenciadores y promotores.

En biología sintética puede generar unidades completas de regulación transcripcional, incluidos promotores y potenciadores, a partir de secuencias reguladoras y codificantes. En investigación clínica puede estimar cómo un polimorfismo de una sola base en una región no codificante afecta la función y el riesgo de enfermedad. Estas predicciones in silico deben validarse experimentalmente antes de aplicarse a terapias o diseño de organismos.

💻 Requisitos del sistema

🧠RAM

Para el modelo 7B, 16 GB o más (bfloat16); para 20B/40B, se recomienda una GPU NVIDIA Hopper (H100/H200) con 80 GB de VRAM y Transformer Engine FP8.

💾Almacenamiento

Depende de los pesos: 7B ~14 GB; 20B/40B ~40–80 GB o más; instalación de paquetes hasta 5 GB.

Instalación

4-1. Inicio rápido

pip install flash-attn==2.8.0.post2 --no-build-isolation pip install evo2

4-2. Instalación detallada

1. Instalar GPU y dependencias (se recomienda Transformer Engine)

conda install -c nvidia cuda-nvcc cuda-cudart-dev conda install -c conda-forge transformer-engine-torch=2.3.0

2. Instalar Flash Attention

pip install flash-attn==2.8.0.post2 --no-build-isolation

3. Instalar la biblioteca Evo 2

pip install evo2

4. Alternativa: instalar directamente desde el código fuente

git clone https://github.com/arcinstitute/evo2 cd evo2 pip install -e .

🧬 Casos de uso en biociencias

🔬

Predicción genómica de función y variantes

Introducir secuencias de ADN humano de más de 10 kbp para estimar rápidamente el fitness y el cambio transcripcional de mutaciones puntuales no codificantes y analizar sus efectos funcionales in silico.

🧬

Diseño generativo de genes y promotores grandes

Proporcionar secuencias y condiciones de regulación para diseñar códigos sintéticos de promotor-potenciador que optimicen la expresión de proteínas, validando los candidatos en laboratorio.

💊

Diseño virtual de genomas microbianos

Usar contextos de hasta 1 millón de bp con StripedHyena 2 para diseñar cadenas de ADN sintético que integren clústeres metabólicos funcionales, siempre sujetos a revisión experimental y de bioseguridad.

FAQ

¿Qué es Evo 2?

Evo 2 es un modelo fundacional genómico de gran escala publicado por Arc Institute en colaboración con Stanford y NVIDIA. Trata las secuencias de ADN, ARN y proteínas como un lenguaje común para analizarlas y diseñarlas. Se entrenó con más de 9 billones de bases de organismos de todos los dominios, incluidas bacterias y arqueas. Su arquitectura StripedHyena 2 mantiene precisión a nivel de base y procesa hasta 1 millón de tokens de información genómica. Los modelos biológicos basados en atención se vuelven costosos cuadráticamente con la longitud de la secuencia y suelen limitarse a contextos cortos. Evo 2 sustituye ese cuello de botella por una arquitectura híbrida de modelos de espacio de estados implícitos y convoluciones, permitiendo estudiar regiones no codificantes extensas e interacciones de largo alcance entre potenciadores y promotores. En biología sintética puede generar unidades completas de regulación transcripcional, incluidos promotores y potenciadores, a partir de secuencias reguladoras y codificantes. En investigación clínica puede estimar cómo un polimorfismo de una sola base en una región no codificante afecta la función y el riesgo de enfermedad. Estas predicciones in silico deben validarse experimentalmente antes de aplicarse a terapias o diseño de organismos.

¿Cuándo debería usar Evo 2?

Modelo fundacional genómico de escala extrema de Arc Institute, Stanford y NVIDIA para analizar y diseñar secuencias de ADN, ARN y proteínas.

¿Cuál es un caso de uso biomédico de Evo 2?

Predicción genómica de función y variantes: Introducir secuencias de ADN humano de más de 10 kbp para estimar rápidamente el fitness y el cambio transcripcional de mutaciones puntuales no codificantes y analizar sus efectos funcionales in silico.

📄 Documentación oficial🐙 GitHub

📝 Notas de actualización

Aún no hay notas de actualización.

🧪 Código de la vida relacionado

Aún no hay publicaciones relacionadas de Código de la vida.