Evo 2
Modelo fundacional genómico de escala extrema de Arc Institute, Stanford y NVIDIA para analizar y diseñar secuencias de ADN, ARN y proteínas.
Evo 2 es un modelo fundacional genómico de gran escala publicado por Arc Institute en colaboración con Stanford y NVIDIA. Trata las secuencias de ADN, ARN y proteínas como un lenguaje común para analizarlas y diseñarlas. Se entrenó con más de 9 billones de bases de organismos de todos los dominios, incluidas bacterias y arqueas. Su arquitectura StripedHyena 2 mantiene precisión a nivel de base y procesa hasta 1 millón de tokens de información genómica.
Los modelos biológicos basados en atención se vuelven costosos cuadráticamente con la longitud de la secuencia y suelen limitarse a contextos cortos. Evo 2 sustituye ese cuello de botella por una arquitectura híbrida de modelos de espacio de estados implícitos y convoluciones, permitiendo estudiar regiones no codificantes extensas e interacciones de largo alcance entre potenciadores y promotores.
En biología sintética puede generar unidades completas de regulación transcripcional, incluidos promotores y potenciadores, a partir de secuencias reguladoras y codificantes. En investigación clínica puede estimar cómo un polimorfismo de una sola base en una región no codificante afecta la función y el riesgo de enfermedad. Estas predicciones in silico deben validarse experimentalmente antes de aplicarse a terapias o diseño de organismos.
💻 Requisitos del sistema
Para el modelo 7B, 16 GB o más (bfloat16); para 20B/40B, se recomienda una GPU NVIDIA Hopper (H100/H200) con 80 GB de VRAM y Transformer Engine FP8.
Depende de los pesos: 7B ~14 GB; 20B/40B ~40–80 GB o más; instalación de paquetes hasta 5 GB.
⚡ Instalación
4-1. Inicio rápido
pip install flash-attn==2.8.0.post2 --no-build-isolation pip install evo2
4-2. Instalación detallada
1. Instalar GPU y dependencias (se recomienda Transformer Engine)conda install -c nvidia cuda-nvcc cuda-cudart-dev conda install -c conda-forge transformer-engine-torch=2.3.0
2. Instalar Flash Attentionpip install flash-attn==2.8.0.post2 --no-build-isolation
3. Instalar la biblioteca Evo 2pip install evo2
4. Alternativa: instalar directamente desde el código fuentegit clone https://github.com/arcinstitute/evo2 cd evo2 pip install -e .
🧬 Casos de uso en biociencias
Predicción genómica de función y variantes
Introducir secuencias de ADN humano de más de 10 kbp para estimar rápidamente el fitness y el cambio transcripcional de mutaciones puntuales no codificantes y analizar sus efectos funcionales in silico.
Diseño generativo de genes y promotores grandes
Proporcionar secuencias y condiciones de regulación para diseñar códigos sintéticos de promotor-potenciador que optimicen la expresión de proteínas, validando los candidatos en laboratorio.
Diseño virtual de genomas microbianos
Usar contextos de hasta 1 millón de bp con StripedHyena 2 para diseñar cadenas de ADN sintético que integren clústeres metabólicos funcionales, siempre sujetos a revisión experimental y de bioseguridad.
FAQ
¿Qué es Evo 2?
Evo 2 es un modelo fundacional genómico de gran escala publicado por Arc Institute en colaboración con Stanford y NVIDIA. Trata las secuencias de ADN, ARN y proteínas como un lenguaje común para analizarlas y diseñarlas. Se entrenó con más de 9 billones de bases de organismos de todos los dominios, incluidas bacterias y arqueas. Su arquitectura StripedHyena 2 mantiene precisión a nivel de base y procesa hasta 1 millón de tokens de información genómica. Los modelos biológicos basados en atención se vuelven costosos cuadráticamente con la longitud de la secuencia y suelen limitarse a contextos cortos. Evo 2 sustituye ese cuello de botella por una arquitectura híbrida de modelos de espacio de estados implícitos y convoluciones, permitiendo estudiar regiones no codificantes extensas e interacciones de largo alcance entre potenciadores y promotores. En biología sintética puede generar unidades completas de regulación transcripcional, incluidos promotores y potenciadores, a partir de secuencias reguladoras y codificantes. En investigación clínica puede estimar cómo un polimorfismo de una sola base en una región no codificante afecta la función y el riesgo de enfermedad. Estas predicciones in silico deben validarse experimentalmente antes de aplicarse a terapias o diseño de organismos.
¿Cuándo debería usar Evo 2?
Modelo fundacional genómico de escala extrema de Arc Institute, Stanford y NVIDIA para analizar y diseñar secuencias de ADN, ARN y proteínas.
¿Cuál es un caso de uso biomédico de Evo 2?
Predicción genómica de función y variantes: Introducir secuencias de ADN humano de más de 10 kbp para estimar rápidamente el fitness y el cambio transcripcional de mutaciones puntuales no codificantes y analizar sus efectos funcionales in silico.
📝 Notas de actualización
Aún no hay notas de actualización.
🧪 Código de la vida relacionado
Aún no hay publicaciones relacionadas de Código de la vida.