Herramientas de IA
IA para biocienciasPrincipiante

ESMC / ESMFold2

Modelo mundial de biología proteica para comprender y diseñar proteínas a escala evolutiva.

ESMC y ESMFold2 son modelos mundiales de biología proteica publicados por Biohub el 27 de mayo de 2026. ESMC preentrena 6.000 millones de parámetros con aproximadamente 2.800 millones de secuencias proteicas para aprender reglas evolutivas de diseño. ESMFold2 combina sus embeddings con un transformador recurrente y una arquitectura de difusión para predecir estructuras 3D all-atom a partir de una secuencia y diseñar binders terapéuticos.

A diferencia de AlphaFold y otros métodos que dependen de alineamientos múltiples de secuencias (MSA), ESMC-ESMFold2 usa un transformador tipo BERT entrenado a escala sin MSA. Esto resulta útil para secuencias de rápida evolución, como anticuerpos. El proyecto informa mayor precisión que AlphaFold 3 en predicción anticuerpo-antígeno y aproximadamente 10 veces más velocidad en modo de secuencia única frente a métodos basados en MSA; estos resultados deben validarse en el conjunto de datos propio.

Biohub diseñó binders de afinidad nanomolar para EGFR, PDGFRβ, PD-L1, CTLA-4 y CD45, con tasas de acierto del 36–88 % para minibinders compactos y del 15–29 % para formatos derivados de anticuerpos; un binder de PD-L1 restauró señales de células T en laboratorio. ESM Atlas permite explorar 6.800 millones de secuencias y 1.100 millones de estructuras predichas. Sus aproximadamente 16.000 características interpretables basadas en SAE ayudan a mapear funciones de proteínas sin anotación. El código y los modelos se publican bajo licencia MIT para uso local o mediante la API de Biohub.

💻 Requisitos del sistema

🧠RAM

Se recomienda una GPU NVIDIA de 16 GB o más; ESMC-6B ocupa unos 12 GB en FP16 y se recomiendan 24 GB (A100, RTX 4090) con memoria de activación. CPU funciona, pero es muy lenta.

💾Almacenamiento

Aproximadamente 15–25 GB para ESMC-6B y ESMFold2. ESM Atlas se consulta online en Biohub; descargarlo localmente requiere cientos de GB.

Instalación

4-1. Inicio rápido

pip install esm@git+https://github.com/Biohub/esm.git@main

La versión oficial de PyPI está en preparación (al 17-06-2026 solo se admite instalación directa desde GitHub).

4-2. Ejemplo básico

from transformers import AutoModelForMaskedLM, AutoTokenizer

# Cargar ESMC-6B (Hugging Face; requiere autenticación)
model = AutoModelForMaskedLM.from_pretrained("biohub/ESMC-6B", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("biohub/ESMC-6B")

# Extraer embeddings de una secuencia proteica
sequence = "MKTAYIAKQRQISFVKSHFSRQLEERLGLIEVQAPILSRVGDGTQDNLSGAEKAVQVKVKALPDAQFEVVHSLAKWKRQQIA"
inputs = tokenizer(sequence, return_tensors="pt").to(model.device)
outputs = model(inputs, output_hidden_states=True)
embeddings = outputs.hidden_states[-1]

4-3. Acceso a la API de Biohub

# Obtener un token en la consola de desarrolladores de biohub.ai
from esm import esmc_client

client = esmc_client(
    model="ESMC-6B",
    url="https://biohub.ai/api",
    token="YOUR_API_TOKEN"
)
result = client.predict(sequence="MKTAYIAK...")

🧬 Casos de uso en biociencias

🔬

Diseño de binders candidatos para terapias de anticuerpos

Generar minibinders de novo contra PD-L1 o CTLA-4, visualizar estructuras con PyMOL o ChimeraX y priorizar validación experimental. Verificar tasas de acierto y afinidad en el laboratorio.

🧬

Exploración funcional de proteínas sin anotación

Usar características SAE de ESM Atlas para agrupar proteínas desconocidas, visualizar embeddings ESMC-6B con UMAP e inferir funciones por similitud, por ejemplo para descubrir péptidos antimicrobianos.

💊

Cribado estructural de grandes bibliotecas de variantes

Predecir en lote estructuras de decenas de miles de variantes sin MSA, filtrar por confianza y transferir candidatos a docking detallado con HADDOCK o ClusPro.

FAQ

¿Qué es ESMC / ESMFold2?

ESMC y ESMFold2 son modelos mundiales de biología proteica publicados por Biohub el 27 de mayo de 2026. ESMC preentrena 6.000 millones de parámetros con aproximadamente 2.800 millones de secuencias proteicas para aprender reglas evolutivas de diseño. ESMFold2 combina sus embeddings con un transformador recurrente y una arquitectura de difusión para predecir estructuras 3D all-atom a partir de una secuencia y diseñar binders terapéuticos. A diferencia de AlphaFold y otros métodos que dependen de alineamientos múltiples de secuencias (MSA), ESMC-ESMFold2 usa un transformador tipo BERT entrenado a escala sin MSA. Esto resulta útil para secuencias de rápida evolución, como anticuerpos. El proyecto informa mayor precisión que AlphaFold 3 en predicción anticuerpo-antígeno y aproximadamente 10 veces más velocidad en modo de secuencia única frente a métodos basados en MSA; estos resultados deben validarse en el conjunto de datos propio. Biohub diseñó binders de afinidad nanomolar para EGFR, PDGFRβ, PD-L1, CTLA-4 y CD45, con tasas de acierto del 36–88 % para minibinders compactos y del 15–29 % para formatos derivados de anticuerpos; un binder de PD-L1 restauró señales de células T en laboratorio. ESM Atlas permite explorar 6.800 millones de secuencias y 1.100 millones de estructuras predichas. Sus aproximadamente 16.000 características interpretables basadas en SAE ayudan a mapear funciones de proteínas sin anotación. El código y los modelos se publican bajo licencia MIT para uso local o mediante la API de Biohub.

¿Cuándo debería usar ESMC / ESMFold2?

Modelo mundial de biología proteica para comprender y diseñar proteínas a escala evolutiva.

¿Cuál es un caso de uso biomédico de ESMC / ESMFold2?

Diseño de binders candidatos para terapias de anticuerpos: Generar minibinders de novo contra PD-L1 o CTLA-4, visualizar estructuras con PyMOL o ChimeraX y priorizar validación experimental. Verificar tasas de acierto y afinidad en el laboratorio.

📄 Documentación oficial🐙 GitHub

📝 Notas de actualización

Aún no hay notas de actualización.

🧪 Código de la vida relacionado

Aún no hay publicaciones relacionadas de Código de la vida.