ESMC / ESMFold2
Modelo mundial de biología proteica para comprender y diseñar proteínas a escala evolutiva.
ESMC y ESMFold2 son modelos mundiales de biología proteica publicados por Biohub el 27 de mayo de 2026. ESMC preentrena 6.000 millones de parámetros con aproximadamente 2.800 millones de secuencias proteicas para aprender reglas evolutivas de diseño. ESMFold2 combina sus embeddings con un transformador recurrente y una arquitectura de difusión para predecir estructuras 3D all-atom a partir de una secuencia y diseñar binders terapéuticos.
A diferencia de AlphaFold y otros métodos que dependen de alineamientos múltiples de secuencias (MSA), ESMC-ESMFold2 usa un transformador tipo BERT entrenado a escala sin MSA. Esto resulta útil para secuencias de rápida evolución, como anticuerpos. El proyecto informa mayor precisión que AlphaFold 3 en predicción anticuerpo-antígeno y aproximadamente 10 veces más velocidad en modo de secuencia única frente a métodos basados en MSA; estos resultados deben validarse en el conjunto de datos propio.
Biohub diseñó binders de afinidad nanomolar para EGFR, PDGFRβ, PD-L1, CTLA-4 y CD45, con tasas de acierto del 36–88 % para minibinders compactos y del 15–29 % para formatos derivados de anticuerpos; un binder de PD-L1 restauró señales de células T en laboratorio. ESM Atlas permite explorar 6.800 millones de secuencias y 1.100 millones de estructuras predichas. Sus aproximadamente 16.000 características interpretables basadas en SAE ayudan a mapear funciones de proteínas sin anotación. El código y los modelos se publican bajo licencia MIT para uso local o mediante la API de Biohub.
💻 Requisitos del sistema
Se recomienda una GPU NVIDIA de 16 GB o más; ESMC-6B ocupa unos 12 GB en FP16 y se recomiendan 24 GB (A100, RTX 4090) con memoria de activación. CPU funciona, pero es muy lenta.
Aproximadamente 15–25 GB para ESMC-6B y ESMFold2. ESM Atlas se consulta online en Biohub; descargarlo localmente requiere cientos de GB.
⚡ Instalación
4-1. Inicio rápido
pip install esm@git+https://github.com/Biohub/esm.git@main
La versión oficial de PyPI está en preparación (al 17-06-2026 solo se admite instalación directa desde GitHub).
4-2. Ejemplo básico
from transformers import AutoModelForMaskedLM, AutoTokenizer
# Cargar ESMC-6B (Hugging Face; requiere autenticación)
model = AutoModelForMaskedLM.from_pretrained("biohub/ESMC-6B", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("biohub/ESMC-6B")
# Extraer embeddings de una secuencia proteica
sequence = "MKTAYIAKQRQISFVKSHFSRQLEERLGLIEVQAPILSRVGDGTQDNLSGAEKAVQVKVKALPDAQFEVVHSLAKWKRQQIA"
inputs = tokenizer(sequence, return_tensors="pt").to(model.device)
outputs = model(inputs, output_hidden_states=True)
embeddings = outputs.hidden_states[-1]
4-3. Acceso a la API de Biohub
# Obtener un token en la consola de desarrolladores de biohub.ai
from esm import esmc_client
client = esmc_client(
model="ESMC-6B",
url="https://biohub.ai/api",
token="YOUR_API_TOKEN"
)
result = client.predict(sequence="MKTAYIAK...")
🧬 Casos de uso en biociencias
Diseño de binders candidatos para terapias de anticuerpos
Generar minibinders de novo contra PD-L1 o CTLA-4, visualizar estructuras con PyMOL o ChimeraX y priorizar validación experimental. Verificar tasas de acierto y afinidad en el laboratorio.
Exploración funcional de proteínas sin anotación
Usar características SAE de ESM Atlas para agrupar proteínas desconocidas, visualizar embeddings ESMC-6B con UMAP e inferir funciones por similitud, por ejemplo para descubrir péptidos antimicrobianos.
Cribado estructural de grandes bibliotecas de variantes
Predecir en lote estructuras de decenas de miles de variantes sin MSA, filtrar por confianza y transferir candidatos a docking detallado con HADDOCK o ClusPro.
FAQ
¿Qué es ESMC / ESMFold2?
ESMC y ESMFold2 son modelos mundiales de biología proteica publicados por Biohub el 27 de mayo de 2026. ESMC preentrena 6.000 millones de parámetros con aproximadamente 2.800 millones de secuencias proteicas para aprender reglas evolutivas de diseño. ESMFold2 combina sus embeddings con un transformador recurrente y una arquitectura de difusión para predecir estructuras 3D all-atom a partir de una secuencia y diseñar binders terapéuticos. A diferencia de AlphaFold y otros métodos que dependen de alineamientos múltiples de secuencias (MSA), ESMC-ESMFold2 usa un transformador tipo BERT entrenado a escala sin MSA. Esto resulta útil para secuencias de rápida evolución, como anticuerpos. El proyecto informa mayor precisión que AlphaFold 3 en predicción anticuerpo-antígeno y aproximadamente 10 veces más velocidad en modo de secuencia única frente a métodos basados en MSA; estos resultados deben validarse en el conjunto de datos propio. Biohub diseñó binders de afinidad nanomolar para EGFR, PDGFRβ, PD-L1, CTLA-4 y CD45, con tasas de acierto del 36–88 % para minibinders compactos y del 15–29 % para formatos derivados de anticuerpos; un binder de PD-L1 restauró señales de células T en laboratorio. ESM Atlas permite explorar 6.800 millones de secuencias y 1.100 millones de estructuras predichas. Sus aproximadamente 16.000 características interpretables basadas en SAE ayudan a mapear funciones de proteínas sin anotación. El código y los modelos se publican bajo licencia MIT para uso local o mediante la API de Biohub.
¿Cuándo debería usar ESMC / ESMFold2?
Modelo mundial de biología proteica para comprender y diseñar proteínas a escala evolutiva.
¿Cuál es un caso de uso biomédico de ESMC / ESMFold2?
Diseño de binders candidatos para terapias de anticuerpos: Generar minibinders de novo contra PD-L1 o CTLA-4, visualizar estructuras con PyMOL o ChimeraX y priorizar validación experimental. Verificar tasas de acierto y afinidad en el laboratorio.
📝 Notas de actualización
Aún no hay notas de actualización.
🧪 Código de la vida relacionado
Aún no hay publicaciones relacionadas de Código de la vida.