F06 La siguiente pregunta: conocer la estructura no revela "cuán fuerte es la unión"
En F03, vimos que AlphaFold3 predice proteínas, ácidos nucleicos y moléculas pequeñas dentro de un mismo marco; en F06, analizamos cómo ESMFold extrae estructuras rápidamente sin necesidad de MSA. Sin embargo, existe un aspecto crucial que resulta frustrante en el desarrollo de fármacos: el hecho de que se haya predicho con precisión la estructura no implica que se indique la fuerza con la que el candidato a fármaco se une a la proteína diana. Los indicadores de confianza de AlphaFold3 reflejan la certeza de que "esta estructura es probable", lo cual es una pregunta distinta a la afinidad de unión (binding affinity), que se refiere a "cuán fuerte es realmente esta unión".
Tradicionalmente, para comparar con precisión la energía libre de unión relativa entre compuestos similares, se utilizan cálculos basados en dinámica molecular, como FEP (perturbación de energía libre). En lugar de ser un cálculo que surge al obtener la afinidad absoluta de un compuesto, el FEP estima típicamente la diferencia de energía libre del compuesto A al B, siguiendo una transformación alquímica y un ciclo termodinámico definidos.
Boltz-2 (MIT Jameel Clinic, 2025) está diseñado para realizar simultáneamente la predicción de estructuras (co-folding) y la predicción de afinidad de unión dentro de un único modelo. Su publicación bajo licencia MIT, que permite su uso comercial sin restricciones, lo distingue de otros modelos fundacionales tratados en los módulos F1.1 a F1.2.
Principio: acoplar un cabezal de regresión de afinidad sobre un modelo de difusión estructural
Revisitar el modelo de difusión tratado en F03
Recordarán que en F03 tratamos la parte de generación de estructuras de AlphaFold3 como un modelo de difusión (diffusion model). Un modelo de difusión comienza con ruido puro y, mediante la eliminación iterativa gradual del ruido, genera coordenadas significativas finales (en este caso, coordenadas atómicas tridimensionales). En cada paso, lo que el modelo aprende es la dirección en la que debe eliminar el ruido para acercarse a la distribución real de los datos, conocida como score (gradiente del logaritmo de la densidad de probabilidad).
Boltz-2 hereda directamente esta arquitectura base de generación de estructuras. Al igual que AlphaFold3, el enfoque general consiste en generar la estructura del complejo mediante un proceso de difusión al introducir conjuntamente proteínas y ligandos (moléculas pequeñas, ácidos nucleicos o péptidos).
Cabezal de afinidad: reformular como un problema de regresión
Lo nuevo que ha incorporado Boltz-2 es una cabeza de predicción de afinidad. Se entrena por separado una cabeza de regresión que toma como entrada la representación generada por el módulo de generación de estructuras (la representación latente en el estado de convergencia estructural) y predice un valor escalar correspondiente a la energía libre de unión.
La salida cuantitativa affinity_pred_value de la implementación pública no es ni . Según la documentación oficial, se trata de una escala de derivada de un en unidades de . La affinity_probability_binary adicional es la probabilidad de unión (binder) entre 0 y 1. Dado que ambas salidas se entrenan principalmente con diferentes supervisores, la primera debe interpretarse para la optimización hit-to-lead de binders conocidos, mientras que la segunda debe interpretarse para el descubrimiento inicial de hits, enfocándose en distinguir los binders entre los decoys.
Ejemplo de cálculo manual: ¿Cómo se traduce la diferencia de energía libre en una relación de constantes de unión?
Supongamos que las energías libres de unión predichas para dos compuestos, A y B, son y respectivamente (a una temperatura cercana a la corporal, , con ).
Una diferencia de apenas 2 kcal/mol en la energía libre implica que la constante de unión varía por un factor de aproximadamente 29. Este es un cálculo manual que explica la relación entre la energía libre física y la constante de unión, no una fórmula para convertir la affinity_pred_value de Boltz-2 a . El aumento de velocidad de aproximadamente 1000 veces frente a FEP reportado por los autores debe interpretarse como un valor comparativo basado en benchmarks y condiciones de ejecución específicos.
Práctica: Predicción de la estructura y la afinidad de complejos ligando-proteína con Boltz-2
# Ejecutar en Colab T4. Instalar repositorio oficial de Boltz.!pip install -q boltz
# Ejemplo de YAML de entrada (proteína + SMILES del ligando)cat << 'EOF' > input.yamlversion: 1sequences: - protein: id: A sequence: "MKTAYIAKQRQISFVKSHFSRQLEERLGLIEVQAPILSRVGDGTQDNLSGAEKAVQVKVKALPDAQFEVVHSLAKWKRQTLGQHDFSAGEGLYTHMKALRPDEDRLSPLHSVYVDQWDWELVMGDGDRQFSTLKSTVEAIWAGIKATEAAVSEEFGLAPFLPDQIHFVHSQELLSRYPDLDAKGRERAIAKDLGAVFLVGIGGKLSDGHRHDVRAPDYDDWSTPSELGHAGLNGDILVWNPVLEDAFELSSMGIRVDADTLKHQLALTGDEDRLELEWHQALLRGEMPQTIGGGIGQSRLTMLLLQLPHIGQVQAGVWPAAVRESVPSLL" - ligand: id: B smiles: "CC(=O)Oc1ccccc1C(=O)O" # Ejemplo de aspirinaproperties: - affinity: binder: BEOF
boltz predict input.yaml --out_dir ./boltz_output --diffusion_samples 5 --use_msa_server
# Valor cuantitativo de la serie affinity_pred_value: log10(IC50[μM])# affinity_probability_binary: probabilidad de ser un enlazador (0~1)Al aumentar diffusion_samples, se pueden muestrear varias estructuras candidatas y seleccionar la que tenga mayor confianza. La naturaleza estocástica del modelo de difusión tratado en F03 —que produce muestras ligeramente diferentes para la misma entrada— se aplica aquí de la misma manera.
Correspondencia de conceptos
- Ajuste de puntuación (Score Matching): Es una estructura que reutiliza el objetivo principal de aprendizaje del modelo de difusión tratado en F03 para el aprendizaje de representaciones en una tarea separada de predicción de afinidad.
- Aprendizaje multitarea (Multi-task Learning): Entrenar simultáneamente dos objetivos distintos, la generación de estructuras y la regresión de afinidad, sobre una misma representación base (backbone) es un diseño típico de redes neuronales multitarea que adjunta múltiples cabezas específicas de tarea (task-specific heads) a un único codificador.
- Reformulación de clasificación/regresión: Al predecir mediante regresión el valor continuo de energía libre en lugar de plantearlo como un problema de clasificación binaria ("¿se une o no?"), se permite una clasificación mucho más cuantitativa que con las puntuaciones de confianza como ipTM, tratadas en F05.
Problemas comunes
- Conversión arbitraria de unidades de salida a , , : La salida oficial se define como el valor del en . Difiere en signo y referencia de unidad de , por lo que convertir basándose solo en el nombre provoca grandes errores.
- Interpretación amplia del rango de soporte: El módulo de afinidad actual está dirigido a combinaciones de dianas proteicas y ligandos de molécula pequeña. Aunque el código podría no detenerse con dianas de ADN/ARN/cofactor, la documentación oficial advierte que sus salidas no son fiables.
- Confusión sobre el reemplazo completo de FEP: Boltz-2 es un "sustituto para cribado rápido" de FEP, pero no reemplaza por completo los cálculos tradicionales de FEP en la etapa final donde se requiere precisión. Los benchmarks de los autores originales también se presentan como una herramienta para la reducción de candidatos iniciales (triage).
- Confundir errores de SMILES con errores de estructura: Si la sintaxis del SMILES del ligando de entrada tiene un pequeño error, el modelo generará moléculas incorrectas. Si los resultados predichos son extraños, lo primero que se debe verificar es el propio parsing del SMILES.
Para profundizar más
El presente texto ha sido reestructurado directamente por el equipo de investigación de BPD. Profundice consultando el artículo original y la documentación oficial.
- Repositorio oficial e informe técnico de Boltz-2:
github.com/jwohlwend/boltz(MIT Jameel Clinic). Para conocer los valores exactos de los benchmarks y la composición de los datos de entrenamiento, es necesario consultar el documento original directamente. - Visión general de la metodología FEP: Cournia et al. (2020), Rigorous Free Energy Simulations in Virtual Screening, J. Chem. Inf. Model. — Contexto sobre por qué el método FEP tradicional tiene un alto costo computacional.
- Relación entre energía libre y constante de equilibrio: Es recomendable repasar la derivación de en la sección de las ecuaciones de van der Waals y van 't Hoff de los libros de texto de fisicoquímica.
En el próximo episodio F08, compararemos modelos de código abierto de predicción de estructuras y docking fuera de la familia AlphaFold: RoseTTAFold2, OpenFold y DiffDock.