Por qué esta entrega es el punto de partida para el Fullstack
Las 25 entregas de la categoría F1 (Foundation Model) de BPD se derivan de las ideas presentadas en esta entrega. ESMFold, RoseTTAFold2 y Boltz-2 son, en última instancia, implementaciones diferentes de este principio dentro del marco abierto por AlphaFold2. Por lo tanto, el primer paso en F1 no es aprender a manejar otros modelos fundacionales, sino comprender AlphaFold2 en sí mismo.
Establezcamos un principio de antemano: no vamos a transcribir el artículo de DeepMind de principio a fin. El original Nature 596, 583~589 (20
ya lo hace de manera adecuada. En esta entrega, reconstruiremos por qué fue necesaria esa decisión en cada punto. Si lo desea, puede profundizar en el texto original a través de los enlaces de curación al final de la entrega, que le dirigirán a clases magistrales.
Por qué la expresión "un desafío de 50 años" no es una exageración
En 1972, Christian Anfinsen pronunció estas palabras al recibir el Premio Nobel de Química:
"La estructura tridimensional de una proteína está determinada por su secuencia de aminoácidos".
Aunque esta afirmación parece contundente, "ya está determinada" y "podemos calcularla" son dos cosas completamente diferentes. Para una proteína pequeña de 300 aminoácidos, el número teórico de estructuras plegables posibles supera los . Esta cifra es más del doble del número de átomos en el universo. Esto se conoce como la paradoja de Levinthal. Sin embargo, dentro de la célula, esta se pliega con precisión en una única estructura estable en cuestión de microsegundos.
Durante medio siglo, dos enfoques han competido para resolver esta imposibilidad teórica:
- Basado en la física (ab initio): minimización de la energía libre total de las fuerzas interatómicas. Es preciso, pero se limita a moléculas pequeñas.
- Basado en plantillas (homology modeling): utiliza estructuras de secuencias similares ya resueltas experimentalmente como base. Es práctico, pero no puede generar nuevas estructuras.
En la competición bienal CASP (Critical Assessment of Structure Prediction), los mejores algoritmos de ambos enfoques se enfrentan. En CASP13 de 2018, AlphaFold1 de DeepMind hizo su primera aparición, obteniendo una puntuación GDT_TS de 58. Dado que el récord anterior estaba en los 40, fue un salto asombroso, aunque aún carecía de utilidad práctica.
En CASP14 de 2020, apareció AlphaFold2. Con una puntuación media GDT_TS de 92, el nivel es indistinguible del error experimental. El juego de 50 años ha terminado.
Tres ideas clave
Podemos dividir la arquitectura de AlphaFold2 en tres partes para analizarla:
- MSA — Para no perder la información de coevolución
- Evoformer — Aprendizaje cruzado entre MSA y pair representation
- Módulo de estructura (IPA) — Reconstrucción con coordenadas 3D
Analicemos cada parte.
1. MSA — ¿Por qué es decisivo el alineamiento múltiple de secuencias?
Si extraemos la misma proteína de los genomas de varias especies y las alineamos (el MSA que aprendimos en M25), observamos algo interesante. Dos posiciones específicas siempre cambian juntas. Si la posición A cambia de valina a isoleucina, la posición B también debe cambiar necesariamente. ¿Por qué? Porque esas dos posiciones están en contacto físico en 3D. Si una aumenta de tamaño, la otra también debe hacerlo para mantener la interacción.
A esto se le llama coevolución. Al extraer estadísticamente esta señal de coevolución del MSA, podemos determinar probabilísticamente qué residuos están en contacto en 3D sin necesidad de experimentos. Esta idea fue intentada por EVfold/GREMLIN alrededor de 2011. La diferencia decisiva de AlphaFold2 radica en que incorporó por completo la señal de coevolución del MSA en su arquitectura de aprendizaje profundo para el aprendizaje de representaciones.
En la primera etapa, se mapea la secuencia de entrada con bases de datos a gran escala (UniRef, MGnify, BFD) para generar el MSA. Este será el cuello de botella que nos afectará en la práctica posterior: el AlphaFold2 original tarda horas con HHblits, mientras que ColabFold tarda minutos con MMseqs2. Explicaremos las razones en la parte práctica.
2. Evoformer — El corazón de la arquitectura
El bloque Evoformer maneja simultáneamente dos representaciones:
- Representación del MSA: ( secuencias, posiciones, canales)
- Representación de pares: (relaciones entre todos los pares de residuos)
Estas dos representaciones intercambian información entre sí. La señal de coevolución del MSA fluye hacia la representación de pares, y las restricciones geométricas de la representación de pares regresan al MSA. Se apilan 48 bloques de este tipo.
El verdadero truco del Evoformer es la Atención Triangular (Triangle Attention). Cuando hay tres residuos , las distancias en el espacio 3D entre -, - e - deben satisfacer la desigualdad triangular: . Para integrar esta restricción triangular en la arquitectura, cada celda de la representación de pares debe referenciar necesariamente la información que pasa a través del tercer residuo al actualizarse. Esto estabiliza drásticamente la consistencia geométrica del resultado.
Es una variante de la autoatención (self-attention) de los Transformers y constituye la respuesta canónica al problema analizado en DryBench: "¿cómo incorporar conocimiento de dominio en la arquitectura al utilizar la atención?".
3. IPA (Atención de puntos invariantes) — mediante coordenadas 3D
Lo que genera el Evoformer sigue siendo una representación vectorial. Esta debe convertirse en coordenadas 3D reales . Aquí, la restricción de equivarianza rotacional y traslacional es crucial. La estructura plegada debe permanecer igual aunque la proteína se rote o se traslade globalmente. Las redes neuronales estándar no satisfacen automáticamente esta propiedad.
El IPA (Atención de puntos invariantes) del módulo de estructura representa cada residuo en un sistema de coordenadas local (el marco de tres átomos de la cadena principal), y el cálculo de la atención se define de forma que sea invariante a las transformaciones de este marco. Como resultado, es posible realizar una reconstrucción 3D robusta frente a rotaciones y traslaciones.
Esta es, a grandes rasgos, la visión general. El artículo original contiene muchos más trucos en sus detalles (reciclaje, simetría de IPA, cabezal de distograma, atención por fila/columna de MSA, etc.), pero si se comprenden estos tres conceptos, se puede entender cómo todos los modelos posteriores (ESMFold, RoseTTAFold2, Boltz-2, etc.) los han adaptado.
Práctica — Predicción de insulina con ColabFold
El AlphaFold2 original requiere al menos 32 GB de VRAM, pero ColabFold (Sergey Ovchinnikov · Milot Mirdita) ha permitido ejecutarlo en una GPU T4 gratuita. Dos trucos son determinantes:
- Búsqueda de MSA en la nube mediante MMseqs2: reduce el tiempo de HHblits de horas a minutos.
- Reducción del reciclaje y optimización de memoria: permite predecir monómeros de hasta 2500 aa con 15 GB de VRAM.
Abra un cuaderno de Colab y comencemos.
# Instalar ColabFold!pip install -q "colabfold[alphafold-minus-jax] @ git+https://github.com/sokrypton/ColabFold"!pip install --upgrade dm-haiku# Versión de JAX para GPU (adaptada al CUDA de Colab T4)!pip install --upgrade "jax[cuda12_pip]" -f https://storage.googleapis.com/jax-releases/jax_cuda_releases.html
from colabfold.batch import run
# Cadena A de la insulina (21 aminoácidos). Para reproducir el artículo, usar el dímero de las cadenas A y B.query_sequences = ["GIVEQCCTSICSLYQLENYCN"]result = run( query_sequences, result_dir="./output", num_models=5, # Ensamble de cinco modelos num_recycles=3, # Tres ciclos de reciclado use_msa=True, # Buscar el MSA con MMseqs2 use_templates=False, # Predicción pura sin plantillas zip_results=False,)print(result)Unos minutos después, aparecen cinco archivos PDB en output/. Cada encabezado de archivo incluye la puntuación pLDDT (confianza a nivel de residuo, 0~100) y la matriz PAE (error de alineamiento por pares).
- pLDDT > 90: Confianza muy alta. Coincide casi exactamente con la estructura experimental.
- pLDDT 70~90: Buena predicción. La estructura local es fiable.
- pLDDT 50~70: Precaución. Podría tratarse de regiones flexibles.
- pLDDT < 50: Generalmente desordenado. Sin información de plegamiento.
Cargue los archivos PDB en el visor Mol* (molstar.org) para rotarlos en 3D. Si predomina el color azul (alta confianza), la predicción es estable.
Defectos y riesgos frecuentes
- Predecir multímeros como monómeros: si solo se introduce la cadena A de la insulina, se pierde la estructura activa real. Es obligatorio usar la opción AlphaFold-Multimer.
- Intentar con secuencias largas (monómeros > 2,500aa · multímeros > 4,000aa): provoca un error de memoria (OOM) inmediato en Colab T4. Divida la secuencia por dominios o utilice una GPU de pago.
- Necesidad de estructuras activas con ligandos unidos: AlphaFold2 predice sin ligandos. Utilice Boltz-2 de F07 como alternativa.
- Re-predecir cuando ya existe en AlphaFold DB: ya hay aproximadamente 200 millones de modelos de UniProt registrados en alphafold.ebi.ac.uk. Realice una búsqueda primero.
- Desinformación en internet sobre "2 mil millones de modelos": la cifra exacta es de aproximadamente 200 millones. Cubren la mayoría de UniProt, pero se omiten las proteínas ultra grandes de más de 2,700aa.
Correspondencia con CS
- Transformer / Self-Attention: la base es Attention Is All You Need, analizado en DryBench. AlphaFold2 es la cúspide de la aplicación industrial que integra conocimiento de dominio (desigualdad triangular) sobre esta base.
- Redes neuronales gráficas (GNN): si se consideran los nodos de residuos y las aristas de contacto, es una GNN. La representación de pares (pair rep) actúa como la matriz de adyacencia.
- Redes neuronales equivariantes: integrar las simetrías de rotación y traslación en la arquitectura. IPA es la culminación de la evolución de las GNN biológicas.
- Recycling: la salida de la red neuronal se combina nuevamente con la entrada, actualizándose tres veces. Es una reinterpretación del eje temporal de una RNN como una mejora iterativa.
Ramas hacia el siguiente capítulo
- F03: AlphaFold3 — Arquitectura Pairformer y Diffusion. Predicción conjunta de ligandos, ADN y ARN.
- F04: ColabFold + MMseqs2 avanzado — Cómo optimizar la búsqueda de MSA de forma privada.
- F05: Multímeros + unión a ligandos — Detalles de AlphaFold-Multimer.
- F06: ESMFold — Solo con la secuencia, sin MSA. Ventaja en el procesamiento masivo.
- F07: Boltz-2 — Estructura y afinidad de unión simultáneamente. Cribado de fármacos 1.000 veces más rápido que FEP.
Si quieres profundizar más
El presente texto es una narrativa reconstruida por BPD. Profundicemos con el artículo original y las clases magistrales.
- Artículo original: Jumper et al. (2021), Highly accurate protein structure prediction with AlphaFold, Nature 596, 583–589. Es la SSoT (fuente única de verdad) de los detalles de la arquitectura.
- EMBL-EBI Training — AlphaFold: Structural Bioinformatics Revolution (60 min, excelente traducción automática de subtítulos). Clase magistral coproducida por EMBL y DeepMind. Explora los bloques Evoformer mediante diagramas.
- MIT 6.874 — AlphaFold and Deep Learning Protein Structure (subtítulos manuales) del profesor Manolis Kellis. Analiza profundamente la arquitectura desde la perspectiva del aprendizaje profundo.
- Stanford Online — Deep Learning for Structural Biology (58 min, subtítulos completos). El trasfondo de álgebra lineal de las redes equivariantes e IPA.
- Broad Institute MPG Primer — From Genetic Variation to Mechanism (AlphaFold3) (68 min). Aborda la conexión con la genómica clínica tras AlphaFold3.
- Bases de datos de referencia: alphafold.ebi.ac.uk (aprox. 200 millones de modelos), rcsb.org (estructuras experimentales), molstar.org (visor web).
Ejecutar una predicción con una proteína de tu interés en Colab T4 y verificar visualmente el pLDDT y el PAE es la mejor preparación antes de pasar al siguiente capítulo. En el próximo capítulo (F03), analizaremos cómo AlphaFold3 expandió esta arquitectura mediante un enfoque basado en difusión.