Tras completar la capa System S2, hacia una dimensión completamente distinta
Desde S26 hasta S50, hemos abordado la capa System, donde analizamos estadísticamente datos de secuencia, expresión y mutación. A partir de aquí, pasamos a la capa Fullstack, que plantea preguntas radicalmente diferentes: el mundo de los modelos fundacionales (Foundation Models) capaces de predecir tanto la estructura tridimensional como la función de las moléculas basándose únicamente en la información de secuencia.
El punto de partida es uno de los problemas más antiguos de la biología: la predicción de la estructura proteica (Protein Structure Prediction). Cuando se establece la secuencia de aminoácidos (estructura primaria) de una proteína, esta se pliega espontáneamente en una forma tridimensional específica (plegamiento), y dicha forma es el factor determinante clave para su función (aunque existen excepciones que no pueden explicarse solo por la estructura, como la dinámica, los socios de unión, las modificaciones postraduccionales o las regiones intrínsecamente desordenadas). Mientras que la secuencia puede leerse fácilmente mediante secuenciación, hasta hace poco dependíamos de experimentos (cristalografía de rayos X, RMN y microscopía crioelectrónica) para determinar cómo se pliega realmente esa secuencia en una estructura tridimensional. En esta sección, repasamos la historia de por qué este problema era tan difícil y cómo el paradigma cambió desde la búsqueda basada en física hasta las funciones aprendidas mediante aprendizaje automático.
La paradoja de Levinthal y la transición de la búsqueda al aprendizaje
La paradoja de Levinthal: ¿por qué la búsqueda aleatoria no da con la respuesta?
En 1969, Cyrus Levinthal aclaró la esencia de este problema mediante un cálculo sencillo. Para una proteína compuesta por 100 aminoácidos, si simplificamos las combinaciones de ángulos diedros del esqueleto (backbone dihedral angle) que puede adoptar cada residuo de aminoácido a solo tres estados posibles, el número total de combinaciones es el siguiente:
Si asumimos que se tarda segundos (la escala de tiempo de las vibraciones moleculares) en probar una combinación, el tiempo necesario para realizar una búsqueda secuencial de todas las combinaciones sería:
El tiempo es aproximadamente 17 órdenes de magnitud (alrededor de veces) más largo que la edad del universo (aproximadamente segundos) (este cálculo simplifica pedagógicamente el argumento original de Levinthal; en realidad, los grados de libertad incluyen ángulos diedros y ángulos de rotación de las cadenas laterales, entre otros). Sin embargo, el tiempo real de plegamiento de proteínas es del orden de microsegundos para algunas proteínas pequeñas que se pliegan ultrarrápidamente, y de milisegundos a segundos para muchas otras, siendo aún más lento en algunos casos; en cualquier caso, es inmensamente más corto que el tiempo de búsqueda aleatoria calculado anteriormente. Esta contradicción es la paradoja de Levinthal (Levinthal's Paradox): la teoría actual sostiene que el paisaje de energía libre de plegamiento tiene generalmente forma de embudo (funnel), alcanzando estados de baja energía relativamente rápido a través de un camino de descenso estocástico impulsado por fluctuaciones térmicas, en lugar de una búsqueda aleatoria (no obstante, el paisaje real no es una pendiente única suave, sino un terreno accidentado con múltiples rutas, intermediarios y trampas locales). Esto está relacionado, pero no es idéntico, a la hipótesis termodinámica de Anfinsen (Premio Nobel de 1973: la afirmación separada de que en un entorno específico la secuencia determina la estructura final y que esa estructura es termodinámicamente estable).
CASP: los Juegos Olímpicos bienales que miden objetivamente la capacidad de predicción
Para rastrear cuantitativamente este problema, se celebra cada dos años desde 1994 el CASP (Critical Assessment of Structure Prediction). El método consiste en revelar anticipadamente a los equipos participantes secuencias cuya estructura experimental aún no ha sido resuelta, recibir sus predicciones y evaluarlas ciegamente una vez que la estructura experimental esté disponible. Durante décadas, el ranking del CASP ha servido como la medida oficial del progreso en este campo.
La era de la búsqueda basada en física: ensamblaje de fragmentos de Rosetta + Monte Carlo
Si entendemos el paisaje de energía como un embudo, el problema restante es "cómo seguir bajando por ese embudo mediante cálculos". El laboratorio de Baker desarrolló Rosetta (finales de la década de 1990 en adelante), que combina dos estrategias:
- Ensamblaje de fragmentos (Fragment Assembly): toma fragmentos de estructura local similares a pequeños trozos de secuencia conocidos, extraídos de bases de datos de estructuras conocidas.
- Búsqueda de Monte Carlo (Monte Carlo Search): intenta variaciones locales aleatorias basándose en una función de puntuación empírica que mezcla términos físicos y estadísticos (aproximando interacciones como puentes de hidrógeno, fuerzas de van der Waals e interacciones hidrofóbicas). La clave es aceptar movimientos que reduzcan la energía y, a veces, aceptar movimientos que aumenten la energía según el criterio de Metropolis (una probabilidad basada en la temperatura y el aumento de energía) para evitar quedar atrapado en mínimos locales; no se trata simplemente de una búsqueda codiciosa que solo acepta cuando la energía disminuye.
Este enfoque no es un cálculo directo de la física real, sino una búsqueda heurística que optimiza el espacio de búsqueda mediante fragmentos basados en conocimiento y movimientos estocásticos. Durante años, este método mantuvo a CASP entre los mejores, pero sigue teniendo límites claros para proteínas grandes o nuevos pliegues (novel fold).
La llegada del aprendizaje profundo: de la búsqueda a funciones aprendidas
A mediados de la década de 2010, el aprendizaje profundo comenzó a cambiar esta estructura. Primero, los modelos basados en CNN (como RaptorX) predijeron directamente la probabilidad de contacto y la distribución de distancias entre pares de aminoácidos a partir de patrones de coevolución evolutiva de las secuencias. En CASP13 de 2018, AlphaFold (primera generación) de DeepMind ganó al combinar esta predicción de distancias con un postprocesamiento basado en física que optimizaba mediante descenso de gradiente. Luego, en CASP14 de 2020, AlphaFold2 integró la predicción de distancias y el ensamblaje estructural en una sola red neuronal de extremo a extremo (end-to-end), redefiniendo prácticamente este campo con una precisión cercana al nivel de error experimental de varios equipos participantes (sin embargo, dado que AlphaFold2 utiliza actualizaciones iterativas mediante reciclaje, es más preciso decir que redujo drásticamente la dependencia del muestreo conformacional explícito a gran escala en comparación con Rosetta, más que eliminar por completo la búsqueda iterativa). Si Rosetta representaba una estrategia de "hacer la búsqueda más inteligente", AlphaFold2 puso mucho más énfasis en el paradigma de "aprender directamente los datos la función que va de la secuencia a la estructura".
Mapeo CS
- Evolución de los algoritmos de búsqueda (Búsqueda heurística → Función aprendida): Se produjo un cambio de paradigma similar al de la IA de ajedrez y Go, que pasó de la búsqueda en árbol minimax (enfoque tradicional) a la predicción directa de buenos movimientos por parte de redes neuronales (AlphaZero); en la predicción de estructuras proteicas, este cambio ocurrió de Rosetta (búsqueda) a AlphaFold (función aprendida).
- Explosión combinatoria: El espacio de estados del orden que muestra la paradoja de Levinthal es un ejemplo típico de problemas de optimización combinatoria donde el número de estados explota exponencialmente en proporción al número de variables.
- Paisaje energético y descenso de gradiente: La intuición compartida con la optimización del aprendizaje profundo, donde el descenso de gradiente funciona bien en paisajes de funciones de pérdida bien diseñados incluso sin convexidad perfecta, es que acercarse a la solución óptima global solo mediante optimización local siguiendo un paisaje energético en forma de embudo.
Defectos comunes
- Malinterpretar la paradoja de Levinthal como "el plegamiento es aleatorio": La conclusión de la paradoja es lo contrario: el núcleo del argumento es que el plegamiento es rápido precisamente porque no es una búsqueda aleatoria; la paradoja es simplemente un cálculo que muestra que la "hipótesis de búsqueda aleatoria" es incorrecta.
- Confundir el ranking de CASP con un indicador absoluto de rendimiento: El ranking de CASP puede fluctuar según la dificultad de las secuencias diana planteadas en cada edición. Es necesario observar tanto la tendencia a lo largo de múltiples ediciones como la clasificación por nivel de dificultad de las dianas (nuevo plegamiento frente a basado en plantilla).
- Desestimar Rosetta como un método completamente obsoleto: La familia de herramientas Rosetta sigue utilizándose activamente en el diseño de proteínas de novo, el acoplamiento molecular y el refinamiento en regiones donde AlphaFold muestra una confianza baja. Aunque ha cedido su posición principal en la predicción de estructuras, la herramienta en sí no ha desaparecido.
Para profundizar más
El texto ha sido reescrito directamente por el equipo de investigación de BPD. Profundice consultando los artículos originales y los materiales oficiales.
- La paradoja de Levinthal: Levinthal (1969), How to Fold Graciously — No es un artículo de revista, sino el manuscrito de una presentación en la conferencia Mössbauer Spectroscopy in Biological Systems.
- Artículo original de la hipótesis termodinámica de Anfinsen: Anfinsen (1973), Principles that Govern the Folding of Protein Chains, Science, 181(4096):223–230.
- Artículo original de AlphaFold (primera generación): Senior et al. (2020), Improved protein structure prediction using potentials from deep learning, Nature, 577:706–710.
- Sitio web oficial de CASP:
predictioncenter.org— Publica los resultados históricos de CASP y la metodología de evaluación (CASP es un sistema de evaluación independiente y a ciegas representativo, y el ranking de una edición específica puede fluctuar según la dificultad de las dianas de ese año).
Hemos examinado por qué y cómo ha cambiado el paradigma. En el siguiente capítulo, analizaremos directamente el núcleo del punto máximo de esta transición: la arquitectura interna de AlphaFold2, extrayendo información de coevolución a partir de MSA y explorando el Triangle Attention de Evoformer.
El próximo capítulo F02 aborda los principios de MSA, Evoformer y Triangle Attention de AlphaFold2 (ya ha sido publicado).