La pregunta final que atraviesa F1.1~F1.3: De la predicción al diseño
F02~F05 preguntaron "¿cuál es la estructura de una secuencia ya existente?". F06~F10 extendieron esta predicción para ser más rápida (F06), incluir información de unión (F07~F09) y el movimiento a lo largo del tiempo (F10). F11~F14 abordaron la probabilidad, generación y efectos de mutación de la propia secuencia. Este capítulo es la parada natural de todo este flujo. ¿Podemos diseñar desde cero una proteína completamente nueva que nunca ha existido en la naturaleza, con la estructura y función deseadas?
El pipeline que conecta RFdiffusion (Baker Lab, 2023) y ProteinMPNN es uno de los enfoques potentes más utilizados. El flujo de trabajo varía según el objetivo: scaffolding de motivos, diseño de ligandos, simetría, generación solo con secuencias, etc.
Principio — Resolver el problema de diseño en dos etapas
Etapa 1: Generación del backbone con RFdiffusion
RFdiffusion reutiliza la arquitectura de RoseTTAFold2 descrita en F08 mediante un modelo de difusión. Se aplica directamente la lógica del modelo de difusión encontrada varias veces en F03, F07 y F08: partir de ruido aleatorio y eliminarlo gradualmente para generar coordenadas plausibles del backbone (esqueleto) de la proteína.
Lo crucial aquí es la condicionamiento. No se genera cualquier backbone aleatoriamente; se inyectan condiciones en el proceso de difusión, como "que tenga esta estructura simétrica", "que esta parte contenga un motivo de unión específico" o "que la longitud total sea de 100~150 residuos", para inducir la generación de un backbone que cumpla con los objetivos de diseño deseados.
Etapa 2: Relleno de secuencia con ProteinMPNN
Lo que RFdiffusion produce son únicamente coordenadas (la forma tridimensional del backbone), no la secuencia de aminoácidos que realmente formaría esa estructura. Aquí aparece nuevamente ProteinMPNN de F14, que resuelve el problema de plegamiento inverso: "Dado este backbone estructural fijo, ¿cuál es la secuencia que mantendrá estable esta estructura?", rellenando así la secuencia.
Los dos modelos se conectan secuencialmente, completando esta estrategia de diseño en dos etapas: "primero crear la forma y luego rellenar la secuencia adecuada para esa forma".
Paso 3: Verificación mediante self-consistency
Sin embargo, aún no se ha confirmado si la secuencia extraída por ProteinMPNN se plegará realmente en la estructura que RFdiffusion pretendía. Para esta verificación, se utilizan nuevamente los modelos de predicción de estructura tratados en F02~F06 (principalmente AlphaFold2 o ESMFold). Este proceso de verificación se denomina self-consistency.
La similitud entre las dos estructuras se mide mediante el TM-score (o RMSD) tratado en F05.
Un valor alto constituye la base computacional de una alta consistencia con el plegamiento (fold) objetivo. No obstante, el flujo de trabajo de RFdiffusion utiliza conjuntamente métricas como self-consistency RMSD (scRMSD), pLDDT, PAE e indicadores de interfaz, dependiendo del tipo de diseño. No se debe fijar un TM-score de 0.5 como un umbral de aprobación universal, sino que se debe seguir el cutoff del protocolo correspondiente.
Ejemplo de cálculo manual: Rendimiento del bucle generación-verificación
Supongamos que RFdiffusion genera 100 candidatos de backbone y que, para cada backbone, ProteinMPNN propone 8 secuencias diferentes. El número total de secuencias candidatas es
Si la proporción que supera la verificación de self-consistency es empíricamente del 10%, los candidatos que pasarán a la siguiente etapa (síntesis y verificación experimental) son
Aunque sigue siendo un número mucho menor que sintetizar y verificar las 800 unidades completas en el laboratorio, incluso esto sigue siendo una escala considerable desde la perspectiva de los recursos de experimentación húmeda (expresión, purificación y verificación funcional de proteínas). Por ello, en la práctica, se suele pasar por una etapa de filtrado posterior para repriorizar estas 80 unidades, combinando la puntuación de self-consistency, la puntuación de confianza de la secuencia de ProteinMPNN y puntuaciones de predicción de características adicionales (similares a las tratadas en F07).
Práctica: Ejecución conceptual del pipeline RFdiffusion + ProteinMPNN
# RFdiffusion real requiere instalar los pesos y un entorno CUDA.# Comprueba primero el procedimiento vigente del Colab/README oficial y la memoria de GPU disponible.
git clone https://github.com/RosettaCommons/RFdiffusioncd RFdiffusion# Para instalarlo, sigue el archivo de entorno conda y el script de descarga de pesos del README.
# Paso 1: generar un esqueleto sencillo sin condicionamiento (ejemplo de 80 residuos)python scripts/run_inference.py \ 'contigmap.contigs=[80-80]' \ inference.output_prefix=outputs/design \ inference.num_designs=10
# Paso 2: completar la secuencia de cada esqueleto generado con ProteinMPNNgit clone https://github.com/dauparas/ProteinMPNNpython ProteinMPNN/protein_mpnn_run.py \ --pdb_path outputs/design_0.pdb \ --num_seq_per_target 8 \ --out_folder outputs/sequences
# Paso 3: validación de autoconsistencia — replegado rápido con ESMFold de F06 (código conceptual)# (Introducir cada secuencia generada en la canalización ESMFold de F06 y compararla con el esqueleto objetivo mediante TM-score)Ejecutar el flujo de trabajo completo en la capa gratuita de Colab es irrealista a escala de producción. Es más práctico comenzar con un conjunto pequeño (50–80 secuencias, diseño reducido) para comprender el flujo y realizar la campaña de diseño formal en recursos de GPU más abundantes.
Mapeo CS
- Bucle generar-verificar (Generate-and-Verify Loop): Este pipeline genera candidatos en masa y los filtra mediante un procedimiento de verificación separado; estructuralmente, es idéntico al paradigma generate-and-test de la síntesis de programas, donde se crea un programa candidato con un generador y se verifica con pruebas.
- Composición de pipelines (Pipeline Composition): Conectar secuencialmente tres modelos entrenados para propósitos distintos (generación, plegamiento inverso, discriminación) para resolver un problema superior es típico del diseño de software que combina módulos especializados.
- Combinación de difusión condicional + plegamiento inverso: Este diseño conecta secuencialmente los modelos de difusión de F03, F07 y F08 con el plegamiento inverso (inverse folding) de F14; es un buen ejemplo de cómo paradigmas computacionales diferentes ("generación" e "inversión") se complementan en la práctica.
Defectos frecuentes
- Confundir el paso de self-consistency con la obtención de funcionalidad: self-consistency solo verifica la probabilidad de que la secuencia diseñada se pliegue en la forma objetivo. Que esa estructura tenga realmente la funcionalidad deseada (actividad enzimática, afinidad de unión, etc.) requiere una verificación completamente independiente (predicción de afinidad con F07, ensayos experimentales).
- Interpretar erróneamente casos de éxito minoritarios como tasas de éxito generales: La tasa de éxito experimental del diseño de novo varía enormemente según el objetivo y la dificultad del diseño. El 10 % calculado a mano es un valor hipotético para ilustración; las tasas de paso reales deben verificse directamente en los artículos originales o informes de proyecto.
- Configurar parámetros de condicionamiento de forma imprecisa: Si se especifican incorrectamente configuraciones como
contigmap, se generarán backbones no deseados. Es necesario comprender con precisión la sintaxis contig de la documentación de RFdiffusion antes de comenzar.
Para profundizar
El texto ha sido reescrito directamente por el equipo de investigación de BPD. Profundice consultando los artículos originales y la documentación oficial.
- Artículo original de RFdiffusion: Watson et al. (2023), De novo design of protein structure and function with RFdiffusion, Nature 620.
- Artículo original de ProteinMPNN: Consulte Dauparas et al. (2022) para F14.
- Antecedentes de la metodología de validación de autoconsistencia en el diseño de novo: Procedimientos de evaluación de las revisiones sobre Baker Lab y los READMEs de los repositorios oficiales de RFdiffusion y ProteinMPNN.
Se han completado los tres subtemas F1.1 a F1.3 (15 artículos sobre predicción de estructuras). En los siguientes cinco artículos (F16 a F20), dejaremos las proteínas para pasar a modelos fundacionales que abordan directamente el ADN y el ARN, como DNABERT, Nucleotide Transformer y la serie Evo.