Volver a la lista

Diseño de novo de proteínas: Creación de proteínas inexistentes con RFdiffusion + ProteinMPNN

Se aborda la combinación de un pipeline que genera el backbone mediante un modelo difusivo y rellena la secuencia resolviendo el problema inverso (RFdiffusion + ProteinMPNN), junto con el procedimiento de validación por autoconsistencia.

Avanzado
|
25min
|
Verificado (2026-07-29)
RFdiffusionde novo designself-consistencyprotein design
Progreso0/120 (0%)

La pregunta final que atraviesa F1.1~F1.3: De la predicción al diseño

F02~F05 preguntaron "¿cuál es la estructura de una secuencia ya existente?". F06~F10 extendieron esta predicción para ser más rápida (F06), incluir información de unión (F07~F09) y el movimiento a lo largo del tiempo (F10). F11~F14 abordaron la probabilidad, generación y efectos de mutación de la propia secuencia. Este capítulo es la parada natural de todo este flujo. ¿Podemos diseñar desde cero una proteína completamente nueva que nunca ha existido en la naturaleza, con la estructura y función deseadas?

El pipeline que conecta RFdiffusion (Baker Lab, 2023) y ProteinMPNN es uno de los enfoques potentes más utilizados. El flujo de trabajo varía según el objetivo: scaffolding de motivos, diseño de ligandos, simetría, generación solo con secuencias, etc.

Principio — Resolver el problema de diseño en dos etapas

Etapa 1: Generación del backbone con RFdiffusion

RFdiffusion reutiliza la arquitectura de RoseTTAFold2 descrita en F08 mediante un modelo de difusión. Se aplica directamente la lógica del modelo de difusión encontrada varias veces en F03, F07 y F08: partir de ruido aleatorio y eliminarlo gradualmente para generar coordenadas plausibles del backbone (esqueleto) de la proteína.

xTN(0,I)difusioˊn inversaxT1x0=coordenadas del backbone generadox_T \sim \mathcal{N}(0, I) \xrightarrow{\text{difusión inversa}} x_{T-1} \rightarrow \cdots \rightarrow x_0 = \text{coordenadas del backbone generado}

Lo crucial aquí es la condicionamiento. No se genera cualquier backbone aleatoriamente; se inyectan condiciones en el proceso de difusión, como "que tenga esta estructura simétrica", "que esta parte contenga un motivo de unión específico" o "que la longitud total sea de 100~150 residuos", para inducir la generación de un backbone que cumpla con los objetivos de diseño deseados.

Etapa 2: Relleno de secuencia con ProteinMPNN

Lo que RFdiffusion produce son únicamente coordenadas (la forma tridimensional del backbone), no la secuencia de aminoácidos que realmente formaría esa estructura. Aquí aparece nuevamente ProteinMPNN de F14, que resuelve el problema de plegamiento inverso: "Dado este backbone estructural fijo, ¿cuál es la secuencia que mantendrá estable esta estructura?", rellenando así la secuencia.

RFdiffusion:coordenadas del backbone,ProteinMPNN:coordenadas del backbonesecuencia\text{RFdiffusion}: \emptyset \rightarrow \text{coordenadas del backbone}, \qquad \text{ProteinMPNN}: \text{coordenadas del backbone} \rightarrow \text{secuencia}

Los dos modelos se conectan secuencialmente, completando esta estrategia de diseño en dos etapas: "primero crear la forma y luego rellenar la secuencia adecuada para esa forma".

Paso 3: Verificación mediante self-consistency

Sin embargo, aún no se ha confirmado si la secuencia extraída por ProteinMPNN se plegará realmente en la estructura que RFdiffusion pretendía. Para esta verificación, se utilizan nuevamente los modelos de predicción de estructura tratados en F02~F06 (principalmente AlphaFold2 o ESMFold). Este proceso de verificación se denomina self-consistency.

Secuencia generadareplegado con AlphaFold2/ESMFoldEstructura predichacomparacioˊnestructura objetivo de RFdiffusion\text{Secuencia generada} \xrightarrow{\text{replegado con AlphaFold2/ESMFold}} \text{Estructura predicha} \xrightarrow{\text{comparación}} \text{estructura objetivo de RFdiffusion}

La similitud entre las dos estructuras se mide mediante el TM-score (o RMSD) tratado en F05.

TM-score de autoconsistencia=TM(backbone objetivo, estructura obtenida al replegar la secuencia de ProteinMPNN)\text{TM-score de autoconsistencia} = \text{TM}(\text{backbone objetivo},\ \text{estructura obtenida al replegar la secuencia de ProteinMPNN})

Un valor alto constituye la base computacional de una alta consistencia con el plegamiento (fold) objetivo. No obstante, el flujo de trabajo de RFdiffusion utiliza conjuntamente métricas como self-consistency RMSD (scRMSD), pLDDT, PAE e indicadores de interfaz, dependiendo del tipo de diseño. No se debe fijar un TM-score de 0.5 como un umbral de aprobación universal, sino que se debe seguir el cutoff del protocolo correspondiente.

Ejemplo de cálculo manual: Rendimiento del bucle generación-verificación

Supongamos que RFdiffusion genera 100 candidatos de backbone y que, para cada backbone, ProteinMPNN propone 8 secuencias diferentes. El número total de secuencias candidatas es

100×8=800 unidades100 \times 8 = 800\text{ unidades}

Si la proporción que supera la verificación de self-consistency es empíricamente del 10%, los candidatos que pasarán a la siguiente etapa (síntesis y verificación experimental) son

800×0.10=80 unidades800 \times 0.10 = 80\text{ unidades}

Aunque sigue siendo un número mucho menor que sintetizar y verificar las 800 unidades completas en el laboratorio, incluso esto sigue siendo una escala considerable desde la perspectiva de los recursos de experimentación húmeda (expresión, purificación y verificación funcional de proteínas). Por ello, en la práctica, se suele pasar por una etapa de filtrado posterior para repriorizar estas 80 unidades, combinando la puntuación de self-consistency, la puntuación de confianza de la secuencia de ProteinMPNN y puntuaciones de predicción de características adicionales (similares a las tratadas en F07).

Práctica: Ejecución conceptual del pipeline RFdiffusion + ProteinMPNN

bash
# RFdiffusion real requiere instalar los pesos y un entorno CUDA.
# Comprueba primero el procedimiento vigente del Colab/README oficial y la memoria de GPU disponible.
git clone https://github.com/RosettaCommons/RFdiffusion
cd RFdiffusion
# Para instalarlo, sigue el archivo de entorno conda y el script de descarga de pesos del README.
# Paso 1: generar un esqueleto sencillo sin condicionamiento (ejemplo de 80 residuos)
python scripts/run_inference.py \
'contigmap.contigs=[80-80]' \
inference.output_prefix=outputs/design \
inference.num_designs=10
# Paso 2: completar la secuencia de cada esqueleto generado con ProteinMPNN
git clone https://github.com/dauparas/ProteinMPNN
python ProteinMPNN/protein_mpnn_run.py \
--pdb_path outputs/design_0.pdb \
--num_seq_per_target 8 \
--out_folder outputs/sequences
# Paso 3: validación de autoconsistencia — replegado rápido con ESMFold de F06 (código conceptual)
# (Introducir cada secuencia generada en la canalización ESMFold de F06 y compararla con el esqueleto objetivo mediante TM-score)

Ejecutar el flujo de trabajo completo en la capa gratuita de Colab es irrealista a escala de producción. Es más práctico comenzar con un conjunto pequeño (50–80 secuencias, diseño reducido) para comprender el flujo y realizar la campaña de diseño formal en recursos de GPU más abundantes.

Mapeo CS

  • Bucle generar-verificar (Generate-and-Verify Loop): Este pipeline genera candidatos en masa y los filtra mediante un procedimiento de verificación separado; estructuralmente, es idéntico al paradigma generate-and-test de la síntesis de programas, donde se crea un programa candidato con un generador y se verifica con pruebas.
  • Composición de pipelines (Pipeline Composition): Conectar secuencialmente tres modelos entrenados para propósitos distintos (generación, plegamiento inverso, discriminación) para resolver un problema superior es típico del diseño de software que combina módulos especializados.
  • Combinación de difusión condicional + plegamiento inverso: Este diseño conecta secuencialmente los modelos de difusión de F03, F07 y F08 con el plegamiento inverso (inverse folding) de F14; es un buen ejemplo de cómo paradigmas computacionales diferentes ("generación" e "inversión") se complementan en la práctica.

Defectos frecuentes

  • Confundir el paso de self-consistency con la obtención de funcionalidad: self-consistency solo verifica la probabilidad de que la secuencia diseñada se pliegue en la forma objetivo. Que esa estructura tenga realmente la funcionalidad deseada (actividad enzimática, afinidad de unión, etc.) requiere una verificación completamente independiente (predicción de afinidad con F07, ensayos experimentales).
  • Interpretar erróneamente casos de éxito minoritarios como tasas de éxito generales: La tasa de éxito experimental del diseño de novo varía enormemente según el objetivo y la dificultad del diseño. El 10 % calculado a mano es un valor hipotético para ilustración; las tasas de paso reales deben verificse directamente en los artículos originales o informes de proyecto.
  • Configurar parámetros de condicionamiento de forma imprecisa: Si se especifican incorrectamente configuraciones como contigmap, se generarán backbones no deseados. Es necesario comprender con precisión la sintaxis contig de la documentación de RFdiffusion antes de comenzar.

Para profundizar

El texto ha sido reescrito directamente por el equipo de investigación de BPD. Profundice consultando los artículos originales y la documentación oficial.

  • Artículo original de RFdiffusion: Watson et al. (2023), De novo design of protein structure and function with RFdiffusion, Nature 620.
  • Artículo original de ProteinMPNN: Consulte Dauparas et al. (2022) para F14.
  • Antecedentes de la metodología de validación de autoconsistencia en el diseño de novo: Procedimientos de evaluación de las revisiones sobre Baker Lab y los READMEs de los repositorios oficiales de RFdiffusion y ProteinMPNN.

Se han completado los tres subtemas F1.1 a F1.3 (15 artículos sobre predicción de estructuras). En los siguientes cinco artículos (F16 a F20), dejaremos las proteínas para pasar a modelos fundacionales que abordan directamente el ADN y el ARN, como DNABERT, Nucleotide Transformer y la serie Evo.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...