GPN-Star, IA genómica que refleja directamente el árbol filogenético, establece un nuevo estándar en la predicción de efectos de variantes del genoma completo

Antecedentes
De los 3.000 millones de pares de bases del genoma humano, solo alrededor del 1,5% codifica proteínas directamente. El resto, más del 98% de las regiones no codificantes, actúa como interruptores clave que regulan la expresión génica; sin embargo, verificar experimentalmente el impacto de las variantes de secuencia en las enfermedades ha sido prácticamente imposible. Aunque se han intentado algoritmos computacionales para medir la conservación evolutiva, estos han mostrado limitaciones al no reflejar adecuadamente el contexto de las secuencias de bases circundantes. Recientemente, los modelos de lenguaje genómico (gLM), que aprenden secuencias a gran escala como lenguaje natural, han surgido como una alternativa prometedora. El problema es que la mayoría de los modelos gLM existentes analizan secuencias de una sola especie o no consideran la distancia evolutiva al alinear secuencias de múltiples especies. La coincidencia de bases entre especies cercanas, como humanos y chimpancés, genera sesgos al actuar como datos redundantes, mientras que las variantes en especies con relaciones evolutivas distantes suelen subestimarse. Esto ha impulsado la necesidad de integrar directamente los árboles filogenéticos biológicos en los algoritmos de aprendizaje.
Hallazgos clave
Un equipo de investigación dirigido por la profesora Yun S. Lee del departamento de Ciencias de la Computación de la Universidad de California en Berkeley (UC Berkeley) El equipo de investigación de Song ha desarrollado y publicado en la revista Nature el modelo genómico GPN-Star, que combina datos de alineamiento del genoma completo (WGA) con distancias filogenéticas. A diferencia de los enfoques anteriores, que se limitaban a la ordenación múltiple por simple enumeración, el motor principal es una arquitectura consciente de la filogenia que mapea directamente los tiempos de divergencia evolutiva entre especies en las operaciones de atención cruzada. Al distanciarse de la práctica de centrarse únicamente en la secuencia humana como especie de referencia, se ha aumentado significativamente la densidad de la señal de aprendizaje mediante el enmascaramiento aleatorio de las secuencias de bases de múltiples especies alineadas. Tras entrenar con la filogenia de 241 especies de mamíferos y 100 especies de vertebrados, el modelo logró cuantificar con precisión la restricción funcional que actúa sobre todos los alelos en el genoma. Las métricas de evaluación muestran una diferencia clara. En el experimento de identificación de variantes de la base de datos de variantes clínicas ClinVar, GPN-Star superó ampliamente los indicadores de conservación existentes PhyloP y las puntuaciones de conjunto CADD. Se ha evaluado que la precisión para identificar variantes causales en estudios de asociación del genoma completo (GWAS) también es superior en las regiones reguladoras no codificantes, en comparación con el mejor modelo anterior. Hasta haber demostrado la flexibilidad trascendiendo las fronteras de las especies, ampliándose hasta el análisis del genoma de cinco modelos clave como ratones, pollos, moscas de la fruta, nematodos Caenorhabditis elegans y Arabidopsis thaliana.
Significado y perspectivas
La aparición de GPN-Star proporciona una guía poderosa para los investigadores del desarrollo de fármacos que rastreaban la asociación de enfermedades con variantes genéticas no codificantes. Aunque se realice una secuenciación del genoma completo (Whole-Genome Sequencing, WGS) a pacientes con enfermedades raras y difíciles de curar que no han encontrado la causa mediante la secuenciación del exoma, el proceso de identificar la verdadera causa entre millones de variantes no codificantes generadas se ha comparado a menudo con buscar una aguja en un pajar. La implementación de GPN-Star, que calcula con precisión las presiones evolutivas, promete aumentar la eficiencia del trabajo de compresión de los candidatos principales en varias veces. La decisión del equipo de investigación de publicar los puntajes obtenidos como pistas en el navegador de genomas UCSC y abrir completamente los pesos del modelo también se considera un factor que inyecta vitalidad al ecosistema. Esto se debe a que las pequeñas y medianas biotecnológicas, aunque no cuentan con equipos de computación de alto rendimiento, ahora pueden evaluar inmediatamente el riesgo de mutación con solo unos pocos clics. Sin embargo, existen desafíos prácticos claros que deben abordarse. En secuencias repetitivas difíciles de alinear o en regiones de variantes estructurales, la confianza en las predicciones tiende a ser algo inestable. Dado que se basa en la información de bases conservada por la historia evolutiva, también es evidente su limitación de no poder capturar en tiempo real la dinámica de expresión epigenética que ocurre en células o tejidos específicos. Esta es la razón por la que la integración con datos de accesibilidad de la cromatina a nivel de célula única se ha destacado como un desafío clave para la próxima generación.
Nature, Published online: 09 September 2026; doi:10.1038/s41586-026-11005-5GPN-Star, a genomic language model with a phylogeny-aware architecture for whole-genome alignment data, is shown to be a scalable and flexible tool for genetic variant effect prediction across species.
En el diagnóstico genómico clínico, se prevé su implementación inmediata en los flujos de trabajo para confirmar variantes patogénicas no codificantes en pacientes con enfermedades genéticas raras de origen desconocido. Cuando se realiza un análisis de genoma completo en pacientes que no fueron diagnosticados con pruebas de exoma estándar, la aplicación de las puntuaciones de GPN-Star permitiría filtrar rápidamente candidatos patogénicos ocultos en promotores o regiones profundas de intrones entre decenas de miles de variantes de significado incierto (VUS). En la industria farmacéutica y de biotecnología, actúa como una pista decisiva para el desarrollo de terapias génicas de próxima generación que apuntan a regiones no codificantes. Si se identifican con precisión los potenciadores o regiones silenciadoras clave que regulan la expresión de genes asociados a enfermedades, se establecerá un sistema para diseñar terapias de regulación transcripcional basadas en oligonucleótidos antisentido (ASO) o en gene editing con una precisión mucho mayor. El sector de la bioeconomía agropecuaria también obtiene beneficios prácticos al seleccionar rápidamente variantes beneficiosas que determinan la resistencia a enfermedades en los cultivos o la productividad del ganado, lo que acorta los ciclos de mejoramiento genético.