OmicsPred, una plataforma que reúne modelos genéticos predictivos multioómicos y amplía el paisaje de la exploración de dianas farmacéuticas

Contexto
Los modelos genéticos predictivos que estiman el impacto de las variantes genéticas en la expresión de ARN, la concentración de proteínas y los niveles de metabolitos se han convertido en herramientas clave para elucidar mecanismos patológicos y descubrir dianas farmacéuticas. Análisis como el de transcritoma asociado (TWAS) o el de proteoma asociado (PWAS) permiten estimar indirectamente rasgos moleculares a partir de datos de asociación genómica (GWAS) y vincularlos con enfermedades. Su ventaja radica en que permiten explorar la ruta desde el gen hasta el rasgo molecular y la enfermedad sin necesidad de tomar muestras directas de los tejidos de los pacientes.
El problema radicaba en que los modelos estaban dispersos en anexos de artículos, servidores de laboratorios o repositorios como PredictDB. Las coordenadas de variantes, las alelos efectores y los formatos de pesos variaban, y en muchos casos faltaban información sobre la composición ancestral de los grupos de entrenamiento o los tejidos y plataformas de medición. Esto dificultaba aplicar modelos en cohortes independientes o comparar capas oómicas diferentes. En particular, los modelos desarrollados en grupos de ascendencia europea, al aplicarse directamente a otros grupos, podían mostrar variaciones en la potencia de detección y en las estimaciones de efecto.
Un equipo de la Universidad de Cambridge construyó la plataforma abierta OmicsPred para reducir estas discontinuidades. Los resultados se publicaron el 1 de septiembre de 2026 en Nature Genetics.
Hallazgos clave
OmicsPred asigna un identificador OPGS a cada puntuación predictiva y proporciona coordenadas cromosómicas o rsID, alelos efectores y pesos por variante en un formato estándar. Además, conecta con la versión original del genoma, los rasgos moleculares, los tejidos y plataformas de medición, los métodos de desarrollo del modelo, el tamaño y la composición ancestral de las muestras de entrenamiento y validación, los indicadores de rendimiento y las condiciones de uso. Los genes, transcritomas, proteomas y metabolomas se vinculan con Ensembl, UniProt y ChEBI, y los tejidos y fenotipos se normalizan con ontologías reconocidas.
El formato de archivos se diseñó siguiendo las normas del catálogo de puntuaciones multigenéticas (PGS Catalog). Los usuarios pueden descargar modelos en formatos compatibles con pgsc_calc o PredictDB para MetaXcan. También se ofrece una interfaz REST (API) para buscar metadatos dentro del programa. El código de implementación de la plataforma y la base de datos se publica bajo licencia Apache 2.0.
El equipo validó la viabilidad usando datos de GWAS de enfermedades del Programa de Veteranos de los EE.UU. (Million Veteran Program, MVP). Analizaron 9 conjuntos de datos con 38.450 puntuaciones de transcritoma y proteoma basados en sangre y plasma con S-PrediXcan. Evaluaron 1.233, 986 y 719 rasgos PheCode en grupos de ascendencia europea, africana y mixta, respectivamente, emparejando solo GWAS con grupos de entrenamiento y ascendencia similares. Excluyeron puntuaciones con menos del 75 % de coincidencia con las variantes de GWAS y corrigieron las pruebas múltiples por conjunto de datos.
El análisis reveló 194.138 asociaciones significativas corregidas por tasa de falsos descubrimientos. La asociación entre la expresión de CFH y la degeneración macular llegó a un valor P de 1,29×10⁻⁶¹, y entre la expresión de PCSK9 y la enfermedad coronaria fue de 7,61×10⁻²⁵. Treinta y un combinaciones gen- enfermedad se replicaron en los seis conjuntos de datos de ascendencia europea, y cinco combinaciones se detectaron comúnmente en modelos de proteoma de SomaLogic a través de grupos de ascendencia.
Valor y perspectivas
El valor de OmicsPred no reside tanto en nuevos algoritmos predictivos como en convertir modelos existentes en infraestructura reutilizable para la investigación. Comparar resultados predictivos del mismo gen o proteína por tejido, plataforma de medición, capa oómica y grupo de ascendencia permite priorizar candidatos que se vinculan repetidamente a ciertas enfermedades. La fuerte replicación de asociaciones conocidas como CFH y PCSK9 demuestra que la plataforma puede recuperar señales patológicas relevantes.
La API abierta y los metadatos normalizados son útiles también para automatizar pipelines de exploración a gran escala. Las empresas farmacéuticas pueden evaluar en masa la asociación entre rasgos moleculares predichos genéticamente y cientos de enfermedades, revisando no solo indicaciones esperadas, sino también señales de efectos secundarios potenciales. Si un candidato se repite en varias capas oómicas, se fortalece la base para priorizar experimentos funcionales posteriores.
Sin embargo, solo la asociación entre predicción genética y enfermedad no demuestra causalidad ni efectividad de un medicamento. Factores como desequilibrio de ligamiento, expresión multifuncional, especificidad tisular y diferencias en plataformas de medición pueden distorsionar los resultados. También persiste la limitación de que los modelos y datos de ascendencia europea siguen dominando. Para identificar con mayor precisión candidatos con potencial terapéutico, será necesario aumentar modelos desarrollados y validados en diversos grupos de ascendencia y tipos celulares, combinando análisis de localización, aleatorización mendeliana y validación experimental.
Nature Genetics, Publicado en línea: 1 de septiembre de 2026; doi:10.1038/s41588-026-02726-4Presentamos OmicsPred, una plataforma abierta para el depósito y difusión de modelos genéticos predictivos de rasgos multioómicos, con metadatos clave necesarios para la reproducibilidad y aplicaciones independientes. Ilustramos la utilidad del recurso para el descubrimiento de dianas mediante un análisis fenómico asociativo multioómico y multiancestral usando datos del Programa de Veteranos.
En el desarrollo de medicamentos, los equipos pueden contrastar GWAS de enfermedades con puntuaciones de OmicsPred para priorizar candidatos de ARN o proteínas regulados genéticamente. Por ejemplo, en un programa de enfermedades cardiovasculares, se podrían elegir candidatos consistentes en varios datos de transcritoma y proteoma, pasarlos a análisis de localización y experimentos celulares, y revisar si el mismo molécula se vincula con otras enfermedades para ampliar la indicación o evaluar riesgos de seguridad tempranamente.
Investigadores de hospitales y biobancos pueden aplicar puntuaciones estándar a sus propios datos genómicos para estimar rasgos moleculares en cohortes de pacientes de gran tamaño, donde no es posible medir tejidos directamente. Sin embargo, para usarlo como herramienta de decisión clínica, será necesario validar en la población objetivo y cuantificar la precisión predictiva y los sesgos por grupo de ascendencia.