Buscando las causas de enfermedades raras en el 98% del genoma no codificante... Un nuevo avance impulsado por la genómica funcional y la inteligencia artificial

Antecedentes
Gracias al avance de las tecnologías de secuenciación del genoma humano, el coste de la secuenciación del genoma completo (WGS) ha disminuido drásticamente, pero más de la mitad de los pacientes con enfermedades raras siguen experimentando una 'odisea diagnóstica' sin conocer la causa genética. Hasta ahora, la investigación genética y el diagnóstico clínico se han centrado en las regiones del exoma, que codifican directamente las proteínas. El exoma representa solo entre el 1,5% y el 2% del genoma completo. Se ha estimado que en el vasto 98% restante, la región no codificante, existen numerosas variantes que causan enfermedades, pero los casos identificados como causas reales han sido extremadamente escasos.
La razón de la escasa interpretación clínica de las variantes en regiones no codificantes radica en la ausencia de reglas de decodificación claras. En las secuencias que codifican proteínas, es relativamente fácil predecir la pérdida de función, como las sustituciones de aminoácidos o la terminación prematura, basándose en el sistema de codones. Por el contrario, es difícil intuir el impacto fenotípico de las variantes en las secuencias reguladoras. La estructura tridimensional de la cromatina, donde elementos reguladores como potenciadores (enhancers) o promotores controlan de forma remota genes situados a cientos de miles de pares de bases de distancia, también aumenta la dificultad del análisis. En esencia, faltaban herramientas de validación para distinguir entre variantes letales que causan enfermedades reales y variantes benignas inofensivas dentro de la vasta secuencia no codificante.
Hallazgos clave
Esta revisión publicada en Nature Genetics resume los mecanismos moleculares por los cuales las variantes no codificantes provocan enfermedades raras y pone el foco en las razones fundamentales de la baja tasa de descubrimiento diagnóstico. Los autores analizaron que las anomalías en la regulación no codificante inducen principalmente cambios cuantitativos en la expresión génica, actuando de forma más específica del tejido y sutilmente en comparación con la pérdida completa de una proteína. Se señaló que los métodos tradicionales, que dependían únicamente del análisis de la conservación evolutiva, tenían dificultades para capturar variantes reguladoras que solo se activan en entornos celulares específicos.
Los investigadores propusieron como solución clave para acelerar el descubrimiento de variantes no codificantes la combinación de Ensayos de Reportero Masivamente Paralelos (MPRA), análisis de estructura tridimensional de la cromatina de alta resolución (Micro-C) y algoritmos de predicción basados en aprendizaje automático. Mediante el uso de la Tecnología de Edición del Genoma por Saturación (SGE), es posible evaluar funcionalmente todas las variantes de un solo nucleótido en secuencias no codificantes simultáneamente en un entorno de laboratorio. Al combinar esto con modelos de secuencias basados en aprendizaje profundo (deep learning) que interpretan directamente la información de la secuencia para cuantificar la accesibilidad de la cromatina y la actividad transcripcional por tipo celular, la precisión de la predicción funcional está mostrando una tendencia de mejora drástica. Se estima que la eficiencia para identificar las variantes causantes reales de la enfermedad entre decenas de miles de variantes candidatas ha aumentado decenas de veces en comparación con el pasado.
Significado y perspectivas
Se prevé que la identificación precisa de las redes de regulación no codificantes sea un punto de inflexión para aumentar la tasa de diagnóstico de enfermedades genéticas raras. Esto se debe a que puede ofrecer una etiología molecular clara a pacientes que perdían la oportunidad de un tratamiento adecuado por desconocer la causa. Los datos acumulados de variantes no codificantes proporcionan un plano para el desarrollo de terapias de precisión que apuntan directamente a secuencias reguladoras no codificantes, como los oligonucleótidos antisentido (ASO) o la edición del epigenoma.
La tarea también es clara. Para cerrar la brecha entre las predicciones de los algoritmos computacionales y los fenotipos reales en los pacientes, debe seguir una comparación precisa con mapas de transcriptómica de célula única en órganos y etapas de desarrollo. La construcción de sistemas de validación funcional rápida utilizando organoides de modelos de enfermedades y la estandarización de las guías de interpretación clínica de variantes no codificantes también se consideran tareas pendientes. La capacidad de interpretación de datos genómicos se está expandiendo plenamente más allá de los límites de las regiones codificantes hacia las regiones no codificantes.
Nature Genetics, Published online: 08 September 2026; doi:10.1038/s41588-026-02743-3This Review discusses how rare-disease-causing variants in the noncoding genome impact gene regulation, why these examples are so few and how new approaches could accelerate discovery of noncoding variants affecting human health.
El enfoque presentado en este estudio puede mejorar significativamente la tasa de diagnóstico en clínicas de enfermedades raras no diagnosticadas que, a pesar de haberse sometido a secuenciación de nueva generación (NGS), no han identificado la causa. En el entorno clínico, al vincular los datos de WGS de los pacientes con modelos de IA de predicción funcional no codificante y datos multiómicos de célula única, se podrá establecer un sistema que priorice las variantes en regiones de regulación transcripcional directamente relacionadas con la enfermedad, reduciendo el tiempo de interpretación de meses a días.
Desde la perspectiva de la industria del desarrollo de fármacos, esto servirá como un paso clave para identificar numerosos nuevos objetivos reguladores en grupos de enfermedades intratables donde el desarrollo de terapias era imposible debido a la falta de dianas proteicas. Se espera que se haga realidad el diseño de terapias de ARN dirigidas que inhiban potenciadores causantes de enfermedades o restauren selectivamente la expresión génica silenciada.