Genomics, proteomics, systems biology — decoding the blueprint of life.

Antecedentes El microbioma vaginal está estrechamente relacionado con la salud reproductiva femenina, incluyendo la vaginitis bacteriana, la infección por el virus del papiloma humano (VPH) y el parto prematuro. Sin embargo, el análisis de ARN ribosomal 16S utilizado en estudios previos tiene dificultades para distinguir bacterias a nivel de especie o cepa, y no logra capturar virus y hongos. La composición de las muestras centradas en poblaciones occidentales y mujeres embarazadas ha dejado limitaciones para explicar la diversidad microbiana de la población mundial. La muestra de heces contiene más del 90 % de ADN humano, lo que dificulta la recuperación del genoma microbiano. Paradójicamente, si se utiliza este ADN humano, es posible leer simultáneamente las variantes genéticas del huésped y la composición microbiana a partir de la misma muestra. Los investigadores integraron 2,967 conjuntos de datos públicos y 1,433 cepas bacterianas aisladas centrados en el metagenoma del ácido desoxirribonucleico (ADN) de 16.65 personas chinas para rastrear la conexión entre el huésped y los microorganismos. El estudio se publicó en Nature Genetics en junio de 2026, y la nota de corrección de septiembre solo ajustó los nombres de los autores y la posición de la figura 5b. Los resultados y conclusiones del estudio no cambiaron. Hallazgos clave El catálogo de genomas ensamblados del metagenoma global (GVMG) construido por los investigadores consta de un total de 65,055 genomas. Incluye 36.059 genomas de 890 especies de procariotas, 43 genomas de 11 especies de hongos y 28.953 genomas de 6.577 unidades taxonómicas de virus. El número de genomas es 1.9 veces mayor que el del VMGC anterior, y el 13.0% de las especies procariotas y el 79.0% de las unidades taxonómicas virales pertenecen a linajes no presentes en repositorios públicos previos. La proporción de genomas procariotas de alta calidad o casi completos fue del 68.1%, superando el 48.2% del VMGC. Las diferencias por grupo también fueron evidentes. El tipo de comunidad donde predomina la bacteria BVAB1, relacionada con la vaginitis bacteriana, fue del 0.46% en la cohorte china, pero del 12.38% en la cohorte estadounidense. Entre los virus, el 56.5% no se encontró en otras bases de datos principales de viromas vaginales, intestinales o bucales, y se confirmó la asociación fago-huésped correspondiente a los lactobacilos predominantes Lactobacillus iners y L. crispatus. Los investigadores analizaron la relación entre 5,46 millones de variantes genéticas humanas y 54 especies de microbiota intestinal a partir de los datos de una cohorte de descubrimiento de 3.137 individuos, una cohorte de validación de 3.227 individuos y 506 casos adicionales. Como resultado, identificaron siete loci génicos del huésped que cumplieron con el nivel de significancia global del estudio y se replicaron en cohortes independientes. La asociación más fuerte fue la que vinculaba las variantes adyacentes a OPRK1 en el cromosoma 8 con el patógeno potencial Ureaplasma urealyticum. El tamaño del efecto (β) fue de 1,24 y el valor P fue de 1,50×10⁻⁵⁵. Las asociaciones entre ADAP1-Lactobacillus mulieris y las variantes adyacentes a PRAMEF1 con Bifidobacterium piotii también se reprodujeron en la misma dirección en ambas cohortes de validación. Significado y perspectivas Este estudio expande la visión del microbioma vaginal, no solo como una proporción de bacterias, sino como un ecosistema que abarca virus, hongos y variaciones genéticas dentro de las cepas. Se reveló que la misma especie microbiana puede variar en su composición genética y funcional según el grupo de origen, lo que sugiere que los criterios de diagnóstico o probióticos desarrollados en una región específica podrían no aplicarse directamente a otras poblaciones. Sin embargo, la asociación no implica causalidad. Es necesario confirmar mediante experimentos celulares y animales si la variante OPRK1 regula directamente la colonización de *U. Debe confirmarse mediante experimentos celulares y con animales si urealyticum regula directamente su establecimiento o si factores como las hormonas, el sistema inmunológico y el entorno ambiental intervienen. También persiste la limitación de que los nuevos datos a gran escala se centran principalmente en la población china. Se requieren estudios longitudinales que incluyan diversas poblaciones ancestrales y validaciones funcionales para que esto conduzca a la predicción de riesgos de infección según el genotipo o a terapias microbianas personalizadas.
💡 El GVMG puede utilizarse como un recurso de referencia para identificar cepas bacterianas, fagos y hongos que las bases de datos actuales pasan por alto en el análisis de metagenómica shotgun de muestras vaginales. Por ejemplo, al analizar muestras de pacientes con vaginitis bacteriana recurrente, será posible realizar diagnósticos precisos, subdividiendo el género Gardnerella y rastreando qué cepas y fagos persisten tras la administración de antibióticos. En la industria, esto puede emplearse para la selección de candidatos a probióticos y terapias con fagos que reflejen las diferencias microbianas regionales. No obstante, aún es prematuro realizar pruebas que determinen el riesgo de infección o enfermedad basándose únicamente en variantes genéticas del huésped. Antes de su aplicación clínica, se debe validar la reproducibilidad en diversas poblaciones, la fluctuación del microbioma a lo largo del tiempo y factores de confusión como el uso de fármacos, la actividad sexual y el estado hormonal.

Antecedentes El adenocarcinoma de pulmón (LUAD) es un tumor maligno que presenta una extrema heterogeneidad molecular. Aunque los inhibidores de EGFR y ALK han mejorado los resultados terapéuticos, muchos pacientes progresan debido a la falta de mutaciones accionables o la adquisición de resistencia. Por ello, es urgente descubrir nuevos objetivos para pacientes sin opciones terapéuticas. Aunque los datos de cribado funcional CRISPR (como DepMap) han facilitado la búsqueda de genes esenciales, los estudios basados en líneas celulares no reflejan la complejidad del microentorno tumoral real, lo que genera falsos positivos. Se requiere una estrategia de selección computacional que cierre la brección entre las vulnerabilidades funcionales de laboratorio y las cohortes de pacientes clínicos. Hallazgos clave Los investigadores desarrollaron DepPrior, un marco computacional basado en reglas de clasificación adyacente que utiliza tres criterios complementarios: 1. Separabilidad de la dependencia genética CRISPR: Identificación de genes con vulnerabilidades selectivas en células cancerosas específicas. 2. Predictibilidad molecular: Uso de modelos de aprendizaje automático (lineales y no lineales) con datos de expresión génica y variación del número de copias (CNV) para predecir puntuaciones de dependencia de DepMap. 3. Reproducibilidad multi-cohorte: Validación de patrones de expresión consistentes en niveles transcriptómicos y proteómicos utilizando bases de datos clínicas independientes como TCGA-LUAD, GEO y CPTAC. Mediante el índice DepScore (combinación de AUROC y R²), se identificaron FERMT2, CRKL, MYC y CHMP4B como los principales candidatos. Estos genes forman módulos de expresión directamente vinculados a la proliferación celular en pacientes de TCGA-LUAD. La validación experimental en la línea celular HCC827 demostró que el knockdown de FERMT2 y CRKL reduce los niveles de proteínas objetivo y aumenta las señales de apoptosis. La inhibición simultánea de ambos genes mostró un efecto sinérgico superior a la inhibición individual. Significado y perspectivas DepPrior actúa como un puente entre el ruido del cribado de líneas celulares y la complejidad del tejido de pacientes, integrando la genómica funcional y la reproducibilidad multiómica. Servirá como una plataforma de generación de hipótesis para reducir costes y tasas de fracaso en el desarrollo de fármacos. El hallazgo de la sinergia en la apoptosis mediante la inhibición de FERMT2 y CRKL abre posibilidades para terapias combinadas. No obstante, se requieren experimentos adicionales para demostrar la unión estructural a las proteínas objetivo y validaciones in vivo mediante organoides y modelos de xenoinjerto.
💡 DepPrior puede implementarse inmediatamente en las etapas iniciales del descubrimiento de fármacos. Para pacientes con cáncer de pulmón no microcítico resistente a inhibidores de EGFR, el desarrollo de inhibidores dobles o terapias combinadas dirigidas a FERMT2 y CRKL es un escenario prometedor. Las empresas farmacéuticas pueden obtener candidatos de alta pureza con reproducibilidad ómica validada antes de realizar costosos cribados experimentales, actuando como un filtro computacional que reduce el error y acelra la búsqueda de compuestos eficaces.

Antecedentes La personalidad, entendida como el patrón de comportamiento único mediante el cual un individuo percibe y reacciona ante el mundo, ha sido durante mucho tiempo una de las principales áreas de estudio en la psicología y las ciencias del comportamiento. En el ámbito clínico, se ha acumulado constantemente evidencia observacional que muestra una estrecha asociación entre los rasgos de personalidad, como la neurosis o la extraversión, y el riesgo de desarrollar depresión, enfermedades cardiovasculares y el síndrome metabólico. Sin embargo, los estudios observacionales por sí solos no permitían determinar con claridad si ciertos rasgos de personalidad causaban la enfermedad o si las enfermedades subyacentes o factores ambientales comunes habían influido en la formación de la personalidad. Se enfrentaba así a la limitación de que resultaba difícil demostrar inequívocamente la secuencia causal. Los estudios genómicos previos también no lograron esclarecer suficientemente la naturaleza multifactorial de la personalidad debido a las limitaciones en el tamaño de la muestra. Dado que el comportamiento y las tendencias humanas se forman mediante la interacción compleja de numerosas variantes genéticas menores, era difícil lograr significancia estadística con cohortes de decenas de miles de personas. La falta de muestras también ha sido un obstáculo prolongado en investigaciones que buscan revelar los mecanismos biológicos compartidos entre enfermedades mentales y físicas. Además, también se carecía de una infraestructura de análisis a gran escala para corregir el sesgo subjetivo de los datos procedentes de encuestas por autoinforme. Los investigadores han iniciado un estudio para desentrañar la estructura genética de los rasgos de personalidad y verificar rigurosamente la causalidad potencial con las enfermedades mediante el análisis integrado de datos genómicos masivos de más de un millón de personas. Hallazgos clave Los investigadores realizaron un estudio de asociación de genoma completo (GWAS) en una cohorte multinacional de más de un millón de personas, identificando múltiples variantes genéticas involucradas en los rasgos de personalidad. El logro consiste en identificar con precisión los loci genómicos asociados con escalas de personalidad principales, como la extraversión, el neuroticismo y la responsabilidad, y verificar su asociación estadística. Se evalúa que la combinación de vastos datos genotípicos con fenotipos de personalidad aumentó drásticamente el poder estadístico en comparación con estudios previos. Posteriormente, aplicaron el método de aleatorización mendeliana (MR), utilizando variantes genéticas como variables instrumentales, para rastrear las rutas causales entre los rasgos de personalidad y los resultados de salud. Los resultados mostraron que las variantes genéticas relacionadas con la tendencia al neuroticismo presentan efectos causales potenciales no solo en el trastorno depresivo mayor y el trastorno de ansiedad, sino también en la enfermedad coronaria y el aumento de los indicadores de inflamación crónica. Esto respalda que la inestabilidad emocional elevada puede causar alteraciones a largo plazo en los sistemas neuroendocrino e inmunológico, aumentando el riesgo de enfermedades físicas. Por el contrario, los indicadores genéticos relacionados con la responsabilidad y la extraversión se tradujeron en efectos protectores directos, vinculados con indicadores de salud positivos como la actividad física regular, la reducción de las tasas de tabaquismo y una mayor longevidad. El estudio demostró estadísticamente que, más allá de una simple correlación, las variantes genéticas comunes y las rutas biológicas pueden participar directamente en la aparición de enfermedades. Significado y perspectivas Este estudio tiene valor académico al transformar los rasgos de personalidad, tratados como conceptos psicológicos, en datos de genética molecular y genética estadística. Esto equivale a demostrar que la salud mental y las enfermedades físicas interactúan en un único eje biológico, basándose en grandes volúmenes de datos genómicos. En el futuro, la integración de variantes genéticas de la personalidad en modelos de puntuación de riesgo poligénico (PRS) proporcionará una base sólida para aumentar significativamente la precisión predictiva de la medicina preventiva personalizada. Sin embargo, existen desafíos claros para su aplicación clínica. Una limitación evidente es que la cohorte estudiada está concentrada principalmente en ascendencia europea, lo que dificulta la generalización de los resultados a poblaciones multiétnicas. También se señala que no es posible excluir por completo la estructuración poblacional ni los factores de confusión residuales mínimos que surgen en los estudios de rasgos complejos. Se prevé que las investigaciones futuras se centren en ampliar significativamente los datos de poblaciones no europeas y vincularlos con datos de neuroimagen y análisis de transcriptómica de células individuales, con el fin de elucidar los mecanismos reales mediante los cuales las variantes genéticas afectan al desarrollo de los circuitos neuronales.
💡 Los resultados de este estudio pueden utilizarse directamente en la práctica clínica y en la industria de la salud digital para establecer estrategias de detección temprana y de intervención personalizada. En los centros médicos de primera línea, se podría establecer un sistema para identificar con precisión a los grupos de alto riesgo de comorbilidad entre depresión y enfermedades cardiovasculares mediante la evaluación integrada de las puntuaciones poligénicas basadas en la personalidad junto con los indicadores de los exámenes físicos de los pacientes. En el campo de las terapias digitales (DTx), podría materializarse el escenario de diseñar algoritmos de terapia cognitivo-conductual adaptados a las características genéticas de neuroticismo o responsabilidad del individuo, maximizando la adherencia al tratamiento y la medicación. Esto anuncia el nacimiento de una próxima plataforma de gestión preventiva integrada que combina información genómica con tendencias psicológicas y conductuales personales.

Antecedentes Cuando se propagan enfermedades infecciosas emergentes o variantes virales, los datos de secuencias genómicas constituyen un recurso fundamental para determinar las rutas de transmisión y la velocidad de mutación. Las autoridades sanitarias reconstruyen la historia evolutiva del virus mediante filogenias para estimar cuándo, dónde y cómo se introdujo y propagó el virus. La técnica reconocida como el marco estadístico más preciso en este proceso es la filogenética bayesiana. Esto se debe a que permite estimar simultáneamente indicadores clave de dinámica, como la tasa de evolución y el número básico de reproducción de infecciones, reflejando sistemáticamente la incertidumbre. El problema es la carga computacional. Las herramientas de análisis filogenético bayesiano existentes utilizan el algoritmo de Monte Carlo por Cadenas de Markov (MCMC). Cuando el número de muestras supera las centenas, el tiempo de computación aumenta exponencialmente, requiriendo días o incluso semanas para completar el análisis. Durante una pandemia, cuando se reciben decenas o cientos de miles de datos de genomas completos del campo de batalla, las técnicas tradicionales tienen dificultades para contribuir a tiempo a la toma de decisiones de prevención y control en tiempo real. Las instituciones de salud pública en países o regiones en desarrollo que carecen de infraestructura de computación de alto rendimiento ni siquiera se atreven a aplicar directamente los resultados más recientes del análisis filogenético en la prevención y el control de enfermedades. Hallazgos clave El equipo de investigación ha presentado Delphy, un nuevo marco computacional capaz de procesar grandes volúmenes de datos genómicos virales acumulados de manera casi en tiempo real. El núcleo de Delphy es una estructura de actualización bayesiana en línea que, en lugar de recalcular todo el árbol filogenético desde cero cada vez que llegan nuevos datos, integra orgánicamente las nuevas secuencias en la distribución de probabilidad posterior del árbol filogenético previamente aprendido. Gracias a la optimización del algoritmo, Delphy ha reducido drásticamente la complejidad computacional incluso cuando el número de muestras aumenta acumulativamente. Mientras que las herramientas tradicionales requerían decenas de horas en clústeres de alto rendimiento para procesar miles de secuencias, Delfi puede completar el análisis bayesiano en menos de una decena de minutos utilizando una computadora de nivel de estación de trabajo convencional. A pesar de este aumento en la velocidad, la precisión estadística se mantiene en los niveles más altos. Las validaciones mediante experimentos simulados y conjuntos de datos genómicos de enfermedades infecciosas reales demostraron que las estimaciones del tiempo de divergencia y la distribución de probabilidad posterior de la topología del árbol filogenético alcanzaron una precisión comparable a la del método MCMC completo tradicional. Esto significa que es posible realizar análisis filodinámicos de alto nivel con un costo computacional mínimo, incluso en entornos con recursos limitados. Significado y perspectivas La aparición de Delphy representa un punto de inflexión para transformar el paradigma de la vigilancia genómica de un análisis posterior centralizado a una vigilancia en tiempo real descentralizada y local. Esto se debe a que los laboratorios locales pueden realizar análisis filogenéticos directamente en el momento en que se generan los datos y retroalimentar los resultados de inmediato a las operaciones de control epidemiológico. Se ha establecido la base para que las instituciones de salud pública de todo el mundo operen de forma autónoma análisis bayesianos precisos y estandarizados, manteniendo su propia soberanía de datos. Sin embargo, aún quedan desafíos. En patógenos con altas tasas de recombinación o mutaciones complejas de inserción/deleción, se requiere un modelado filogenético adicional más allá del modelo simple de mutación puntual. Tampoco se puede descartar el riesgo de sesgos en el proceso de actualización a largo plazo si se acumulan variaciones en la calidad de los nuevos datos o errores de secuenciación. Las investigaciones futuras requerirán la expansión de pipelines que automatizen el proceso de refinamiento de datos y acepten con flexibilidad diversos mecanismos de mutación.
💡 Delfi ofrece una utilidad inmediata para establecer estrategias de bloqueo de la entrada inicial en pandemias y de contención de la propagación comunitaria. Cuando una nueva variante ingresa a través de aeropuertos o puertos, se pueden analizar los genomas recolectados y confirmar el origen evolutivo y la velocidad de transmisión de la variante en menos de medio día. Esto permitirá que los países de ingresos bajos y medios, así como los centros de salud a nivel regional que no pueden depender de grandes centros de supercomputación, operen redes independientes de vigilancia precisa de enfermedades infecciosas utilizando equipos de escritorio estándar. También se prevé una alta aplicabilidad en la epidemiología hospitalaria, donde, ante un brote dentro de un hospital, se pueda determinar el mismo día si la transmisión es entre pacientes dentro del recinto o si se trata de múltiples introducciones externas, permitiendo decidir con precisión el alcance de la desinfección y la gestión de las salas de aislamiento.

Antecedentes En el ámbito de la atención médica, la infección por Clostridioides difficile (CDI) se considera una de las infecciones nosocomiales más difíciles de manejar. Cuando el ecosistema de la microbiota intestinal de los pacientes que han recibido un tratamiento prolongado con antibióticos de amplio espectro se desequilibra, la bacteria C. difficile, un bacilo anaerobio formador de esporas, prolifera excesivamente y destruye el tejido epitelial intestinal. Este microorganismo, que puede provocar desde diarrea leve hasta perforación intestinal y colitis pseudomembranosa mortal, representa una amenaza letal para las personas mayores y los pacientes inmunodeprimidos. Actualmente, en la práctica clínica se utilizan antibióticos específicos como vancomicina o fidaxomicina como tratamiento de primera línea. Sin embargo, este tratamiento elimina también la microbiota comensal normal, provocando un ciclo de recurrencia en más del 20% de los pacientes. Se ha intentado durante mucho tiempo desarrollar vacunas que neutralicen las toxinas o bloqueen la proliferación bacteriana, pero los métodos tradicionales de vacunas vivas atenuadas o toxoides de proteínas recombinantes no han superado las barreras de la fase clínica debido a su limitada capacidad para responder a cepas variantes y a su inmunogenicidad insuficiente. Ante la limitación clínica de que un solo antígeno es insuficiente para bloquear simultáneamente la secreción de toxinas y la colonización intestinal, surge la necesidad de una plataforma de próxima generación que combine con precisión múltiples epítopos inmunológicos. La combinación de la tecnología de ARN mensajero (ARNm), probada en la respuesta a enfermedades infecciosas, con técnicas de diseño virtual mediante computación de alto rendimiento, está abriendo una vía para resolver este desafío. Hallazgos clave En lugar de sintetizar manualmente numerosos antígenos en el banco de laboratorio, los investigadores adoptaron un enfoque de vacunología inversa (reverse vaccinology) que analiza con precisión los genomas de patógenos y las estructuras proteicas en entornos virtuales informáticos. Se ha diseñado una estructura de vacuna de ARNm multiepítopo que puede inducir simultáneamente la inmunidad humoral y celular, tomando como diana las secuencias de proteínas clave implicadas en la infección por Diplococcus y la expresión de la patogenicidad. Mediante modelos de computación, se identificaron con precisión los epítopos de las células B (que estimulan la producción de anticuerpos), así como los epítopos de los linfocitos T colaboradores (HTL) y los epítopos de los linfocitos T citotóxicos (CTL) (que eliminan directamente las células infectadas). Los candidatos seleccionados fueron sometidos a un riguroso cribado algorítmico para garantizar la seguridad, evaluando no solo su potencial inmunogénico, sino también su alergenicidad, toxicidad y riesgo de autoinmunidad. Los epítopos seleccionados se unieron mediante los conectores (linkers) óptimos para reconstruir una única estructura de fusión. Se evaluaron posteriormente las propiedades fisicoquímicas de la proteína de la vacuna y la cobertura poblacional, abarcando diversos trasfondos genéticos y étnicos. Tras realizar el acoplamiento molecular (docking) 3D y simulaciones de respuesta inmunitaria, se observó que la vacuna diseñada puede inducir eficazmente una fuerte respuesta de anticuerpos y la secreción de interferón gamma. Finalmente, se aplicaron simulaciones de dinámica molecular (MD) a escala de decenas de nanosegundos para confirmar la estabilidad mecánica molecular, es decir, que la estructura tridimensional de la proteína se mantenía estable en condiciones similares al entorno biológico. Significado y perspectivas Este estudio demostró que es posible diseñar de manera racional vacunas de ARNm multiantigénicas, reduciendo significativamente los costos y el tiempo asociados con la fase de laboratorio. Destaca el hecho de que la computación ha presentado un plan para dirigirse con precisión a la compleja estrategia de evasión inmune del Clostridioides difficile, la cual posee un triple mecanismo que incluye la formación de esporas, la adhesión al intestino delgado y la secreción de exotoxinas. También existen tareas futuras claramente definidas. No se puede afirmar que los resultados de las simulaciones in silico coincidan perfectamente con la respuesta inmunitaria in vivo. Es esencial realizar validaciones en laboratorio (wet lab) para confirmar si los títulos de anticuerpos y la inducción de la inmunidad mediada por células T predichos por los modelos computacionales se replican en modelos animales. Asimismo, deben realizarse investigaciones paralelas sobre la optimización de formulaciones para la administración mucosa que permitan mejorar la eficiencia de encapsulación en nanopartículas lipídicas (LNP) y reforzar la inmunidad intestinal local. Dado que el entorno inmunológico de las células epiteliales del colon difiere del sistema circulatorio sistémico, la investigación preclínica posterior que demuestre la inducción de inmunidad mucosa local, incluyendo la producción de IgA secretora, será la clave decisiva para la comercialización.
💡 Este estudio aporta un punto de inflexión concreto para las estrategias de protección de pacientes de alto riesgo en hospitales generales y centros de atención a largo plazo, donde el control de infecciones nosocomiales es urgente. Se ha sentado la base para una línea de desarrollo de vacunas de ARNm que podría administrarse como profilaxis previa a procedimientos en pacientes hospitalizados de edad avanzada o aquellos bajo tratamiento antibiótico prolongado. Esto permitiría superar la limitación de las terapias antibióticas actuales, que destruyen la microbiota beneficiosa y causan recurrencias frecuentes, estableciendo una barrera inmunológica preventiva que controle la colonización y la actividad de las toxinas. Industrialmente, posee un gran potencial para expandirse como una plataforma de desarrollo de vacunas de próxima generación, capaz de derivar candidatos multivalentes contra nuevas variantes en cuestión de semanas, siempre que se disponga de los datos de análisis genómico para proceder directamente a la fase de síntesis.

Antecedentes La puntuación de riesgo poligénico (PRS, por sus siglas en inglés), que calcula el riesgo futuro de desarrollar enfermedades mediante la combinación de las variantes genéticas individuales, ha sido reconocida como una herramienta fundamental para la medicina de precisión. Se trata de un método que evalúa la predisposición individual sumando estadísticamente los efectos de cientos de miles a millones de polimorfismos de un solo nucleótido (SNP). Sin embargo, los estudios previos sobre la dinámica del genoma estaban atrapados en una limitación estructural grave: el desequilibrio muestral. Esto se debió a que más del 80% de los participantes utilizados en los estudios de asociación del genoma completo (GWAS) provenían de linajes de ascendencia europea. Esta distorsión de los datos genómicos ha provocado una caída drástica en el rendimiento de los modelos predictivos en poblaciones no europeas. Al aplicar algoritmos de PRS existentes a grupos de ascendencia africana o hispana, la precisión predictiva puede caer a menos de la mitad en comparación con los grupos europeos. Esto se debe a que los patrones de desequilibrio de ligamiento (LD) y la frecuencia de los alelos difieren entre las poblaciones al evaluar la susceptibilidad a enfermedades. En consecuencia, se han planteado críticas constantes a que el avance de la investigación genómica profundiza las desigualdades en materia de salud al beneficiar únicamente a determinadas razas. Hallazgos clave Los investigadores optaron por una estrategia de metanálisis a gran escala y multirracial que combinaba datos del programa de investigación All of Us (AoU) de los Institutos Nacionales de Salud de EE. UU. (NIH) y la UK Biobank (UKB). AoU es una cohorte que ha asegurado más del 50 % de participantes de minorías étnicas, históricamente excluidas de la investigación médica. Los investigadores integraron datos de secuenciación del genoma completo (WGS) y análisis de genotipo de cientos de miles de individuos registrados en dos grandes biobancos para reconstruir modelos de rasgos complejos y enfermedades crónicas principales. Al aplicar una técnica de regresión bayesiana multirracial que aprende simultáneamente la estructura genotípica de diversas razas, la capacidad predictiva del modelo en grupos no europeos mejoró notablemente. En enfermedades crónicas principales como la diabetes tipo 2, la enfermedad coronaria y la hipertensión, la precisión predictiva (AUC) para los grupos de ascendencia africana y mestiza de las Américas aumentó significativamente en comparación con los modelos basados en una sola raza. En particular, en la cohorte de ascendencia africana, el rendimiento de predicción de los rasgos continuos de presión arterial sistólica e índice de masa corporal (IMC) registró una mejora de hasta más del 40%. Esto fue posible gracias a un algoritmo que selecciona variantes genéticas causales comunes entre diversos grupos y corrige meticulosamente la estructura de LD específica de cada población. Esto demuestra que la garantía de diversidad genética, además de la expansión absoluta del tamaño de la muestra, es el factor determinante en el rendimiento de los algoritmos predictivos. Significado y perspectivas Este estudio demuestra que la expansión de la escala de los datos y la recolección de muestras multirraciales son soluciones prácticas para cerrar la brecha étnica en la genómica clínica. Se ha establecido un punto de inflexión para ampliar el alcance de la medicina preventiva de precisión, que anteriormente estaba limitada a etnias específicas. La universalización de los algoritmos multiancestrales permitirá reducir los errores de falsos negativos en los sistemas de cribado temprano, elevando la precisión en la identificación de grupos de alto riesgo. En la industria farmacéutica global, se abre la posibilidad de validar previamente la validez genética en el proceso de descubrimiento de dianas terapéuticas en diversas poblaciones étnicas. No obstante, se requiere un enfoque cauteloso para la aplicación clínica. A pesar del aumento de muestras no europeas, la densidad de los datos aún es insuficiente para reflejar completamente la alta heterogeneidad genética dentro de la población africana. Además, se señala como un desafío pendiente la necesidad de ajustar por la interacción de factores no genéticos, como los determinantes socioeconómicos y el entorno residencial, en las enfermedades complejas. En el futuro, será necesaria la vinculación internacional de datos con cohortes locales de Asia, América del Sur y el continente africano para lograr una verdadera equidad genómica global.
💡 El modelo de predicción poligénica multiancestral derivado de este estudio puede utilizarse de inmediato en programas de detección temprana de enfermedades crónicas en atención primaria. Esto permitiría identificar precozmente a pacientes de diversos orígenes multiculturales que se pasaban por alto en los grupos de alto riesgo al aplicar el modelo tradicional de linaje único, iniciando así vías para la mejora de los hábitos de vida o la administración preventiva de medicamentos. También conlleva beneficios económicos al prevenir el desperdicio de recursos en la salud pública mediante la clasificación precisa de grupos en riesgo de enfermedades cardiovasculares o síndrome metabólico. En el ámbito del desarrollo de nuevos fármacos, mejora la eficiencia en la estratificación de participantes en ensayos clínicos y en el descubrimiento de biomarcadores. En los ensayos clínicos globales de fase 3, reduce la incertidumbre en la predicción de la respuesta farmacológica al mitigar el sesgo de riesgo genético durante la selección de grupos de pacientes de diversas etnias. Las empresas de análisis genómico pueden establecer una canalización comercial que proporcione informes de pruebas genéticas con un nivel uniforme de fiabilidad para consumidores de diversas ascendencias.

Antecedentes El paradigma de tratamiento del cáncer de pulmón no microcítico (NSCLC) se divide claramente antes y después de la aparición de los inhibidores de puntos de control inmunitarios (ICI). Se ha determinado la prescripción guiándose por biomarcadores como la tasa de expresión de la ligando 1 de muerte programada 1 (PD-L1) o la carga mutacional tumoral (TMB). En el entorno clínico, aún muchos pacientes muestran un pronóstico diferente al esperado. Incluso con una alta expresión de PD-L1, algunos no responden, mientras que otros, clasificados como negativos, logran una supervivencia prolongada. Esto se debe a la dificultad de capturar completamente la compleja interacción entre el microambiente tumoral (TME) y el sistema inmunológico del huésped utilizando un único biomarcador molecular. Para resolver estas discrepancias, se han seguido realizando intentos de multiómica que buscan integrar imágenes médicas, láminas de tejido patológico y datos genómicos. Los modelos existentes de aprendizaje automático no lograron superar la barrera para su implementación clínica debido a su estructura de "caja negra" (Black Box), en la cual el proceso interno de cálculo es desconocido. Es difícil que un algoritmo incomprensible para el personal médico sobre por qué se clasificó a ciertos pacientes como grupo de respuesta conduzca a cambios reales en la prescripción. La garantía de universalidad, necesaria para superar las disparidades de datos entre instituciones y grupos étnicos, también ha sido un obstáculo recurrente. Hallazgos clave Un equipo de investigación internacional construyó un modelo de inteligencia artificial explicable (XAI) multimodal basado en datos de evidencia del mundo real (RWE) a gran escala y multicéntrica. Este estudio validó la eficacia del algoritmo en cohortes de pacientes con cáncer de pulmón no microcítico de varios países con diferentes sistemas de atención médica. Se trata de un método que integra y analiza en una única red imágenes de patología digital (imágenes de diapositivas antes de la tinción con H&E), imágenes de tomografía computarizada (TC), secuenciación del exoma completo (WES) y perfiles de transcriptómica, así como registros electrónicos de salud clínicos. El modelo propuesto por el equipo de investigación superó con una clara ventaja a los indicadores individuales previos en el área bajo la curva característica de operación del receptor (AUC), que es el indicador de precisión para predecir la respuesta al tratamiento inmunooncológico. Demostró una capacidad de discriminación superior a 0.80, superando ampliamente el valor predictivo basado en la tinción inmunohistoquímica de PD-L1, que se situaba en la mitad alta del rango de 0.60, y el valor predictivo basado en la carga mutacional tumoral (TMB), que se situaba en la mitad baja del rango de 0.60. La estratificación también separó estadísticamente de manera clara a los grupos de alto riesgo y bajo riesgo en la supervivencia libre de progresión (PFS) y la supervivencia global (OS). La principal ventaja competitiva radica en la interpretabilidad. El modelo no se limita a emitir puntuaciones de predicción, sino que visualiza en forma de mapas de atención (Attention Map) la densidad espacial de los linfocitos tumorales infiltrantes (TIL) en las imágenes patológicas como base del diagnóstico, las características de invasión en la interfaz tumoral de las imágenes TC y las vías de expresión de quimiocinas específicas. A través de esto, el equipo de investigación confirmó que el algoritmo otorga mayor peso a los patrones de actividad inmunitaria en la frontera entre el estroma tumoral y las áreas del parénquima tumoral. En un estudio multicéntrico de apoyo a la toma de decisiones que contó con la participación de numerosos especialistas en oncología médica, tanto la concordancia como la precisión en la determinación de los planes de tratamiento por parte del personal médico que verificó la justificación del modelo mejoraron significativamente. Significado y perspectivas La oncología de precisión, que antes se basaba en pruebas genéticas aisladas o en uno o dos tipos de inmunohistoquímica, está evolucionando hacia un sistema de diagnóstico basado en la integración de datos. Al entrelazar orgánicamente los datos multidimensionales obtenidos del cuerpo del paciente, se ha revelado el valor clínico oculto. También destaca el hecho de haber abierto un camino para disipar la desconfianza del sector médico hacia la inteligencia artificial, al contar con un módulo de interpretación independiente. Al presentar las bases de sus predicciones, ha sentado las bases para aumentar la confianza en el proceso de elección de tratamiento entre médicos y pacientes. Quedan claros los desafíos que deben superarse para la comercialización. Es indispensable una estandarización de las condiciones de tinción H&E, que varían según cada institución; de las diferencias en la resolución de los escáneres CT, dependiendo del fabricante; y de las variaciones técnicas asociadas a las plataformas de secuenciación. También deben seguirse trabajos posteriores que determinen hasta qué punto los mecanismos biológicos propuestos por el módulo de explicabilidad coinciden con la validación funcional a nivel de laboratorio. Asimismo, es necesario completar los ensayos clínicos prospectivos con asignación aleatoria adaptados a los criterios de autorización del software como dispositivo médico (SaMD) por parte de las autoridades reguladoras.
💡 Los resultados de este estudio pueden aportar cambios sustanciales para los pacientes con cáncer de pulmón no microcítico avanzado que se encuentran en la encrucijada de la elección del tratamiento de primera línea. Actualmente, los criterios para decidir entre la monoterapia con inmunoterapia y la combinación con quimioterapia citotóxica en el tratamiento estándar son incompletos. Al integrar la IA multimodal en los sistemas de interpretación patológica e imagenológica hospitalarios, es posible identificar a los pacientes que responden individualmente y no requieren terapias combinadas complejas, reduciendo así el riesgo de efectos adversos tóxicos y ahorrando costes de tratamiento. Para los pacientes con alta probabilidad de falta de respuesta, es posible establecer estrategias de tratamiento personalizadas que recomienden tempranamente otros fármacos dirigidos o la participación en ensayos clínicos. Además, proporciona una base clara para que las empresas de kits de diagnóstico y de software médico desarrollen productos de diagnóstico concomitante (CDx) basados en múltiples biomarcadores.

Antecedentes Los inhibidores de puntos de control inmunitario (ICI), pilares de la inmunoterapia oncológica, han logrado respuestas de supervivencia a largo plazo, casi curativas, en algunos pacientes con cáncer avanzado. El hecho de que se hayan registrado casos sucesivos de pacientes que experimentaron una reducción dramática de los tumores tras la administración del fármaco ha posicionado a los ICI como una alternativa para superar las limitaciones de la quimioterapia citotóxica convencional. Sin embargo, en la práctica clínica real, la proporción de pacientes que se benefician significativamente del tratamiento se limita a entre el 20% y el 30%. La mayoría de los pacientes experimentan un empeoramiento de la enfermedad o enfrentan efectos secundarios de toxicidad inmunitaria graves, similares a enfermedades autoinmunes, a pesar de recibir fármacos de alto costo. Actualmente, las decisiones terapéuticas se basan en biomarcadores individuales como la tasa de expresión de la proteína Programmed Death-Ligand 1 (PD-L1) o la carga mutacional tumoral (TMB). No obstante, se señala que estos indicadores únicos no logran explicar por completo el complejo microentorno tumoral ni el ecosistema inmunitario sistémico propio de cada paciente. De hecho, se reportan con frecuencia casos en los que el pronóstico terapéutico varía drásticamente dentro de un mismo grupo de pacientes con idénticos niveles de TMB. Esto ha impulsado la aparición de modelos de análisis integrativo de datos multimodales a nivel de paciente, que abarcan las variantes genéticas y los patrones de expresión del transcriptoma del tejido tumoral, la distribución de linfocitos infiltrantes en el tumor y los indicadores de inflamación sistémica. Hallazgos clave Los investigadores integraron datos biológicos multimodales a nivel de paciente recopilados en múltiples cohortes clínicas para construir un modelo predictivo de la respuesta al tratamiento con ICI. Configuración que fusiona variantes genómicas basadas en la secuenciación del exoma completo (WES), la expresión génica medida mediante secuenciación de ARN, la infiltración de células inmunitarias extraída de láminas de tejido patológico y los valores de análisis de sangre periférica del paciente, utilizando un único algoritmo de aprendizaje automático. Al integrar y analizar datos multimodales en comparación con la aplicación individual de biomarcadores únicos existentes, el área bajo la curva ROC (AUC) mejoró significativamente en más de 0.15. Esto permite identificar con precisión de antemano a los pacientes no respondedores al tratamiento, que resultaban difíciles de detectar utilizando únicamente un solo marcador. Se explica que los biomarcadores que conforman la red de señales complejas actúan de manera complementaria, compensando el error de discriminación del modelo predictivo. A pesar de esta mejora en el rendimiento, se expuso una clara limitación técnica: la disminución de la capacidad predictiva en cohortes de validación externas. Mientras que el valor del AUC superaba 0.80 en el conjunto de datos de entrenamiento interno utilizado para entrenar el modelo, al aplicarlo a cohortes de validación independientes de otros centros médicos, este disminuyó drásticamente hasta situarse entre 0.60 y 0.65. Se señala que las diferencias técnicas en los métodos de preprocesamiento de muestras y las plataformas de análisis de secuencias, que varían entre cada hospital, son la principal causa que perjudica el rendimiento de generalización del modelo. Las diferencias raciales en la población de pacientes y el desequilibrio en la distribución de las etapas clínicas detalladas también son factores que incrementan el error de predicción. Esto evidencia el riesgo de sobreajuste (overfitting) que persiste cuando el modelo se ajusta excesivamente a las características locales de los datos de entrenamiento durante el proceso forzado de combinación de datos multimodales. Significado y perspectivas Este estudio ofrece una pista para mejorar la capacidad predictiva de la respuesta a los inmunoterapéuticos mediante la integración precisa de señales biológicas multidimensionales, al tiempo que pone de manifiesto claramente los cuellos de botella tecnológicos que obstaculizan su aplicación clínica real. Se valora que la investigación ha señalado la cruda realidad clínica: los algoritmos desarrollados en un entorno de estudio único son difíciles de trasladar directamente a conjuntos de datos de otras instituciones médicas. Un modelo predictivo excesivamente ajustado a un conjunto de datos específico difícilmente funcionará plenamente en el complejo entorno de la práctica clínica real. Para investigaciones futuras, la prioridad será establecer técnicas de normalización que corrijan con precisión las disparidades de datos y los efectos de lote (batch effects) entre instituciones médicas. Se debe establecer un estándar de recopilación de datos compatible para su uso en entornos médicos de todo el mundo, tras la validación clínica multicéntrica. Se prevé un cambio de paradigma en la investigación, pasando de simplemente aumentar la complejidad de los algoritmos hacia el desarrollo de pipelines de Inteligencia Artificial (AI) robustos que mantengan una capacidad predictiva sólida incluso en entornos heterogéneos.
💡 El sistema de análisis de biomarcadores multimodales tiene el potencial de evolucionar hacia un panel de diagnóstico de precisión para seleccionar a los candidatos al tratamiento con ICI, que es costoso. Un escenario de aplicación clínica representativo sería la exclusión de pacientes no respondedores antes de la administración del fármaco, evitando así efectos secundarios de toxicidad inmunitaria innecesarios y reduciendo simultáneamente la carga económica del paciente y el gasto del seguro médico. También podría contribuir al establecimiento de estrategias terapéuticas personalizadas, sugiriendo oportunamente terapias combinadas o terapias dirigidas alternativas para pacientes con factores de inmunodeficiencia específicos. Sin embargo, para que esto se consolide en la práctica clínica hospitalaria o como Dispositivo Médico de Software (SaMD), debe ir acompañado de la estandarización de los protocolos de análisis de muestras y la validación de la reproducibilidad entre instituciones.

Antecedentes Durante la pandemia de COVID-19, el despliegue masivo de vacunas de ARN mensajero (ARNm) reveló las limitaciones estructurales de los sistemas tradicionales de farmacovigilancia. La vigilancia pasiva convencional, que depende de informes voluntarios de profesionales médicos y vacunados, presenta defectos como retrasos en los informes y altas tasas de subnotificación. La dificultad para calcular con precisión la incidencia real de efectos secundarios en la población general también ha planteado desafíos para las autoridades sanitarias. Cada vez que se introduce una nueva plataforma de vacunas, los puntos de vigilancia reciben un flujo simultáneo de datos narrativos no estructurados y reclamaciones duplicadas. Para detectar signos anómalos de forma temprana y demostrar la seguridad, era necesario un nuevo enfoque que integrara rápidamente datos de múltiples fuentes. El aprendizaje automático (ML) ha surgido como una alternativa para procesar datos del mundo real (RWD), que abarcan registros de salud electrónicos (EHR), datos de facturación de atención médica y sistemas de notificación de eventos adversos. Hallazgos clave Los investigadores recopilaron de manera exhaustiva literatura en inglés indexada en PubMed, Embase y Web of Science desde el inicio de las bases de datos hasta junio de 2026. Dos evaluadores revisaron la literatura de forma independiente, y la evaluación del riesgo de sesgo se basó en una versión adaptada de la herramienta QUADAS-2 para la calidad de estudios de precisión diagnóstica. Debido a la gran heterogeneidad en las tareas de aprendizaje automático (detección de señales, extracción de texto, predicción de riesgos y estratificación del pronóstico), los algoritmos y las métricas de evaluación, fue inevitable realizar una síntesis descriptiva. Un total de 43 estudios cumplieron con los criterios estrictos para el análisis final. En el campo de la predicción de reacciones adversas, los modelos basados en árboles (como los árboles de decisión) registraron valores estables del área bajo la curva (AUC) entre 0,85 y 0,87. No obstante, se interpreta que es difícil determinar una superioridad directa debido a las diferencias en los entornos clínicos y los conjuntos de datos aplicados en cada estudio. Al aplicar el procesamiento del lenguaje natural (NLP) a los registros descriptivos de efectos adversos en los sistemas de notificación de vacunas, las señales duplicadas disminuyeron un 17%. Al filtrar informes redundantes innecesarios, se redujo la carga de trabajo del personal de vigilancia y se aceleró la identificación de señales de seguridad significativas. En el caso de la miocarditis, una de las principales reacciones adversas de las vacunas de ARNm, el rendimiento predictivo de los modelos de ML entrenados con cohortes cardiovasculares alcanzó un AUC de hasta 0,899. Sin embargo, los estudios que validan directamente estos modelos en grupos de pacientes vacunados con ARNm siguen siendo escasos y la mayoría se limitan a análisis retrospectivos. Se observó que las aplicaciones de ML para plataformas de próxima generación, como las vacunas de ARNm autoamplificables o las vacunas contra el cáncer, aún se encuentran en una etapa de prueba de concepto debido a la falta de datos del mundo real post-comercialización. Significado y perspectivas Esta revisión sistemática de la literatura muestra claramente que el sistema de vigilancia de la seguridad de las vacunas, anteriormente centrado en la notificación posterior a la administración, está evolucionando hacia un sistema de monitoreo en tiempo real proactivo e inteligente. Los algoritmos que aprenden en tiempo real de vastos conjuntos de datos médicos tienen el potencial de detectar tempranamente las sutiles señales de efectos adversos raros, difíciles de identificar durante las fases iniciales de la vacunación. Sin embargo, existen numerosos obstáculos que deben superarse antes de que estos sistemas se integren plenamente en la práctica clínica real. Los formatos de datos y las desviaciones en la calidad, que varían según cada institución médica, junto con el problema de la "caja negra" que dificulta explicar claramente el proceso de derivación de los algoritmos, siguen siendo un obstáculo para ganar la confianza del entorno clínico. La falta de directrices específicas de autorización por parte de las autoridades reguladoras y de estándares de verificación acreditados también se señala como un factor que retrasa la comercialización. La transparencia de los datos y el establecimiento de modelos de inteligencia artificial explicables son fundamentales para que los sistemas inteligentes de farmacovigilancia se consoliden como un sólido escudo para la salud pública.
💡 Los resultados de este estudio ofrecen una dirección concreta de mejora para los sistemas de gestión de la seguridad en los centros de vacunación y las autoridades sanitarias. En las instituciones médicas, mediante el uso de modelos de ML basados en EHR, es posible realizar un análisis previo de las enfermedades subyacentes, el historial de reacciones a medicamentos y los factores de riesgo cardiovascular de los vacunados para identificar con precisión a los grupos de alto riesgo de miocarditis. Esto permitiría integrar sistemas de apoyo a la decisión clínica (CDSS) que proporcionen automáticamente un calendario de observación intensiva y pautas de seguimiento personalizado para estos grupos. Por su parte, las agencias reguladoras de salud pueden reducir significativamente la fatiga administrativa del personal especializado al implementar algoritmos de NLP en los canales de notificación de efectos adversos, eliminando rápidamente el 17% de las señales duplicadas. Esto permitiría la creación de una red de vigilancia activa a nivel nacional capaz de detectar anomalías estadísticas sin omitir señales críticas durante las fases iniciales de distribución de nuevas vacunas.

Antecedentes La propagación de bacterias multirresistentes (MDR), que no responden a los antibióticos existentes, constituye una grave crisis sanitaria a la que se enfrenta la medicina moderna. Las autoridades sanitarias advierten que las muertes anuales causadas por la resistencia a los antibióticos podrían alcanzar los 10 millones para 2050. Por otro lado, el desarrollo de nuevos antibióticos se encuentra estancado debido a los elevados costes y a la rápida adquisición de resistencia. En medio de este estancamiento, los bacteriófagos (Bacteriophage), virus que infectan selectivamente y eliminan solo ciertas bacterias, han surgido como una alternativa. El consenso académico es que existen límites claros al uso de bacteriófagos naturales como agentes terapéuticos. Los fagos de origen natural tienen un rango de hospedadores demasiado estrecho y son fácilmente neutralizados por el sistema de defensa CRISPR-Cas de las bacterias. Algunos fagos se han integrado en el genoma del hospedador, lo que ha provocado efectos secundarios como la propagación de genes de toxinas o de resistencia. La biología sintética tradicional se ha limitado a modificar parcialmente las proteínas. Por tanto, resultaba imposible que los seres humanos reconstruyeran manualmente la red de regulación a lo largo del genoma completo, que abarca decenas de miles de pares de bases (bp). Esto explica el trasfondo de la necesidad de una tecnología capaz de diseñar de principio a fin todo el ciclo vital del virus. Hallazgos clave El equipo de investigación construyó un modelo lingüístico genómico a gran escala (Genomic Language Model) y diseñó por primera vez en computadora el genoma completo de bacteriófagos que destruyen bacterias diana. El modelo de IA, tras aprender en profundidad datos de secuencias de cientos de miles de especies de virus, adquirió por sí mismo las reglas de disposición génica. Establecimiento de un sistema generador de genomas que abarca simultáneamente la estructura de superposición entre genes y los factores de regulación transcripcional. El genoma fago artificial derivado tiene un tamaño de aproximadamente 42.000 pares de bases, con una homología de secuencia inferior al 60 % en comparación con los fagos naturales. A pesar de ser una secuencia completamente nueva, se observa que el gen de la endolisina (Endolysin), que descompone las proteínas del cápside y la pared bacteriana, está dispuesto según reglas precisas. El equipo de investigación ensambló el ADN de cadena larga sintetizado en un sistema de expresión sin células y luego lo inyectó en un huésped bacteriano, logrando revivir con éxito partículas virales reales con capacidad infecciosa. Logro de la manifestación del código informático como un virus físico. Los resultados de los experimentos in vitro demostraron que lisisó por completo 28 de las 30 cepas clínicas de Pseudomonas aeruginosa multirresistente. El rango de dianas se amplió 2,6 veces en comparación con los fagos naturales. Al optimizar el sitio de unión, también se inhibió la frecuencia de aparición de mutaciones de resistencia bacteriana hasta un nivel de una décima parte. Significado y perspectivas Este estudio se destaca como el primer caso en que se diseñó desde cero mediante inteligencia artificial el genoma completo de un organismo viral, logrando su expresión como una entidad funcional. Se ha establecido una base técnica para la fabricación rápida de virus personalizados mediante instrucciones informáticas. La esperanza de poder reducir el período de suministro de terapias con fagos personalizadas para pacientes (Phage Therapy) de varios meses a unas pocas semanas. También existen numerosos desafíos por superar para lograr su implementación en la práctica clínica. El costo del proceso de síntesis y ensamblaje sin errores de largas cadenas de ADN de decenas de miles de pares de bases sigue siendo una carga significativa. Cuando se administra un parche artificial en el cuerpo, es difícil excluir la posibilidad de que el sistema inmunológico del paciente lo reconozca como un invasor externo y genere anticuerpos neutralizantes. Por ello, debe demostrarse previamente su seguridad biológica sin dañar al microbioma beneficioso. También es urgente establecer un sistema de verificación de bioseguridad (Biosecurity). Se señala la necesidad de un dispositivo de seguridad software que bloquee la generación de virus nocivos. Se prevé que las investigaciones posteriores se orienten hacia el fortalecimiento de la capacidad de evasión inmune y el aumento de la velocidad de síntesis de ADN.
💡 Es posible que se materialice un escenario clínico en el que se ofrezcan opciones de tratamiento personalizadas y rápidas a pacientes con infecciones nosocomiales graves contra los cuales los antibióticos convencionales han perdido su eficacia. Las aplicaciones representativas incluyen la neumonía crónica por Pseudomonas aeruginosa en pacientes con fibrosis quística y las infecciones por Staphylococcus aureus que se producen en el sitio de cirugía de prótesis articulares. Cuando el personal médico analiza y carga el genoma bacteriano de las muestras del paciente, la estructura del modelo de IA diseña inmediatamente un genoma de fago artificial capaz de superar la estructura del receptor y los sistemas de defensa de esa cepa. Al integrarse con plataformas de síntesis automatizada, se abre una vía de tratamiento de precisión ultrarrápida que completa el cóctel de fagos diana en 1 a 2 semanas para administrar al paciente. Se analiza que su valor de aplicación en el mercado de control biológico ecológico, que va más allá del ámbito médico para inhibir el uso indebido de antibióticos en la ganadería y la acuicultura, y eliminar bacterias patógenas causantes de intoxicación alimentaria en las instalaciones de procesamiento de alimentos, es también muy alto.

Antecedentes De los 3.000 millones de pares de bases del genoma humano, solo alrededor del 1,5% codifica proteínas directamente. El resto, más del 98% de las regiones no codificantes, actúa como interruptores clave que regulan la expresión génica; sin embargo, verificar experimentalmente el impacto de las variantes de secuencia en las enfermedades ha sido prácticamente imposible. Aunque se han intentado algoritmos computacionales para medir la conservación evolutiva, estos han mostrado limitaciones al no reflejar adecuadamente el contexto de las secuencias de bases circundantes. Recientemente, los modelos de lenguaje genómico (gLM), que aprenden secuencias a gran escala como lenguaje natural, han surgido como una alternativa prometedora. El problema es que la mayoría de los modelos gLM existentes analizan secuencias de una sola especie o no consideran la distancia evolutiva al alinear secuencias de múltiples especies. La coincidencia de bases entre especies cercanas, como humanos y chimpancés, genera sesgos al actuar como datos redundantes, mientras que las variantes en especies con relaciones evolutivas distantes suelen subestimarse. Esto ha impulsado la necesidad de integrar directamente los árboles filogenéticos biológicos en los algoritmos de aprendizaje. Hallazgos clave Un equipo de investigación dirigido por la profesora Yun S. Lee del departamento de Ciencias de la Computación de la Universidad de California en Berkeley (UC Berkeley) El equipo de investigación de Song ha desarrollado y publicado en la revista Nature el modelo genómico GPN-Star, que combina datos de alineamiento del genoma completo (WGA) con distancias filogenéticas. A diferencia de los enfoques anteriores, que se limitaban a la ordenación múltiple por simple enumeración, el motor principal es una arquitectura consciente de la filogenia que mapea directamente los tiempos de divergencia evolutiva entre especies en las operaciones de atención cruzada. Al distanciarse de la práctica de centrarse únicamente en la secuencia humana como especie de referencia, se ha aumentado significativamente la densidad de la señal de aprendizaje mediante el enmascaramiento aleatorio de las secuencias de bases de múltiples especies alineadas. Tras entrenar con la filogenia de 241 especies de mamíferos y 100 especies de vertebrados, el modelo logró cuantificar con precisión la restricción funcional que actúa sobre todos los alelos en el genoma. Las métricas de evaluación muestran una diferencia clara. En el experimento de identificación de variantes de la base de datos de variantes clínicas ClinVar, GPN-Star superó ampliamente los indicadores de conservación existentes PhyloP y las puntuaciones de conjunto CADD. Se ha evaluado que la precisión para identificar variantes causales en estudios de asociación del genoma completo (GWAS) también es superior en las regiones reguladoras no codificantes, en comparación con el mejor modelo anterior. Hasta haber demostrado la flexibilidad trascendiendo las fronteras de las especies, ampliándose hasta el análisis del genoma de cinco modelos clave como ratones, pollos, moscas de la fruta, nematodos Caenorhabditis elegans y Arabidopsis thaliana. Significado y perspectivas La aparición de GPN-Star proporciona una guía poderosa para los investigadores del desarrollo de fármacos que rastreaban la asociación de enfermedades con variantes genéticas no codificantes. Aunque se realice una secuenciación del genoma completo (Whole-Genome Sequencing, WGS) a pacientes con enfermedades raras y difíciles de curar que no han encontrado la causa mediante la secuenciación del exoma, el proceso de identificar la verdadera causa entre millones de variantes no codificantes generadas se ha comparado a menudo con buscar una aguja en un pajar. La implementación de GPN-Star, que calcula con precisión las presiones evolutivas, promete aumentar la eficiencia del trabajo de compresión de los candidatos principales en varias veces. La decisión del equipo de investigación de publicar los puntajes obtenidos como pistas en el navegador de genomas UCSC y abrir completamente los pesos del modelo también se considera un factor que inyecta vitalidad al ecosistema. Esto se debe a que las pequeñas y medianas biotecnológicas, aunque no cuentan con equipos de computación de alto rendimiento, ahora pueden evaluar inmediatamente el riesgo de mutación con solo unos pocos clics. Sin embargo, existen desafíos prácticos claros que deben abordarse. En secuencias repetitivas difíciles de alinear o en regiones de variantes estructurales, la confianza en las predicciones tiende a ser algo inestable. Dado que se basa en la información de bases conservada por la historia evolutiva, también es evidente su limitación de no poder capturar en tiempo real la dinámica de expresión epigenética que ocurre en células o tejidos específicos. Esta es la razón por la que la integración con datos de accesibilidad de la cromatina a nivel de célula única se ha destacado como un desafío clave para la próxima generación.
💡 En el diagnóstico genómico clínico, se prevé su implementación inmediata en los flujos de trabajo para confirmar variantes patogénicas no codificantes en pacientes con enfermedades genéticas raras de origen desconocido. Cuando se realiza un análisis de genoma completo en pacientes que no fueron diagnosticados con pruebas de exoma estándar, la aplicación de las puntuaciones de GPN-Star permitiría filtrar rápidamente candidatos patogénicos ocultos en promotores o regiones profundas de intrones entre decenas de miles de variantes de significado incierto (VUS). En la industria farmacéutica y de biotecnología, actúa como una pista decisiva para el desarrollo de terapias génicas de próxima generación que apuntan a regiones no codificantes. Si se identifican con precisión los potenciadores o regiones silenciadoras clave que regulan la expresión de genes asociados a enfermedades, se establecerá un sistema para diseñar terapias de regulación transcripcional basadas en oligonucleótidos antisentido (ASO) o en gene editing con una precisión mucho mayor. El sector de la bioeconomía agropecuaria también obtiene beneficios prácticos al seleccionar rápidamente variantes beneficiosas que determinan la resistencia a enfermedades en los cultivos o la productividad del ganado, lo que acorta los ciclos de mejoramiento genético.

Antecedentes Gracias al avance de las tecnologías de secuenciación del genoma humano, el coste de la secuenciación del genoma completo (WGS) ha disminuido drásticamente, pero más de la mitad de los pacientes con enfermedades raras siguen experimentando una 'odisea diagnóstica' sin conocer la causa genética. Hasta ahora, la investigación genética y el diagnóstico clínico se han centrado en las regiones del exoma, que codifican directamente las proteínas. El exoma representa solo entre el 1,5% y el 2% del genoma completo. Se ha estimado que en el vasto 98% restante, la región no codificante, existen numerosas variantes que causan enfermedades, pero los casos identificados como causas reales han sido extremadamente escasos. La razón de la escasa interpretación clínica de las variantes en regiones no codificantes radica en la ausencia de reglas de decodificación claras. En las secuencias que codifican proteínas, es relativamente fácil predecir la pérdida de función, como las sustituciones de aminoácidos o la terminación prematura, basándose en el sistema de codones. Por el contrario, es difícil intuir el impacto fenotípico de las variantes en las secuencias reguladoras. La estructura tridimensional de la cromatina, donde elementos reguladores como potenciadores (enhancers) o promotores controlan de forma remota genes situados a cientos de miles de pares de bases de distancia, también aumenta la dificultad del análisis. En esencia, faltaban herramientas de validación para distinguir entre variantes letales que causan enfermedades reales y variantes benignas inofensivas dentro de la vasta secuencia no codificante. Hallazgos clave Esta revisión publicada en Nature Genetics resume los mecanismos moleculares por los cuales las variantes no codificantes provocan enfermedades raras y pone el foco en las razones fundamentales de la baja tasa de descubrimiento diagnóstico. Los autores analizaron que las anomalías en la regulación no codificante inducen principalmente cambios cuantitativos en la expresión génica, actuando de forma más específica del tejido y sutilmente en comparación con la pérdida completa de una proteína. Se señaló que los métodos tradicionales, que dependían únicamente del análisis de la conservación evolutiva, tenían dificultades para capturar variantes reguladoras que solo se activan en entornos celulares específicos. Los investigadores propusieron como solución clave para acelerar el descubrimiento de variantes no codificantes la combinación de Ensayos de Reportero Masivamente Paralelos (MPRA), análisis de estructura tridimensional de la cromatina de alta resolución (Micro-C) y algoritmos de predicción basados en aprendizaje automático. Mediante el uso de la Tecnología de Edición del Genoma por Saturación (SGE), es posible evaluar funcionalmente todas las variantes de un solo nucleótido en secuencias no codificantes simultáneamente en un entorno de laboratorio. Al combinar esto con modelos de secuencias basados en aprendizaje profundo (deep learning) que interpretan directamente la información de la secuencia para cuantificar la accesibilidad de la cromatina y la actividad transcripcional por tipo celular, la precisión de la predicción funcional está mostrando una tendencia de mejora drástica. Se estima que la eficiencia para identificar las variantes causantes reales de la enfermedad entre decenas de miles de variantes candidatas ha aumentado decenas de veces en comparación con el pasado. Significado y perspectivas Se prevé que la identificación precisa de las redes de regulación no codificantes sea un punto de inflexión para aumentar la tasa de diagnóstico de enfermedades genéticas raras. Esto se debe a que puede ofrecer una etiología molecular clara a pacientes que perdían la oportunidad de un tratamiento adecuado por desconocer la causa. Los datos acumulados de variantes no codificantes proporcionan un plano para el desarrollo de terapias de precisión que apuntan directamente a secuencias reguladoras no codificantes, como los oligonucleótidos antisentido (ASO) o la edición del epigenoma. La tarea también es clara. Para cerrar la brecha entre las predicciones de los algoritmos computacionales y los fenotipos reales en los pacientes, debe seguir una comparación precisa con mapas de transcriptómica de célula única en órganos y etapas de desarrollo. La construcción de sistemas de validación funcional rápida utilizando organoides de modelos de enfermedades y la estandarización de las guías de interpretación clínica de variantes no codificantes también se consideran tareas pendientes. La capacidad de interpretación de datos genómicos se está expandiendo plenamente más allá de los límites de las regiones codificantes hacia las regiones no codificantes.
💡 El enfoque presentado en este estudio puede mejorar significativamente la tasa de diagnóstico en clínicas de enfermedades raras no diagnosticadas que, a pesar de haberse sometido a secuenciación de nueva generación (NGS), no han identificado la causa. En el entorno clínico, al vincular los datos de WGS de los pacientes con modelos de IA de predicción funcional no codificante y datos multiómicos de célula única, se podrá establecer un sistema que priorice las variantes en regiones de regulación transcripcional directamente relacionadas con la enfermedad, reduciendo el tiempo de interpretación de meses a días. Desde la perspectiva de la industria del desarrollo de fármacos, esto servirá como un paso clave para identificar numerosos nuevos objetivos reguladores en grupos de enfermedades intratables donde el desarrollo de terapias era imposible debido a la falta de dianas proteicas. Se espera que se haga realidad el diseño de terapias de ARN dirigidas que inhiban potenciadores causantes de enfermedades o restauren selectivamente la expresión génica silenciada.

Antecedentes A pesar de los avances drásticos en la tecnología de análisis del genoma, la genómica humana se ha enfrentado a un desafío persistente. Han pasado más de 20 años desde que el Proyecto del Genoma Humano descifrara 3.000 millones de pares de bases, pero las regiones que realmente codifican proteínas representan apenas entre el 1,5% y el 2% de la secuencia total. El vasto 98% restante, la región no codificante, actúa como un interruptor que regula finamente la expresión génica, pero su mapa funcional sigue siendo considerado territorio desconocido. Estudios previos, incluidos los estudios de asociación del genoma completo (GWAS), han logrado catalogar numerosas variantes genéticas relacionadas con enfermedades complejas. Sin embargo, dado que más del 90% de las variantes descubiertas se concentran en regiones reguladoras no codificantes, no ha sido fácil demostrar a nivel molecular la relación causal entre cambios específicos de nucleótidos y la inducción de enfermedades. Los experimentos de cribado de alto rendimiento, que introducen variantes en líneas celulares para su medición, también enfrentan limitaciones debido a los enormes costes y la dificultad de reproducir fielmente la compleja estructura de la cromatina in vivo. Aunque AlphaFold y AlphaMissense han avanzado en el análisis de variantes missense en el campo de la predicción de estructuras proteicas, durante mucho tiempo ha permanecido sin cubrir la necesidad de un modelo computacional que elucidara la vasta red reguladora de las regiones no codificantes. Descubrimiento clave Investigadores de Google DeepMind han presentado 'AlphaGenome', un modelo de secuencia basado en inteligencia artificial (IA) que abarca todo el genoma humano para llenar este vacío. El equipo logró predecir con éxito el impacto biológico de un total de 9.000 millones de variantes de un solo nucleótido (SNV), analizando exhaustivamente cada uno de los aproximadamente 3.000 millones de pares de bases que componen el genoma humano y sus tres posibles sustituciones. En esencia, han calculado con resolución de un solo nucleótido cómo fluctúan la cantidad de expresión génica, la accesibilidad de la cromatina, la afinidad de unión de los factores de transcripción y los patrones de empalme cuando cambia una sola base. La arquitectura del modelo está diseñada para procesar simultáneamente contextos genómicos largos de cientos de miles de pares de bases, capturando las interacciones de elementos reguladores distantes. Los investigadores cuantificaron el efecto de las repercusiones sobre elementos reguladores distantes, como promotores y potenciadores, entrenando el modelo con datos del genoma completo y resultados de experimentos de genómica funcional a gran escala. Los resultados de la evaluación de referencia (benchmark) mostraron que la precisión en la predicción de la patogenicidad de las variantes no codificantes presenta una mejora de más de dos órdenes de magnitud en comparación con las herramientas de genética estadística y los modelos de aprendizaje automático existentes. Mientras que los modelos anteriores solían perder nuevas variantes reguladoras al depender de la proporción de secuencias conservadas, AlphaGenome posee la distinción de interpretar los cambios en la unión tridimensional de los factores reguladores directamente a partir de la propia información de la secuencia. Significado y perspectivas Este logro establece un nuevo punto de inflexión en la investigación para rastrear los mecanismos de patogénesis de enfermedades genéticas raras e incurables, así como enfermedades complejas como el cáncer y la diabetes, derivadas de variantes no codificantes. Al resolver el cuello de botella en la interpretación de variantes que era difícil de verificar individualmente en el laboratorio, se abre el camino para identificar preventivamente la patogenicidad de numerosas variantes en regiones no codificantes que permanecían como variantes de significado incierto (VUS) en la secuenciación genómica clínica. Para los investigadores que manejan cohortes genómicas a gran escala, esto proporciona un criterio de selección riguroso para reducir el número de candidatos al análisis. Sin embargo, existen limitaciones prácticas claras en los resultados de las predicciones computacionales. Dado que los efectos de las variantes reguladoras calculados por la IA pueden manifestarse de manera diferente según el entorno tisular in vivo, la etapa de desarrollo o el estado epigenético, es indispensable que este proceso se acompañe de una verificación experimental precisa. También se requiere un trabajo de seguimiento para reforzar la información genómica de diversas poblaciones, evitando sesgos hacia datos de grupos específicos. Se espera que, al combinarse con la tecnología de análisis de célula única, la biología computacional se posicione como un motor clave para acelerar el descubrimiento de dianas terapéuticas.
💡 El mapa funcional de 9.000 millones de variantes presentado por AlphaGenome anticipa el cronograma para el desarrollo de fármacos y la medicina de precisión en la práctica clínica. En el entorno clínico, permitirá proporcionar diagnósticos moleculares rápidos a pacientes que portan variantes no codificantes clasificadas como de función desconocida tras pruebas de secuenciación de nueva generación (NGS). Un escenario representativo sería establecer una estrategia terapéutica el mismo día del examen, prediciendo que una variante en un promotor no codificante de un paciente con sospecha de enfermedad genética rara inhibe la expresión de un gen específico. En la industria biofarmacéutica, reduce los errores en las etapas de descubrimiento de dianas y diseño de terapias génicas. Al diseñar terapias de corrección basadas en CRISPR u oligonucleótidos antisentido (ASO) que apuntan a regiones no codificantes específicas causantes de enfermedades, ayuda a prevenir el riesgo de efectos fuera del objetivo (off-target). Se prevé que proporcione beneficios prácticos al reducir significativamente los procesos repetitivos de experimentos celulares en la etapa de obtención de candidatos, ahorrando costes en el desarrollo de nuevos fármacos.

Antecedentes La Tripanosomiasis Africana Humana (HAT), transmitida por la mosca tse-tse, es una enfermedad endémica mortal causada por el protozoo Trypanosoma brucei, que provoca parálisis del sistema nervioso central y trastornos del sueño hasta provocar la muerte. En las etapas iniciales, solo presenta fiebre y cefalea, pero la invasión de la barrera hematoencefálica conlleva daños neurológicos graves. Los tratamientos terapéuticos comercializados actualmente presentan baja comodidad de administración y un riesgo persistente de neurotoxicidad, y no existe ninguna vacuna preventiva aprobada por la Administración de Alimentos y Medicamentos de los Estados Unidos (FDA). La principal dificultad en el desarrollo de vacunas radica en la estrategia de evasión inmunológica del patógeno. La glicoproteína de superficie variante (VSG), que recubre la superficie del protozoo, cambia constantemente su antigenicidad, lo que impide la formación de memoria por parte del sistema inmunitario del huésped frente a un único antígeno. Las vacunas tradicionales de virus atenuados o subunidades proteicas han tenido dificultades para superar esta variación antigénica extrema. Por ello, ha cobrado relevancia el diseño de vacunas alternativas que combinan la técnica de vacunología inversa (Reverse Vaccinology), basada en el análisis de datos genómicos y estructurales, con la plataforma de ARN mensajero (ARNm), que permite una rápida combinación de antígenos. Hallazgos clave El equipo de investigación se centró en tres proteínas esenciales para la infección persistente y la supervivencia de T. brucei: el VSG, eje central del intercambio antigénico; la proteína de choque térmico 70 (Heat Shock Protein 70, HSP70), que ayuda a la respuesta al estrés y al plegamiento de proteínas; y el complejo chaperona transportadora vacuolar (Vacuolar Transporter Chaperone, VTC), responsable del transporte de membranas y del movimiento de vesículas. Tras pasar por un pipeline de selección bioinformática, se identificó el epítopo peptídico óptimo con alta inmunogenicidad y sin riesgo de alergenicidad ni toxicidad celular. La combinación de epítopos seleccionados abarca los alelos del complejo mayor de histocompatibilidad (MHC) predominantes en las poblaciones humanas a nivel mundial, logrando una cobertura global del 100%. La evaluación de las propiedades fisicoquímicas mostró un índice alifático de 71.23, asegurando estabilidad estructural, y un valor medio de hidrofobicidad (GRAVY) de -0.719, indicando una excelente solubilidad. La estructura terciaria predicha de la proteína de la vacuna registró un TM-score de 0.65 ± 0.13 y un C-score de -0.50; tras el refinamiento estructural, el porcentaje en la región preferida del gráfico de Ramachandran fue del 86.8% con un Z-score de -5.26, validando su estabilidad termodinámica. La capacidad de activación del sistema inmunitario también se demostró a nivel molecular. En el acoplamiento molecular (docking) con los receptores tipo Toll 2 (TLR-2) y 4 (TLR-4), mediadores clave del reconocimiento inmunitario innato, se formaron energías de unión muy bajas de -1013.5 kJ/mol y -1002.8 kJ/mol, respectivamente. La estabilidad del complejo se confirmó mediante simulaciones de dinámica molecular (MD), análisis de componentes principales (PCA), matriz de correlación dinámica (DCCM) y cálculos de superficie de área generalizada de energía libre molecular (MM-GBSA). Además, para maximizar la eficiencia de traducción de la molécula de ARNm, se realizó una optimización de codones adaptada al sistema de expresión de Escherichia coli. Se obtuvo un índice de adaptación de codones (CAI) de 0.9688 y un contenido de GC del 44.70%, y se confirmó la integridad estructural del transcrito mediante el análisis de energía libre mínima (MFE). Las simulaciones inmunológicas observaron la proliferación de linfocitos B y T activados, junto con altos títulos de anticuerpos de inmunoglobulina M (IgM) e inmunoglobulina G (IgG). Significado y perspectivas Este estudio es significativo porque completa el diseño de una vacuna de múltiples epítopos que ataca multidimensionalmente las proteínas del interior citoplasmático y de la membrana superficial, aprovechando la compleja variación antigénica del patógeno. En particular, al incluir HSP70 y VTC, factores esenciales de supervivencia celular, más allá de la limitación de apuntar solo a la VSG, se propone un diseño que bloquea las vías de evasión de la vacuna causadas por la variación antigénica. Dado que la estabilidad estructural y el potencial de inducción inmunitaria han sido claramente identificados mediante modelado computacional, esto podría servir como catalizador para reducir el tiempo de investigación en el desarrollo de vacunas para enfermedades tropicales desatendidas. Sin embargo, al ser resultados in silico basados en cálculos computacionales, queda pendiente el importante paso de la validación de la eficacia in vivo. Deben evaluarse previamente la eficiencia de entrega al encapsular el ARNm diseñado en nanopartículas lipídicas (LNP), la tasa de expresión proteica intracelular y la capacidad de protección contra la infección en modelos animales. El monitoreo de la respuesta inmunitaria a largo plazo frente a la posible aparición de variantes del patógeno también se identifica como un desafío futuro a resolver.
💡 Este candidato a vacuna presenta una alternativa real para mejorar la seguridad sanitaria en el África subsahariana, región donde habita la mosca tse-tse. Los quimioterapéuticos actuales requieren hospitalización prolongada y administración intravenosa, lo que dificulta su aplicación en aldeas remotas con infraestructura médica precaria. Si esta vacuna de múltiples epítopos de ARNm se comercializa combinada con tecnologías de liofilización o formulaciones termoestables, podría convertirse en un arma de salud pública para frenar la propagación de la enfermedad mediante vacunación masiva. Además, su diseño pensado para cubrir al 100% de la población aumenta las posibilidades de colaboración con empresas globales de producción de vacunas, ya que puede aplicarse ampliamente sin importar el origen étnico.

Antecedentes David Botstein, fallecido el 27 de febrero de 2026 a los 83 años, fue un genetista que no se limitó a explicar fenómenos biológicos específicos, sino que diseñó herramientas para interpretar sistemas biológicos complejos. Un artículo conmemorativo publicado en PNAS en septiembre de 2026 ilumina su trayectoria académica, desde su estudio del fago P22 de Salmonella hasta la cartografía del genoma humano, los microarreglos de ADN y la educación en biología cuantitativa. Durante los años 1960 y 1970, cuando Botstein inició su investigación, no existían métodos efectivos para localizar genes causales de enfermedades en el genoma humano. La secuenciación de ADN estaba en etapas iniciales y faltaban mapas para vincular fenotipos con genes causales. Botstein utilizó mutantes letales condicionales e inhibidores para agrupar genes que participaban en la misma función y estimar el orden de acción dentro de una vía. Este enfoque amplió la genética, que hasta entonces se centraba en genes individuales, hacia problemas de interacción y sistemas. Descubrimientos clave Su logro más conocido fue el mapa genético basado en polimorfismos de longitud de fragmentos de restricción (RFLP), propuesto en 1980 junto con Ronald Davis. La idea era utilizar fragmentos de ADN distintivos entre individuos como marcadores cromosómicos y calcular la frecuencia con que se heredaban junto con fenotipos patológicos dentro de familias, lo que permitía delimitar la ubicación de genes causales. Este enfoque invertía el orden tradicional, en el cual se necesitaba conocer el gen antes de poder localizarlo. El mapa RFLP aceleró la identificación de genes causales en enfermedades genéticas como la enfermedad de Huntington, sirvió como base conceptual para la búsqueda de BRCA1 y el Proyecto Genoma Humano. En una época sin secuenciación genómica, convirtió la frecuencia de recombinación en coordenadas para explorar el genoma humano como un mapa navegable. Por este logro, Botstein fue uno de los once primeros ganadores del Premio Breakthrough en Ciencias de la Vida en 2013. La Universidad de Princeton lo describió como uno de los principales líderes del Proyecto Genoma Humano y pionero en la cartografía genética. Sus investigaciones se extendieron desde la localización genética hasta la expresión génica. Trabajó con Patrick Brown en el desarrollo de microarreglos de ADN, permitiendo agrupar expresiones de miles de genes para identificar genes con funciones similares y clasificar subtipos tumorales. Analizó el ciclo celular y las respuestas metabólicas en levadura a nivel genómico y contribuyó a la clasificación molecular de linfomas de células B grandes difusas y cáncer de mama. Su enfoque fue distinto en que no solo estudió equipos experimentales, sino también algoritmos y sistemas de visualización para interpretar grandes volúmenes de datos. Significado y perspectivas El legado de Botstein no reside tanto en la tecnología RFLP como en el enfoque metodológico de crear marcadores medibles y reconstruir estructuras biológicas mediante cálculos. Este principio subyace en técnicas modernas como el análisis de asociación de genoma completo (GWAS), la secuenciación transcriptómica de células individuales y la diagnóstico molecular del cáncer. La transferencia de conceptos establecidos en bacterias y levadura hacia enfermedades humanas también redujo la brecha entre la investigación en modelos biológicos y la genómica clínica. Su carrera, que abarcó tanto academia como industria, amplió su influencia. Botstein investigó en el MIT y en la Universidad de Stanford, y ocupó cargos como vicepresidente en Genentech y director científico fundador en Calico. Durante diez años, desde 2003, dirigió el Instituto de Genómica Integrativa Lewis-Sigler de la Universidad de Princeton, integrando matemáticas, física y ciencias de la computación en la educación biológica. Sin embargo, los mapas RFLP y los primeros microarreglos tenían limitaciones en resolución y alcance, y hoy en día han sido reemplazados en gran parte por técnicas de secuenciación de alta velocidad. Aunque la tecnología ha cambiado, el principio de diseñar herramientas acordes a una hipótesis y analizar datos a nivel sistémico sigue vigente en la medicina de precisión y la biología de sistemas.
💡 El mapa genético basado en RFLP es el punto de partida de los paneles genéticos para cáncer hereditario y pruebas familiares para enfermedades raras que se realizan actualmente en hospitales. El flujo diagnóstico, que analiza la herencia conjunta de mutaciones y enfermedades para delimitar regiones candidatas y luego confirma la mutación causal mediante secuenciación, se basa en este enfoque. La clasificación de expresión tumoral establecida con microarreglos ha evolucionado hacia pruebas multigénicas que ayudan a elegir tratamientos, como la predicción del riesgo de recurrencia en cáncer de mama o la identificación de subtipos de linfoma. Las empresas farmacéuticas pueden aplicar el mismo principio para seleccionar grupos de pacientes y descubrir biomarcadores. Sin embargo, determinar la respuesta a medicamentos solo con señales de expresión es complejo, y se requieren validaciones clínicas independientes en diversas poblaciones.

Contexto Las ómicas espaciales miden la expresión génica, proteínas, accesibilidad de cromatina, modificaciones de histonas, metabolitos e información de imagen en coordenadas específicas dentro de los tejidos. Al superponer varias capas moleculares en la misma región, se puede comprender tridimensionalmente la relación entre el estado celular y la estructura tisular, pero las diferencias en la distribución y nivel de ruido de las mediciones hacen que las señales únicas se pierdan fácilmente durante la integración. Los métodos de integración de células individuales como Seurat, MOFA+ y MultiVI no reflejan adecuadamente las relaciones espaciales de vecindad. El modelo SpatialGlue, diseñado para múltiples ómicas espaciales, solo puede procesar hasta tres capas moleculares y presenta una carga computacional elevada con imágenes de alta resolución o conjuntos de datos con millones de coordenadas. La fuerza para alinear información diversa puede nivelar diferencias biológicas, causando un 'alineamiento excesivo'. Además, no identifica claramente las ubicaciones con resultados inestables. Hallazgo clave SCIGMA, desarrollado por investigadores de la Universidad de Brown, es un modelo de aprendizaje profundo no supervisado que combina una red neuronal gráfica de múltiples puntos en el tiempo con aprendizaje contrastivo basado en percepción de incertidumbre. Combina una gráfica espacial que conecta ubicaciones físicamente cercanas y una gráfica de características que conecta ubicaciones con propiedades moleculares similares, y genera representaciones latentes por capa molecular mediante una red neuronal de atención gráfica (GAT). La atención cruzada integra estas representaciones en un espacio común, mientras que un decodificador reconstruye las características originales para minimizar la pérdida de información. El núcleo es la pérdida contrastiva basada en percepción de incertidumbre, que aprende un parámetro de temperatura por ubicación. Las representaciones comunes y por capa molecular de la misma coordenada se colocan cerca, pero no se mezclan uniformemente las señales exclusivas de cada capa molecular. A las coordenadas con baja alineación se les asigna una alta incertidumbre, lo que permite identificar en el mapa áreas complejas como la heterogeneidad tumoral o la segmentación de células inmunes, o regiones con ruido técnico. Los investigadores evaluaron el modelo en 19 conjuntos de datos de 8 tipos de datos, 10 tejidos y 9 plataformas, incluyendo expresión génica, proteínas, accesibilidad cromatínica, imágenes de tejido, modificaciones de histonas y metabolitos. En datos comparables como el espacio ATAC–RNA del cerebro de ratón y los datos SPOTS del bazo, SCIGMA mostró una detección espacial, preservación de capas moleculares, reconstrucción de características y repetibilidad de ejecuciones superiores a las de Seurat v5, MOFA+ 1.13.0, MultiVI v1 y SpatialGlue v1. Otros métodos no pudieron procesar algunos conjuntos de datos grandes, requiriendo más de 400 GB de memoria de CPU y más de dos días de ejecución, según reportaron los investigadores. SCIGMA procesó más de un millón de ubicaciones espaciales, incluyendo datos de 2 micrómetros de resolución de 10x Visium HD, mediante muestreo gráfico. En datos de Spatial-Mux-seq del cerebro de un ratón de cinco meses, integró simultáneamente cinco tipos de información: RNA, proteínas, ATAC, H3K27ac y H3K27me3. Capas moleculares individuales mostraban imágenes borrosas de capas corticales cerebrales, el giro cingulado, el núcleo amigdalino caudal y el núcleo caudado, que se separaron claramente en regiones anatómicas en la representación común. El artículo en Nature Genetics explica que esta estructura es escalable a futuras plataformas que excedan las cinco capas. Significado y perspectivas SCIGMA aborda tres problemas clave de la integración de ómicas espaciales—preservación de señales por capa molecular, escalabilidad computacional para grandes conjuntos de datos y representación de la confiabilidad de los resultados—en un solo marco. En particular, la asignación de incertidumbre por coordenada permite no aceptar ciegamente los clústeres generados por el modelo, sino identificar áreas que requieren revisión patológica o experimentos adicionales. El software y el código para reproducir el análisis están disponibles públicamente. Sin embargo, el valor de incertidumbre es una medida que combina heterogeneidad biológica y variabilidad técnica. No se pueden determinar nuevos estados celulares o límites patológicos solo con valores altos, y se requiere validación con tinción tisular y marcadores independientes. La superioridad en rendimiento también tiene limitaciones, ya que se evaluó en conjuntos de datos con anotaciones correctas o donde los métodos competidores eran ejecutables. La capacidad para manejar diferencias en la disposición de muestras clínicas, capas moleculares faltantes y resoluciones distintas sigue siendo un tema de validación prospectiva.
💡 En hospitales, SCIGMA puede integrar RNA, proteínas e imágenes patológicas de rebanadas tumorales para dividir con mayor precisión las zonas de células cancerosas, infiltración de células inmunes y límites estromales. Por ejemplo, en tejidos de cáncer de ovario, se pueden priorizar para reevaluación las zonas de frontera con alta incertidumbre, y al comparar las proteínas de barrera inmune y la expresión génica en esas coordenadas, se puede reducir el número de candidatos para objetivos terapéuticos. En la industria farmacéutica, SCIGMA puede integrarse en pipelines de análisis que comparen cambios en señales espaciales antes y después de la administración de medicamentos para identificar microambientes resistentes o zonas de toxicidad. Sin embargo, en la actualidad SCIGMA es una herramienta computacional de investigación, y para su uso en decisiones clínicas se requiere procesamiento estandarizado de muestras, validación en cohortes externas y calibración clínica de umbrales de incertidumbre.

Contexto El córtex cerebral humano se expande rápidamente durante la gestación, cuando las células madre neuronales se multiplican y se diferencian en varios linajes. En el centro de este proceso se encuentran las astrocitos radiales ventriculares (vRG) y los astrocitos radiales externos (oRG). Especialmente en los primates, los oRG, que se han incrementado significativamente, son considerados células clave para formar el córtex ancho y arrugado exclusivo del ser humano, aunque el modo de regulación génica a nivel celular no está completamente aclarado. Estudios previos a nivel de célula única han mostrado qué genes se expresan y qué cromatina está abierta, pero han tenido dificultades para rastrear con precisión cómo las regiones reguladoras distantes interactúan con genes específicos en el espacio tridimensional. Esto limita la interpretación de variantes asociadas a trastornos mentales, que suelen estar concentradas en regiones no codificantes y pueden regular genes situados a decenas de miles de pares de bases de distancia. El equipo de investigación analizó de forma integrada la expresión génica, la accesibilidad de la cromatina, la metilación del ADN y las interacciones tridimensionales de la cromatina en vRG, oRG, precursores de oligodendrocitos (OPC) y microglia (MG) obtenidos del córtex cerebral humano durante la semana 15 a 24 de gestación. La diferencia en etapas de desarrollo se debe a que el pico de aparición de RG y OPC·MG ocurre en momentos distintos. Artículo en Nature Hallazgos clave Los investigadores identificaron 69.141 cCRE candidatos con alta accesibilidad y baja metilación en vRG, 72.450 en oRG, 65.295 en OPC y 6.958 en MG. Más del 60 % de estos se encontraban fuera de los promotores. Con PLAC-seq basado en H3K4me3, detectaron entre 135.000 y 144.000 interacciones significativas por tipo celular con una resolución de 2 kilobases, lo que representa un aumento de aproximadamente 4 veces en comparación con análisis de 5 kilobases. La distancia promedio de contacto osciló entre 188.000 y 233.000 pares de bases. En experimentos con reporteros en embriones de ratón, 14 de 18 secuencias reguladoras de RG y células precursoras intermedias mostraron actividad de enhancer en el cerebro embrionario. Al comparar vRG y oRG, se encontraron 7.941 regiones con acceso diferencial, pero solo 756 con metilación diferencial. La diferencia entre ambas células fue más clara en la accesibilidad cromatínica y en las interacciones tridimensionales. Los factores de transcripción LHX2 y ASCL1 estaban conectados con las redes reguladoras de oRG y vRG, respectivamente. Al inhibir LHX2 con ARN de horquilla corta, se redujo la autorenovación de oRG y aumentó la diferenciación hacia células gliales. El análisis con aprendizaje automático también ayudó a delimitar el alcance de las variantes patogénicas. De 11.360 variantes de esquizofrenia identificadas por DeepGWAS, 929 estaban en cromatina abierta y 112 se clasificaron como candidatas a modificar la accesibilidad. La variante rs4449074 T se predijo que reduciría la actividad del enhancer vRG hs3134, y en el prosencefalo de ratón mostró una señal más débil que la variante no riesgosa C. La susceptibilidad a la enfermedad de Alzheimer se concentró en elementos reguladores de MG, mientras que la susceptibilidad al trastorno del espectro autista destacó en vRG y oRG. Significado y perspectivas En el análisis evolutivo, 72 de las regiones con acceso diferencial en oRG coincidieron con áreas aceleradas humanas (HAR), mientras que en vRG solo 13, lo que indica una concentración 2,43 veces mayor en oRG. Los investigadores evaluaron 565 HAR abiertas en oRG y 3.447 variantes entre humanos y chimpancés, identificando 76 candidatos que podrían aumentar la accesibilidad en el genoma humano y 73 en el genoma de chimpancés. HARsv21313 se conectó tridimensionalmente con el promotor de ROCK2. Al inhibir esta región con CRISPRi en precursores neuronales derivados de células madre pluripotentes inducidas, la expresión de ROCK2 disminuyó y aumentó el número de células Ki67 positivas. Además, la secuencia humana de HARsv21602 eliminó un sitio de unión al factor de transcripción represor ZBT18, lo que podría incrementar la actividad reguladora de EPHA4. Esto sugiere que la expansión cortical humana y el riesgo de trastornos mentales podrían compartir ciertos circuitos reguladores no codificantes. Sin embargo, los valores analizados representan promedios de poblaciones celulares obtenidas mediante clasificación por citometría de flujo. No se capturaron diferencias en subtipos raros de precursores ni variaciones por ubicación, y la diferencia en accesibilidad entre portadores de rs4449074 no fue estadísticamente significativa. Los resultados obtenidos en embriones de ratón y precursores neuronales cultivados no deben extrapolarse directamente al desarrollo fetal humano ni a la patología clínica. Se necesitarán estudios posteriores con análisis epigenéticos espaciales y celulares, y experimentos de edición precisa en organoides cerebrales humanos para confirmar relaciones causales.
💡 Este mapa puede servir como herramienta para conectar variantes no codificantes identificadas en estudios de asociación de todo el genoma con las células donde operan y los genes que regulan. Por ejemplo, si una variante de un paciente con esquizofrenia reduce la actividad de un enhancer de vRG y se conecta con un gen de desarrollo específico, las empresas farmacéuticas podrían evaluar compuestos candidatos en organoides corticales humanos que reproduzcan esa vía reguladora. Las variantes de Alzheimer podrían priorizarse en MG, y las de autismo y esquizofrenia en RG·OPC, lo que reduciría costos en modelos celulares y validación funcional. Sin embargo, con los datos actuales aún es prematuro definir puntuaciones de riesgo diagnóstico ni objetivos terapéuticos, y se necesitarán más donantes y estudios en diversos perfiles genéticos para confirmar la reproducibilidad.

Contexto Los modelos genéticos predictivos que estiman el impacto de las variantes genéticas en la expresión de ARN, la concentración de proteínas y los niveles de metabolitos se han convertido en herramientas clave para elucidar mecanismos patológicos y descubrir dianas farmacéuticas. Análisis como el de transcritoma asociado (TWAS) o el de proteoma asociado (PWAS) permiten estimar indirectamente rasgos moleculares a partir de datos de asociación genómica (GWAS) y vincularlos con enfermedades. Su ventaja radica en que permiten explorar la ruta desde el gen hasta el rasgo molecular y la enfermedad sin necesidad de tomar muestras directas de los tejidos de los pacientes. El problema radicaba en que los modelos estaban dispersos en anexos de artículos, servidores de laboratorios o repositorios como PredictDB. Las coordenadas de variantes, las alelos efectores y los formatos de pesos variaban, y en muchos casos faltaban información sobre la composición ancestral de los grupos de entrenamiento o los tejidos y plataformas de medición. Esto dificultaba aplicar modelos en cohortes independientes o comparar capas oómicas diferentes. En particular, los modelos desarrollados en grupos de ascendencia europea, al aplicarse directamente a otros grupos, podían mostrar variaciones en la potencia de detección y en las estimaciones de efecto. Un equipo de la Universidad de Cambridge construyó la plataforma abierta OmicsPred para reducir estas discontinuidades. Los resultados se publicaron el 1 de septiembre de 2026 en Nature Genetics. Hallazgos clave OmicsPred asigna un identificador OPGS a cada puntuación predictiva y proporciona coordenadas cromosómicas o rsID, alelos efectores y pesos por variante en un formato estándar. Además, conecta con la versión original del genoma, los rasgos moleculares, los tejidos y plataformas de medición, los métodos de desarrollo del modelo, el tamaño y la composición ancestral de las muestras de entrenamiento y validación, los indicadores de rendimiento y las condiciones de uso. Los genes, transcritomas, proteomas y metabolomas se vinculan con Ensembl, UniProt y ChEBI, y los tejidos y fenotipos se normalizan con ontologías reconocidas. El formato de archivos se diseñó siguiendo las normas del catálogo de puntuaciones multigenéticas (PGS Catalog). Los usuarios pueden descargar modelos en formatos compatibles con pgsc_calc o PredictDB para MetaXcan. También se ofrece una interfaz REST (API) para buscar metadatos dentro del programa. El código de implementación de la plataforma y la base de datos se publica bajo licencia Apache 2.0. El equipo validó la viabilidad usando datos de GWAS de enfermedades del Programa de Veteranos de los EE.UU. (Million Veteran Program, MVP). Analizaron 9 conjuntos de datos con 38.450 puntuaciones de transcritoma y proteoma basados en sangre y plasma con S-PrediXcan. Evaluaron 1.233, 986 y 719 rasgos PheCode en grupos de ascendencia europea, africana y mixta, respectivamente, emparejando solo GWAS con grupos de entrenamiento y ascendencia similares. Excluyeron puntuaciones con menos del 75 % de coincidencia con las variantes de GWAS y corrigieron las pruebas múltiples por conjunto de datos. El análisis reveló 194.138 asociaciones significativas corregidas por tasa de falsos descubrimientos. La asociación entre la expresión de CFH y la degeneración macular llegó a un valor P de 1,29×10⁻⁶¹, y entre la expresión de PCSK9 y la enfermedad coronaria fue de 7,61×10⁻²⁵. Treinta y un combinaciones gen- enfermedad se replicaron en los seis conjuntos de datos de ascendencia europea, y cinco combinaciones se detectaron comúnmente en modelos de proteoma de SomaLogic a través de grupos de ascendencia. Valor y perspectivas El valor de OmicsPred no reside tanto en nuevos algoritmos predictivos como en convertir modelos existentes en infraestructura reutilizable para la investigación. Comparar resultados predictivos del mismo gen o proteína por tejido, plataforma de medición, capa oómica y grupo de ascendencia permite priorizar candidatos que se vinculan repetidamente a ciertas enfermedades. La fuerte replicación de asociaciones conocidas como CFH y PCSK9 demuestra que la plataforma puede recuperar señales patológicas relevantes. La API abierta y los metadatos normalizados son útiles también para automatizar pipelines de exploración a gran escala. Las empresas farmacéuticas pueden evaluar en masa la asociación entre rasgos moleculares predichos genéticamente y cientos de enfermedades, revisando no solo indicaciones esperadas, sino también señales de efectos secundarios potenciales. Si un candidato se repite en varias capas oómicas, se fortalece la base para priorizar experimentos funcionales posteriores. Sin embargo, solo la asociación entre predicción genética y enfermedad no demuestra causalidad ni efectividad de un medicamento. Factores como desequilibrio de ligamiento, expresión multifuncional, especificidad tisular y diferencias en plataformas de medición pueden distorsionar los resultados. También persiste la limitación de que los modelos y datos de ascendencia europea siguen dominando. Para identificar con mayor precisión candidatos con potencial terapéutico, será necesario aumentar modelos desarrollados y validados en diversos grupos de ascendencia y tipos celulares, combinando análisis de localización, aleatorización mendeliana y validación experimental.
💡 En el desarrollo de medicamentos, los equipos pueden contrastar GWAS de enfermedades con puntuaciones de OmicsPred para priorizar candidatos de ARN o proteínas regulados genéticamente. Por ejemplo, en un programa de enfermedades cardiovasculares, se podrían elegir candidatos consistentes en varios datos de transcritoma y proteoma, pasarlos a análisis de localización y experimentos celulares, y revisar si el mismo molécula se vincula con otras enfermedades para ampliar la indicación o evaluar riesgos de seguridad tempranamente. Investigadores de hospitales y biobancos pueden aplicar puntuaciones estándar a sus propios datos genómicos para estimar rasgos moleculares en cohortes de pacientes de gran tamaño, donde no es posible medir tejidos directamente. Sin embargo, para usarlo como herramienta de decisión clínica, será necesario validar en la población objetivo y cuantificar la precisión predictiva y los sesgos por grupo de ascendencia.

Contexto La simbiosis microbiana desempeña funciones amplias, desde la adquisición de nutrientes y resistencia al estrés, defensa contra enfermedades hasta ciclos de carbono y nitrógeno en los ecosistemas. Sin embargo, una gran proporción de bacterias y arqueas no se cultivan en el laboratorio, lo que dificulta confirmar con quién y cómo sobreviven. Los genomas de simbióticos conocidos estaban sesgados hacia especies aisladas de humanos o animales, y hacia especies fáciles de cultivar, dificultando estimar la escala real de relaciones simbióticas en los ecosistemas. Los simbióticos tienden a perder genes metabólicos y regiones genómicas innecesarias a medida que aumenta su dependencia del huésped. Sin embargo, no es posible determinar la simbiosis solo por el tamaño del genoma. Los microbios libres también pueden reducir su genoma durante la adaptación ambiental, y las especies con asociaciones flojas al huésped suelen mantener capacidades metabólicas completas. Los investigadores consideraron que un sistema de aprendizaje automático que lea combinaciones funcionales a nivel genómico, en lugar de genes individuales, podría superar esta limitación, distinguiendo entre formas libres, asociadas al huésped y absolutamente intracelulares. Hallazgo clave Los investigadores desarrollaron un marco predictivo de simbiosis llamado 'symclatron'. Primero, inferieron conjuntos ortogonales de genes a partir de 792 proteomas simbióticos seleccionados en principales grupos filogenéticos, y construyeron 26,3 perfiles ocultos de Markov en grupos con cinco o más miembros. Luego, clasificaron 6,751 genomas microbianos con historia de vida confirmada en 5,959 libres, 409 asociados al huésped y 383 absolutamente intracelulares, usándolos como datos de entrenamiento. El clasificador 'symcla' y el modelo de regresión 'symreg', que representan la dependencia del huésped como valor continuo, recibieron 1,000 características con mayor influencia cada uno. La red neuronal final integró siete factores: predicciones de ambos modelos, integridad genómica y distancia filogenética con los datos de entrenamiento. Los investigadores también realizaron validación cruzada por grupo filogenético, excluyendo sucesivamente 11,025 linajes desde la especie hasta el filo, para probar no solo la capacidad de identificar parientes cercanos ya vistos, sino también su aplicabilidad a linajes no entrenados. En los datos de validación, las puntuaciones F1 para formas libres, asociadas al huésped y absolutamente intracelulares fueron 0.982, 0.699 y 0.908, respectivamente. Clasificó correctamente el 97.6% de los simbióticos absolutamente intracelulares, y el 5.2% de los asociados al huésped se clasificó como absolutamente intracelulares, mientras que el 2.3% de los absolutamente intracelulares se clasificó como asociados al huésped, lo que reflejó la naturaleza continua del límite biológico entre ambas categorías. El 'symclatron' se aplicó a genomas de metagenomas reconstruidos de 31,152 proyectos de secuenciación ambiental y a genomas de referencia. Tras eliminar duplicados según criterios de calidad y alineamiento promedio del 95%, se obtuvieron 107,067 genomas bacterianos y arqueales. Con un umbral de confianza de 0.725, se identificaron 14,070 como simbióticos, lo que representa aproximadamente el 14%, o uno de cada siete. En los metagenomas, la proporción varió entre el 15 y el 23%, y se encontraron candidatos en la mitad de los filos bacterianos y arqueales conocidos. Estos genomas se publicaron como el catálogo 'Genomas Simbióticos (SymGs)'. Significado y perspectivas Este estudio abre una vía para seleccionar a gran escala la posibilidad de simbiosis solo con huellas funcionales genómicas, sin necesidad de cultivo ni observación del huésped. El modelo clasificó como absolutamente intracelulares a linajes como 'Candidatus Azoamicus ciliaticola', que suministra energía a ciliados, y al arquea recientemente reportado 'Candidatus Sukunaarchaeum mirabile', lo que sugiere que puede explorar relaciones de dependencia no solo entre eucariotas, sino también entre bacterias y arqueas. Sin embargo, se requiere cautela en la interpretación. Los datos de entrenamiento estaban sesgados hacia bacterias asociadas a eucariotas y con pocos casos de arqueas. El rendimiento disminuyó en grupos filogenéticos distantes, y la puntuación F1 de los asociados al huésped fue menor que en los otros dos grupos. Además, no es posible determinar con solo predicciones si la interacción es mutualista o parasitaria, ni identificar el socio exacto. Por lo tanto, el 'SymGs' no es una lista definitiva de simbióticos, sino más bien una guía de prioridades para estudios posteriores, como cultivos, observaciones microscópicas, análisis de células individuales y experimentos metabólicos.
💡 Al introducir genomas microbianos obtenidos de muestras ambientales en el 'symclatron', se pueden priorizar candidatos con alta probabilidad de dependencia del huésped. Por ejemplo, en el rizosfera de cultivos, se pueden seleccionar candidatos relacionados con la absorción de nutrientes o la supresión de patógenos para diseñar comunidades microbianas sintéticas, o en muestras marinas, se pueden rastrear pares simbióticos que median ciclos de carbono y nitrógeno. En microbiomas de humanos y ganado, se pueden predecir deficiencias metabólicas en bacterias difíciles de cultivar, ayudando a diseñar medios personalizados y condiciones de co-cultivo. Sin embargo, para adoptar cepas industriales o terapéuticas, se requiere confirmación del huésped, validación funcional y evaluación de seguridad biológica.

Contexto Las bacterias del género Leptospira son patógenos que causan leptospirosis en humanos y ganado. Se establecen en los riñones de diversos animales y se excretan por la orina, contaminando el ambiente, pero los genes que determinan su patogenicidad y adaptación al huésped no están completamente caracterizados. La creación de cepas mutantes para verificar directamente la función genética es difícil. En la edición genética bacteriana habitual, Cas9 corta ambas hebras del ADN objetivo y el proceso de reparación celular induce mutaciones genéticas. Sin embargo, la mayoría de las leptospiras no pueden reparar adecuadamente los cortes de doble hebra (DSB). Aunque Cas9 corte con precisión, las células editadas no sobreviven, dificultando la recuperación de cepas knockout. La técnica de interferencia CRISPR con Cas9 inactiva la transcripción pero no altera permanentemente la secuencia genética. El equipo desarrolló un sistema combinado de CRISPR/Cas9-uniendo extremos no homólogos (NHEJ) y edición primaria (PE) de CRISPR. El primero complementa la capacidad de reparación y el segundo evita los cortes mortales. Hallazgo clave En el sistema CRISPR/Cas9-NHEJ, se expresan conjuntamente Cas9, ARN guía y proteínas de reparación LigD y Ku de Mycobacterium smegmatis. Ku agarra los extremos cortados y LigD los une, proporcionando la capacidad de NHEJ que le falta a Leptospira. Esta reparación inexacta genera inserciones o eliminaciones (indel) que alteran el marco de lectura genético, permitiendo crear mutantes knockout. La edición primaria reduce riesgos y aumenta precisión. Los investigadores fusionaron Cas9-nicaza con una transcriptasa inversa. El ARN guía de edición primaria dirige la secuencia objetivo y la transcriptasa inversa registra la secuencia deseada en el ADN. Al no cortar ambas hebras, se preserva la viabilidad celular en leptospiras sensibles a DSB. Los sistemas tienen funciones claramente diferenciadas. Cas9-NHEJ es adecuado para generar rápidamente múltiples indel mediante reparación defectuosa. PE, en cambio, es ideal para experimentos que requieren resultados predefinidos, como sustituciones de un solo nucleótido. Ahora se puede elegir entre destrucción genética y corrección precisa según el objetivo, superando métodos anteriores basados en mutaciones aleatorias o supresión temporal. Significado y perspectivas El nuevo sistema edita genéticamente a Leptospira para validar causalmente factores patogénicos, rutas metabólicas, genes de supervivencia ambiental y colonización. Comparando cepas con genes eliminados y con cambios específicos, se pueden analizar efectos de pérdida de proteínas y cambios individuales de aminoácidos. También es útil para estudiar diferencias funcionales entre especies y serotipos. En el desarrollo de vacunas, se pueden aplicar cepas atenuadas al eliminar genes patogénicos o ajustar la producción de antígenos. Sin embargo, los resultados actuales se centran en el desarrollo de herramientas. La eficiencia de edición por objetivo, mutaciones no objetivo, variaciones en la transferencia y expresión de plásmidos según la cepa, y la variabilidad de los indel generados por NHEJ requieren validación adicional. PE también depende de la secuencia cercana al objetivo y del diseño del ARN guía. Para evaluar el uso real, se debe confirmar la estabilidad genética y la patogenicidad en modelos de infección animal.
💡 En el laboratorio, se pueden eliminar genes patogénicos sospechosos con Cas9-NHEJ para seleccionar fenotipos de infección y luego usar PE para cambiar bases o aminoácidos específicos y delimitar mecanismos. Por ejemplo, al inocular cepas editadas en modelos de infección en hámsteres y comparar su capacidad de causar enfermedad aguda y colonizar riñones, se puede identificar el rol de los genes en etapas específicas de la infección. En el ámbito industrial, diseñar cepas vacunales sin genes tóxicos es una aplicación prometedora. Sin embargo, se deben evaluar la estabilidad en cultivos, mutaciones no objetivo y riesgos de liberación ambiental. Al manipular con precisión patógenos, también se deben establecer normas de bioseguridad y regulaciones adecuadas.