Cómo leer un genoma de referencia
Por qué es necesario este concepto
En los resultados del análisis del genoma, aparecen con frecuencia posiciones como chr7:.... Sin embargo, el número de cromosoma y la posición numérica no constituyen una dirección completa. Es necesario conocer en qué ensamblaje del genoma se basa el análisis para poder localizar correctamente los mismos segmentos de secuencia y variantes.
El genoma de referencia no es simplemente "la secuencia de ADN representativa de las personas". Es un sistema de coordenadas basado en la secuencia utilizado para alinear lecturas de secuenciación, registrar variantes y características génicas, e intercambiar resultados. Si no se fija el genoma de referencia antes de iniciar el análisis, las coordenadas, las anotaciones y los recursos posteriores pueden quedar desalineados entre sí.
El genoma de referencia no significa solo un archivo FASTA
| Nivel | Información que debe fijarse | Problemas que surgen al cambiarla |
|---|---|---|
| Ensamblaje | GRCh37, GRCh38, T2T-CHM13, etc. | El mismo número de posición puede apuntar a secuencias diferentes |
| Versión del ensamblaje | Mayor, parche y accession/version | La composición de las secuencias incluidas y la identidad de la versión quedan poco claras |
| Paquete de referencia | Primary, alt, decoy, etc., que componen el FASTA real | El mapeo de lecturas y la llamada de variantes pueden variar |
| Anotación | Proveedor y versión, GTF/GFF | Los límites de genes/transcritos y las consecuencias pueden cambiar |
| Recursos del análisis | Sitios conocidos, intervalos, índices | Los nombres de contigs y las coordenadas pueden no coincidir con el genoma de referencia |
Por lo tanto, decir "se usó GRCh38" es necesario pero no suficiente. Es necesario registrar también la accession exacta del ensamblaje, las versiones del archivo FASTA y los archivos adjuntos, así como la versión de la anotación.
GRCh37, hg19, GRCh38, hg38
GRCh37 y GRCh38 son los nombres del ensamblaje del Genome Reference Consortium, mientras que hg19 y hg38 son los nombres correspondientes ampliamente utilizados por UCSC. GRCh19 no es el nombre oficial y suele ser una expresión mezclada entre GRCh37 y hg19.
El ensamblaje principal humano actual de GRC es GRCh38, y la última versión parcheada es GRCh38.p14. Las versiones parcheadas añaden secuencias de parche pero no modifican las coordenadas de los cromosomas del ensamblaje mayor. En cambio, cuando se cambia el ensamblaje mayor de GRCh37 a GRCh38, es necesario volver a verificar las coordenadas y el contexto de la secuencia.
¿Basta con cambiar la dirección cuando cambia el ensamblado?
No. Aunque los segmentos bien conservados y de correspondencia única pueden transformarse de manera relativamente sencilla, en las regiones de secuencias repetitivas, duplicaciones segmentarias, diferencias estructurales y nuevas inserciones pueden aparecer características sin mapear (unmapped) o con múltiples mapeos (multi-mapped), así como cambios en los intervalos y la hebra, y discrepancias en el alelo de referencia.
UCSC LiftOver y Ensembl Assembly Converter proyectan las coordenadas mediante alineación del ensamblado. El mensaje de éxito no garantiza la identidad biológica. Tras la transformación, es necesario verificar el mapeo, los intervalos, la hebra, los alelos y la anotación objetivo; en regiones complejas, puede ser más adecuado volver a alinear las lecturas originales contra la referencia objetivo.
Comprobar el ensamblaje de origen y el alelo de referencia
↓
Fijar el ensamblaje de destino y el método de conversión
↓
Revisar intervalos sin mapear, multimapeados o modificados
↓
Volver a comprobar el alelo de destino y la versión de anotación¿Qué aporta KOREF?
El estudio KOREF de 2016 presentó KOREF_S, basado en un donante, y KOREF_C, que incorporó variantes comunes de los genomas completos de 40 personas coreanas. Su objetivo no era crear un estándar único que sustituyera a GRCh38, sino evaluar la posibilidad de mejorar la representación de secuencias y variantes relevantes para poblaciones coreanas y de Asia oriental.
El posterior KOREF_S1 es un ensamblaje a escala cromosómica que utiliza lecturas largas, Hi-C e información parental. Por tanto, incluso la afirmación «se utilizó KOREF» debe indicar la versión exacta. KOREF no representa un único genoma normal de todas las personas coreanas ni un estándar clínico.
¿Por qué se sigue utilizando GRCh38 después de T2T y el pangenoma?
T2T-CHM13 amplió considerablemente los huecos y las regiones complejas de las referencias anteriores. Human Pangenome Reference representa ensamblajes faseados de múltiples personas y sus relaciones para reducir la diversidad que una sola referencia lineal no capta. Un ensamblaje individual T2T y un pangenoma que representa la diversidad poblacional no son el mismo concepto.
Esto no invalida automáticamente los resultados basados en GRCh38, porque las anotaciones, las bases de datos poblacionales, el diseño de ensayos, el conocimiento clínico y el ecosistema de software están vinculados a referencias concretas. Lo importante no es memorizar «la referencia más reciente», sino especificar la pregunta de investigación, la versión exacta, el paquete de referencia, la anotación y la validación de cualquier conversión.
Puntos que pueden resultar confusos
- Un genoma de referencia no es el genoma normal y perfecto de una sola persona.
- Aunque un parche de GRC conserve las coordenadas principales de los cromosomas, debe registrarse el paquete utilizado.
- Una conversión de coordenadas satisfactoria no garantiza la identidad completa de una variante.
- Un pangenoma no es simplemente la siguiente versión de GRCh38.
Evidencia y limitaciones actuales
Este artículo es una guía conceptual para seleccionar y registrar una referencia. No proporciona procedimientos ni comandos para convertir o interpretar ensayos, enfermedades o variantes clínicas concretas. Un tutorial operativo debe fijar por separado el paquete de referencia, la versión de la anotación y las sumas de comprobación.