Preguntas que quedan tras completar F27~F31 — ¿Por qué se siguen pasando por alto ciertas variantes?
En F27~F31 hemos encapsulado el orden del pipeline (Snakemake·Nextflow) y el entorno de ejecución (Docker·Slurm). Sin embargo, incluso con toda esta infraestructura funcionando a la perfección, la historia cambia si el genoma de referencia utilizado en la etapa de alineamiento es la secuencia de una sola persona. GRCh38 es esencialmente una secuencia lineal compuesta por la ensamblaje de secuencias de un pequeño número de donantes. Los reads de individuos con alelos que difieren significativamente de esta referencia tienden a ser desplazados desde la etapa de alineamiento, lo que resulta en que las variantes mismas no sean llamadas y desaparezcan. En F32 abordaremos el enfoque del Pangenoma (Genoma Pan) que resuelve este problema mediante una estructura de grafo, así como PanVariants, que aplica esto a la detección de variantes.
Principio — Sesgo de referencia y alineamiento en grafos
Dónde surge el sesgo de referencia
Los alineadores lineales como BWA-MEM2 alinean los reads contra una única secuencia de referencia mediante un método de siembra y extensión (seed-and-extend). A medida que aumentan las discrepancias (mismatches) entre el read y la referencia, la puntuación del alineamiento disminuye; al superar cierto umbral, el alineador excluye completamente esa posición de los candidatos o reduce su calidad de mapeo (MAPQ). El problema radica cuando estas discrepancias no son errores, sino alelos reales existentes. En regiones con alta polimorfismo entre poblaciones, como la región HLA, o en segmentos donde las inserciones y deleciones (indels) son comunes solo en grupos específicos, los individuos con secuencias distintas a la referencia presentan una tasa sistemáticamente mayor de fallos de alineamiento. Es decir, el sesgo de referencia no es un error aleatorio, sino un sesgo cuya dirección está determinada por qué tan cerca se encuentra uno del grupo de donantes que originó la secuencia de referencia.
Ejemplo de cálculo manual: Cómo la frecuencia alélica afecta la tasa de éxito del alineamiento
Supongamos que un alineador de siembra y extensión con una longitud de read de 150 pb permite un máximo de 6 discrepancias. Si una variante de inserción ausente en la referencia tiene 8 pb, el read que contiene esta inserción tendrá una puntuación de alineamiento con huecos (gap alignment score) por debajo del umbral crítico, lo que provoca que el alineamiento falle o se realice incorrectamente en otra posición (mismap). Si la frecuencia alélica de esta variante dentro de la población es del 40%, aproximadamente la mitad de los reads que cubren esa posición en individuos heterocigotos seguirán esta ruta fallida.
La cobertura en este punto se reduce prácticamente a la mitad en la mitad de los heterocigotos, y si el llamador de variantes de GATK4 no supera el umbral mínimo de cobertura, la variante desaparece del VCF. El simple hecho de que la secuencia de referencia ignore por completo ese alelo equivale a eliminar la variante en la etapa de alineamiento, en lugar de hacerlo mediante una pérdida de potencia estadística.
Grafos de pangenoma — Absorción de secuencias alternativas como rutas en el grafo
Los grafos de pangenoma representan la referencia no como una única secuencia, sino como un grafo que refleja las variantes conocidas. Los nodos son fragmentos de secuencia y las aristas indican los caminos por los cuales esos fragmentos pueden conectarse realmente. Un SNP se representa como un pequeño bucle (bubble) donde el nodo se bifurca y vuelve a unirse; las inserciones y deleciones, como rutas alternativas; y las variantes estructurales, como subgrafos más complejos. El borrador del pangenoma publicado por el Human Pangenome Reference Consortium en Nature en 2023 integró secuencias ensambladas completas de 47 individuos (94 haplotipos) en un único grafo, incorporando explícitamente en el grafo una gran cantidad de variantes estructurales que GRCh38 no lograba representar adecuadamente.
vg giraffe y GBWT — Alineamiento rápido sobre grafos
A medida que los grafos crecen, también lo hace el costo del alineamiento sobre ellos. vg giraffe aborda este problema mediante dos estrategias. En primer lugar, utiliza siembra basada en minimizadores para reducir la búsqueda de posiciones candidatas a regiones estrechas en lugar de recorrer todo el grafo. En segundo lugar, emplea GBWT (Graph Burrows-Wheeler Transform) para comprimir e indexar las rutas de haplotipos individuales contenidas en el grafo, lo que orienta el alineamiento hacia caminos observados realmente y evita que se pierda en recombinaciones hipotéticas (por ejemplo, rutas mezcladas con fragmentos de diferentes haplotipos). Conceptualmente, GBWT es una estructura de datos que extiende el BWT y el índice FM, tratados en las secciones M14~M15, a grafos y múltiples secuencias.
PanVariants — Integración del alineamiento en grafos con la llamada de variantes
PanVariants (bioRxiv, 2026) es un marco que integra los resultados del alineamiento en grafos para la llamada de SNV, indel, SV, CNV y STR. En las comparaciones presentadas en este preprint, la sensibilidad (recall) y el puntaje F1 variaron según la composición y el tamaño del panel de referencia, la plataforma de secuenciación y el tipo de variante. Por ejemplo, en una comparación reportada por el artículo, al ampliar el panel de referencia de 88 a 214 haplotipos, la sensibilidad aumentó del 62,46 % al 68,28 %, y el puntaje F1 del 72,57 % al 75,23 %. Por lo tanto, en lugar de generalizar cifras específicas a todos los datos, es necesario verificar cuántas variantes que la referencia lineal no representa adecuadamente logra capturar el grafo, utilizando el mismo conjunto de verdad (truth set) y el mismo intervalo de evaluación. Dado que aún es un preprint sin revisión por pares, las cifras y conclusiones deben confirmarse en la versión final publicada.
Práctica: Construcción de un grafo de variantes a pequeña escala y alineamiento en grafos (CPU en Colab)
Dado que el tamaño del grafos de pangenoma humano completo es demasiado grande para manejarlo localmente, se recorta un solo segmento génico para verificar directamente el funcionamiento del grafo.
# Ejecutar en Colab o shell Linux local (usando binario estático de vg toolkit)
# 1. Descargar el binario vg (compilación estática desde la página de lanzamientos)wget https://github.com/vgteam/vg/releases/latest/download/vg -O vgchmod +x vg
# 2. Construcción del grafo con una secuencia de referencia de ejemplo (FASTA pequeño) y variantes (VCF)# ref.fa: segmento aleatorio de 1 kb, sites.vcf: algunos SNP·indel dentro de ese segmento# ref.fa: segmento aleatorio de 1 kb, sites.vcf: algunos SNP·indel dentro de ese segmento# 2. Construcción del grafo con una secuencia de referencia de ejemplo (FASTA pequeño) y variantes (VCF)./vg construct -r ref.fa -v sites.vcf.gz > graph.vg
# 3. Indexación del grafo — índice para siembra con minimizer e índice de haplotipos GBWT./vg autoindex --workflow giraffe -r ref.fa -v sites.vcf.gz -p graph_index
# 4. Alineación de lecturas simuladas al grafo./vg giraffe -Z graph_index.giraffe.gbz -m graph_index.min -d graph_index.dist \ -f reads.fastq > aligned.gam
# 5. Verificar estadísticas de alineación — tasa de alineación basada en rutas del grafo, no posiciones de referencia./vg stats -a aligned.gamAl comparar la tasa de alineamiento obtenida con vg stats con la alineación lineal realizada con BWA-MEM2 para las mismas lecturas, se puede observar directamente que la tasa de alineamiento del alineamiento en grafos tiende a ser mayor en regiones donde hay una mayor concentración de variantes. En los flujos de trabajo clínicos y de investigación reales, este paso suele ir seguido por la proyección (surject) de las coordenadas del grafo nuevamente a coordenadas lineales de GRCh38; esta transformación de coordenadas es en sí misma uno de los obstáculos prácticos para la implementación de pangenomas.
Mapeo CS
- grafo de secuencias bidireccional: un variation graph tiene nodos que representan fragmentos de secuencia y aristas que indican la relación de adyacencia entre los extremos de estos fragmentos; debido a inversiones o repeticiones, puede contener ciclos. Por lo tanto, no se puede considerar esencialmente como un DAG (grafo acíclico dirigido), y el alineamiento se redefine como el problema de encontrar en este grafo la ruta que mejor coincida con las lecturas.
- estructura de datos succincta: GBWT es una estructura de datos succincta que comprime y almacena decenas de miles de rutas de haplotipos contenidas en el grafo en un espacio mucho menor en comparación con el original, mientras admite consultas rápidas; es una extensión del BWT e FM-index descritos en las páginas M14~M15 al contexto de grafos y múltiples secuencias.
- búsqueda en grafos vs búsqueda lineal: si la estrategia seed-and-extend del alineamiento lineal se expande basándose en una única coordenada, el alineamiento en grafos tiene una estructura similar a un problema de expansión del espacio de búsqueda que explora simultáneamente múltiples candidatos de rutas.
Defectos comunes encontrados
- la malinterpretación de que "el pangenoma reemplaza completamente a GRCh38": la mayoría de los flujos de trabajo prácticos siguen utilizando el sistema de coordenadas de GRCh38 (o T2T-CHM13) como referencia para informar resultados y conectar con bases de datos. Es necesario proyectar los resultados del alineamiento en grafos a este sistema de coordenadas lineales, por lo que el grafo por sí solo no puede reemplazar completamente las herramientas y anotaciones basadas en coordenadas existentes.
- pasar por alto que la complejidad no es lineal a medida que el grafo crece: las regiones densas en variantes estructurales pueden formar subgrafos enredados (tangle) donde el grafo se entrelaza, lo que puede hacer que los costos de indexación y alineamiento sean significativamente mayores de lo esperado. Antes de graficar todo el genoma indiscriminadamente, es más seguro definir primero qué regiones deben representarse en el grafo.
Para profundizar más
El texto ha sido reconstruido directamente por el equipo de investigación de BPD. Profundice consultando los artículos originales y la documentación oficial.
- Human Pangenome Reference Consortium (Liao et al., 2023, Nature): artículo original del borrador del pangenoma de referencia con 47 individuos y 94 haplotipos.
- Repositorio oficial de vg toolkit en GitHub (
vgteam/vg): referencia completa de comandos para la construcción, indexación y alineamiento de grafos. - Artículo original de GBWT (Sirén et al.): diseño del índice de compresión de haplotipos sobre grafos.
- PanVariants (bioRxiv, 2026): Pipeline integrado de alineación de grafos y llamada de variantes. Es necesario actualizar la información de citación cuando se publique formalmente.
Este es el primer capítulo del conjunto "Futuro" del subtema F2 (F32~F35), que aborda un enfoque que modifica el propio genoma de referencia. En el siguiente capítulo, F33, ampliamos la perspectiva hacia agentes de IA que operan sobre esta infraestructura de grafos y modelos fundacionales.