La era del genoma completo
En 2022, el consorcio T2T (Telomere-to-Telomere) completó por primera vez el genoma humano sin interrupciones. Unió completamente los telómeros y centrómeros, que antes eran un pantano de secuencias repetitivas. Entre las herramientas que respaldaron este logro, hifiasm se ha consolidado como el estándar de facto.
Este capítulo es la corona de la serie de ensamblajes Micro Tier (M22 OLC → M23 De Bruijn → M24 hifiasm). Verificamos cómo la teoría de grafos aprendida hasta ahora fructifica en herramientas prácticas de vanguardia.
Por qué hifiasm es especial
hifiasm (Cheng et al., Nature Methods 2021) tiene dos características decisivas:
- Especializado en lecturas HiFi: Aprovecha con precisión las características de PacBio HiFi (precisión Q20+, longitud de 10 a 25 kb).
- Soporte completo para ensamblaje diploide: Separa los haplotipos paterno y materno para producir dos ensamblajes completos.
Los ensambladores de lecturas largas anteriores (Canu, Falcon) solo generaban un consenso haploide: una sola secuencia promedio donde se mezclaban los genomas paterno y materno. hifiasm ensambla dejando ambos haplotipos en el grafo desde el principio.
Características estadísticas de las lecturas HiFi
La tasa de error de las lecturas PacBio CLR es del 15 %. La de Nanopore es del 5 al 15 %. HiFi tiene menos del 0,1 % (Q30+). Esta precisión cambia radicalmente el diseño de los algoritmos de ensamblaje.
- Permite detectar superposiciones entre lecturas en una forma casi perfecta (se alivia enormemente la gestión de errores, que era el cuello de botella del M22 OLC).
- Incluso las secuencias repetitivas se distinguen con precisión si una lectura las abarca completamente.
- En un contexto diploide, basta con una sola SNV para distinguir los dos haplotipos.
Las características estadísticas de HiFi hicieron posible el enfoque de string graph de hifiasm, lo cual representa un retorno a las raíces teóricas de Myers mencionadas en M22.
Reinterpretación del string graph: conservar las burbujas para realizar el faseado
En M23, las burbujas del grafo De Bruijn se consideraban errores y se eliminaban. hifiasm, por el contrario, conserva las burbujas.
Esto se debe a que, en un genoma diploide, la mayoría de las burbujas representan diferencias entre los haplotipos paterno y materno. Eliminarlas implicaría una pérdida de información. En su lugar, se mantienen como dos rutas alternativas y el algoritmo de fase determina cuál corresponde al padre y cuál a la madre.
Las fuentes de información para la fase son tres:
- Trio binning: clasifica las lecturas en grupos específicos del padre o de la madre utilizando los datos de secuenciación de ambos progenitores (el más preciso).
- Hi-C: Probabilidad de que las secuencias físicamente cercanas pertenezcan al mismo haplotipo, utilizada para el phasing.
- Strand-seq: Información sobre la dirección de los cromátidas hermanas.
Con trio binning, hifiasm genera un ensamblaje diplóide casi perfecto. Los haplotipos paterno y materno se extienden hasta el nivel T2T.
Ejecución de hifiasm — tres modos
Modo 1 — Ensamblaje exclusivo con HiFi:
hifiasm -o output_prefix -t 32 sample.hifi.fastq.gzCuando solo se desea la salida del consenso haploide, el resultado es un único .p_ctg.gfa.
Modo 2 — Binning de tríos (requiere secuenciación de los padres):
# 1) Extraer k-mers específicos de la secuenciación paterna y materna (también sirven lecturas cortas)yak count -k31 -b37 -t16 -o mother.yak mother.R1.fq.gz mother.R2.fq.gzyak count -k31 -b37 -t16 -o father.yak father.R1.fq.gz father.R2.fq.gz
# 2) Pasar a hifiasm la información paterna y maternahifiasm -o child.trio -t 32 \ -1 father.yak -2 mother.yak \ child.hifi.fastq.gzEl resultado contiene dos elementos: .hap1.p_ctg.gfa y .hap2.p_ctg.gfa, que corresponden a los ensamblajes completos de los haplotipos paterno y materno, respectivamente.
Modo 3 — Ensamblaje con pares Hi-C:
hifiasm -o output_prefix -t 32 \ --h1 hic.R1.fastq.gz --h2 hic.R2.fastq.gz \ sample.hifi.fastq.gzCuando no hay secuenciación de los padres pero sí datos Hi-C, la ensambladura diploide sigue siendo posible, aunque con menor precisión que el trio binning.
Formato GFA — Por qué se exporta el grafo en sí
La salida principal de hifiasm es un archivo en formato GFA (Graphical Fragment Assembly), no FASTA. Este contiene no solo las secuencias de los contigs, sino también la topología completa del grafo de ensamblaje.
H VN:Z:1.0
S s1 ACGTACGT... LN:i:12345
S s2 GTACGTAC... LN:i:12000
L s1 + s2 + 50M
L s1 + s3 - 60MS: segmento (secuencia del contig)L: enlace (solapamiento y orientación entre dos segmentos)
Este formato representa múltiples rutas alternativas. Las herramientas de faseado o curación pueden consultar posteriormente la topología del grafo para tomar decisiones; FASTA pierde esta información.
La visualización suele realizarse con Bandage. Inspeccionar la topología del grafo permite localizar de inmediato los cuellos de botella del ensamblaje.
Ejercicio práctico: ensamblaje HiFi de E. coli
Como el genoma de E. coli es pequeño (~5 Mb), este análisis también puede ejecutarse en un portátil.
# Instalar hifiasm (requiere compilación)git clone https://github.com/chhylp123/hifiasmcd hifiasm && make./hifiasm --version
# Datos HiFi públicos (E. coli K-12)wget https://sra-pub-src-1.s3.amazonaws.com/SRR11434954/m64011_190830_220126.subreads.bam.1
# En la práctica existe un paso que genera HiFi mediante subreads.bam → CCS,# pero para el ejemplo resulta más cómodo usar un FASTQ ya procesado como HiFi# (o probar con datos simulados cortos)
# Ejecutar el ensamblaje (modo single)./hifiasm -o ecoli -t 8 ecoli.hifi.fastq.gz
# Convertir el GFA resultante a FASTAawk '/^S/{print ">"$2;print $3}' ecoli.p_ctg.gfa > ecoli.contigs.fasta
# Estadísticasgrep -c "^>" ecoli.contigs.fasta # Número de contigsawk '/^>/{next}{sum+=length($0)}END{print sum}' ecoli.contigs.fasta # Longitud totalIdealmente, E. coli se completa en un único contig circular. Si el resultado práctico muestra múltiples contigs fragmentados, la causa suele ser una cobertura insuficiente de las lecturas o la presencia de regiones repetitivas.
Escala del genoma humano — HPRC y T2T
El Consorcio de Referencia del Pangenoma Humano (HPRC) utilizó hifiasm para completar 47 genomas diploides, construyendo así un pangenoma. El ensamblado de cada individuo se basó en:
- Cobertura HiFi de 30~40×
- Separación de haplotipos paterno y materno mediante trio binning
- Ejecución de hifiasm: durante varios días en un servidor de 32 núcleos
Como resultado, cada haplotipo alcanzó un contig N50 de 40~60 Mb, lo que equivale a la longitud completa de un cromosoma humano. Estos datos constituyen la materia prima de la era del pangenoma.
T2T-CHM13 (2022) completó un ensamblado sin huecos utilizando la línea celular CHM13 (homocigota, no diploide), eliminando así la carga del phasing. Se empleó la combinación de hifiasm + Verkko (Nurk et al. 2020). Este fue el momento en que el genoma humano se completó realmente después de 21 años.
Complejidad
- Detección de superposiciones: basado en minimap2. O((N+L) log L)
- Construcción del grafo de cadenas: O(número de aristas)
- Phasing: O(número de burbujas × información de soporte de lecturas) — computacionalmente costoso, pero polinómico en la práctica
- Total: genoma humano con 30× HiFi (90 GB) → 3~5 días en un servidor de 32 núcleos
El ensamblaje del genoma bacteriano en una laptop toma minutos u horas; el del genoma humano requiere servidores o clústeres.
Comparación con otros ensambladores de lecturas largas
| Herramienta | Tipo de lectura | Diploide | Características |
|---|---|---|---|
| Canu | PacBio CLR, Nanopore | No | Estándar inicial para lecturas largas, tolerante a errores |
| Flye | Nanopore, PacBio | No | Especializado en repeticiones, fuerte en bacterias y plásmidos |
| Falcon | PacBio | Parcial | Herramienta oficial de Pacific Biosciences |
| Verkko | HiFi + Nanopore ULK | Sí | Estándar para ensamblado T2T. Híbrido |
| hifiasm | HiFi + trio/Hi-C | Completo | Estándar para genomas diploides |
Si hay HiFi, usar hifiasm. Si se necesita Nanopore ULK (ultra-largo) o un enfoque híbrido, usar Verkko. Si solo hay Nanopore, usar Flye. Estas tres herramientas cubren el 90% de los casos prácticos.
Mapeo CS — Representación de múltiples soluciones en grafos
Aquí se aplica la lección sobre la selección de estructuras de datos de DryBench.
- FASTA solo representa una solución (cadena de caracteres 1D)
- GFA expresa múltiples soluciones alternativas en su topología (gráfico 2D)
Si el problema posee esencialmente múltiples soluciones (diploide, repetitivo, phasing), la estructura de datos debe ser capaz de representarlo. La expresión determina el máximo contenido informativo. Si se comprime en FASTA, ninguna herramienta posterior podrá recuperar esa información.
Esta intuición aparece también en otros contextos. Que un esquema normalizado en una base de datos preserve las relaciones de la información, que JSON contenga más información que CSV, o que el grafo computacional de PyTorch pueda calcular gradientes automáticamente: todo ello es una reiteración del principio de que la expresión determina el espacio de posibilidades del algoritmo.
Ramas hacia la siguiente entrega — Entrada en Micro §M.6
Con M22~M24 se concluye la trilogía de ensamblaje del Tier Micro §M.5. A partir de la próxima entrega, se avanzará hacia alineamiento múltiple de secuencias y árboles filogenéticos.
- Próxima entrega (M25): MSA — Alineamiento progresivo (ClustalW, MAFFT) — Alinear múltiples secuencias simultáneamente. Materia prima para los árboles filogenéticos.
- Dentro de dos entregas (M26~M28): Trilogía de algoritmos de árboles filogenéticos — NJ/UPGMA, Fitch/Sankoff, máxima verosimilitud con IQ-TREE.
- Posteriormente (M29~M30): Genética de poblaciones — Teoría del coalescente, Wright-Fisher.
El ensamblaje es un grafo. El árbol filogenético es un árbol. Al cambiar la estructura de datos, el algoritmo se redefine nuevamente.
Para profundizar más
- Cheng, Concepcion, Feng, Zhang, Li (2021), Haplotype-resolved de novo assembly using phased assembly graphs with hifiasm, Nature Methods — Artículo original de hifiasm. Teoría y benchmarks prácticos.
- Nurk et al. (2022), The complete sequence of a human genome, Science — Artículo T2T. El camino hacia la secuencia completa del genoma humano.
- Liao et al. (2023), A draft human pangenome reference, Nature — Artículo del pangenoma HPRC. Resultados prácticos de hifiasm.
- Documentación oficial de hifiasm:
https://hifiasm.readthedocs.io/— Tutorial sobre opciones, modos e interpretación. - Wellcome Sanger — Lista de reproducción de YouTube sobre ensamblaje. Pipelines prácticos en la era HiFi.
Visualicemos el GFA de un ensamblaje a pequeña escala con Bandage. Observar cómo se ven las burbujas y las puntas del grafo es la práctica real que cierra esta serie. A partir del próximo capítulo, preparémonos para trasladar el cerebro desde el grafo hacia un árbol.