¿Por qué comparar ahora las tres generaciones lado a lado?
En la sección anterior, resumimos hasta que "el ADN es una cadena de caracteres finita compuesta por cuatro letras". Sin embargo, las cadenas que manipulamos en la práctica no están completas desde el principio. Los equipos de secuenciación las generan. Si no sabemos cuándo se desarrollaron estos equipos, qué longitud de fragmentos producen y qué tipo de errores dejan, los pasos posteriores de alineamiento, ensamblaje y detección de variantes carecerán de base sólida.
Comparemos las tres generaciones lado a lado. Cada una nació en una época diferente, tiene perfiles de error distintos y todas siguen vigentes en la práctica actual. En los laboratorios de diagnóstico clínico, los secuenciadores Sanger aún están en funcionamiento; el RNA-seq masivo es dominado por Illumina; y el ensamblaje completo de genomas diploides se logra gracias a la colaboración entre PacBio HiFi y Nanopore.
Primera generación: Sanger — fragmentos cortos y precisos
Este método fue publicado por Frederick Sanger en 1977. Su principio es sorprendentemente elegante.
- Se mezcla ADN con una baja proporción de didesoxinucleótidos (ddNTP) para llevar a cabo la síntesis de ADN.
- Cuando se incorpora un ddNTP durante la síntesis, la cadena se termina.
- Debido a que las posiciones de terminación tienen una distribución aleatoria, se genera una mezcla de fragmentos de cadena con longitudes de 1 a 1000 pb.
- Esto se separa por tamaño mediante electroforesis y se lee la última base mediante color fluorescente.
Resultado: una sola secuencia muy precisa de 500 a 1000 pb. Precisión Q40+ (tasa de error inferior al 0,01 %).
¿Por qué sigue vigente en el ámbito clínico? Porque es el estándar de oro para la validación. Para confirmar si una variante detectada por NGS es real, especialmente cuando su patogenicidad es dudosa, se realiza una verificación con Sanger. Los flujos de trabajo aprobados por la FDA y el IVDR europeo aún incluyen un paso de confirmación con Sanger.
Segunda generación: NGS (Illumina) — la explosión del paralelismo masivo
La aparición de 454 en 2005 e Illumina en 2007 cambió las reglas del juego, siendo especialmente Illumina quien dominó el mercado. El principio, resumido, es el siguiente:
- Se fragmenta el ADN en trozos de 300 a 500 pb.
- Se unen adaptadores a ambos extremos de cada fragmento y se realiza una amplificación por puentes (bridge amplification) sobre un "prado" de cebadores fijados en un portaobjetos de vidrio. En cada posición crecen miles de copias idénticas del mismo fragmento. Esto se denomina clúster.
- Se añaden nucleótidos marcados con fluorescencia ciclo a ciclo y se captura una imagen completa del portaobjetos con una cámara. El color que aparece en la posición de cada clúster indica la base correspondiente a esa posición.
- Esto se repite durante 100 a 300 ciclos. Un solo portaobjetos genera cientos de millones de clústeres, es decir, cientos de millones de lecturas.
Resultado: cientos de millones de lecturas con una longitud de 100~300bp. Precisión Q30~Q40 (tasa de error inferior al 0.1%). La mayoría de los errores son sustituciones (substitution), y la tasa de error aumenta a medida que avanzan los ciclos (debido al desvanecimiento de la señal).
Hay tres razones por las que Illumina domina el mundo.
- Bajo coste: cubre una cobertura de 30x del genoma humano por aproximadamente 3/300 USD.
- Baja tasa de error: el alineamiento y la detección de variantes son estadísticamente robustos.
- Pipeline estandarizado: el ecosistema de herramientas como bwa, GATK y DESeq2 está optimizado para lecturas cortas.
Las limitaciones son claras. La longitud es corta. Si una secuencia repetitiva es más larga que la lectura, el ensamblaje colapsa. Las variantes estructurales (inserciones, deleciones o inversiones de más de 50bp) tampoco se detectan bien con lecturas cortas.
3ª Generación: Lecturas Largas (PacBio HiFi, Oxford Nanopore)
Para superar las limitaciones de las lecturas cortas, surgieron dos tecnologías.
PacBio HiFi (2019~)
Es una mejora de la secuenciación en tiempo real de una sola molécula (SMRT). Tras circularizar el ADN, se realiza una secuenciación repetida en varias vueltas y esas repeticiones se integran en una secuencia consenso. El resultado son las lecturas HiFi.
- Longitud 10~25kb
- Precisión Q30~Q40 (nivel Illumina)
- Este es el momento en que la tecnología se consolidó tras superar la era geológica. Esto se debe a que su precisión se ha acercado a la de las lecturas cortas.
Oxford Nanopore
Se hace pasar el ADN a través de un nanoporo (nanopore, poro único) y se mide el cambio en la corriente que ocurre durante el paso. Cada combinación de 4~5 bases produce un patrón de corriente característico.
- Longación 10kb~varios Mb (teóricamente ilimitada)
- Precisión Q10~Q20 (original), acercándose a Q30 con la química R10 más reciente y un basecaller de aprendizaje profundo (deep learning)
- Existe una versión portátil (MinION). De tamaño de palma, con conexión USB, permite la secuenciación en exteriores o al pie de la cama del paciente.
El significado histórico de ambas tecnologías es distinto. HiFi abrió la puerta al ensamblaje completo de diploides mediante lecturas largas precisas. Fue el protagonista de la finalización del genoma humano de extremo a extremo (T2T) en 2022. Nanopore abrió la puerta a la secuenciación en tiempo real y en el campo gracias a su extrema movilidad y longitud de lectura extrema.
Perfil de errores — Por qué el pipeline debe conocer esto
| Generación | Tipo de error representativo | Respuesta en alineamiento · detección de variantes |
|---|---|---|
| Sanger | Debilitamiento de la señal en ciclos finales | Verificación manual tras el trimming |
| Illumina | Sustitución (substitution), especialmente en los últimos 20~30 ciclos | BQSR · filtrado de variantes |
| PacBio HiFi | Bajos errores de indel, homogéneo | Detectores de variantes estándar sin cambios |
| Nanopore | Inserciones y deleciones, especialmente en regiones homopoliméricas | Es esencial el uso de algoritmos de llamada basados en aprendizaje profundo, como Medaka y Clair3 |
Esta tabla se repetirá en las siguientes secciones. Por ejemplo, M14 BWT y M15 FM-index asumen la alineación de lecturas cortas de Illumina. M16 minimap2 fue diseñado específicamente para lecturas largas. Si los perfiles de error son diferentes, los algoritmos también lo serán.
Examinando una línea de un archivo FASTQ
Los resultados generados por las tres generaciones se almacenan finalmente en el mismo formato de archivo: FASTQ. Una lectura consta de cuatro líneas.
@READ_ID:instrument:run:flowcell:lane:tile:x:y
ACGTACGT...
+
!!##$$%%&&'((()...- Línea 1:
@inicio, ID de lectura + metadatos del dispositivo - Línea 2: secuencia real
- Línea 3:
+ - Línea 4: Puntuación de calidad: representa la precisión en cada posición mediante caracteres ASCII
La puntuación de calidad se codifica como puntuación Phred. Q = -10 log₁₀(P), donde P es la probabilidad de error. Q30 corresponde a una probabilidad de error de 0,001 y Q40 a una probabilidad de error de 0,0001. En la línea 4 de FASTQ, cada carácter tiene un valor ASCII menos 33 (codificación Phred33) que equivale a la puntuación Q. Por ejemplo, el carácter # (ASCII 35) corresponde a Q2 y el carácter I (ASCII 73) a Q40.
Como primer ejercicio práctico, abra un ejemplo gratuito de FASTQ de Rosalind o del entrenamiento de EMBL-EBI y verifique visualmente la longitud de la lectura y las puntuaciones Q del último carácter de las primeras cinco lecturas. Esto le dará una idea de qué generación de secuenciador proviene.
Problemas comunes en la práctica
- Phred33 vs Phred64: Los datos antiguos de Illumina (anteriores a 2011) utilizan codificación Phred64. Las herramientas más recientes tienen Phred33 como predeterminado. Verifique el encabezado del archivo.
- Lecturas apareadas vs. de un solo extremo: Illumina suele generar lecturas apareadas. Los archivos R1 y R2 forman un par. Procesar solo un archivo significa perder la mitad de la información.
- Restos de adaptadores: Si quedan adaptadores de secuenciación en el archivo FASTQ, el alineamiento se verá afectado. Debe verificar la contaminación por adaptadores con FastQC y eliminarlos con Trim Galore o fastp; este es el tema del capítulo S02.
- Versión del software de basecalling de Nanopore: El dato original de Nanopore es una señal de corriente (FAST5/POD5). La tasa de error varía según la versión del software de basecalling (Guppy · Dorado) que convierte esto en secuencias. Es obligatorio especificar la versión al reanalizar.
Analogías con la informática
- Teoría del muestreo: La cobertura de secuenciación sigue exactamente la misma lógica que el muestreo de Nyquist. El motivo por el que 30x es el estándar práctico es que representa un umbral de confianza estadística.
- Aprendizaje por conjuntos: La combinación de lecturas cortas (precisas) y lecturas largas (de unión) se denomina ensamblaje híbrido. Es la misma idea del aprendizaje por conjuntos en informática, que combina dos conjuntos de datos con diferentes niveles de confianza.
- Procesamiento en tiempo real vs. por lotes: Las lecturas de Nanopore se reciben en tiempo real (streaming). Las otras dos tecnologías funcionan por lotes. Esta diferencia cambia fundamentalmente el diseño de los flujos de trabajo de análisis en tiempo real.
Continuación en el siguiente capítulo
- Siguiente capítulo (M03): Distancia de Hamming: mide cuánta diferencia hay entre dos caracteres en la misma posición. Es la métrica básica para medir cuán diferentes son una lectura y una secuencia de referencia.
- Dos capítulos después (M04): Contenido de GC — El sesgo de GC varía según el secuenciador. Este es el tema del siguiente capítulo.
- Cuatro capítulos después (M06): Needleman-Wunsch — Cómo alinear óptimamente las lecturas con la referencia. Capítulo introductorio.
- Diez a dieciséis capítulos después (M14~M16): BWT · FM-index · minimap2 — Cómo se alinean las lecturas cortas y largas con el genoma de referencia.
Para profundizar más
El texto principal es una narración reconstruida por BPD. Para un estudio más profundo, consulte los materiales de referencia a continuación.
- Harvard STAT115 — La Semana 3: Tecnologías de secuenciación del profesor Xiaole Shirley Liu (subtítulos completos, excelente traducción automática). Presenta los principios de cada generación desde la perspectiva de un estadístico.
- MIT 7.91J — La Visión general de la secuenciación del profesor Christopher Burge (subtítulos completos). Aborda la estructura de errores de los datos de secuencia desde una perspectiva probabilística.
- Broad Institute BroadE — La Introducción a la secuenciación de nueva generación (30 minutos, traducción automática de subtítulos adecuada). Describe la química del ciclo de Illumina mediante diagramas.
- Artículo original de referencia: Sanger et al. (1977), Secuenciación de ADN con inhibidores de terminación de cadena, PNAS 74, 5463–5467. El inicio de una generación.
- Libro web gratuito de referencia: NCBI Bookshelf — Secuenciación de nueva generación. Una visión general desde la perspectiva de los profesionales.
Resuelva algunos problemas relacionados con FASTQ en Rosalind (por ejemplo, ADN · Contenido de GC) y descargue un archivo FASTQ gratuito del entrenamiento de EMBL-EBI para abrirlo con un editor de texto. Debe familiarizarse visualmente con la longitud de las lecturas y la cadena de calidad, para que la distancia de Hamming en el próximo capítulo sea más intuitiva.