PacBio SMRT: no usar "lecturas largas" y "HiFi" como sinónimos
Por qué es importante saberlo
Las lecturas cortas leen con precisión muchas bases, pero tienen dificultades para conectar secuencias repetitivas, grandes variaciones estructurales y la fase de variantes distantes. La secuenciación PacBio SMRT observa en tiempo real la síntesis de una única molécula de ADN para generar lecturas largas, mientras que el enfoque actual HiFi busca simultáneamente longitud y una alta precisión de consenso.
Usar PacBio, long read y HiFi como sinónimos implica perder las características específicas de cada generación de datos. El CLR del pasado y el HiFi actual difieren en la generación de lecturas, los perfiles de error y los pipelines de análisis adecuados.
Lo que ocurre en el ZMW
SMRT observa una única ADN polimerasa dentro de una microestructura llamada guía de onda de modo cero (ZMW). Se lee la secuencia de bases mediante la señal que se genera cuando se incorporan nucleótidos fluorescentes. Al crear una plantilla circular con adaptadores de horquilla (hairpin) en ambos extremos del fragmento de ADN, la polimerasa puede pasar varias veces por el mismo inserto.
Cada paso individual es una sublectura y el CCS se forma al combinar la información de múltiples pasadas como consenso. El CCS con suficientes pasadas y calidad de señal constituye la base de las lecturas HiFi.
CLR e HiFi
CLR se centraba en obtener lecturas continuas muy largas, pero tenía una tasa de error por lectura relativamente alta, lo que requería una cobertura suficiente o corrección. HiFi lee repetidamente el inserto para crear un consenso y aumenta la precisión a nivel de lectura. Incluso con los mismos datos brutos, si la longitud del inserto es excesiva, el número de pasadas disminuye, lo que genera un compromiso (trade-off) entre la calidad del consenso y la longitud.
Por lo tanto, no se debe seleccionar el experimento solo basándose en la longitud máxima de lectura. Se deben considerar conjuntamente la longitud de la molécula necesaria para la pregunta de investigación, la precisión por lectura, el rendimiento y la cobertura.
Qué se visualiza mejor
Las lecturas largas conectan secuencias flanqueantes únicas a través de repeticiones y aumentan la posibilidad de observar deleciones, inserciones, inversiones y puntos de ruptura de variaciones estructurales (SV) complejas en una sola molécula. También son útiles para el fase de haplotipos al conectar múltiples variantes heterocigotas dentro de una misma lectura. El contexto largo es también una ventaja en el ensamblaje de novo y en la secuenciación de isoformas.
Sin embargo, no todas las repeticiones son más cortas que las lecturas, y las duplicaciones segmentarias aún pueden dificultar el mapeo. El rendimiento en la detección de variantes mosaico de baja frecuencia y de variantes pequeñas también depende de la profundidad, el caller y la validación del ensayo.
Ejemplo breve
Supongamos que en una lectura corta (short read) se sospecha una inserción grande entre dos exones, pero el punto de ruptura (breakpoint) se encuentra dentro de una secuencia repetida, lo que impide un alineamiento preciso. Si una lectura HiFi suficientemente larga conecta ambas secuencias únicas y la inserencia completa, se puede esclarecer la estructura del evento y la fase alélica. Por el contrario, si el ADN de entrada está muy fragmentado, incluso utilizando una plataforma de lectura larga (long-read) no se obtendrán las conexiones necesarias.
Diseño experimental y QC
La extracción de ADN de alto peso molecular, la fragmentación (shearing) y la selección de tamaño determinan la longitud de la lectura. Se debe verificar conjuntamente el rendimiento de la librería, la longitud de lectura de la polimerasa, la distribución del tamaño del inserto, el rendimiento HiFi, la calidad de la lectura y la cobertura. El tipo de muestra y el historial de almacenamiento tienen un gran impacto en la integridad del ADN.
En el análisis, se deben registrar la construcción de referencia (reference build), el alineador/ensamblador, los callers de SV y variantes pequeñas, así como sus versiones. Los cambios en la química y en el software del instrumento también afectan la comparación con datos previos.
Puntos de confusión
- Las lecturas largas no implican automáticamente una alta precisión; es necesario verificar las condiciones de generación de HiFi.
- Un N50 de lectura elevado no garantiza una cobertura suficiente en todos los loci.
- El consenso no elimina por completo ni los sesgos sistemáticos ni los problemas de preparación de la muestra.
- Los eventos detectados mediante lectura larga pueden requerir confirmación ortogonal y validación para su uso clínico.
Límites de la interpretación
La utilidad depende de la calidad de la molécula de entrada, el tamaño del inserto, la cobertura, la química y el software. No se debe asumir que una plataforma es superior a los ensayos existentes basándose únicamente en su nombre; se debe verificar el rendimiento según cada pregunta de investigación.
Lectura relacionada
El problema de las regiones homólogas se vincula con Mapeo de pseudogenes; la elección del ensayo con WGS·WES·panel; y la referencia y el ensamblado con la historia del pangenoma tras el Proyecto Genoma Humano.