De la escala de SNP a la escala de fragmentos genómicos
La mayoría de las variantes analizadas hasta ahora han sido SNPs, es decir, a nivel de un único nucleótido. En esta sección, cambiamos completamente el enfoque para abordar las variantes estructurales (SV, Structural Variant), en las que grandes fragmentos del genoma, desde aproximadamente 50 pares de bases hasta millones de pares de bases, se eliminan por completo (deleción), se duplican, se invierten o se trasladan a otro cromosoma. Estas variantes pueden destruir genes completos o fusionar dos genes distintos para crear un nuevo gen de fusión; en el cáncer, esto puede ser la causa directa de la enfermedad, como ocurre con la fusión BCR-ABL.
El problema es que resulta difícil "ver" directamente estas grandes variantes mediante lecturas de secuenciación cortas (generalmente de 100 a 150 pb). En su lugar, se detectan estadísticamente las anomalías en los patrones de alineación de las lecturas con el genoma de referencia para inferir la presencia de variantes estructurales.
Interpretación de las señales de variantes estructurales a partir de los patrones de alineación de lecturas
Línea base de la alineación emparejada normal
En la secuenciación emparejada (paired-end), se leen ambos extremos de un fragmento de ADN para formar un par de lecturas. Si el genoma de referencia es idéntico a la muestra real, este par de lecturas se alinea: (1) en el mismo cromosoma, (2) en direcciones opuestas entre sí y (3) separadas por una distancia cercana al tamaño medio de inserción de la biblioteca (insert size, generalmente entre 300 y 500 pb). Cuando hay una variante estructural, se rompe una o más de estas tres condiciones.
| Tipo de variante | Patrón de alineación del par de lecturas |
|---|---|
| Deleción | El tamaño de inserción es anormalmente grande (porque la secuencia de referencia entre las dos lecturas no existe realmente) |
| Duplicación (en tándem) | El tamaño de inserción es anormalmente pequeño, o la dirección de las lecturas está invertida (reverse-forward) |
| Inversión | En lugar de estar en direcciones opuestas (FR), se alinean en la misma dirección (FF o RR) |
| Translocación | Las dos lecturas del par se alinean en cromosomas diferentes |
A estos pares de lecturas que se desvían del patrón esperado se les denomina pares de lecturas discordantes. Además, las lecturas que atraviesan exactamente el punto de ruptura de la variante aparecen como lecturas divididas (split reads), donde la lectura se corta durante el alineamiento y sus segmentos frontal y posterior se mapean en posiciones diferentes. Herramientas como Manta (Chen et al., 2016), DELLY (Rausch et al., 2012) y LUMPY (Layer et al., 2014) agrupan conjuntamente las evidencias de pares discordantes y lecturas divididas para acotar el punto de ruptura con precisión a nivel de nucleótido.
Detección de CNV basada en la profundidad de lectura: búsqueda de cambios en el número de copias mediante la prueba de Poisson
Mientras que las translocaciones e inversiones se detectan a partir de la orientación de los pares de lecturas, las variantes del número de copias (CNV, Copy Number Variant), como las deleciones o duplicaciones, también pueden detectarse mediante otra señal: el cambio en la propia cantidad de lecturas alineadas (profundidad de lectura). El genoma se divide en segmentos de tamaño fijo (bins), y se establece como línea base el número medio esperado de lecturas por segmento en un diploide normal. En un segmento con una copia perdida (deleción hemizigótica), el número esperado de lecturas disminuye aproximadamente a .
Si asumimos que el número observado de lecturas sigue una distribución de Poisson , y dado que es suficientemente grande (generalmente entre decenas y cientos), podemos aproximarla mediante una distribución normal para realizar la prueba: .
Ejemplo de cálculo manual: discriminación entre segmentos diploides normales y deleciones de una sola copia
En un segmento con un número esperado de lecturas bajo la norma diploide, el número observado de lecturas para un individuo fue . Analicemos si este valor corresponde a un estado normal (diploide, ) o a una deleción de una sola copia ().
Hipótesis de normalidad (diploide):
Un valor de corresponde a un nivel de significancia en la distribución normal, por lo que la hipótesis de diploidía normal se rechaza fuertemente.
Hipótesis de deleción de una sola copia:
Un valor de no es inusual en absoluto (valor p bilateral ). Es decir, la observación de 52 no se explica bien como "diploide normal", pero sí se ajusta adecuadamente a una "deleción de una sola copia".
Esta razón log2 es , lo cual se acerca al valor teórico de para una pérdida de una sola copia (). Esta es la razón por la que las herramientas de detección de CNV calculan y listan esta razón log2 segmento por segmento. En genomas reales, se conectan las razones log2 de cientos o miles de segmentos adyacentes mediante algoritmos de detección de puntos de cambio como CBS (Circular Binary Segmentation, Olshen et al., 2004) para identificar los límites de los segmentos con un número de copias constante.
Práctica en R: reproducción de la discriminación de CNV basada en la profundidad de lectura
# Reproducir el ejemplo de cálculo manual con código
lambda0 <- 100 # Número de lecturas de referencia para diploide normal
x_obs <- 52 # Número de lecturas observadas
z_diploid <- (x_obs - lambda0) / sqrt(lambda0)
z_deletion <- (x_obs - lambda0 / 2) / sqrt(lambda0 / 2)
cat(sprintf("Hipótesis diploide Z = %.3f (p = %.2e)\n", z_diploid, 2 * pnorm(-abs(z_diploid))))
cat(sprintf("Hipótesis de deleción de una copia Z = %.3f (p = %.3f)\n", z_deletion, 2 * pnorm(-abs(z_deletion))))
cat(sprintf("log2 ratio = %.3f (cercano al valor teórico -1.0)\n", log2(x_obs / lambda0)))Mapeo de CS
- Detección de anomalías: Identificar pares de lecturas que se desvían de la distribución base de patrones normales de alineación es el mismo marco estadístico que la detección de anomalías en redes, donde se buscan paquetes que se desvían de la distribución normal del tráfico.
- Detección de puntos de cambio: El algoritmo CBS, que une segmentos adyacentes de profundidad de lectura para encontrar los límites de segmentos con un número de copias constante, es equivalente al problema de detección de puntos de cambio en datos de series temporales, donde se busca el punto en que cambia la media.
- Emparejamiento basado en grafos: Integrar múltiples evidencias de pares de lecturas discordantes y lecturas divididas en una única unión puede verse como un problema de algoritmos de grafos para encontrar clústeres en un grafo compuesto por nodos (puntos de ruptura candidatos) y aristas (evidencia de soporte).
Defectos comunes
- Ignorar la calidad del mapeo en regiones repetitivas: Las regiones cercanas a los telómeros y centrómeros, o las duplicaciones segmentales, suelen tener múltiples mapeos por naturaleza; por lo tanto, las llamadas de SV (variación estructural) apoyadas únicamente por lecturas con baja calidad de mapeo (MAPQ) tienen una alta probabilidad de ser falsos positivos.
- Tomar decisiones basándose en un solo tipo de evidencia: Las llamadas de SV que solo tienen pares de lecturas discordantes y ninguna evidencia de lecturas divididas suelen tener una fiabilidad baja. Herramientas como Manta integran múltiples evidencias (incluyendo ensamblaje local) para evaluar la fiabilidad, pero no imponen simultáneamente ambos tipos de evidencia en todas las llamadas; se debe entender que la coincidencia de múltiples evidencias aumenta la fiabilidad, y es más seguro verificar tanto el número como el tipo de evidencias de soporte al filtrar.
- Asumir un modelo de profundidad de lectura puramente de Poisson: En la práctica, los recuentos de lecturas a menudo presentan una dispersión mayor que la distribución de Poisson (sobre-dispersión) debido a sesgos de GC, capacidad de mapeo, regiones repetitivas, eficiencia de captura y efectos de lote. Las herramientas prácticas de CNV utilizan normalización, estimación robusta de la varianza o modelos de distribución binomial negativa, y no confirman las CNV basándose únicamente en pruebas de Poisson para un solo intervalo.
- Determinación absoluta de CNV sin comparación par tumor-normal: Para obtener el número de copias absoluto en el análisis del genoma tumoral, es necesaria la corrección por pureza tumoral y ploidía. Afirmar categóricamente "este segmento tiene una deleción de 2 copias" basándose únicamente en la relación log2 puede llevar a grandes errores en muestras con baja pureza.
Si desea profundizar más
El texto ha sido reconstruido directamente por el equipo de investigación de BPD. Para un estudio avanzado, consulte los artículos originales y la documentación oficial.
- Artículo original de Manta: Chen et al. (2016), Manta: detección rápida de variantes estructurales e indels para aplicaciones de secuenciación de la línea germinal y del cáncer, Bioinformatics.
- Artículo original de DELLY: Rausch et al. (2012), DELLY: descubrimiento de variantes estructurales mediante análisis integrado de lecturas emparejadas y divididas, Bioinformatics.
- Artículo original de LUMPY: Layer et al. (2014), LUMPY: un marco probabilístico para el descubrimiento de variantes estructurales, Genome Biology.
- Artículo original del algoritmo CBS: Olshen et al. (2004), Segmentación binaria circular para el análisis de datos de número de copias de ADN basados en matrices, Biostatistics.
- Artículo original de CNVkit: Talevich et al. (2016), CNVkit: detección y visualización del número de copias a nivel del genoma a partir de la secuenciación dirigida del ADN, PLOS Computational Biology.
Ahora que también se han abordado las variantes estructurales, volvemos a la pregunta fundamental sobre la causalidad: "¿es realmente esta variante la causa de la enfermedad?". Los estudios observacionales no están exentos del problema de las variables de confusión.
En el siguiente capítulo, S49, abordaremos la aleatorización mendeliana, que utiliza variantes genéticas como un experimento aleatorio natural para inferir relaciones causales.