El ADN también guarda memoria
Con S38(ChIP-seq), S39(ATAC-seq) y S40(Hi-C) se analizaron las modificaciones de histonas, la accesibilidad de la cromatina y la estructura 3D. Queda una última capa del epigenoma: las marcas químicas grabadas en el propio ADN, la metilación.
La metilación del ADN consiste en la adición covalente de un grupo metilo (-CH₃) al carbono 5 de la base citosina (C). Ocurre principalmente en los dinucleótidos CpG (5'-CG-3'), y la metilación de las islas CpG en los promotores generalmente se asocia con el silenciamiento génico. Durante el desarrollo, los patrones de activación/desactivación (ON/OFF) de genes específicos de cada tipo celular se "bloquean" mediante la metilación, y estos patrones se mantienen a través de las division de las células; por eso se les llama "memoria química".
En este capítulo se aborda el principio químico del secuenciamiento por bisulfito para leer la metilación a resolución de base individual, la estrategia única de la herramienta de alineamiento Bismark y la detección de regiones diferencialmente metiladas (DMR).
La química de la conversión por bisulfito
El núcleo del tratamiento con bisulfito de sodio (NaHSO₃) es convertir las citosinas (C) no metiladas en uracilo (U). Las citosinas metiladas (mC) permanecen como C sin convertirse, gracias a la protección del grupo metilo.
Al secuenciar, el uracilo se lee como timina (T), por lo que:
- C → T: La citosina en esta posición no estaba metilada
- C → C: La citosina en esta posición estaba metilada
Este es el principio para leer la metilación a resolución de base individual.
Eficiencia de conversión y conversión incompleta
En teoría, las C no metiladas deberían convertirse al 100 % en U, pero la eficiencia de conversión real suele estar entre el 99 y el 99,5 %. La conversión incompleta provoca una sobreestimación de la metilación. La práctica estándar consiste en añadir como control interno (spike-in) ADN del fago lambda (completamente no metilado) para medir la eficiencia de conversión.
WGBS vs RRBS: el compromiso entre cobertura y costo
- WGBS (Whole-Genome Bisulfite Sequencing): Lee todas las C del genoma completo. Es el método más exhaustivo, pero requiere aproximadamente 1000 millones de lecturas para una cobertura de 30×.
- RRBS (Reduced Representation Bisulfite Sequencing): Utiliza enzimas de restricción como MspI para fragmentar y secuenciar solo las regiones ricas en CpG. Lee solo entre el 1 y el 3 % del genoma, pero cubre la mayoría de las islas CpG con un costo mucho menor.
| Ítem | WGBS | RRBS |
|---|---|---|
| Cobertura | Genoma completo (~28M CpG) | Regiones ricas en CpG (~1~3M CpG) |
| Costo | Alto | Bajo |
| Resolución | A nivel de base individual | A nivel de base individual |
| Región entre potenciador y gen | Cobertura | Mayoría sin cobertura |
| --- | --- | --- |
| Uso adecuado | Exploratorio + metilación de potenciadores | Análisis centrado en islas CpG |
Bismark: alineación con un alfabeto de 3 caracteres
Alinear lecturas tratadas con bisulfito con un alineador estándar (BWA, Bowtie2) genera problemas: las bases que originalmente eran C se han convertido en T, lo que provoca una gran cantidad de desajustes (mismatches) frente al genoma de referencia. Bismark resuelve este problema mediante una conversión in silico.
- Preparar el genoma de referencia en dos versiones: (a) todas las C→T, (b) todas las G→A (procesamiento de la hebra complementaria).
- Convertir también las lecturas in silico: C→T o G→A.
- Alinear las lecturas convertidas con la referencia convertida (backend Bowtie2).
- Restaurar la secuencia original para determinar en cada posición C si hubo conversión (estado de metilación).
Esta estrategia reduce efectivamente el alfabeto del ADN de 4 caracteres (ACGT) a 3 caracteres (A/T/G o A/C/T) antes de la alineación. Dado que hay pérdida de información, es normal que la tasa de mapeo sea menor que con una alineación estándar (60~80%).
# Paso 1: Preparar el índice del genoma de Bismarkbismark_genome_preparation --bowtie2 genome/
# Paso 2: Alineamiento (pareado)bismark --bowtie2 --genome genome/ \ -1 reads_R1.fastq.gz -2 reads_R2.fastq.gz \ -o aligned/
# Paso 3: Extracción de metilaciónbismark_methylation_extractor --paired-end --comprehensive \ --bedGraph --CX \ aligned/reads_R1_bismark_bt2_pe.bam
# Paso 4: Informe de coberturabismark2report --alignment_report aligned/reads_R1_bismark_bt2_PE_report.txtLa salida es el número de lecturas metiladas / número total de lecturas por cada posición CpG = proporción de metilación (valor β, 0–1).
Detección de regiones diferencialmente metiladas (DMR)
Las regiones que presentan niveles de metilación significativamente diferentes entre dos condiciones (por ejemplo, tumor vs. normal, células de tipo A vs. células de tipo B) se denominan DMR (regiones diferencialmente metiladas).
methylKit (R)
library(methylKit)
# Cargar datos de metilación (salida de Bismark o bedGraph)
myobj <- methRead(
list("tumor.txt", "normal.txt"),
sample.id = list("tumor", "normal"),
treatment = c(1, 0),
assembly = "hg38",
context = "CpG"
)
# Filtrado: cobertura mínima de 10×
filtered <- filterByCoverage(myobj, lo.count = 10, hi.perc = 99.9)
# Agrupación por mosaicos: agregación en ventanas de 1000bp (nivel de región en lugar de CpG individual)
tiles <- tileMethylCounts(filtered, win.size = 1000, step.size = 1000)
# Prueba de metilación diferencial
meth_diff <- calculateDiffMeth(tiles)
# Extracción de DMR (diferencia > 25%, q < 0.01)
dmr <- getMethylDiff(meth_diff, difference = 25, qvalue = 0.01)DSS/bsseq (Bioconductor)
DSS (Dispersion Shrinkage for Sequencing data) emplea un enfoque bayesiano para estimar las proporciones de metilación a nivel de cada unidad CpG mediante un modelo beta-binomial. Utiliza la correlación espacial entre unidades CpG adyacentes para estabilizar las estimaciones en posiciones con baja cobertura.
library(DSS)
library(bsseq)
# Creación del objeto BSseq
bs <- BSseq(chr = chr_vec, pos = pos_vec,
M = cbind(tumor_M, normal_M),
Cov = cbind(tumor_cov, normal_cov),
sampleNames = c("tumor", "normal"))
# Prueba de metilación diferencial
dml_test <- DMLtest(bs, group1 = "tumor", group2 = "normal")
# Detección de DMR (combinación de CpG significativos consecutivos)
dmr <- callDMR(dml_test, p.threshold = 0.001)Significado biológico de la metilación
- Metilación de islas CpG en el promotor → silenciamiento génico: Las proteínas con dominio de unión a metil-CpG (MBD) se unen a los CpG metilados, bloqueando el acceso a la maquinaria de transcripción.
- Metilación del cuerpo del gen (gene body) → actividad transcripcional: Paradójicamente, la metilación del cuerpo del gen es mayor en genes que se transcriben activamente.
- Inactivación del X: Uno de los dos cromosomas X en las mujeres se silencia mediante metilación.
- Impronta genómica (imprinting): Los patrones de metilación varían según el origen parental, permitiendo la expresión de solo un alelo de uno de los progenitores.
- Cáncer: La hipermetilación de promotores (silenciamiento de genes supresores de tumores) y la hipometilación global (inestabilidad genómica) son características epigenéticas del cáncer.
Mapeo computacional (CS)
- Expansión/contracción del alfabeto: La conversión por bisulfito elimina la distinción entre C/T en el alfabeto de 4 letras del ADN, reduciéndolo a 3 letras. Esto es una demostración empírica de cómo el tamaño del alfabeto afecta la complejidad de ordenamiento y la precisión en algoritmos de cadenas de texto.
- Alineamiento asimétrico: La estrategia de doble referencia con conversión in silico de Bismark es una variante del alineamiento general, que acepta de forma medible el aumento de la incertidumbre de mapeo desde la perspectiva de la teoría de la información.
- Distribución beta / estimación bayesiana: Modelar la incertidumbre de la proporción de metilación (éxitos/intentos) mediante una distribución beta y actualizar la distribución previa con información de los sitios vecinos es una aplicación clásica de la inferencia bayesiana.
Errores comunes
- Conversión incompleta no medida: Si se asume una eficiencia de conversión sin utilizar un control de pico de fago lambda, se sobreestimará sistemáticamente la metilación. Es imprescindible medirla.
- Reportar proporciones de metilación con baja cobertura: Si hay solo 2 lecturas en un CpG (1 metilada), β = 0.5, pero la confianza es extremadamente baja. Apliquemos filtros de cobertura mínima de 5~10×.
- Analizar solo CpG: Aunque la metilación de CpG es predominante en mamíferos, la metilación en contextos CHG y CHH (H = A/T/C) también es importante en plantas y en el desarrollo temprano. Extraigamos todos los contextos con la opción
--CX. - No distinguir la 5-hidroximetilcitocina (5hmC): El bisulfito estándar no distingue entre 5mC y 5hmC (ambos resisten la conversión). Si el 5hmC es relevante, utilicemos bisulfito oxidativo (oxBS-seq) o TAB-seq.
- Sesgo de PCR: El tratamiento con bisulfito daña el ADN, lo que intensifica el sesgo de GC. Se requiere la eliminación de duplicados y la corrección del sesgo de GC.
Para profundizar más
Este texto es una narrativa reconstruida directamente por BPD. Para un estudio más profundo, utilicemos las fuentes académicas originales a continuación.
- Revisión de secuenciación por bisulfito: Krueger et al. (2012), DNA methylome analysis using short bisulfite sequencing data, Nature Methods 9:145.
- Documentación oficial de Bismark: Krueger & Andrews (2011), Bismark: a flexible aligner and methylation caller for Bisulfite-Seq applications, Bioinformatics 27:1571.
- methylKit: Akalin et al. (2012), methylKit: a comprehensive R package for the analysis of genome-wide DNA methylation profiles, Genome Biology 13:R87.
- DSS: Park & Wu (2016), Differential methylation analysis for BS-seq data under general experimental design, Bioinformatics 32:1446.
- Clase de epigenética STAT115 de Harvard: Profesora Xiaole Shirley Liu — aborda el análisis estadístico de la metilación del ADN.
- Datos WGBS de ENCODE: encodeproject.org — conjuntos de datos WGBS de acceso público gratuito.
Con esto, concluimos la serie de epigenómica — ChIP-seq (S38), ATAC-seq (S39), Hi-C (S40), secuenciación por bisulfito (S41) — . Ahora podemos leer las cuatro capas que regulan la expresión génica. En la siguiente sección, cambiaremos nuestra atención de genes individuales a poblaciones, para pasar al GWAS y la genética de poblaciones.