Volver a la lista

ChIP-seq y detección de picos con MACS: identificando la unión de modificaciones de histonas y factores de transcripción.

Se identifican las modificaciones de histonas y los sitios de unión de los factores de transcripción en el genoma. Analicemos el principio experimental de ChIP-seq, los modelos de fondo dinámico/Poisson de MACS y detectemos picos directamente con los datos de ENCODE.

Intermedio
|
20min
|
Verificado (2026-07-24)
ChIP-seqMACSpeak callinghistone modification
Progreso0/120 (0%)

Para que un gen se active, alguien debe sentarse en ese lugar

En S17~S21 se midió la expresión génica mediante RNA-seq, y se aumentó la resolución con datos de célula única (S26~S34) y espaciales (S35~S37). Sin embargo, aún no se ha respondido a la pregunta: "¿por qué se activa este gen en esta célula?". Para que ocurra la transcripción, las histonas cerca del promotor deben sufrir modificaciones específicas y los factores de transcripción deben unirse a los potenciadores (enhancers). ChIP-seq sirve para identificar la ubicación de estas marcas epigenéticas.

La idea detrás de ChIP-seq (inmunoprecipitación de cromatina seguida de secuenciación) es sencilla: se recogen los fragmentos de ADN unidos a la proteína de interés (una modificación de histona o un factor de transcripción) utilizando un anticuerpo específico para dicha proteína (inmunoprecipación) y luego se secuencian esos fragmentos de ADN. El resultado es un mapa de densidad de lecturas sobre el genoma, donde las lecturas se acumulan como picos (peaks) en los lugares donde la proteína estaba realmente unida.

En este capítulo, derivaremos el principio del llamado de picos (peak calling), que detecta estadísticamente estos picos de lecturas, centrándonos en el algoritmo MACS, y realizaremos una práctica directa con datos de ENCODE.

Resumen del flujo de trabajo experimental de ChIP-seq

  1. Entrecruzamiento (crosslinking): Se fijan los complejos proteína-ADN mediante formaldehído.
  2. Fragmentación de la cromatina: El ADN se corta en fragmentos de 200~600 bp mediante sonicación.
  3. Inmunoprecipitación (IP): Solo se recogen los fragmentos de ADN unidos a la proteína de interés utilizando un anticuerpo diana.
  4. Desentrecruzamiento + purificación de ADN: Se degrada la proteína y se recupera el ADN.
  5. Construcción de bibliotecas + secuenciación: Los fragmentos de ADN recuperados se leen mediante NGS.
  6. Alineamiento + detección de picos: Tras alinear las lecturas contra el genoma de referencia con BWA/Bowtie2 (S03), se detectan los picos con MACS.

La clave para la interpretación de los resultados es la comparación entre la muestra IP frente al control de entrada (input) o IgG. Si hay una acumulación de lecturas en la muestra IP y niveles bajos en el control, es probable que la proteína se haya unido realmente en esa posición.

Modelo estadístico de MACS: Poisson + fondo dinámico

MACS (Model-based Analysis of ChIP-Seq) es el llamador de picos (peak caller) más utilizado. Su idea central es la siguiente:

Paso 1 — Modelado del desplazamiento (shift) de las lecturas

Las lecturas de ChIP-seq no provienen de la posición exacta de unión de la proteína, sino de los bordes de ambos lados (extremo 5' del fragmento). MACS calcula la correlación entre las lecturas de la cadena positiva (+) y la negativa (-) para estimar el tamaño del fragmento d, y desplaza cada lectura d/2d/2 hacia el interior para alinearlas con la región de unión.

Paso 2 — Fondo dinámico (lambda local)

La densidad de lecturas del genoma no es uniforme: el fondo varía según el contenido de GC, las secuencias repetitivas y la accesibilidad de la cromatina. MACS realiza una estimación de fondo multiescala en cada posición.

λlocal=max(λ1k,λ5k,λ10k,λgenome)\lambda_{\text{local}} = \max(\lambda_{1k}, \lambda_{5k}, \lambda_{10k}, \lambda_{\text{genome}})

Se selecciona como fondo λ\lambda el valor más alto entre las densidades de lecturas en ventanas de 1 kb, 5 kb, 10 kb y a nivel de genoma completo. Esto permite suprimir los falsos positivos en regiones con una alta densidad general de lecturas debido a la cromatina abierta.

Paso 3 — Prueba de Poisson

Se considera el número de lecturas en cada posición como una observación de la distribución de Poisson y se realiza una prueba de Poisson utilizando λlocal\lambda_{\text{local}} como valor esperado. Si el valor p es inferior al umbral, se identifica como un pico.

P(Xk)=1i=0k1eλλii!P(X \geq k) = 1 - \sum_{i=0}^{k-1} \frac{e^{-\lambda} \lambda^i}{i!}

Paso 4 — Corrección de FDR

Dado que se realizan decenas de miles de pruebas en todo el genoma, es esencial aplicar la corrección de FDR de Benjamini-Hochberg. El umbral predeterminado es q-value < 0,05.

Picos estrechos vs. picos anchos

La forma de los picos varía según el objetivo del experimento ChIP-seq.

  • Pico estrecho (narrow peak): Factores de transcripción (CTCF, p53, etc.) o marcas de histonas de promotores como H3K4me3. Los sitios de unión son claros, por lo que los picos son agudos (cientos de pb). Es el modo predeterminado macs3 callpeak.
  • Pico ancho (broad peak): Marcas de dominios amplios como H3K27me3 (represión) o H3K36me3 (cuerpo génico). Se extienden desde unos pocos kb hasta decenas de kb. Se fusionan los picos adyacentes mediante macs3 callpeak --broad.

Práctica: Detección de picos con datos H3K4me3 de ENCODE

Utilizaremos los datos de ChIP-seq H3K4me3 de la línea celular K562 del proyecto ENCODE en Galaxy EU.

Flujo de trabajo

  1. Obtención de datos: Descargar archivos BAM (IP + Input) desde el Portal ENCODE o utilizar un historial compartido de Galaxy.
  2. MACS2 callpeak: IP BAM + Input BAM, con parámetros predeterminados.
  3. Visualización de resultados: IGV o deepTools plotHeatmap.

Referencia CLI

bash
# Detección de picos con MACS3 (picos estrechos, predeterminado)
macs3 callpeak \
-t chip_IP.bam \
-c chip_input.bam \
-f BAM \
-g hs \ # Tamaño efectivo del genoma humano
-n K562_H3K4me3 \
--outdir peaks/ \
-q 0.05
# Archivos resultantes
# peaks/K562_H3K4me3_peaks.narrowPeak — coordenadas de picos en formato BED
# peaks/K562_H3K4me3_summits.bed — coordenadas de las cumbres de los picos
# peaks/K562_H3K4me3_model.r — script de R para visualizar la estimación del tamaño de fragmento

Visualización de señales alrededor del TSS con deepTools

bash
# Generar bigWig (normalización de la proporción IP/Input)
bamCompare -b1 chip_IP.bam -b2 chip_input.bam \
-o H3K4me3_log2ratio.bw --normalizeUsing RPKM
# Mapa de calor de TSS ±3 kb
computeMatrix reference-point -S H3K4me3_log2ratio.bw \
-R genes.bed -a 3000 -b 3000 -o matrix.gz
plotHeatmap -m matrix.gz -out H3K4me3_TSS_heatmap.png

H3K4me3 es una marca de promotores activos, por lo que debe aparecer un pico agudo centrado en el TSS (sitio de inicio de la transcripción). Este mapa de calor resume en una sola imagen el estado de actividad de los promotores de miles de genes.

Especificaciones de calidad de ENCODE

El proyecto ENCODE ha definido los criterios de calidad para los datos de ChIP-seq. Apliquemos estos mismos criterios a nuestros propios datos.

  • NSC (Normalized Strand Coefficient): Altura del pico de correlación entre cadenas. Se recomienda ≥ 1,05.
  • RSC (Relative Strand Correlation): Proporción de la correlación de cadena frente a picos fantasma. Se recomienda ≥ 0,8.
  • FRiP (Fraction of Reads in Peaks): Proporción de lecturas dentro de los picos. ≥ 1 % (mínimo), objetivo 5 %+.
  • IDR (Irreproducible Discovery Rate): Concordancia de picos entre réplicas biológicas. Para la lista final de picos, utilice solo aquellos con IDR < 0,05.

Mapeo conceptual

  • Relación señal-ruido (SNR): La detección de picos es, esencialmente, un problema de separar la señal (unión de proteínas) del ruido (lecturas de fondo). Tiene la misma estructura que la optimización de la SNR en el procesamiento de señales.
  • Modelos estadísticos de Poisson/binomial negativo: La prueba de Poisson de MACS es una variante de la estadística basada en recuentos, como DESeq2 (S19) en RNA-seq.
  • Corrección por comparaciones múltiples (FDR): La corrección BH-FDR en pruebas a escala genómica es la reaparición del problema de comparaciones múltiples tratado también en S19.

Defectos frecuentes

  • Llamada de picos sin control (Input/IgG): Si se identifican picos basándose únicamente en el número absoluto de lecturas sin un control, los sesgos de fondo (sesgo de GC, mapeabilidad) aparecerán como falsos positivos. Utilice siempre un control.
  • Análisis de marcas amplias con modo de pico estrecho: Analizar marcas amplias como H3K27me3 en el modo predeterminado (narrow) fragmenta los dominios y reduce la precisión. Utilicemos la opción --broad.
  • Reportar picos sin réplicas biológicas: Los picos obtenidos de un solo experimento no garantizan la reproducibilidad. El estándar de ENCODE exige un mínimo de 2 réplicas biológicas + filtro IDR.
  • Comparar solo el número de picos: Las diferencias en el número de picos entre condiciones pueden deberse a variaciones técnicas (eficiencia del anticuerpo, profundidad de secuenciación). El método de comparación correcto es el análisis de unión diferencial (DiffBind).

Para profundizar más

El texto principal es una narrativa reconstruida directamente por BPD. Para un estudio avanzado, utilice los materiales canónicos que se indican a continuación.

  • Artículo original de MACS: Zhang et al. (2008), Model-based Analysis of ChIP-Seq (MACS), Genome Biology 9:R137. Es la fuente del modelo de Poisson + fondo dinámico.
  • Guías de ChIP-seq de ENCODE: Landt et al. (2012), ChIP-seq guidelines and practices of the ENCODE and modENCODE consortia, Genome Research 22:1813. Es la SSoT de las especificaciones de calidad.
  • Clase de ChIP-seq de Harvard STAT115: Profesora Xiaole Shirley Liu — aborda detalladamente la estadística de detección de picos en la sección de ChIP-seq.
  • Documentación oficial de deepTools: Ramírez et al. (2016), deepTools2: a next generation web server for deep-sequencing data analysis, Nucleic Acids Research 44:W160.
  • Portal de ENCODE: encodeproject.org — Archivo de conjuntos de datos de ChIP-seq de acceso público y gratuito.

Si ChIP-seq identificó las posiciones de unión de una proteína específica, en el siguiente módulo S39 ampliaremos la perspectiva hacia ATAC-seq, una técnica que identifica simultáneamente todos los sitios de cromatina abierta sin necesidad de anticuerpos.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...