Volver a la lista

Hi-C y la estructura tridimensional del genoma: interpretación de TAD, bucles y compartimentos a partir de matrices de contacto.

Se analiza la estructura tridimensional del genoma mediante matrices de frecuencia de contacto. Verifiquemos directamente con datos públicos los principios de proximidad de Hi-C, la detección de límites de TAD, los bucles de CTCF y la clasificación de compartimentos A/B.

Avanzado
|
22min
|
Verificado (2026-07-24)
Hi-C3D genomeTADchromatin loopcontact matrix
Progreso0/120 (0%)

El genoma no es una secuencia unidimensional

En S38 (ChIP-seq) y S39 (ATAC-seq), se analizaron las marcas epigenéticas y la accesibilidad de la cromatina en el genoma. Sin embargo, estos análisis trataron el genoma como señales sobre una secuencia lineal unidimensional. En el núcleo celular real, el genoma está plegado de manera compleja; potenciadores y promotores separados por decenas de miles de pares de bases en la línea recta pueden estar en contacto directo en tres dimensiones. Esta relación de contacto tridimensional es un nivel clave para la regulación de la expresión génica.

Hi-C (Captura de Conformación Cromosómica de Alto Rendimiento) es la tecnología que analiza estas relaciones de contacto a escala genómica. El resultado es una matriz de contacto, una matriz simétrica que indica con qué frecuencia cada par de posiciones del genoma está físicamente cerca. En esta matriz se identifican tres estructuras: los dominios asociativos topológicos (TAD), los bucles de CTCF y los compartimentos A/B.

Principio experimental de Hi-C: ligación por proximidad

La idea central de Hi-C es conectar fragmentos de ADN que están cerca en el espacio tridimensional.

  1. Entrecruzamiento: Se fijan complejos ADN-proteína-ADN espacialmente cercanos mediante formaldehído.
  2. Corte con enzimas de restricción: El genoma se corta en decenas de miles de fragmentos.
  3. Ligación por proximidad: Los extremos cortados se rellenan, se marcan con biotina y luego se ligan en condiciones diluidas. En esta etapa clave, los fragmentos que estaban cerca en el espacio tridimensional se conectan preferentemente.
  4. Inmunoprecipitación con biotina + secuenciación: Solo los fragmentos quiméricos (chimeric fragments) ligados se recuperan y se someten a secuenciación de extremo emparejado (paired-end).

Al alinear ambos extremos de cada par de lecturas contra el genoma, se obtiene un registro de "qué posiciones del genoma estuvieron en contacto físico". Al agrupar estos pares de contacto en una cuadrícula dividida en bins de resolución fija del genoma (por ejemplo, 10 kb, 25 kb, 100 kb), se completa la matriz de contacto.

Análisis de la matriz de contacto: tres estructuras

1. Compartimentos A/B — Escala de megabases

Al aplicar PCA a la matriz de coeficientes de correlación de la matriz de contacto, el primer componente principal (PC1) divide el genoma en dos compartimentos.

  • Compartimento A (PC1 positivo): Eucromatina (abierta), alta densidad génica, enriquecimiento de H3K4me3/H3K27ac, transcripción activa.
  • Compartimento B (PC1 negativo): Heterocromatina (cerrada), baja densidad génica, enriquecimiento de H3K27me3/H3K9me3, silenciamiento transcripcional.

Los compartimentos A contactan más frecuentemente entre sí, al igual que los B, lo que se manifiesta en la matriz de contacto como un patrón de tablero de ajedrez.

2. TAD (Dominio Asociativo Topológico) — Escala de cientos de kb

Los TAD son bloques triangulares que aparecen a lo largo de la diagonal de la matriz de contacto. Los pares de posiciones dentro de un TAD interactúan con frecuencia, mientras que las interacciones que cruzan los límites del TAD disminuyen drásticamente.

En los límites de los TAD suelen unirse CTCF (una proteína aislante) y cohesina, lo que respalda el modelo de "extrusión de bucles": la cohesina avanza a través del ADN como si fuera un hilo, formando un bucle hasta detenerse en CTCF.

Los límites de los TAD tienden a conservarse entre especies; si estos límites se rompen, puede ocurrir el secuestro de potenciadores (enhancer hijacking), donde un potenciador activa genes incorrectos (lo cual está directamente relacionado con enfermedades).

3. Bucles de cromatina — escala de kb

Los puntos fuera de la diagonal en la matriz de contacto, que indican que un par específico de posiciones tiene una frecuencia de contacto significativamente mayor que su entorno, representan los bucles de cromatina. Los ejemplos más destacados son los bucles promotor-potenciador y los bucles CTCF-CTCF.

El algoritmo HiCCUPS de Juicer detecta automáticamente estos puntos.

Flujo de trabajo de análisis: Pipeline de Juicer

bash
# 1. Alineamiento BWA-MEM (alineamiento independiente de cada extremo del fragmento)
bwa mem -SP5M genome.fa read_R1.fastq.gz read_R2.fastq.gz | \
samtools view -bS - > aligned.bam
# 2. Filtrado específico Hi-C + generación de matriz de contacto (Juicer)
# juicer.sh -g hg38 -d fastq/ -s MboI -p chrom.sizes -y restriction_sites.txt
# 3. Normalización de la matriz de contacto (KR/VC/ICE)
# java -jar juicer_tools.jar pre merged_nodups.txt output.hic genome_id
# 4. Detección de bucles (HiCCUPS)
# java -jar juicer_tools.jar hiccups output.hic loops.bedpe
# 5. Clasificación de compartimentos A/B (autovector)
# java -jar juicer_tools.jar eigenvector KR output.hic chr1 25000 BP eigenvector.txt

cooler + HiGlass: ecosistema de Python

Si Juicer está basado en Java, cooler es un formato de datos Hi-C (.cool, .mcool) y una herramienta de análisis desarrollados en Python.

python
import cooler
import matplotlib.pyplot as plt
# Carga del archivo .mcool (múltiples resoluciones)
clr = cooler.Cooler("data.mcool::resolutions/25000")
# Visualización de la matriz de contacto (chr14:70-90Mb)
mat = clr.matrix(balance=True).fetch("chr14:70000000-90000000")
plt.imshow(mat, cmap="YlOrRd", vmax=0.02)
plt.title("Hi-C Contact Matrix (chr14, 25kb)")
plt.colorbar(label="Normalized Contact Frequency")
plt.show()

Si en la matriz de contacto se observan bloques triangulares (TAD) a lo largo de la diagonal y puntos brillantes (bucles) fuera de ella, significa que se está interpretando correctamente la estructura subyacente de los datos Hi-C.

HiGlass: visualización interactiva

HiGlass (higlass.io) es un visor web que permite explorar matrices de contacto con zoom y desplazamiento en tiempo real. Se pueden cargar directamente datos públicos del proyecto 4DN (4D Nucleome) en HiGlass para verificar visualmente los TAD y los bucles.

Normalización: ¿por qué es esencial?

Las matrices de contacto sin procesar contienen sesgos sistemáticos: la frecuencia de contactos por intervalo varía según el contenido de GC, la densidad de sitios de corte de las enzimas de restricción y la capacidad de mapeo. La normalización elimina estos sesgos.

  • ICE (Iterative Correction and Eigenvector decomposition): equilibrio de matrices que estima iterativamente el vector de sesgo para cada intervalo.
  • KR (Knight-Ruiz): normalización doble estocástica que iguala las sumas de filas y columnas.
  • VC (Vanilla Coverage): el método más simple, que divide por el número total de contactos de cada intervalo.

En la mayoría de los análisis, la normalización KR es el valor predeterminado.

Mapeo CS

  • Matriz de contacto = matriz de adyacencia: la matriz de contactos Hi-C es la matriz de adyacencia ponderada del grafo de contactos 3D del genoma. Se pueden aplicar todas las herramientas de la teoría de grafos (centralidad, detección de comunidades).
  • Detección de comunidades (TAD): la detección de límites de TAD es el mismo problema que la detección de comunidades en ciencias de redes (optimización de la modularidad). Los bloques densamente conectados son las comunidades.
  • Descomposición de matrices (vector propio): la clasificación de compartimentos A/B es una descomposición en vectores propios (PCA) de la matriz de correlación de contactos. Se basa en principios de álgebra lineal como la SVD en sistemas de recomendación y los vectores propios de PageRank.

Defectos comunes

  • Incongruencia entre la resolución y la profundidad de secuenciación: si se desea una resolución de 1 kb, se necesitan miles de millones de lecturas. Forzar una alta resolución con datos de baja profundidad de secuenciación hace que la matriz sea dispersa, lo que imposibilita la detección de TAD/bucles. Elija una resolución adecuada a la profundidad.
  • Análisis antes de la normalización: si se detectan TAD en matrices sin procesar, los sesgos de GC/mappability crean límites falsos. La normalización KR/ICE es esencial.
  • Interpretar los TAD como estructuras fijas: los TAD son un promedio poblacional (de millones de células) y sus límites son dinámicos en células individuales. Los recientes datos de Hi-C de célula única han mostrado esta dinámica.
  • Ignorar la proporción cis-trans: los contactos dentro del mismo cromosoma (cis) deben representar más del 90% del total. Si hay muchos contactos trans, indica que falló la ligación cercana o hay un problema de mezcla celular.

Para profundizar más

Este texto es una narración reconstruida por BPD. Para profundizar, consultemos los siguientes materiales de referencia.

  • Artículo original (Hi-C): Lieberman-Aiden et al. (2009), Mapeo exhaustivo de interacciones a largo alcance revela los principios de plegamiento del genoma humano, Science 326:289. Fuente de las matrices de contacto y los compartimentos A/B.
  • Artículo original (TAD): Dixon et al. (2012), Dominios topológicos en genomas de mamíferos identificados mediante el análisis de interacciones de la cromatina, Nature 485:376.
  • Artículo original (extrusión de bucles): Fudenberg et al. (2016), Formación de dominios cromosómicos mediante la extrusión de bucles, Cell Reports 15:2038.
  • Juicer/Juicebox: Durand et al. (2016), Juicer proporciona un sistema de un solo clic para analizar experimentos Hi-C a resolución de bucles, Cell Systems 3:95.
  • Portal de datos 4DN: data.4dnucleome.org: conjuntos de datos Hi-C públicos y visualización con HiGlass.

Después de analizar la estructura tridimensional, queda por explorar la última capa del epigenoma. En el siguiente capítulo, S41, concluiremos la serie sobre epigenómica con la secuenciación por bisulfito, una tecnología que permite leer las marcas de metilación grabadas en el ADN para descifrar la memoria química del silenciamiento génico y el desarrollo.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...