게놈은 1차원 서열이 아닙니다
S38(ChIP-seq)과 S39(ATAC-seq)에서 게놈 위의 후성유전적 표식과 크로마틴 접근성을 읽었습니다. 하지만 이 분석들은 게놈을 1차원 선형 서열 위의 신호로 다뤘습니다. 실제 세포 핵 안에서 게놈은 복잡하게 접혀 있고, 선형으로 수십만 bp 떨어진 인핸서와 프로모터가 3차원에서는 바로 옆에 접촉하고 있을 수 있습니다. 이 3차원 접촉 관계가 유전자 발현 조절의 핵심 층위입니다.
Hi-C(High-throughput Chromosome Conformation Capture)는 이 접촉 관계를 게놈 전체 규모에서 읽는 기술입니다. 결과는 접촉 행렬(contact matrix) — 게놈의 각 위치 쌍이 얼마나 자주 물리적으로 가까이 있는지를 나타내는 대칭 행렬입니다. 이 행렬에서 TAD(Topologically Associating Domain), CTCF 루프, A/B 구획이라는 세 가지 구조를 읽어냅니다.
Hi-C 실험 원리: 근접 연결
Hi-C의 핵심 아이디어는 3차원에서 가까이 있는 DNA 조각끼리 연결하는 것입니다.
- 교차결합: 포름알데히드로 공간적으로 가까운 DNA-단백질-DNA 복합체를 고정합니다.
- 제한효소 절단: 게놈을 수만 개의 조각으로 잘라냅니다.
- 근접 연결(proximity ligation): 절단된 말단을 채우고 비오틴으로 표지한 뒤, 희석 조건에서 연결합니다. 이 핵심 단계에서, 3차원에서 가까이 있던 조각끼리 우선적으로 연결됩니다.
- 비오틴 풀다운 + 시퀀싱: 연결된 접합체(chimeric fragment)만 끌어모아 페어드엔드 시퀀싱합니다.
각 리드 쌍의 두 끝을 게놈에 정렬하면, "게놈의 어느 위치와 어느 위치가 물리적으로 접촉했는가"의 기록이 됩니다. 이 접촉 쌍을 게놈을 일정 해상도(예: 10kb, 25kb, 100kb)의 빈으로 나눈 격자 위에 집계하면 접촉 행렬이 완성됩니다.
접촉 행렬 읽기: 세 가지 구조
1. A/B 구획 (Compartments) — 메가베이스 스케일
접촉 행렬의 상관계수 행렬에 PCA를 적용하면, 첫 번째 주성분(PC1)이 게놈을 두 구획으로 나눕니다.
- A 구획(양의 PC1): 유크로마틴(열린), 유전자 밀도 높음, H3K4me3/H3K27ac 농축, 전사 활발
- B 구획(음의 PC1): 헤테로크로마틴(닫힌), 유전자 밀도 낮음, H3K27me3/H3K9me3 농축, 전사 침묵
A 구획끼리, B 구획끼리 더 자주 접촉하며, 접촉 행렬에서 체크보드 패턴으로 나타납니다.
2. TAD (Topologically Associating Domain) — 수백 kb 스케일
TAD는 접촉 행렬의 대각선을 따라 나타나는 삼각형 블록입니다. TAD 내부의 위치쌍은 자주 접촉하지만, TAD 경계를 넘는 접촉은 급격히 줄어듭니다.
TAD 경계에는 보통 CTCF(절연자 단백질)와 **코히신(cohesin)**이 결합해 있으며, 이것이 "루프 압출(loop extrusion)" 모델의 근거입니다: 코히신이 DNA를 실처럼 통과시키며 루프를 만들다가 CTCF에서 멈추는 것입니다.
TAD 경계는 종간에 보존되는 경향이 있으며, 경계가 파괴되면 인핸서가 잘못된 유전자를 활성화하는 인핸서 하이재킹이 일어날 수 있습니다(질환과 직결).
3. 크로마틴 루프 — kb 스케일
접촉 행렬에서 대각선 밖의 점(dot) — 특정 위치 쌍이 주변보다 현저히 높은 접촉 빈도를 보이는 것 — 이 크로마틴 루프입니다. 대표적으로 프로모터-인핸서 루프, CTCF-CTCF 루프가 있습니다.
Juicer의 HiCCUPS 알고리즘이 이 점을 자동으로 검출합니다.
분석 워크플로: Juicer 파이프라인
# 1. BWA-MEM 정렬 (각 리드 말단 독립 정렬)bwa mem -SP5M genome.fa read_R1.fastq.gz read_R2.fastq.gz | \ samtools view -bS - > aligned.bam
# 2. Hi-C 특이적 필터링 + 접촉 행렬 생성 (Juicer)# juicer.sh -g hg38 -d fastq/ -s MboI -p chrom.sizes -y restriction_sites.txt
# 3. 접촉 행렬 정규화 (KR/VC/ICE)# java -jar juicer_tools.jar pre merged_nodups.txt output.hic genome_id
# 4. 루프 검출 (HiCCUPS)# java -jar juicer_tools.jar hiccups output.hic loops.bedpe
# 5. A/B 구획 분류 (eigenvector)# java -jar juicer_tools.jar eigenvector KR output.hic chr1 25000 BP eigenvector.txtcooler + HiGlass: Python 생태계
Juicer가 Java 기반이라면, cooler는 Python 기반의 Hi-C 데이터 형식(.cool, .mcool)과 분석 도구입니다.
import coolerimport matplotlib.pyplot as plt
# .mcool 파일 로드 (다중 해상도)clr = cooler.Cooler("data.mcool::resolutions/25000")
# 접촉 행렬 시각화 (chr14:70-90Mb)mat = clr.matrix(balance=True).fetch("chr14:70000000-90000000")plt.imshow(mat, cmap="YlOrRd", vmax=0.02)plt.title("Hi-C Contact Matrix (chr14, 25kb)")plt.colorbar(label="Normalized Contact Frequency")plt.show()접촉 행렬에서 대각선을 따라 삼각형 블록(TAD)이 보이고, 대각선 밖에 밝은 점(루프)이 보이면, Hi-C 데이터의 기본 구조를 올바르게 읽고 있는 것입니다.
HiGlass: 인터랙티브 시각화
HiGlass(higlass.io)는 접촉 행렬을 실시간으로 줌/팬하면서 탐색할 수 있는 웹 기반 뷰어입니다. 4DN(4D Nucleome) 프로젝트의 공개 데이터를 HiGlass에서 바로 로드해 TAD와 루프를 시각적으로 확인할 수 있습니다.
정규화: 왜 필수인가
원시 접촉 행렬에는 체계적 편향이 있습니다 — GC 함량, 제한효소 절단 부위 밀도, 맵핑 가능성(mappability)에 따라 빈별 접촉 빈도가 달라집니다. 정규화는 이 편향을 제거합니다.
- ICE (Iterative Correction and Eigenvector decomposition): 각 빈의 편향 벡터를 반복적으로 추정하는 매트릭스 밸런싱
- KR (Knight-Ruiz): 행과 열의 합이 동일하도록 하는 더블스토캐스틱 정규화
- VC (Vanilla Coverage): 각 빈의 총 접촉 수로 나누는 가장 단순한 방법
대부분의 분석에서 KR 정규화가 기본입니다.
CS 매핑
- 접촉 행렬 = 인접 행렬: Hi-C 접촉 행렬은 게놈의 3D 접촉 그래프의 가중 인접 행렬입니다. 그래프 이론의 모든 도구(중심성, 커뮤니티 검출)를 적용할 수 있습니다.
- 커뮤니티 검출(TAD): TAD 경계 검출은 네트워크 과학의 커뮤니티 검출(모듈성 최적화)과 동일한 문제입니다. 접촉이 밀집된 블록이 커뮤니티입니다.
- 행렬 분해(eigenvector): A/B 구획 분류는 접촉 상관 행렬의 고유벡터 분해(PCA)입니다. 추천 시스템의 SVD, PageRank의 고유벡터와 같은 선형대수 원리입니다.
자주 만나는 결함
- 해상도 vs 시퀀싱 깊이 불일치 — 1kb 해상도를 원하면 수십억 리드가 필요합니다. 시퀀싱 깊이가 부족한 데이터로 고해상도를 강제하면 행렬이 희소해져 TAD/루프 검출이 불가능합니다. 깊이에 맞는 해상도를 선택합시다.
- 정규화 전 분석 — 원시 행렬에서 TAD를 잡으면 GC/mappability 편향이 가짜 경계를 만듭니다. KR/ICE 정규화가 필수입니다.
- TAD를 고정 구조로 해석 — TAD는 집단 평균(수백만 세포)이며, 개별 세포에서는 경계가 유동적입니다. 최근 단일세포 Hi-C가 이 역동성을 보여주고 있습니다.
- cis-trans 비율 무시 — 같은 염색체 내 접촉(cis)이 전체의 90%+ 이어야 합니다. trans가 많으면 근접 연결이 실패했거나 세포 혼합물 문제입니다.
더 깊게 파고 싶다면
본문은 BPD가 직접 재구성한 서술입니다. 심화는 아래 정통 자료를 활용합시다.
- 원 논문(Hi-C): Lieberman-Aiden et al. (2009), Comprehensive mapping of long-range interactions reveals folding principles of the human genome, Science 326:289. 접촉 행렬과 A/B 구획의 원천입니다.
- 원 논문(TAD): Dixon et al. (2012), Topological domains in mammalian genomes identified by analysis of chromatin interactions, Nature 485:376.
- 원 논문(루프 압출): Fudenberg et al. (2016), Formation of chromosomal domains by loop extrusion, Cell Reports 15:2038.
- Juicer/Juicebox: Durand et al. (2016), Juicer provides a one-click system for analyzing loop-resolution Hi-C experiments, Cell Systems 3:95.
- 4DN Data Portal: data.4dnucleome.org — 공개 Hi-C 데이터셋과 HiGlass 시각화.
3차원 구조를 읽었으니, 후성유전체의 마지막 층위가 남았습니다. 다음 편 S41에서는 바이설파이트 시퀀싱 — DNA 자체에 새겨진 메틸화 표식을 읽어 유전자 침묵과 발달의 화학적 기억을 해독하는 기술 — 로 후성유전체 시리즈를 마무리합니다.