유전자가 켜지려면 그 자리에 누군가 앉아야 합니다
S17~S21에서 RNA-seq로 유전자 발현을 측정했고, 단일세포(S26~S34)와 공간(S35~S37)으로 해상도를 높였습니다. 하지만 "이 유전자가 왜 이 세포에서 켜졌는가"에는 아직 답하지 못했습니다. 전사가 일어나려면 프로모터 근처의 히스톤이 특정 방식으로 변형되어야 하고, 전사 인자가 인핸서에 결합해야 합니다. 이 **후성유전적 표식(epigenetic marks)**이 어디에 있는지를 읽는 것이 ChIP-seq입니다.
ChIP-seq(Chromatin Immunoprecipitation followed by sequencing)의 아이디어는 단순합니다. 관심 있는 단백질(히스톤 변형 또는 전사 인자)에 특이적인 항체로 그 단백질이 결합한 DNA 조각을 끌어모은 뒤(immunoprecipitation), 그 DNA를 시퀀싱합니다. 결과는 게놈 위의 리드 밀도 지형이며, 단백질이 실제로 앉아 있던 자리에 리드가 봉우리(peak)처럼 쌓입니다.
이 편에서는 이 리드 봉우리를 통계적으로 검출하는 **피크 콜링(peak calling)**의 원리를 MACS 알고리즘 중심으로 유도하고, ENCODE 데이터로 직접 실습합니다.
ChIP-seq 실험 워크플로 요약
- 교차결합(crosslinking): 포름알데히드로 단백질-DNA 복합체를 고정합니다.
- 크로마틴 단편화: 초음파(sonication)로 DNA를 200~600bp 조각으로 깹니다.
- 면역침강(IP): 표적 항체로 관심 단백질에 결합한 DNA 조각만 끌어모읍니다.
- 교차결합 해제 + DNA 정제: 단백질을 분해하고 DNA만 회수합니다.
- 라이브러리 제작 + 시퀀싱: 회수된 DNA를 NGS로 읽습니다.
- 정렬 + 피크 검출: BWA/Bowtie2로 참조 게놈에 정렬(S03)한 뒤, MACS로 피크를 검출합니다.
결과 해석의 핵심은 IP 샘플 vs 입력(input) 또는 IgG 대조군의 비교입니다. IP에서 리드가 쌓이고 대조군에서는 낮으면, 그 위치에 실제로 단백질이 결합했을 가능성이 높습니다.
MACS의 통계 모델: 포아송 + 동적 배경
MACS(Model-based Analysis of ChIP-Seq)는 가장 널리 쓰이는 피크 콜러입니다. 핵심 아이디어는 다음과 같습니다.
1단계 — 리드 이동(shift) 모델링
ChIP-seq 리드는 단백질 결합 부위의 정확한 위치가 아니라, 그 양쪽 가장자리에서 나옵니다(단편의 5' 말단). MACS는 정방향(+)과 역방향(-) 리드의 상관관계를 계산해 단편 크기 d를 추정하고, 각 리드를 만큼 안쪽으로 이동시켜 결합 부위에 정렬합니다.
2단계 — 동적 배경(local lambda)
게놈의 리드 밀도는 균일하지 않습니다 — GC 함량, 반복 서열, 크로마틴 접근성에 따라 배경이 달라집니다. MACS는 각 위치에서 다중 스케일 배경 추정을 수행합니다.
1kb, 5kb, 10kb 창과 전체 게놈 수준의 리드 밀도 중 가장 큰 값을 배경 로 선택합니다. 이렇게 하면 크로마틴이 열려 있어 전반적으로 리드가 많은 영역에서의 위양성을 억제합니다.
3단계 — 포아송 검정
각 위치의 리드 수를 포아송 분포의 관측값으로 보고, 를 기대값으로 하는 포아송 검정을 수행합니다. p-value가 임계치 이하이면 피크로 판정합니다.
4단계 — FDR 보정
게놈 전체에서 수만 회의 검정을 수행하므로, Benjamini-Hochberg FDR 보정이 필수입니다. 기본 임계치는 q-value < 0.05입니다.
좁은 피크 vs 넓은 피크
ChIP-seq 실험의 표적에 따라 피크의 형태가 다릅니다.
- 좁은 피크(narrow peak): 전사 인자(CTCF, p53 등)나 H3K4me3 같은 프로모터 히스톤 마크. 결합 부위가 명확해 피크가 날카롭습니다(수백 bp).
macs3 callpeak기본 모드입니다. - 넓은 피크(broad peak): H3K27me3(억제), H3K36me3(유전자 본체) 같은 넓은 도메인 마크. 수 kb~수십 kb에 걸쳐 퍼집니다.
macs3 callpeak --broad로 인접 피크를 병합합니다.
실습: ENCODE H3K4me3 데이터로 피크 검출
Galaxy EU에서 ENCODE 프로젝트의 K562 세포주 H3K4me3 ChIP-seq 데이터를 사용합니다.
워크플로
- 데이터 가져오기: ENCODE Portal에서 BAM 파일(IP + Input) 다운로드 또는 Galaxy 공유 히스토리 사용
- MACS2 callpeak: IP BAM + Input BAM, 기본 파라미터
- 결과 시각화: IGV 또는 deepTools
plotHeatmap
CLI 레퍼런스
# MACS3 피크 검출 (좁은 피크, 기본)macs3 callpeak \ -t chip_IP.bam \ -c chip_input.bam \ -f BAM \ -g hs \ # 인간 유효 게놈 크기 -n K562_H3K4me3 \ --outdir peaks/ \ -q 0.05
# 결과 파일# peaks/K562_H3K4me3_peaks.narrowPeak — BED 형식 피크 좌표# peaks/K562_H3K4me3_summits.bed — 피크 정점(summit) 좌표# peaks/K562_H3K4me3_model.r — 단편 크기 추정 시각화 R 스크립트deepTools로 TSS 주변 신호 시각화
# bigWig 생성 (IP/Input 비율 정규화)bamCompare -b1 chip_IP.bam -b2 chip_input.bam \ -o H3K4me3_log2ratio.bw --normalizeUsing RPKM
# TSS ±3kb 히트맵computeMatrix reference-point -S H3K4me3_log2ratio.bw \ -R genes.bed -a 3000 -b 3000 -o matrix.gz
plotHeatmap -m matrix.gz -out H3K4me3_TSS_heatmap.pngH3K4me3은 활성 프로모터의 표식이므로, TSS(전사 시작 부위)를 중심으로 날카로운 봉우리가 나타나야 합니다. 이 히트맵이 수천 개 유전자의 프로모터 활성 상태를 한 장으로 요약합니다.
ENCODE 품질 규격
ENCODE 프로젝트는 ChIP-seq 데이터의 품질 기준을 정의했습니다. 자신의 데이터에도 이 기준을 적용합시다.
- NSC (Normalized Strand Coefficient): 가닥 간 상관관계 피크 높이. ≥ 1.05 권장.
- RSC (Relative Strand Correlation): 가닥 상관 vs 유령 피크 비율. ≥ 0.8 권장.
- FRiP (Fraction of Reads in Peaks): 피크 내 리드 비율. ≥ 1% (최소), 목표 5%+.
- IDR (Irreproducible Discovery Rate): 생물학적 반복 간 피크 일치도. 최종 피크 목록은 IDR < 0.05인 피크만 사용.
CS 매핑
- 신호 대 잡음비(SNR): 피크 검출은 본질적으로 신호(단백질 결합)를 잡음(배경 리드)에서 분리하는 문제입니다. 신호 처리의 SNR 최적화와 같은 구조입니다.
- 포아송/음이항 통계 모델: MACS의 포아송 검정은 RNA-seq의 DESeq2(S19)와 같은 카운트 기반 통계의 변주입니다.
- 다중 검정 보정(FDR): 게놈 전체 검정에서의 BH-FDR 보정은 S19에서도 다뤘던 다중 비교 문제의 재등장입니다.
자주 만나는 결함
- 대조군(Input/IgG) 없이 피크 콜링 — 대조군 없이 절대 리드 수만으로 피크를 잡으면 배경 편향(GC bias, mappability)이 위양성으로 나타납니다. 반드시 대조군을 사용합시다.
- 좁은 피크 모드로 넓은 마크 분석 — H3K27me3 같은 넓은 마크를 기본 모드(narrow)로 분석하면 도메인이 여러 조각으로 쪼개지고 정확도가 떨어집니다.
--broad옵션을 사용합시다. - 생물학적 반복 없이 피크 보고 — 한 번의 실험에서 나온 피크는 재현성이 보장되지 않습니다. ENCODE 표준은 최소 2개의 생물학적 반복 + IDR 필터를 요구합니다.
- 피크 수만 비교 — 조건 간 피크 수 차이는 실험 기술 차이(항체 효율, 시퀀싱 깊이)에 기인할 수 있습니다. 차등 결합 분석(DiffBind)이 올바른 비교 방법입니다.
더 깊게 파고 싶다면
본문은 BPD가 직접 재구성한 서술입니다. 심화는 아래 정통 자료를 활용합시다.
- MACS 원 논문: Zhang et al. (2008), Model-based Analysis of ChIP-Seq (MACS), Genome Biology 9:R137. 포아송 + 동적 배경 모델의 원천입니다.
- ENCODE ChIP-seq 가이드라인: Landt et al. (2012), ChIP-seq guidelines and practices of the ENCODE and modENCODE consortia, Genome Research 22:1813. 품질 규격의 SSoT입니다.
- Harvard STAT115 ChIP-seq 강의: Xiaole Shirley Liu 교수 — ChIP-seq 편이 피크 검출 통계를 상세히 다룹니다.
- deepTools 공식 문서: Ramírez et al. (2016), deepTools2: a next generation web server for deep-sequencing data analysis, Nucleic Acids Research 44:W160.
- ENCODE Portal: encodeproject.org — 무료 공개 ChIP-seq 데이터셋 아카이브.
ChIP-seq가 특정 단백질의 결합 위치를 읽었다면, 다음 편 S39에서는 ATAC-seq — 항체 없이 크로마틴이 열려 있는 모든 자리를 한 번에 읽는 기술 — 으로 관점을 넓힙니다.