BioPlayground

🧬
목록으로

하플로타입 결정과 임퓨테이션: Beagle · Minimac이 어떻게 결측을 채우나요

저커버리지 시퀀싱에서 놓친 변이를 인구 참조 패널로 어떻게 채우는지, 하플로타입 페이징이 왜 GWAS에 필수인지, Beagle과 Minimac이 어떻게 다른지 정리합니다.

심화
|
20
|
검증 완료 (2026-07-22)
haplotype phasingimputationreference panel
진행률0/52 (0%)

왜 하플로타이핑과 임퓨테이션이 별도 단계인가요

지난 편들에서 우리는 각 위치별 유전자형(0/0, 0/1, 1/1)을 잘 콜했습니다. 그런데 이 유전자형만으로는 부족한 정보가 있습니다.

첫째, 하플로타입 정보. 0/1이라는 표기는 이 위치에 참조와 대안 각 하나씩 있다는 뜻이지만, 어떤 조합이 같은 염색체에 있는지는 안 알려줍니다. 예: 두 위치가 모두 0/1이면 (참조·참조 + 대안·대안) 조합인지, (참조·대안 + 대안·참조) 조합인지 모릅니다. 이걸 결정하는 게 페이징(phasing) = 하플로타이핑.

둘째, 결측 채우기. 저커버리지 시퀀싱(예: 4×)이나 마이크로어레이는 게놈의 일부 위치만 관찰합니다. 나머지 위치는 결측. 그런데 인구 참조 패널(TOPMed 등)의 통계를 활용하면 관찰된 위치와 인접한 결측 위치의 유전자형을 확률적으로 채울 수 있습니다. 이게 임퓨테이션.

두 작업 다 HMM 기반이고 실제로는 같은 도구가 처리합니다.

Beagle — 페이징 + 임퓨테이션 통합

Brian Browning이 워싱턴 대학에서 개발한 도구. 20년 넘게 유지되어 왔고 현재 v5.5.

원리

핵심 아이디어를 한 문장으로.

참조 패널의 알려진 하플로타입들을 HMM 상태로 두고, 새 샘플의 유전자형이 그중 어떤 조합에서 왔을지 확률로 판단.

수식으로 감을 잡아봅시다. 참조 패널에 K개의 하플로타입이 있다고 하면, 각 샘플의 두 하플로타입은 각각 K개 중 하나(또는 그 재조합)에서 왔다고 가정합니다. HMM의 상태 = K, 관찰 = 위치별 유전자형. Baum-Welch로 학습하고 Forward-Backward로 각 위치의 조건부 확률을 계산.

이 원리로 두 작업을 동시에 수행합니다.

  • 결측 위치: HMM이 관찰된 인접 위치와의 링키지로 채웁니다.
  • 페이징: HMM 상태 시퀀스가 곧 하플로타입 소속.

실행 명령

bash
java -Xmx16g -jar beagle.jar \
gt=input.vcf.gz \
ref=1000GP_chr22.bref3 \
map=plink.chr22.GRCh38.map \
out=output_chr22
  • gt: 입력 VCF (샘플의 관찰 유전자형).
  • ref: 참조 패널 (Beagle 자체 형식 .bref3).
  • map: 유전자 지도 (재조합률).
  • out: 결과 prefix.

인간 참조 패널은 1000 Genomes, HRC, TOPMed 중 하나. TOPMed(90,000+ 하플로타입)가 감도 최고.

강점

  • 한 도구로 페이징 + 임퓨테이션: 파이프라인 간결.
  • 오랜 안정성: 20년 검증.
  • 비상업 · 상업 모두 무료.

약점

  • 속도 vs Minimac4: 대규모 코호트에서 Minimac4가 3~5배 빠름.
  • 참조 패널 배포 복잡: 참조를 자체 형식(.bref3)으로 변환해야.

Minimac4 — 클라우드 세대의 임퓨테이션

미시간대에서 만든 도구. Michigan Imputation Server의 뒷단 엔진.

원리

Beagle과 유사한 HMM이지만 참조 패널이 압축된 M3VCF 형식이라 메모리 효율이 좋고, 대규모 코호트에서 병렬 처리에 유리합니다.

실행 명령

bash
minimac4 \
--refHaps HRC.r1-1.EGA.GRCh38.chr22.haplotypes.m3vcf.gz \
--haps eagle_phased.vcf.gz \
--prefix imputed_chr22 \
--cpus 8 \
--format GT,DS,GP

Minimac4는 페이징을 안 합니다. 그래서 페이징 전용 도구(Eagle이나 SHAPEIT)로 먼저 페이징하고, 그 페이지드 VCF를 Minimac4에 넣습니다.

강점

  • 속도: 대규모 코호트에 강함.
  • Michigan Imputation Server: 웹 인터페이스로 무료 서비스 (https://imputationserver.sph.umich.edu/). 자신의 VCF만 업로드하면 서버가 임퓨테이션 수행.

약점

  • 페이징 별도 필요.

Eagle · SHAPEIT — 페이징 전용

두 도구가 대규모 페이징의 표준.

  • Eagle2: Broad Institute. HRC 참조 패널 전용 최적화. 인구 유전학에서 표준.
  • SHAPEIT4: 옥스퍼드 대. 다양한 참조 지원.
bash
eagle \
--vcfTarget=input.vcf.gz \
--vcfRef=hrc_ref.vcf.gz \
--geneticMapFile=genetic_map_hg38.tsv \
--outPrefix=phased \
--numThreads=8

이 결과 VCF를 Minimac4에 넣습니다.

실무 결정 규칙

상황선택
작은 코호트 (<1000)Beagle (단순함)
대규모 코호트 (수만~수십만)Eagle → Minimac4
웹 서비스로 편하게Michigan Imputation Server (Eagle + Minimac4 서버)
UK Biobank · TOPMed 스타일 프로젝트SHAPEIT4 → Minimac4
소규모 임상 실증Beagle

참조 패널 — 무엇을 쓸까요

임퓨테이션 정확도는 참조 패널 크기·다양성에 결정됩니다.

참조 패널하플로타입 수인구접근
1000 Genomes Phase 35,008다인종완전 무료
HRC r1.164,976유럽 편중Sanger Imputation Service
TOPMed Freeze 8194,512다인종Michigan Imputation Server
UK Biobank500,000+영국승인 필요

TOPMed가 규모·다양성 모두 우수해서 현재 표준. Michigan Imputation Server에서 무료로 접근 가능.

손 계산 — 임퓨테이션이 실제로 하는 일

가상 시나리오. 개인 A의 SNP 어레이가 chr22의 100 위치를 관찰. 그 사이 결측 10,000 위치를 채우고 싶음.

  • 참조 패널에서 A의 관찰 100 위치가 참조 하플로타입 h_123과 90/100 일치, h_456과 85/100 일치.
  • HMM은 A의 두 하플로타입이 대략 (h_123, h_456)에서 유래했다고 학습.
  • 나머지 결측 10,000 위치는 h_123과 h_456이 그 위치에서 뭐라고 되어 있는지를 참조 → 그 값으로 채움.
  • 각 채움에 확률(DS = dosage, 0~2)과 정확도 지표(R²) 부여.

이 확률적 채움 후 GWAS 검정에서 이 임퓨티드 유전자형을 관찰된 것처럼 사용.

임퓨테이션 정확도 — R²

각 임퓨티드 SNP에 R²(예상 정확도, 0~1)가 붙습니다.

  • R² ≥ 0.8: 고품질. GWAS에 사용.
  • R² 0.3~0.8: 중품질. 후속 필터.
  • R² < 0.3: 저품질. 대부분 폐기.

R²는 마이너 알렐 빈도(MAF)에 크게 의존. MAF 0.001인 드문 변이는 임퓨테이션이 어렵습니다.

Michigan Imputation Server 사용법

가장 실용적인 접근입니다.

  1. VCF를 chromosome별로 나누기.
  2. 서버 웹 인터페이스에서 참조 패널 선택 (TOPMed 권장).
  3. 페이징 도구 선택 (Eagle 권장).
  4. VCF 업로드 후 몇 시간 대기.
  5. 결과 다운로드 (임퓨티드 VCF + INFO 리포트).

랩 서버에 Beagle이나 Minimac4를 설치·유지하는 것보다 훨씬 편합니다. 데이터 프라이버시가 문제라면 로컬 실행.

하플로타이핑 · 임퓨테이션이 왜 GWAS에 필수인가

GWAS(S42)에서 다시 만납니다.

  • 검정 파워: 관찰된 100 SNP만으로는 특정 유전자 근처의 관련 신호를 놓칠 수 있음.
  • 임퓨티드 1M~30M SNP로 확장하면 인과 변이에 더 가까이 접근.
  • 메타 분석: 여러 연구가 다른 어레이·다른 시퀀싱 방법을 써도 임퓨테이션 후에는 공통 SNP 세트로 통합 가능.

이런 이유로 GWAS 파이프라인에서 임퓨테이션은 필수 스텝.

Colab 소형 실습

bash
!apt-get install -y openjdk-17-jre-headless >/dev/null
!wget -q https://faculty.washington.edu/browning/beagle/beagle.jar
!java -Xmx4g -jar beagle.jar --help 2>&1 | head -20

실제 실행은 참조 패널이 크니 chr22 소형 슬라이스로 시연 가능.

CS 매핑

  • HMM Forward-Backward: 각 위치의 조건부 사후 확률 계산 (M19).
  • 참조 패널 매칭: HMM 상태 공간이 K = 참조 하플로타입 수.
  • 조건부 확률 채움: 결측 위치에서 사후 분포의 기대값 = dosage.

DryBench "HMM 추론 패턴" 편(hmm-inference-patterns) 참고.

마무리

임퓨테이션은 놀랍도록 강력한 기술입니다. 관찰이 부족한 위치를 인구 데이터로 확률적으로 채워, GWAS와 후속 분석의 파워를 극단적으로 늘립니다. 다음 편(S17)에서는 이번까지의 DNA 계열 파이프라인을 마무리하고, RNA-seq 정량 세계로 진입합니다. Salmon과 kallisto의 유사 정렬이 어떻게 정렬 자체를 우회하는지 봅시다.

더 깊게 파고 싶다면

  • Browning B.L. et al. (2018), A one-penny imputed genome from next-generation reference panels. American Journal of Human Genetics 103:338. Beagle 5의 확장성.
  • Das S. et al. (2016), Next-generation genotype imputation service and methods. Nature Genetics 48:1284. Minimac4 · Michigan Imputation Server 원 논문.
  • Loh P.R. et al. (2016), Reference-based phasing using the Haplotype Reference Consortium panel. Nature Genetics 48:1443. Eagle 원 논문.
  • Delaneau O. et al. (2019), Accurate, scalable and integrative haplotype estimation. Nature Communications 10:5436. SHAPEIT4.
  • Michigan Imputation Server (https://imputationserver.sph.umich.edu/): 무료 임퓨테이션 서비스.

임퓨테이션이 왜 통계 파워를 늘리는지 감이 오면 GWAS 편(S42)이 훨씬 편해집니다. 다음 편에서 RNA-seq 정량으로 갑시다.