목록으로

Reference Genome을 읽는 법 — 서열보다 먼저 좌표계를 확인한다

참조 유전체를 서열 기반 좌표계로 이해하고 assembly, reference bundle, annotation release와 좌표 변환의 경계를 설명합니다.

중급
|
14
|
검증 완료 (2026-08-21)
genome coordinate systemassembly versioncoordinate conversion
진행률0/20 (0%)

Reference Genome을 읽는 법

왜 이 개념이 필요한가

유전체 분석 결과에는 chr7:...처럼 위치가 자주 등장합니다. 그러나 염색체 번호와 숫자만으로는 완전한 주소가 아닙니다. 어느 genome assembly를 기준으로 했는지 알아야 같은 서열 구간과 변이를 찾을 수 있습니다.

Reference genome은 단순히 “사람의 대표 DNA 서열”이 아닙니다. sequencing read를 정렬하고 variant와 gene feature를 기록하며 결과를 교환하기 위한 서열 기반 좌표계입니다. 분석 시작 전에 reference를 고정하지 않으면 이후의 좌표·annotation·resource가 서로 어긋날 수 있습니다.

Reference는 FASTA 파일 하나만 뜻하지 않는다

고정할 정보달라질 때 생기는 문제
assemblyGRCh37, GRCh38, T2T-CHM13 등같은 위치 숫자가 다른 서열을 가리킬 수 있음
assembly releasemajor·patch와 accession/version포함 sequence와 release 정체가 불명확해짐
reference bundleprimary, alt, decoy 등 실제 FASTA 구성read mapping과 variant call이 달라질 수 있음
annotationprovider와 release, GTF/GFFgene·transcript 경계와 consequence가 달라질 수 있음
analysis resourcesknown-sites, interval, indexreference와 contig 이름·좌표가 맞지 않을 수 있음

따라서 “GRCh38을 썼다”는 필요하지만 충분하지 않습니다. 정확한 assembly accession, FASTA와 부속 파일 버전, annotation release를 함께 남겨야 합니다.

GRCh37, hg19, GRCh38, hg38

GRCh37GRCh38은 Genome Reference Consortium의 assembly 이름이고, hg19hg38은 UCSC에서 널리 쓰는 대응 이름입니다. GRCh19는 공식 이름이 아니며 대개 GRCh37hg19가 섞인 표현입니다.

현재 GRC human major assembly는 GRCh38이고 최신 patch는 GRCh38.p14입니다. patch release는 patch sequence를 추가하지만 major assembly chromosome 좌표를 바꾸지 않습니다. 반면 GRCh37에서 GRCh38로 major assembly가 바뀌면 좌표와 서열 맥락을 다시 확인해야 합니다.

Assembly가 바뀌면 주소만 바꾸면 되는가

아닙니다. 잘 보존되고 유일하게 대응되는 구간은 비교적 단순하게 변환할 수 있지만, 반복서열·segmental duplication·구조 차이·신규 구간에서는 unmapped 또는 multi-mapped feature, 달라진 interval·strand, reference allele 불일치가 생길 수 있습니다.

UCSC LiftOver나 Ensembl Assembly Converter는 assembly alignment로 좌표를 투영합니다. 성공 메시지가 생물학적 동일성을 보증하지는 않습니다. 변환 뒤에는 mapping, interval, strand, allele와 target annotation을 검수해야 하며, 복잡한 영역에서는 원 read를 target reference에 다시 정렬하는 편이 타당할 수 있습니다.

text
source assembly와 reference allele 확인
              ↓
target assembly와 변환 방법 고정
              ↓
unmapped / multi-mapped / changed interval 검수
              ↓
target allele와 annotation release 재확인

KOREF는 무엇을 더하는가

2016년 KOREF 연구는 한 donor 기반 KOREF_S와 40개 한국인 whole genome의 common variant를 반영한 KOREF_C를 제시했습니다. 목적은 GRCh38을 대체하는 단일 표준을 만드는 것이 아니라, 한국인·동아시아인 분석에서 집단 관련 서열과 변이 표현을 보완할 가능성을 평가하는 것이었습니다.

후속 KOREF_S1은 long-read, Hi-C와 parental information을 사용한 chromosome-level assembly입니다. 따라서 “KOREF를 사용했다”는 말에도 정확한 release가 필요합니다. KOREF는 모든 한국인의 단일 정상 유전체나 임상 표준을 뜻하지 않습니다.

T2T와 pangenome 이후에도 GRCh38을 쓰는 이유

T2T-CHM13은 기존 reference의 gap과 복잡 영역을 크게 확장했습니다. Human Pangenome Reference는 여러 사람의 phased assembly와 관계를 표현해 하나의 선형 reference가 놓치는 다양성을 줄이려 합니다. T2T 단일 assembly와 population diversity를 표현하는 pangenome은 같은 개념이 아닙니다.

그렇다고 GRCh38 기반 결과가 자동으로 폐기되는 것은 아닙니다. annotation, population database, assay design, clinical knowledge와 software ecosystem이 특정 reference에 묶여 있기 때문입니다. 중요한 것은 “최신 reference 하나”를 외우는 것이 아니라 연구 질문, exact release, reference bundle, annotation과 변환 검수를 명시하는 것입니다.

혼동하기 쉬운 점

  • Reference genome은 한 사람의 완벽한 정상 유전체가 아닙니다.
  • GRC patch가 올라가도 major chromosome coordinate는 유지되지만 사용 bundle은 기록해야 합니다.
  • 좌표 변환 성공은 variant의 완전한 동일성을 의미하지 않습니다.
  • Pangenome은 GRCh38의 단순한 다음 버전이 아닙니다.

현재 근거와 한계

이 글은 reference 선택과 기록을 위한 Concept입니다. 특정 assay·질환·임상 variant의 변환·판독 절차나 실행 명령을 제공하지 않습니다. 실제 tutorial은 reference bundle, annotation release와 checksum을 별도로 고정해야 합니다.

References

💬 질문과 댓글

0개의 댓글

로그인 없이 작성할 수 있습니다. 비로그인 댓글은 작성 후 직접 수정·삭제할 수 없습니다.

0/2000

로딩 중...