Human Genome Project 이후 — 하나의 서열에서 pangenome으로
시작점 — 공통 지도가 필요했다
20세기 말 연구자들은 인간 유전체의 일부 유전자와 표지를 알고 있었지만, 전체를 같은 좌표에서 비교할 공통 지도가 없었습니다. Human Genome Project(HGP)는 1990년에 시작해 인간 DNA의 서열과 유전자 지도를 체계적으로 구축하려 했습니다. 여러 국가와 연구기관이 기술·시료·데이터 공개 원칙을 함께 설계한 대형 협력 사업이었습니다.
2003년의 완료 선언은 당시 정한 핵심 목표를 달성했다는 뜻입니다. 모든 사람의 모든 염기와 구조변이를 완전히 읽었다는 뜻은 아니었습니다. 반복서열과 centromere 같은 복잡 영역에는 공백이 있었고, 주된 reference는 제한된 수의 사람에게서 조립된 선형 서열이었습니다.
첫 번째 변화 — 좌표가 생기다
참조서열의 가장 큰 역할은 “정상 인간 한 명의 정답”이 아니라 공통 좌표를 제공한 것입니다. 연구자들은 gene의 위치, variant와 assay target을 같은 지도 위에서 표현하고 서로의 결과를 비교할 수 있게 됐습니다. sequencing read를 reference에 정렬하고 variant를 염색체–위치–대립서열로 기록하는 현대 분석의 기반도 여기서 강화됐습니다.
하지만 reference allele이 인구에서 가장 흔하거나 건강한 allele이라는 보장은 없습니다. reference와 다른 서열을 모두 이상으로 보는 것도 잘못입니다. 좌표계와 생물학적 기준을 구분해야 합니다.
기술이 질문을 넓히다
초기 대규모 sequencing은 시간과 비용이 많이 들었지만 이후 기술 발전은 한 사람의 genome과 여러 population을 더 빠르게 조사하게 했습니다. Short-read sequencing은 대규모 variant discovery를 가능하게 했고, long-read와 assembly 기술은 반복서열·구조변이·haplotype을 더 길게 연결할 수 있게 했습니다.
기술 향상은 자동 해석을 뜻하지 않았습니다. 더 많은 변이를 찾을수록 pathogenicity, phenotype, ancestry와 데이터 거버넌스를 함께 다뤄야 했습니다. HGP가 만든 지도 위에서 새로운 불확실성이 더 선명해진 셈입니다.
T2T — 공백을 줄이는 도전
Telomere-to-Telomere Consortium은 long read와 보완 기술을 결합해 기존 reference에서 남았던 복잡 영역을 크게 메운 assembly를 제시했습니다. 이는 centromere와 segmental duplication을 포함한 영역의 연구 기회를 넓혔습니다. complete라는 말도 사용한 cell line, haplotype과 assembly version의 범위 안에서 읽어야 합니다.
더 완전한 한 assembly는 서열 공백 문제를 줄이지만 인간 집단의 다양성 표현 문제를 혼자 해결하지는 않습니다.
Pangenome — 한 줄에서 여러 경로로
Human Pangenome Reference Consortium은 다양한 haplotype assembly를 포함해 하나의 선형 reference가 놓치던 sequence와 구조를 표현하려 합니다. graph 또는 여러 assembly를 이용하면 특정 집단의 서열이 reference에 없어 mapping이 불리해지는 bias를 줄이고 복잡한 variant를 더 잘 표현할 가능성이 있습니다.
그러나 pangenome은 단일 파일을 새 파일로 교체하는 간단한 사건이 아닙니다. 좌표 표현, 도구 호환성, variant normalization, 데이터 저장과 임상 보고 체계가 함께 변해야 합니다. 어떤 release와 path를 사용했는지 provenance가 더 중요해집니다.
남아 있는 대표성의 질문
다양한 ancestry를 포함하는 것은 기술 정확도뿐 아니라 형평성의 문제입니다. 참조와 연구 cohort에서 덜 대표된 집단은 variant frequency와 imputation, 위험 예측에서 더 큰 불확실성을 겪을 수 있습니다. 표본 수만 늘리는 대신 지역사회 참여, 동의, benefit sharing과 통제된 데이터 접근을 함께 설계해야 합니다.
대표성은 ancestry label 몇 개를 채우는 것으로 끝나지 않습니다. 집단 내 다양성과 사회적 맥락을 단순한 생물학적 범주로 환원하지 않아야 합니다.
무엇을 이해하게 되는가
HGP의 유산은 질병의 답을 모두 제공한 완결된 책이 아니라, 비교 가능한 질문을 만들게 한 기반 시설입니다. T2T는 한 assembly의 공백을 줄였고 pangenome은 여러 haplotype을 표현하는 방향을 열었습니다. 세 단계는 서로를 폐기하기보다 reference의 서로 다른 한계를 드러내고 확장합니다.
현재의 재검증과 한계
더 나은 reference는 mapping과 variant discovery를 개선할 수 있지만 변이의 질병 인과성, 임상 actionability와 개인의 치료 선택을 자동 결정하지 않습니다. assembly와 tool release가 바뀌면 좌표 변환과 재분석도 필요합니다. 연구 결과에는 reference 이름과 version을 반드시 남겨야 합니다.
개념 연결
좌표와 reference allele의 의미는 Reference genome, 다양한 assembly와 구조변이 관찰은 PacBio SMRT·HiFi, population representation은 UK genomic medicine과 Broad MPG Concept으로 이어집니다.