다인종 바이오뱅크 데이터 결합으로 소외 집단의 복합질환 다유전자 예측 정확도 대폭 개선

배경
개인의 DNA 변이를 종합해 미래 질병 발병 위험을 계산하는 다유전자 위험 점수(Polygenic Risk Score, PRS)는 정밀 의학의 핵심 도구로 주목받아 왔다. 수십만 개에서 수백만 개에 이르는 단일염기다형성(Single Nucleotide Polymorphism, SNP) 효과를 통계적으로 합산해 개인별 소인을 평가하는 방식이다. 그러나 기존 유전체 역학 연구는 심각한 표본 불균형이라는 구조적 한계에 갇혀 있었다. 전장 유전체 연관성 분석(Genome-Wide Association Study, GWAS)에 활용된 참가자의 80% 이상이 유럽계 혈통에 편중된 탓이다.
이러한 유전체 데이터 왜곡은 비유럽계 인구 집단에서 예측 모델 성능이 급격히 떨어지는 부작용을 낳았다. 아프리카계나 히스패닉 집단에 기존 PRS 알고리즘을 적용할 경우 예측 정확도가 유럽계 대비 절반 이하로 떨어지기도 한다. 질병 감수성을 평가할 때 연관 불평형(Linkage Disequilibrium, LD) 패턴과 대립유전자 빈도가 인종마다 서로 다르기 때문이다. 결과적으로 유전체 연구의 발전이 특정 인종에게만 혜택을 주는 의료 불평등을 심화시킨다는 비판이 꾸준히 제기됐다.
핵심 발견
연구진은 미국 국립보건원(NIH)의 올오브어스 연구 프로그램(All of Us Research Program, AoU)과 영국 바이오뱅크(UK Biobank, UKB) 데이터를 결합하는 대규모 다인종 메타분석 전략을 택했다. AoU는 역사적으로 의학 연구에서 배제됐던 소수 인종 비율을 50% 이상 확보한 코호트다. 연구진은 두 대형 바이오뱅크에 등록된 수십만 명의 전장 유전체 서열(Whole Genome Sequencing, WGS) 및 유전체형 분석 데이터를 통합해 복합 형질과 주요 만성 질환 모델을 재구축했다.
다양한 인종의 유전형 구조를 동시에 학습하는 다인종 베이지안 회귀 기법을 적용하자 비유럽계 집단에서의 모델 예측력이 눈에 띄게 향상됐다. 제2형 당뇨병, 관상동맥질환, 고혈압 등 주요 만성질환에서 아프리카계와 아메리카 대륙 혼혈 집단의 예측 정확도(AUC)는 기존 단일 인종 기반 모델 대비 유의미하게 상승했다. 특히 아프리카계 코호트에서 수축기 혈압 및 체질량지수(BMI) 연속형 형질 예측 성능은 최대 40% 이상 개선된 수치를 기록했다. 다인종 집단 사이에서 공통으로 작용하는 인과적 유전 변이를 선별하고, 집단별 고유한 LD 구조를 세밀하게 보정한 알고리즘 덕분이다. 표본 수의 절대적 확장뿐 아니라 유전적 다양성의 확보가 예측 알고리즘 성능을 좌우하는 결정적 요인임을 증명한 셈이다.
의미와 전망
이번 연구는 데이터 규모 확장과 다인종 표본 수집이 임상 유전체학의 인종 간 격차를 메우는 실질적 해법임을 입증했다. 특정 인종에만 국한되던 정밀 예방 의학의 외연을 넓히는 전환점이 마련됐다. 다인종 알고리즘이 보편화되면 조기 스크리닝 체계에서 발생하던 위음성 오류를 줄여 고위험군 선별의 정확도를 한층 끌어올리게 된다. 글로벌 제약 산업에서도 표적 발굴 과정의 유전적 타당성을 다양한 민족군에서 사전 검증할 수 있는 길이 열렸다.
다만 임상 적용까지는 신중한 접근이 요구된다. 비유럽계 표본이 늘어났음에도 여전히 아프리카계 내부의 높은 유전적 이질성을 완전히 반영하기에는 데이터 밀도가 부족하다. 또한 사회경제적 요인이나 거주 환경 같은 비유전적 요인이 복합질환에 미치는 상호작용 역시 보정해야 할 과제로 꼽힌다. 향후 아시아, 남미, 아프리카 대륙 현지 코호트와의 국제적 데이터 연계가 뒤따라야 진정한 글로벌 유전체 형평성을 달성할 수 있다.
Nature Genetics, Published online: 14 September 2026; doi:10.1038/s41588-026-02734-4Leveraging multiancestry and multi-biobank data from the All of Us Research Program and the UK Biobank improves polygenic prediction models for complex traits and diseases, especially for under-represented populations.
본 연구에서 도출된 다인종 다유전자 예측 모델은 1차 의료 기관의 만성질환 조기 선별 프로그램에 즉각 활용될 수 있다. 기존 단일 혈통 모델을 적용했을 때 고위험군에서 누락되던 다인종 다문화 배경 환자들을 조기에 발견해 생활 습관 개선이나 예방적 투약을 시작하는 경로다. 심혈관 질환이나 대사 증후군 발병 위험군을 정확히 분류함으로써 국가 보건 의료 재정의 낭비를 방지하는 경제적 이점도 뒤따른다.
신약 개발 영역에서는 임상시험 대상자 층화와 바이오마커 발굴 효율을 끌어올린다. 글로벌 3상 임상시험에서 다양한 인종의 환자 반응군을 선별할 때 유전적 위험도 편향을 줄여 약물 반응률 예측의 불확실성을 낮춘다. 유전체 분석 기업들은 다양한 혈통의 소비자에게 균일한 신뢰도의 유전자 검사 리포트를 제공하는 상용화 파이프라인을 구축할 수 있다.