💻생명의 코드

진화 계통수를 직접 반영한 유전체 AI GPN-Star, 전장 유전체 변이 효과 예측의 새 기준을 제시하다

Nature·2026년 9월 10일AI 큐레이션
진화 계통수를 직접 반영한 유전체 AI GPN-Star, 전장 유전체 변이 효과 예측의 새 기준을 제시하다
AI 요약 (Beta)Beta

배경

인간 유전체 30억 쌍 가운데 단백질을 직접 암호화하는 부위는 단 1.5% 안팎에 불과하다. 나머지 98%가 넘는 비코딩 영역은 유전자 발현을 조절하는 핵심 스위치 역할을 맡고 있음에도, 서열 변이가 질환에 미치는 영향을 실험실에서 일일이 검증하기란 사실상 불가능에 가까운 실정이었다. 컴퓨터 알고리즘으로 진화적 보존성을 측정하려는 시도가 이어졌으나, 주변 염기서열 문맥을 제대로 반영하지 못하는 한계를 드러냈다. 최근 대규모 염기서열을 자연어처럼 학습하는 유전체 언어모델(Genomic Language Model, gLM)이 대안으로 부상하며 기대를 모았다. 문제는 기존 gLM 모델 대다수가 단일 종 서열만 분석하거나, 다중 종 서열을 정렬할 때 진화적 거리를 전혀 고려하지 못한다는 사실이다. 인간과 침팬지처럼 가까운 종 사이의 염기 일치는 중복 데이터로 작용해 편향을 낳았고, 먼 유연관계에 놓인 종의 변이는 과소평가되기 일쑤였다. 생물학적 진화 계통도를 학습 알고리즘에 직접 통합해야 한다는 요구가 커진 배경이 여기에 있다.

핵심 발견

미국 UC버클리 컴퓨터과학과 윤 송(Yun S. Song) 교수 연구진은 전장 유전체 정렬(Whole-Genome Alignment, WGA) 데이터에 계통수 거리를 결합한 유전체 모델 GPN-Star를 구축해 국제학술지 네이처에 발표했다. 단순 나열식 다중 정렬에 머물던 이전 방식과 달리 종 사이의 진화 분기 시간을 교차 어텐션 연산에 직접 매핑하는 계통 인식 아키텍처가 핵심 동력으로 꼽힌다. 기준 종인 인간 서열만 가리던 관행을 탈피해 정렬된 여러 종의 염기서열 전반을 무작위 마스킹 처리함으로써 학습 신호의 밀도를 대폭 끌어올렸다. 포유류 241종과 척추동물 100종의 진화 계통을 학습시킨 결과, 유전체 내 모든 대립유전자에 작용하는 기능적 제약(functional constraint)을 정밀 수치화하는 성과로 이어졌다. 성능 평가 지표는 뚜렷한 격차를 보여준다. 임상 유전 변이 데이터베이스 클린바(ClinVar) 변이 식별 실험에서 GPN-Star는 기존 보존성 지표 PhyloP와 앙상블 점수 CADD를 큰 격차로 앞질렀다. 비코딩 조절 부위에서도 전장 유전체 연관성 분석(Genome-Wide Association Study, GWAS) 인과 변이를 찾아내는 정확도가 종전 최고 모델 대비 우위를 점했다는 평가다. 생쥐, 닭, 초파리, 예쁜꼬마선충, 애기장대 등 5대 모델 유전체 분석까지 확장하며 종의 경계를 넘는 유연성을 증명해 보인 셈이다.

의미와 전망

GPN-Star의 등장은 비코딩 유전 변이의 질환 연관성을 추적하던 신약 개발 연구진에게 강력한 길잡이를 제공한다. 희귀 난치 질환 환자의 엑솜 시퀀싱에서 원인을 찾지 못해 전장 유전체 시퀀싱(Whole-Genome Sequencing, WGS)을 진행하더라도, 쏟아지는 수백만 개의 비코딩 변이 중 진짜 원인을 추리는 작업은 모래사장에서 바늘 찾기에 비유되곤 했다. 진화 압력을 정밀 계산하는 GPN-Star를 도입하면 유력 후보군을 압축하는 작업 효율이 몇 배 이상 상승할 전망이다. 연구진이 산출 점수를 UCSC 게놈 브라우저 트랙으로 공개하고 모델 가중치를 전면 개방한 조치도 생태계에 활력을 불어넣는 요인으로 꼽힌다. 고성능 연산 장비를 갖추지 못한 중소 바이오텍도 클릭 몇 번으로 변이 위험도를 즉시 판정할 길이 열렸기 때문이다. 해결해야 할 현실적 과제도 분명 존재한다. 종간 염기 정렬이 어려운 반복 서열이나 구조 변이 영역에서는 예측 신뢰도가 다소 흔들리는 양상을 보인다. 진화 역사가 보존한 염기 정보에 기대므로, 특정 세포나 조직에서 일어나는 후성유전학적 발현 동역학을 실시간으로 포착하지는 못한다는 한계도 뚜렷하다. 단일세포 염색질 접근성 데이터와의 융합이 차세대 핵심 과제로 부각되는 이유다.

Nature, Published online: 09 September 2026; doi:10.1038/s41586-026-11005-5GPN-Star, a genomic language model with a phylogeny-aware architecture for whole-genome alignment data, is shown to be a scalable and flexible tool for genetic variant effect prediction across species.

💬왜 중요하냐면:

임상 유전체 진단 현장에서는 원인 불명 희귀 유전 질환 환자의 비코딩 병인 변이를 확정하는 판독 파이프라인에 즉시 도입될 전망이다. 표준 엑솜 검사로 진단에 실패한 환자에게 전장 유전체 분석을 수행할 때, GPN-Star 점수를 적용하면 수만 개에 달하는 의미불명변이(Variants of Uncertain Significance, VUS) 가운데 프로모터나 인트론 깊숙이 숨은 병원성 후보를 신속히 걸러내는 시나리오가 구현된다. 제약·바이오 산업계에서는 비코딩 영역을 표적하는 차세대 유전자 치료제 개발에 결정적인 단서로 작용한다. 질환 유전자 발현을 조절하는 핵심 인핸서나 침묵 부위를 정확히 찾아내면, 안티센스 올리고뉴클레오타이드(Antisense Oligonucleotide, ASO)나 유전자 가위 기반 전사 조절 치료제를 훨씬 정밀하게 설계하는 체계가 자리 잡는다. 농축산 바이오 분야 역시 작물의 내병성이나 가축의 생산성을 좌우하는 유익 변이를 빠르게 선별해 육종 주기를 단축하는 실질적 혜택으로 이어진다.

💬 댓글

0개의 댓글
댓글을 작성하려면 로그인이 필요합니다
로딩 중...

BioPlayground

열람·링크·정당한 인용은 열어 두고, 고속 전수수집과 무단 재배포는 제한합니다.

별도 표시가 없는 콘텐츠의 권리는 BioPlayground 또는 정당한 권리자에게 있습니다.