💻生命のコード

進化系統樹を直接反映したゲノムAI「GPN-Star」、全ゲノム変異効果予測の新たな基準を提示

Nature·2026年9月10日AI キュレーション
進化系統樹を直接反映したゲノムAI「GPN-Star」、全ゲノム変異効果予測の新たな基準を提示
AI 要約 (Beta)Beta

背景

ヒトゲノムの30億塩基対のうち、タンパク質を直接コードする領域はわずか1.5%程度に過ぎない。残りの98%を超える非コード領域は、遺伝子発現を制御する重要なスイッチの役割を果たしているが、配列変異が疾患に及ぼす影響を実験室で一つずつ検証することは事実上不可能に近い状況であった。コンピュータアルゴリズムを用いて進化的な保存性を測定する試みも続いてきたが、周囲の塩基配列のコンテキストを十分に反映できないという限界があった。近年、大規模な塩基配列を自然言語のように学習するゲノム言語モデル(Genomic Language Model, gLM)が代替案として浮上し、期待を集めている。しかし、既存のgLMモデルの多くは単一種の配列のみを分析するか、多種配列のアライメントにおいて進化的な距離を全く考慮できていないという課題があった。ヒトとチンパンジーのような近縁種間の塩基一致は重複データとしてバイアスを生み、遠い系統関係にある種の変異は過小評価されがちであった。そのため、生物学的な進化系統樹を学習アルゴリズムに直接統合する必要性が高まっていた。

主な発見

米国UCバークレー校コンピュータサイエンス学科のYun S. Song教授らの研究チームは、全ゲノムアライメント(Whole-Genome Alignment, WGA)データに系統樹の距離を結合したゲノムモデル「GPN-Star」を構築し、国際学術誌『Nature』に発表した。単なる羅列的なマルチプルアライメントに留まっていた従来の手法とは異なり、種間の進化的な分岐時間をクロスアテンション演算に直接マッピングする「系統認識アーキテクチャ」が核心的な原動力となっている。基準種であるヒトの配列のみに焦点を当てる慣習を脱却し、アライメントされた複数の種の塩基配列全体に対してランダムなマスキング処理を行うことで、学習信号の密度を大幅に向上させた。哺乳類241種と脊椎動物100種の進化系統を学習させた結果、ゲノム内のすべての対立遺伝子に作用する機能的な制約(functional constraint)を精密に数値化することに成功した。性能評価指標には顕著な差が見られた。臨床遺伝変異データベース「ClinVar」の変異識別実験において、GPN-Starは既存の保存性指標であるPhyloPやアンサンブルスコアであるCADDを大きな差で上回った。非コード調節領域においても、全ゲノム関連解析(GWAS)の因果変異を特定する正確性が、従来の最高モデルを凌駕したとの評価を得ている。マウス、ニワトリ、ショウジョウバエ、線虫、シロイヌナズナといった5大モデル生物のゲノム解析にも拡張し、種の境界を越える柔軟性を証明した。

意義と展望

GPN-Starの登場は、非コード遺伝変異の疾患関連性を追跡する創薬研究者に対し、強力なガイドを提供することになる。希少な難病患者のエキソームシーケンシングで原因が見つからず、全ゲノムシーケンシング(Whole-Genome Sequencing, WGS)を実施したとしても、溢れ出る数百万もの非コード変異の中から真の原因を絞り込む作業は、砂漠の中から針を探すようなものだった。進化圧を精密に計算するGPN-Starを導入することで、有力な候補群を圧縮する作業効率は数倍以上に向上する見込みである。研究チームが算出スコアをUCSCゲノムブラウザのトラックとして公開し、モデルの重みを全面的に開放したことも、エコシステムに活力を与える要因となっている。高性能な演算設備を持たない中小のバイオテック企業でも、数クリックで変異の危険度を即座に判定できる道が開かれたためである。解決すべき現実的な課題も存在する。種間の塩基アライメントが困難な反復配列や構造変異領域では、予測の信頼性がやや揺らぐ傾向が見られる。また、進化の歴史が保存してきた塩基情報に依存するため、特定の細胞や組織で起こるエピジェネティックな発現動態をリアルタイムに捉えることはできないという限界も明確である。次世代の核心課題として、単一細胞クロマチンアクセシビリティデータとの融合が浮上している。

Nature, Published online: 09 September 2026; doi:10.1038/s41586-026-11005-5GPN-Star, a genomic language model with a phylogeny-aware architecture for whole-genome alignment data, is shown to be a scalable and flexible tool for genetic variant effect prediction across species.

💬なぜ重要なのか:

臨床ゲノム診断の現場では、原因不明の希少遺伝疾患患者における非コード病原性変異を確定するための解析パイプラインとして、即座に導入されることが期待される。標準的なエキソーム検査で診断に至らなかった患者に対し、全ゲノム解析を実施した際、GPN-Starのスコアを適用することで、数万個に及ぶ意義不明の変異(Variants of Uncertain Significance, VUS)の中から、プロモーターやイントロンの深くに隠れた病原性候補を迅速にフィルタリングするシナリオが実現可能となる。製薬・バイオ産業においては、非コード領域を標的とする次世代遺伝子治療薬の開発における決定的な手がかりとなる。疾患遺伝子の発現を制御する重要なエンハンサーやサイレンサーを正確に特定できれば、アンチセンスオリゴヌクレオチド(ASO)やゲノエディティング技術を用いた転写調節治療薬を、より精密に設計できる体制が整う。農畜産バイオ分野においても、作物の耐病性や家畜の生産性を左右する有益な変異を迅速に選抜することで、育種サイクルの短縮という実質的な利益につながる。

💬 コメント

0件のコメント
コメントするにはログインが必要です
読み込み中...

BioPlayground

閲覧・リンク・適法な引用は開放し、高速な一括収集と無断再配布は制限します。

別途表示がない限り、コンテンツの権利はBioPlaygroundまたは正当な権利者に帰属します。