配列から遺伝子発現を予測するAIモデル:次のマイルストーンとしての一般化可能性と解釈可能性

背景
ヒトゲノムの解読に続き、現代遺伝学における主要な課題は、30億塩基対のDNA特異的な遺伝子制御活動を解明することであった。主流の遺伝学研究は、特定バリアントと疾患相関を特定するゲノムワイド関連解析(GWAS)に焦点を当てており、非コード領域バリアントの分子生物学的メカニズムを直接説明することを困難にしていた。機能ゲノミクスデータと人工知能(AI)の最近の進歩により、DNA配列から遺伝子発現レベルを予測する「配列機能予測モデル(seq2funcモデル)」が登場した。このAIモデルは標的遺伝子の制御メカニズムを分子レベルで予測し、ゲノミクス研究における新しいパラダイムを開いている。しかし、既存のモデルは、トレーニング範囲外のデータセットに適用された場合に予測力が急激に低下するという脆弱性を示している。さらに、遺伝子制御原則が複雑なニューラルネットワーク内でどのように機能するかというメカニズムは不透明であり、信頼性の高い検証は依然として課題である。
主な発見
本総説論文では、seq2funcモデルのパフォーマンスと信頼性を決定する重要な要因として、モデルアーキテクチャ、トレーニングデータ、予測タスク、モデル解釈、評価戦略を特定している。 まず、モデルアーキテクチャの観点から、畳み込みニューラルネットワーク(CNN)はDNA配列内の局所的な制御パターン(モチーフ)を識別することに優れている。対照的に、Transformerベースのモデルは自己注意機構を適用することにより、100キロベース(kb)以上の長距離エンハンサーとプロモーターの相互作用を効果的に捉える。最近では、最大1メガベース(Mb)までの長配列を処理しながら計算量を大幅に削減する、状態空間モデル(SSM)ベースのHyenaDNAが新しい代替案として研究されている。 しかし、トレーニングデータと予測タスクの限界は残っている。ほとんどのseq2funcモデルは、特定の細胞株や染色体に偏ったエピゲノムデータで訓練されており、これがモデルに実際の生物学的ルールではなくデータの統計的ノイズを学習させる原因となり得る。バルクデータにおける細胞タイプの区別ができないことも、汎化能力を低下させる要因である。 したがって、AIの予測的根拠を検証する方法も多様化している。入力配列内の重要な位置を示すIntegrated Gradientsや、インシリコ変異誘発(ISM)が代表的な例である。研究者らは、単一塩基解析を超えて、制御パターンの距離や順序などの生物学的特徴を定量化するグローバル重要度解析(GIA)の導入を提案している。さらに、モデル検証中に未学習の染色体や新しい細胞状態を利用する厳格な評価戦略は、モデルの汎化能力を正確に測定するために必要である。
意義と展望
この分析は、ゲノミクスAIの分野が単純なパラメータ拡張の競争から離れ、生物学的因果関係を説明する解釈可能性とロバスト性に焦点を当てるべきであることを示している。特に、モデル構造とデータの特性が汎化性能に与える影響を包括的に検証するフレームワークは、研究者が将来より洗練されたニューラルネットワークを設計するための有用なガイドになると期待される。 しかし、克服すべき現実的な課題も存在する。既存のseq2funcモデルのほとんどは、学習プロセス中の転写因子(TF)の濃度の変化やクロマチンの三次元的構造変化など、動的な生理学的現象を完全に反映していない。したがって、細胞状態情報を入力に統合するコンテキストベースモデルの導入が不可欠である。さらに、AIモデルが実際の生物学的ルールを学習したかどうかを評価するための標準化されたベンチマークプラットフォームを確立し、精密医薬品開発の分野で目に見える成果を達成しなければならない。
Nature Genetics, Published online: 27 July 2026; doi:10.1038/s41588-026-02670-3This Review surveys the current landscape of genomic artificial intelligence through the lens of sequence-to-function models, examining how architectural choices, training data, prediction tasks, model interpretation and evaluation strategies can shape their generalization.
本研究で提示されたゲノムAI検証ガイドラインは、個別化精密医療および医薬品開発産業に直接的な変化をもたらす可能性がある。典型的なシナリオは、希少疾患を引き起こす患者の新規非コード遺伝子バリアントの同定である。AIが遺伝子発現を直接阻害する病原性バリアントを正確に予測できれば、臨床医は数万個の遺伝子バリアントから疾患の実際の原因を容易に特定できるようになる。 さらに、遺伝子治療開発において治療用遺伝子の活動を最適化する合成プロモーター設計の効率を最大化できる。これには、AIで目的の細胞タイプでのみ強く発現するように配列を設計し、GIAを使用してリアルタイムで設計の安定性を検証することが含まれる。このシミュレーションは動物実験の前に効果的な候補物質をスクリーニングするのに役立ち、医薬品開発の時間とコストの削減につながる。