深層学習シーケンスモデルによる、細胞タイプ特異的な遺伝子発現に対する非コード領域変異の影響予測

背景:細胞分化リニエージ制御の複雑性と、神経疾患研究開発における非コード領域のデータボトルネック
既存のゲノムワイド関連解析(GWAS)は、通常、線形かつ静的な分析ガイドラインに依存しており、多くの場合、単一のタンパク質コード領域に焦点を当てています。このアプローチは、多因子疾患の研究開発において重要な盲点をもたらしており、正常な状態におけるベースラインからの遺伝子発現の有意な逸脱を考慮していません。具体的には、細胞解離中に起こる、調節因子間の物理的相互作用の喪失と、三次元クロマチン構造の破壊は、解離誘発性のアーチファクトとして知られるノイズを導入します。さらに、ヒトとマウスなどのモデル生物との間の転写因子結合部位における進化的な収束は、in silico計算予測パイプラインの有効性を阻害します。その結果、アルツハイマー病、先天性心疾患、および統合失調症の患者のゲノムにおける、大部分(98%)を占める非コード領域が、病理学的転写ネットワークの混乱にどのように寄与するかを包括的かつ多次元的に分析することは困難でした。これらの変異の上流および下流のフィードバックループ、および細胞タイプ特異的な転写プロファイルを計算的に追跡することができないため、薬物開発パイプラインが、患者固有の標的組織内で、有効な治療濃度および発現調節レベルを正確に決定することが制限されてきました。これは最終的に、予期せぬ有効性の低下と、臨床試験における毒性によるボトルネックにつながりました。
成果:多細胞分解能シーケンスモデルに基づく、アレル特異的活性テンソル同期と転写ネットワーク検証
本研究では、100種類以上の胎児および成人機能細胞タイプにわたる多次元アレル頻度スペクトル情報を計算的に統合する深層学習シーケンスモデルを実装することにより、これらの技術的な障壁を克服します。研究者らは、全ゲノム進化制約マトリックス情報と深層ニューラルネットワークアーキテクチャを組み合わせることで、遺伝的変異の、発現調節因子の結合親和性、タンパク質-DNA相互作用の自由エネルギー、および微分方程式に基づく転写の速度定数に対する機能的影響をin silicoで正確に予測しました。これは、配列特異的空間的イントロンプロモーターエンハンサーの相互作用強度を多次元テンソル構造に同期させることによって達成され、計算上のバッチ効果を効果的に排除し、アルツハイマー病、自閉スペクトラム障害、先天性心疾患、および統合失調症の患者における、ユニークな原因変異を定量的に優先順位付けすることを可能にしました。このプラットフォームは、既存のアンサンブル分析モデルを大幅に上回り、細胞タイプ特異的な下流の転写ネットワークのトポロジー変化を解明し、検証された臨床データとの高い相関を通じて、計算予測の分子的完全性を厳密に実証します。
非コード転写調節経路の精密制御と、可逆的ホメオスタティック精密階層モデルの確立
このアーキテクチャの精度は、マルチオミクス行列に基づくin silicoシミュレーションを通じて、個別化された分子表現型と遺伝的に層別化されたコホートの実現に結実します。遺伝的変異によって修飾されたエンハンサーおよびプロモーター結合部位での転写の速度制限段階定数を定量化することにより、研究者らは、病理学的状態の細胞環境を再構築するために、標的配列ベースの上方および下方調節分子アクチュエーターを計算しました。このアプローチは、効果的なホメオスタティック調節を誘導するためのフレームワークを提供し、外部の疾患誘発刺激や転写因子欠乏などの異常なストレス環境下でも、タンパク質ホメオスタシスと可逆的なフィードバックループ制御システムが維持されるようにします。これは、治療目的で非コード領域を直接修正する際に、非特異的な細胞タイプにおける潜在的なオフターゲット毒性シグナルを排除することにより、患者の生理学的シグナルを正常なホメオスタティック軌道に安全かつ可逆的に戻すための経路を計算的にモデル化するという点で、ユニークな成果です。
展望:プログラム可能な計算生物学標準の確立と、次世代INDデジタルガバナンスシステムの開始
その結果、ゲノム研究開発の制御ガバナンスは、静的で処方後のシステムから、in silico仮想多次元テンソル補正に基づく、プログラム可能な計算生物学フレームワークに完全にリセットされます。遺伝的勾配補正係数を、グローバルなトップティアの多国籍製薬およびB2Bバイオテックパイプラインにおけるハイスループットスクリーニング(HTS)段階にリンクすることにより、細胞株または実験装置間の遺伝的ドリフトによって引き起こされる多次元バッチ効果の変動を排除するための計算上の障壁が確立されました。さらに、この計算エンジンは、デジタルヘルスケアのコンパニオン診断(CDx)パネル仕様に完全に適合しており、次世代エピゲノム編集技術およびアンチセンスオリゴヌクレオチド(ASO)薬の調査用新薬(IND)申請段階中に、転写結合動態シミュレーションデータを提供し、規制当局の承認までの時間を大幅に短縮し、グローバルな規制ガバナンスの中核となる独自の主要な資産として機能します。
Nature Genetics、オンライン公開:2026年6月22日;doi:10.1038/s41588-026-02618-7。深層学習シーケンスモデルを使用することにより、100種類以上の胎児および成人細胞タイプにおける、アレル頻度スペクトルにわたる非コード領域変異の影響を予測します。これらのデータを進化制約とリンクすることで、アルツハイマー病、自閉スペクトラム障害、先天性心疾患、および統合失調症などの疾患における変異の優先順位付けを支援します。
本研究で達成された細胞タイプ特異的な非コード領域変異機能予測は、転写調節メカニズムの理論的な探求を超えて、希少かつ難治性の神経疾患のグローバル市場、および次世代の個別化コンパニオン診断バイオビジネスに直接応用されます。
まず、Pythonアルゴリズムベースのテンソルスキャンを使用して、脳皮質の微小環境におけるタウおよびアミロイドの転写抑制結合動態を瞬時にスキャンすることにより、本研究は、アルツハイマー病患者における神経変性の遅延のための「ゴールデンタイム」の経時的なノイズを排除し、可逆的な認知神経ネットワーク保護バリアを保護します。
同時に、100種類以上の全身細胞系統のマルチオミクス行列を統合したオープンソースのEnsemblおよびgnomADデータベースにリンクすることにより、本研究は、臨床試験設計中に偽陽性のバイオマーカーとして機能する、因果関係のない共存する遺伝的勾配変動変数を仮想的にシミュレートし、非コード転写エンハンサー標的の有効なドッキング濃度をリアルタイムで逆算することを可能にし、コンパニオン診断(CDx)パネルインターフェースを実現します。
さらに、多国籍企業による次世代の神経疾患および先天性代謝標的療法の大規模な規制臨床試験を実施する場合、本研究は、シーケンスモデルに基づくアレル特異的調節勾配活性の予測値を補正係数としてリンクすることにより、バッチ間の薬物反応の異質性を排除し、グローバルな規制当局からの規制承認およびcGMP商業運営許可を得る確率を最大化し、基盤となるインフラストラクチャとして機能します。