💻生命のコード

scE2G:シングルセルデータ駆動型モデルによるエンハンサー-ターゲット遺伝子間の制御ネットワークの解明

Nature Genetics·2026年8月4日AI キュレーション
scE2G:シングルセルデータ駆動型モデルによるエンハンサー-ターゲット遺伝子間の制御ネットワークの解明
AI 要約 (Beta)Beta

背景

ヒトゲノムには、特定の細胞タイプにおける遺伝子発現を制御する数百万個のエンハンサーが存在する。疾患に関連する変異の多くは、タンパク質コード領域ではなく、エンハンサーに位置する。しかし、これらのエンハンサーによって制御されるターゲット遺伝子と細胞タイプを特定することは困難である。これは、エンハンサーがターゲット遺伝子から数十キロ塩基、あるいは数百キロ塩基離れた場所に位置し、最も近い遺伝子ではなく、他の遺伝子の発現を制御する可能性があるためである。

既存のActivity-by-Contact(ABC)およびENCODE-rE2Gモデルは、クロマチン活性と三次元接触情報を用いて、制御関係を予測する。しかし、バルク組織分析では、複数の細胞からのシグナルが混在するため、まれな、または一時的な細胞状態における制御回路を区別することが難しい。シングルセルクロマチンアクセシビリティ分析(scATAC-seq)およびシングルセルRNAシーケンス(scRNA-seq)が代替手段として登場したが、アクセシビリティと発現レベルの単純な相関関係に依存する教師なし学習アプローチは、精度の評価に関する客観的な基準に欠けている。

これらの限界に対処するため、研究者らは、シングルセルエンハンサー-遺伝子予測モデルのファミリーであるscE2Gを開発した。その結果は、2026年8月3日にNature Geneticsに発表された。

主要な発見

scE2Gは、scATAC-seqデータのみを使用するscE2G-ATACと、同じ細胞で実行されたscRNA-seqおよびATAC-seqからのデータを使用するscE2G-Multiomeの2つのモデルで構成される。両方のモデルは、教師あり学習に基づくロジスティック回帰分類器である。研究者らは、K562赤芽白血病細胞において、CRISPRスクリーニングによって同定された13,420個のエンハンサー-遺伝子候補ペアを用いてモデルをトレーニングした。これらのうち、466個は、遺伝子発現がエンハンサー阻害後に有意に減少する正の関連を示し、9,876個は負の関連を示した。

scE2G-ATACは、ABCスコア、エンハンサーとプロモーターのクロマチンアクセシビリティ、2つの領域間の距離と遺伝子密度、プロモータータイプという6つの特徴量を計算する。scE2G-Multiomeは、個々の細胞におけるエンハンサーアクセシビリティと遺伝子発現のKendallの相関係数を追加し、これをABCスコアと組み合わせて、ARC-E2G特徴量を作成する。過学習の可能性も、1つの染色体を一度に除外する交差検証によって低減された。

研究者らは、2つのscE2Gモデルの性能を、CRISPR摂動、微細マッピングされた発現定量形質座位(eQTL)、およびゲノムワイド関連研究(GWAS)変異-遺伝子関連という3つの独立したデータセットを用いて、既存の10個のシングルセルモデルと比較した。両方のscE2Gモデルは、K562細胞だけでなく、他の5つの細胞タイプからの4,175個の追加のCRISPRデータセットにおいても、最も高い精度と、精度-再現率曲線下の面積(AUC)を達成した。eQTL評価では、scE2G-Multiomeは13.9%の再現率と、14.9倍の変異のエンリッチメントを示した。次によく機能する非ABCベースのモデルであるSCENIC+は、1.4%の再現率と10.3倍のエンリッチメントを示した。

末梢血、骨髄単核細胞、および膵島から得られた45個の細胞タイプについて、制御マップを構築することにより、研究者らは、品質基準を満たす39個のタイプにおいて、1細胞あたり平均48,758個の接続を予測した。平均して、1つの発現遺伝子には5.6個のエンハンサーが関連しており、エンハンサーとそのターゲットプロモーター間の平均距離は86.3キロ塩基であった。

意義と示唆

scE2Gは、混合細胞集団においても、疾患変異によって影響を受ける細胞タイプとターゲット遺伝子を絞り込むことができるため、重要である。研究者らは、1,892個の非コード領域に存在する1,450個の変異を1,351個の遺伝子に関連付け、最も近い転写開始部位から離れた遺伝子をターゲットとする458個の領域を同定した。

たとえば、リンパ球数に関連する変異であるrs7696969は、INPP4B内に位置する。scE2Gは、この変異がナチュラルキラー細胞およびT細胞において、INPP4BおよびIL15を制御する可能性があることを示唆している。変異から2つの遺伝子のプロモーターまでの距離は、それぞれ441キロ塩基および769キロ塩基である。変異がINPP4BのeQTLであるという事後包含確率は66.6%であり、独立した遺伝子優先順位付け分析であるPoPSも、2つの遺伝子を最優先候補として選択した。ただし、これは機能的な因果関係の決定的な確認ではなく、さらなる実験的な検証が必要な仮説である。

モデルの安定した適用のためには、1細胞あたり少なくとも100個の細胞、最小200万個のATACフラグメント、および100万個のRNAユニーク分子識別子(UMI)を有することが推奨される。制限事項として、トレーニングには466個の正の関連のみが使用され、そのほとんどはK562細胞からのものである。エンハンサー以外のトポロジカル制御要素(CTCF結合部位など)は、予測ターゲットとして含まれていない。大規模なCRISPR検証データを複数の一次細胞から蓄積し、Hi-CまたはH3K27ac情報を組み込むことで、モデルを臨床的に信頼できる制御マップに拡張する必要がある。

Nature Genetics、オンライン公開:2026年8月3日;doi:10.1038/s41588-026-02695-8。scE2Gは、シングルセルデータセットからエンハンサー-遺伝子間の制御関係を予測するモデルファミリーであり、多様な細胞タイプおよび組織におけるこれらの関係のマップを作成することを可能にする。

💬なぜ重要なのか:

患者組織からのシングルセルマルチオミクスデータにscE2Gを適用することで、GWAS変異によって制御される細胞タイプとターゲット遺伝子を絞り込むことができる。たとえば、自己免疫疾患に関連する非コード変異が特定のT細胞サブタイプに存在するエンハンサーと重複する場合、接続されたターゲット遺伝子は、CRISPR阻害によって、またはオルガノイドまたは一次細胞における発現の変化を調べることによって検証することができる。

製薬会社にとって、scE2Gは、ターゲット発見および患者層別化ツールとして機能する可能性がある。疾患変異、作用する細胞タイプ、およびターゲット遺伝子を結びつけることで、薬剤ターゲットの遺伝的根拠を強化し、適切なバイオマーカーの設計を促進することができる。ただし、scE2Gによって行われる接続は確率的な予測であるため、薬剤開発の意思決定に使用する前に、CRISPR摂動、タンパク質発現、および三次元クロマチン接触データで検証する必要がある。

💬 コメント

0件のコメント
コメントするにはログインが必要です
読み込み中...

BioPlayground

閲覧・リンク・適法な引用は開放し、高速な一括収集と無断再配布は制限します。

別途表示がない限り、コンテンツの権利はBioPlaygroundまたは正当な権利者に帰属します。