AI Tools
Bio AI初級

ESMC / ESMFold2

タンパク質生物学ワールドモデル — 進化的規模でのタンパク質の理解・設計プラットフォーム

ESMCとESMFold2は、Biohubが2026年5月27日に公開したタンパク質生物学のワールドモデルである。GPTが人間の言語の文法と意味を大規模なテキストから学習するように、ESMCは地球上のすべての生物から収集した約28億個のタンパク質配列を事前学習し、進化が数十億年にわたって蓄積したタンパク質設計の文法を習得した60億パラメータ規模の基礎言語モデルである。ESMFold2は、このESMCの埋め込みの上に、ループトランスフォーマーと拡散ベースの構造予測アーキテクチャを組み合わせることで、アミノ酸配列1つだけで原子レベルの3D構造を予測し、さらに治療用タンパク質バインダーを設計するエンジンである。

従来のタンパク質構造予測の標準であったAlphaFoldシリーズは、多重配列アライメント(Multiple Sequence Alignment、MSA)に大きく依存する。MSAベースのアプローチは、進化的に保存されたタンパク質には強力であるが、抗体のように急速に変異する配列では、アライメント信号が消失し、精度が急落するという構造的な限界がある。ESMC-ESMFold2は、いわゆる「苦い教訓(The Bitter Lesson)」の哲学を採用した。MSAなしで、純粋なBERT系のトランスフォーマーを十分に大きく、多様なデータで訓練すれば、特殊なアーキテクチャを上回るというスケーリング法則に賭けたものである。その結果、抗体-抗原結合予測においてAlphaFold 3を上回る精度を達成し、Chai-1やBoltz-1などの競合モデルに対しても優位性を示した。単一配列モードでは、MSAベースと比較して約10倍の推論速度の向上を提供し、大規模なスクリーニングにも適している。

生命工学研究者の観点から最も注目すべき点は、実験室で検証された治療用バインダーの設計能力である。Biohubチームは、EGFR、PDGFRβ、PD-L1、CTLA-4、CD45などの5つの癌・免疫標的について、コンパクトミニバインダー36-88%、抗体由来フォーマット15-29%のヒット率で、ナノモラー(nanomolar)の親和性を持つバインダーを設計し、PD-L1バインダーは実際にT細胞のシグナル回復機能があることを証明した。従来、数ヶ月から数年かかっていた標的バインダーの設計サイクルを数日に短縮した。また、ESM Atlasを通じて68億個の配列と11億個の予測構造を探索することができ、スパースオートエンコーダー(Sparse Autoencoder、SAE)ベースの約16,000個の解釈可能な特徴(interpretable feature)で、未注釈のタンパク質の機能をマッピングすることができる。MITライセンスでモデルとコードが完全に公開されており、学術・産業研究者はローカルGPUで直接実行するか、BiohubプラットフォームAPIを通じてアクセスすることができる。

💻 必要なスペック

🧠RAM

NVIDIA GPU 16GB以上を推奨。FP16の場合、ESMC-6Bの重みだけで約12GBを占有し、推論に必要なメモリも考慮すると、24GBクラス(A100、RTX 4090など)が最適。CPUのみでの実行も可能だが、非常に遅い。

💾ストレージ

ESMC-6B + ESMFold2モデルの合計は約15〜25GB。ESM AtlasデータはBiohubプラットフォームからオンラインでアクセス可能(ローカルにダウンロードする場合は数百GB以上)。

インストール

4-1. 簡単な始め方

pip install esm@git+https://github.com/Biohub/esm.git@main

PyPIの公式リリースは準備中(2026-06-17現在、GitHubからの直接インストールのみ可能)

4-2. 基本的な使用例

from transformers import AutoModelForMaskedLM, AutoTokenizer

# ESMC-6Bをロード(HuggingFace、認証が必要)
model = AutoModelForMaskedLM.from_pretrained("biohub/ESMC-6B", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("biohub/ESMC-6B")

# タンパク質配列の埋め込みを抽出
sequence = "MKTAYIAKQRQISFVKSHFSRQLEERLGLIEVQAPILSRVGDGTQDNLSGAEKAVQVKVKALPDAQFEVVHSLAKWKRQQIA"
inputs = tokenizer(sequence, return_tensors="pt").to(model.device)
outputs = model(inputs, output_hidden_states=True)
embeddings = outputs.hidden_states[-1]

4-3. BiohubプラットフォームAPIへのアクセス

# biohub.ai開発者コンソールでAPIトークンを発行後、使用
from esm import esmc_client

client = esmc_client(
    model="ESMC-6B",
    url="https://biohub.ai/api",
    token="YOUR_API_TOKEN"
)
result = client.predict(sequence="MKTAYIAK...")

🧬 バイオ活用シナリオ

🔬

抗体治療薬候補のバインダー設計

ESMFold2のデノボ(de novo)バインダー設計プロトコルを活用し、PD-L1やCTLA-4などの免疫チェックポイント標的に対するミニバインダーを生成する。コンパクトなミニバインダーの場合、36〜88%のヒット率とナノモルの親和性を達成し、設計後、PyMOLやChimeraXで3D結合構造を可視化して、実験検証の優先順位を決定する。従来の数か月の設計サイクルを3〜5日に短縮し、治療薬候補の創出までの時間を大幅に短縮する

🧬

注釈のないタンパク質の機能探索と新規標的の発見

ESM Atlas(68億の配列、11億の構造)でSAEベースの16,000個の解釈可能な特徴を活用し、機能が不明なタンパク質を機能クラスターに分類する。ESMC-6Bの埋め込みを抽出し、UMAPなどで次元削減して可視化すると、既存の注釈がないタンパク質でも、既知のタンパク質との特徴の類似性から役割を推測できる。環境メタゲノミクスサンプルから新規の抗菌ペプチド候補を発見するなど、標的拡張の初期段階に活用する

💊

大規模な変異体構造スクリーニング

ESMC-6Bの単一配列推論モードを活用し、MSAなしで数万個の変異体ライブラリの構造を一括予測する。AlphaFold 3と比較して約10倍高速な推論速度で、GPUサーバーで1日に数万件の処理が可能。予測の信頼度スコアに基づいて上位の候補をフィルタリングし、精密ドッキングシミュレーション(HADDOCK、ClusProなど)に移行して、ヒット化合物の選別効率を最大化する

FAQ

ESMC / ESMFold2とは何ですか?

ESMCとESMFold2は、Biohubが2026年5月27日に公開したタンパク質生物学のワールドモデルである。GPTが人間の言語の文法と意味を大規模なテキストから学習するように、ESMCは地球上のすべての生物から収集した約28億個のタンパク質配列を事前学習し、進化が数十億年にわたって蓄積したタンパク質設計の文法を習得した60億パラメータ規模の基礎言語モデルである。ESMFold2は、このESMCの埋め込みの上に、ループトランスフォーマーと拡散ベースの構造予測アーキテクチャを組み合わせることで、アミノ酸配列1つだけで原子レベルの3D構造を予測し、さらに治療用タンパク質バインダーを設計するエンジンである。 従来のタンパク質構造予測の標準であったAlphaFoldシリーズは、多重配列アライメント(Multiple Sequence Alignment、MSA)に大きく依存する。MSAベースのアプローチは、進化的に保存されたタンパク質には強力であるが、抗体のように急速に変異する配列では、アライメント信号が消失し、精度が急落するという構造的な限界がある。ESMC-ESMFold2は、いわゆる「苦い教訓(The Bitter Lesson)」の哲学を採用した。MSAなしで、純粋なBERT系のトランスフォーマーを十分に大きく、多様なデータで訓練すれば、特殊なアーキテクチャを上回るというスケーリング法則に賭けたものである。その結果、抗体-抗原結合予測においてAlphaFold 3を上回る精度を達成し、Chai-1やBoltz-1などの競合モデルに対しても優位性を示した。単一配列モードでは、MSAベースと比較して約10倍の推論速度の向上を提供し、大規模なスクリーニングにも適している。 生命工学研究者の観点から最も注目すべき点は、実験室で検証された治療用バインダーの設計能力である。Biohubチームは、EGFR、PDGFRβ、PD-L1、CTLA-4、CD45などの5つの癌・免疫標的について、コンパクトミニバインダー36-88%、抗体由来フォーマット15-29%のヒット率で、ナノモラー(nanomolar)の親和性を持つバインダーを設計し、PD-L1バインダーは実際にT細胞のシグナル回復機能があることを証明した。従来、数ヶ月から数年かかっていた標的バインダーの設計サイクルを数日に短縮した。また、ESM Atlasを通じて68億個の配列と11億個の予測構造を探索することができ、スパースオートエンコーダー(Sparse Autoencoder、SAE)ベースの約16,000個の解釈可能な特徴(interpretable feature)で、未注釈のタンパク質の機能をマッピングすることができる。MITライセンスでモデルとコードが完全に公開されており、学術・産業研究者はローカルGPUで直接実行するか、BiohubプラットフォームAPIを通じてアクセスすることができる。

ESMC / ESMFold2はいつ使いますか?

タンパク質生物学ワールドモデル — 進化的規模でのタンパク質の理解・設計プラットフォーム

ESMC / ESMFold2のバイオ研究での活用例は何ですか?

抗体治療薬候補のバインダー設計: ESMFold2のデノボ(de novo)バインダー設計プロトコルを活用し、PD-L1やCTLA-4などの免疫チェックポイント標的に対するミニバインダーを生成する。コンパクトなミニバインダーの場合、36〜88%のヒット率とナノモルの親和性を達成し、設計後、PyMOLやChimeraXで3D結合構造を可視化して、実験検証の優先順位を決定する。従来の数か月の設計サイクルを3〜5日に短縮し、治療薬候補の創出までの時間を大幅に短縮する

📄 公式ドキュメント🐙 GitHub

📝 アップデートノート

まだアップデートノートはありません。

🧪 関連「生命のコード」

関連する「生命のコード」記事はまだありません。