ESMC (EvolutionaryScale Cambrian)
ESMCは、人類史上最も急激な進化が起こったカンブリア紀にちなんで名付けられた、次世代の生物学基盤モデルであり、2026年5月にチャン・ザッカーバーグ・バイオハブとエボリューショナリースケールによる共同研究チームによって発表されました。このモデルは、巨大なタンパク質宇宙の設計図を理解するために、地球上に存在する生物から収集された約28億個のアミノ酸配列データを学習しました。それは、あたかも人間が書いた数十億ページものテキストのようです。
ESMCは、人類史上最も急激な進化が起こったカンブリア紀にちなんで名付けられ、2026年5月にチャン・ザッカーバーグ・バイオハブとエボリューショナリースケールによる共同研究チームによって発表された次世代の生物学的基盤モデルです。このモデルは、巨大なタンパク質宇宙の設計図を理解するために、地球上に存在する生物から収集された約28億個のアミノ酸配列データを学習しました。まるで人間が書いた数十億ページものテキストを読み、言語の文法を習得した大規模言語モデル(LLM)のように、ESMCはタンパク質のアミノ酸配列の配置を通じて、タンパク質の物理的・化学的なフォールディング(折り畳み)の法則と複雑な相互作用メカニズムを自律的に学習するマスク言語モデリング(Masked language modeling)アーキテクチャを採用しています。
従来の生物情報学的分析ツールは、主に多重配列アライメント(Multiple Sequence Alignment)方式に依存し、種間で保存された配列を比較する静的かつ局所的な分析にとどまっており、新しいアミノ酸の組み合わせが生み出す動的かつ立体的な相互作用を予測するのには限界がありました。ESMCは、このような静的な比較分析を超えて、生物学的配列全体を多次元の連続的な埋め込み(Embedding)空間にマッピングすることで、タンパク質の進化的な文脈と構造的な潜在力を有機的に捉えます。これは、従来の比較生物学的手法が古い辞書で単語の意味を一つずつ照合するのに対し、ESMCは多数の小説から文脈を把握し、単語の多層的なニュアンスを一度に理解するのと似ています。このツールは、特にオープンウェイト(Open weight)形式で提供され、世界中の研究者が計算リソースや研究目的に合わせて、300Mから6Bパラメータまで、適切なサイズのモデルをローカル環境に柔軟に展開し、タンパク質言語表現のパフォーマンスを最大限に高めることができます。
生命工学分野の研究者は、新しい新薬の標的タンパク質に強力に結合する人工タンパク質バインダー(Binder)を発見する過程で、ESMCを主要な予測エンジンとして活用できます。例えば、特定の癌細胞の表面受容体の3次元バインディングインターフェース(Binding interface)の情報に基づいて、その受容体に特異的に結合できる候補のアミノ酸配列を設計し、それをESMCの言語モデル評価スコア(Likelihood score)でスクリーニングすることで、実際の合成実験を行う候補群の範囲を大幅に絞り込むことができます。また、構造生物学の研究のために、ESMFold2モデルと統合された構造予測パイプラインを連携させることで、配列情報入力後1秒以内に、原子レベル(All-atom resolution)の精密な3D立体構造を予測し、従来の実験室で数か月かかる結晶構造解析(X-ray crystallography)のプロセスを仮想空間で迅速に先行検証することができます。このような統合分析技術は、大規模な変異誘導ライブラリーのスクリーニング段階で有用に活用され、最終的には標的タンパク質の活性制御や耐性メカニズムの解明など、精密医療や次世代のバイオ医薬品設計分野の効率を数十倍以上に革新する基盤となります。
💻 必要なスペック
最小限のNVIDIA GPU VRAMは8GB(ESMC-300Mの推論用)、推奨は16GB以上(ESMC-6B FP16の推論用)。CPU単独での実行では、アミノ酸配列1つあたり1個で10〜30秒かかり、速度が遅くなります。
モデルの重みをダウンロードする際、1GB(300M) ~ 15GB(6B) のディスク領域を確保する必要があります。
⚡ インストール
4-1. クイックスタート
pip install esm@git+https://github.com/Biohub/esm.git@main
4-2. 詳細なインストール
# Hugging Face Transformersを用いたモデルのロードと推論の例
import torch
from transformers import AutoModelForMaskedLM, AutoTokenizer
# 1. モデルとトークナイザーの読み込み
model_id = "biohub/ESMC-6B" # または "biohub/ESMC-300M"
model = AutoModelForMaskedLM.from_pretrained(model_id, device_map="auto").eval()
tokenizer = AutoTokenizer.from_pretrained(model_id)
# 2. 解析するタンパク質のアミノ酸配列を定義
sequences = ["MSKGEELFTGVVPILVELDGDVNGHKFSVSGEGEGDATYGKLTLKFICTTGKLPVPWPTLVTTFSYGVQCFSRYPDHMKQHDFFKSAMPEGYVQERTIFFKDDGNYKTRAEVKFEGDTLVNRIELKGIDFKEDGNILGHKLEYNYNSHNVYIMADKQKNGIKVNFKIRHNIEDGSVQLADHYQQNTPIGDGPVLLPDNHYLSTQSALSKDPNEKRDHMVLLEFVTAAGITHGMDELYK"]
# 3. 入力データの前処理とデバイステンソルの転送
inputs = tokenizer(sequences, return_tensors="pt", padding=True)
inputs = {k: v.to(model.device) for k, v in inputs.items()}
# 4. 推論モードの実行とタンパク質埋め込み/予測ログの出力
with torch.inference_mode():
output = model(inputs)
print(output.logits)
FAQ
ESMC (EvolutionaryScale Cambrian)とは何ですか?
ESMCは、人類史上最も急激な進化が起こったカンブリア紀にちなんで名付けられ、2026年5月にチャン・ザッカーバーグ・バイオハブとエボリューショナリースケールによる共同研究チームによって発表された次世代の生物学的基盤モデルです。このモデルは、巨大なタンパク質宇宙の設計図を理解するために、地球上に存在する生物から収集された約28億個のアミノ酸配列データを学習しました。まるで人間が書いた数十億ページものテキストを読み、言語の文法を習得した大規模言語モデル(LLM)のように、ESMCはタンパク質のアミノ酸配列の配置を通じて、タンパク質の物理的・化学的なフォールディング(折り畳み)の法則と複雑な相互作用メカニズムを自律的に学習するマスク言語モデリング(Masked language modeling)アーキテクチャを採用しています。 従来の生物情報学的分析ツールは、主に多重配列アライメント(Multiple Sequence Alignment)方式に依存し、種間で保存された配列を比較する静的かつ局所的な分析にとどまっており、新しいアミノ酸の組み合わせが生み出す動的かつ立体的な相互作用を予測するのには限界がありました。ESMCは、このような静的な比較分析を超えて、生物学的配列全体を多次元の連続的な埋め込み(Embedding)空間にマッピングすることで、タンパク質の進化的な文脈と構造的な潜在力を有機的に捉えます。これは、従来の比較生物学的手法が古い辞書で単語の意味を一つずつ照合するのに対し、ESMCは多数の小説から文脈を把握し、単語の多層的なニュアンスを一度に理解するのと似ています。このツールは、特にオープンウェイト(Open weight)形式で提供され、世界中の研究者が計算リソースや研究目的に合わせて、300Mから6Bパラメータまで、適切なサイズのモデルをローカル環境に柔軟に展開し、タンパク質言語表現のパフォーマンスを最大限に高めることができます。 生命工学分野の研究者は、新しい新薬の標的タンパク質に強力に結合する人工タンパク質バインダー(Binder)を発見する過程で、ESMCを主要な予測エンジンとして活用できます。例えば、特定の癌細胞の表面受容体の3次元バインディングインターフェース(Binding interface)の情報に基づいて、その受容体に特異的に結合できる候補のアミノ酸配列を設計し、それをESMCの言語モデル評価スコア(Likelihood score)でスクリーニングすることで、実際の合成実験を行う候補群の範囲を大幅に絞り込むことができます。また、構造生物学の研究のために、ESMFold2モデルと統合された構造予測パイプラインを連携させることで、配列情報入力後1秒以内に、原子レベル(All-atom resolution)の精密な3D立体構造を予測し、従来の実験室で数か月かかる結晶構造解析(X-ray crystallography)のプロセスを仮想空間で迅速に先行検証することができます。このような統合分析技術は、大規模な変異誘導ライブラリーのスクリーニング段階で有用に活用され、最終的には標的タンパク質の活性制御や耐性メカニズムの解明など、精密医療や次世代のバイオ医薬品設計分野の効率を数十倍以上に革新する基盤となります。
ESMC (EvolutionaryScale Cambrian)はいつ使いますか?
ESMCは、人類史上最も急激な進化が起こったカンブリア紀にちなんで名付けられた、次世代の生物学基盤モデルであり、2026年5月にチャン・ザッカーバーグ・バイオハブとエボリューショナリースケールによる共同研究チームによって発表されました。このモデルは、巨大なタンパク質宇宙の設計図を理解するために、地球上に存在する生物から収集された約28億個のアミノ酸配列データを学習しました。それは、あたかも人間が書いた数十億ページものテキストのようです。
📝 アップデートノート
まだアップデートノートはありません。
🧪 関連「生命のコード」
関連する「生命のコード」記事はまだありません。