← AI Tools
Bio AI初級

ESMFold2

Chan Zuckerberg Biohubが2026年5月に発表したESMFold2は、多数の配列アライメント(「Multiple Sequence Alignment」)を生成する必要なく、単一のアミノ酸配列情報のみからタンパク質の3D立体構造を正確に予測する最先端のバイオインフォマティクスモデルです。以前の世代のタンパク質フォールディング(「Folding」)モデルは、アミノ酸間の進化的な関連性と距離制約を計算するために、ギガバイト規模の巨大なデータベースから相同配列を検索し、アライメントする処理に数十分以上の時間を費やす必要がありました。

Chan Zuckerberg Biohubが2026年5月に発表したESMFold2は、多数の配列アラインメント(「Multiple Sequence Alignment」)を生成する必要なく、単一のアミノ酸配列情報のみからタンパク質の3D立体構造を正確に予測する最先端のバイオインフォマティクスモデルです。以前の世代のタンパク質フォールディング(「Folding」)モデルは、アミノ酸間の進化的な関連性と距離制約を計算するために、ギガバイト規模の巨大なデータベースから相同配列を検索し、アラインメントするプロセスに数十分以上の時間を費やす必要がありました。一方、このモデルは、タンパク質アミノ酸配列情報に内在する進化的な文脈と構造的パターンを深く学習した60億パラメータのタンパク質言語モデル(「Protein Language Model」)であるESMCを基盤として、複雑な前処理検索プロセスを完全にスキップし、数秒以内に正確な立体構造を復元します。これは、巨大言語モデルであるGPTが数億の文データセットを学習し、文脈的に最も自然な単語の流れを繋ぎ合わせるように、ESMFold2がタンパク質ドメイン内の残基配列の流れを認識し、自然界に存在しうるタンパク質の3D形態学的構造的妥当性(「Structural Plausibility」)をリアルタイムで推論する原理です。

従来広く使用されていたAlphaFoldのような手法は、個々のタンパク質構造を分析するために、数十台の高パフォーマンスコンピューターノードと膨大なデータベースディスクを稼働させ、長い時間を待つ必要があったため、リアルタイムのタンパク質デザイン研究や数万の変異体をスクリーニングする大規模ゲノム解析研究では、深刻な速度の限界に直面していました。ESMFold2は、このような高コストな配列アラインメントパイプラインに依存せず、単一配列フォールディング(「Single-Sequence Folding」)を通じて処理速度を劇的に短縮し、1秒あたり数十の配列を構造空間に変換できる圧倒的な効率性を保証します。また、高度な拡散モデル(「Diffusion Model」)デコーダーを構造生成部に搭載し、従来の単一配列モデルがしばしば経験する多ドメイン構造予測の限界を打ち破り、タンパク質複合体やウイルスキャプシドなどの高難度の構造物でも高いレベルの予測精度を維持します。

このような計算革新のおかげで、現代の生命工学研究者たちは、標的となる抗がん標的であるEGFRや、免疫チェックポイント阻害剤の主要な成分であるPD-L1などの疾患標的タンパク質に最適化された新規バイオバインダー(「Bio-binder」)や、一本鎖抗体可変領域(「scFv」)フラグメントを数日で設計し、実験室で即座に検証できる道が開かれました。さらに、従来の方法では構造解明が事実上不可能であった未知の進化系統に属する環境由来タンパク質のフォールディング形態を高速で解読できるため、新規酵素の開発や気候変動への対応のための生物学的資源の発見速度が数百倍に加速されています。要するに、ESMFold2は、単にタンパク質の3D立体座標を算出するツールを超えて、ゲノムシーケンスデータ全体を立体構造の世界に迅速に投影する強力な顕微鏡であり、分子エンジニアリングの重要な指標となっています。

💻 必要なスペック

🧠RAM

最小限の12GB(API推論時は不要)、ローカル実行にはNVIDIA GPU 24GB以上推奨(A100、RTX 3090/4090以降)

💾ストレージ

モデルの重みファイルのダウンロードと依存パッケージを含む、最小20GB以上の空き容量を推奨します。

⚡ インストール

4-1. クイックスタート

pip install esm@git+https://github.com/Biohub/esm.git@main

4-2. 詳細なインストール

# PyTorchと必須ビルドツールをインストールした後、ESM SDKのインストールを進めます。
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121
pip install esm@git+https://github.com/Biohub/esm.git@main

🧬 バイオ活用シナリオ

🔬

Dnovoミニバインダー設計

特定の治療標的タンパク質(例:EGFR、PD-L1)に特異的に結合する超小型結合タンパク質の3D相互作用構造を迅速にモデル化し、結合力の最適化シミュレーションを実行する

🧬

大規模ゲノム変異構造影響解析

一塩基多型(SNP)またはアミノ酸変異が、タンパク質の3次元立体構造およびリガンド結合ポケットに及ぼす影響を高速度でシミュレーションし、臨床変異情報の解釈に貢献する

💊

超高速タンパク質複合体スクリーニング

タンパク質-タンパク質相互作用(PPI)予測において、大量の候補パートナーライブラリをMSA探索なしで超短時間で処理し、大規模な構造相互作用マッピングを実現する

FAQ

ESMFold2とは何ですか?

Chan Zuckerberg Biohubが2026年5月に発表したESMFold2は、多数の配列アラインメント(「Multiple Sequence Alignment」)を生成する必要なく、単一のアミノ酸配列情報のみからタンパク質の3D立体構造を正確に予測する最先端のバイオインフォマティクスモデルです。以前の世代のタンパク質フォールディング(「Folding」)モデルは、アミノ酸間の進化的な関連性と距離制約を計算するために、ギガバイト規模の巨大なデータベースから相同配列を検索し、アラインメントするプロセスに数十分以上の時間を費やす必要がありました。一方、このモデルは、タンパク質アミノ酸配列情報に内在する進化的な文脈と構造的パターンを深く学習した60億パラメータのタンパク質言語モデル(「Protein Language Model」)であるESMCを基盤として、複雑な前処理検索プロセスを完全にスキップし、数秒以内に正確な立体構造を復元します。これは、巨大言語モデルであるGPTが数億の文データセットを学習し、文脈的に最も自然な単語の流れを繋ぎ合わせるように、ESMFold2がタンパク質ドメイン内の残基配列の流れを認識し、自然界に存在しうるタンパク質の3D形態学的構造的妥当性(「Structural Plausibility」)をリアルタイムで推論する原理です。 従来広く使用されていたAlphaFoldのような手法は、個々のタンパク質構造を分析するために、数十台の高パフォーマンスコンピューターノードと膨大なデータベースディスクを稼働させ、長い時間を待つ必要があったため、リアルタイムのタンパク質デザイン研究や数万の変異体をスクリーニングする大規模ゲノム解析研究では、深刻な速度の限界に直面していました。ESMFold2は、このような高コストな配列アラインメントパイプラインに依存せず、単一配列フォールディング(「Single-Sequence Folding」)を通じて処理速度を劇的に短縮し、1秒あたり数十の配列を構造空間に変換できる圧倒的な効率性を保証します。また、高度な拡散モデル(「Diffusion Model」)デコーダーを構造生成部に搭載し、従来の単一配列モデルがしばしば経験する多ドメイン構造予測の限界を打ち破り、タンパク質複合体やウイルスキャプシドなどの高難度の構造物でも高いレベルの予測精度を維持します。 このような計算革新のおかげで、現代の生命工学研究者たちは、標的となる抗がん標的であるEGFRや、免疫チェックポイント阻害剤の主要な成分であるPD-L1などの疾患標的タンパク質に最適化された新規バイオバインダー(「Bio-binder」)や、一本鎖抗体可変領域(「scFv」)フラグメントを数日で設計し、実験室で即座に検証できる道が開かれました。さらに、従来の方法では構造解明が事実上不可能であった未知の進化系統に属する環境由来タンパク質のフォールディング形態を高速で解読できるため、新規酵素の開発や気候変動への対応のための生物学的資源の発見速度が数百倍に加速されています。要するに、ESMFold2は、単にタンパク質の3D立体座標を算出するツールを超えて、ゲノムシーケンスデータ全体を立体構造の世界に迅速に投影する強力な顕微鏡であり、分子エンジニアリングの重要な指標となっています。

ESMFold2はいつ使いますか?

Chan Zuckerberg Biohubが2026年5月に発表したESMFold2は、多数の配列アライメント(「Multiple Sequence Alignment」)を生成する必要なく、単一のアミノ酸配列情報のみからタンパク質の3D立体構造を正確に予測する最先端のバイオインフォマティクスモデルです。以前の世代のタンパク質フォールディング(「Folding」)モデルは、アミノ酸間の進化的な関連性と距離制約を計算するために、ギガバイト規模の巨大なデータベースから相同配列を検索し、アライメントする処理に数十分以上の時間を費やす必要がありました。

ESMFold2のバイオ研究での活用例は何ですか?

Dnovoミニバインダー設計: 特定の治療標的タンパク質(例:EGFR、PD-L1)に特異的に結合する超小型結合タンパク質の3D相互作用構造を迅速にモデル化し、結合力の最適化シミュレーションを実行する

📄 公式ドキュメント🐙 GitHub

📝 アップデートノート

まだアップデートノートはありません。

🧪 関連「生命のコード」

関連する「生命のコード」記事はまだありません。

BioPlayground

閲覧・リンク・適法な引用は開放し、高速な一括収集と無断再配布は制限します。

別途表示がない限り、コンテンツの権利はBioPlaygroundまたは正当な権利者に帰属します。