AI Tools
マルチモーダル中級

OmniParser (OmniParser v2)

マイクロソフトリサーチが2025年2月に発表したOmniParser v2は、コンピューター画面のスクリーンショットを、機械が読み取れる構造化データに変換する汎用スクリーンパーシングツールです。従来の大型ビジョン言語モデル(Vision Language Model、VLM)が、コンピューター画面の画像だけを見てマウスのクリック座標を正確に計算できず、位置のずれという問題を抱えていたため、それを根本的に解決するために開発されました。大規模言語モデル(Large Language Model)が自然言語テキスト

マイクロソフトリサーチが2025年2月に発表したOmniParser v2は、コンピューター画面のスクリーンショットを、機械が読み取れる構造化データに変換する汎用スクリーンパーシングツールです。従来の大型ビジョン言語モデル(Vision Language Model、VLM)が、コンピューター画面の画像だけを見てマウスのクリック座標を正確に計算できず、位置のずれという問題を抱えていたのを根本的に解決するために開発されました。大規模言語モデル(Large Language Model)が自然言語テキストをトークンに分割して精密に処理するように、OmniParser v2は、画面内のすべてのグラフィック要素を、幾何学的座標と機能の説明がマッピングされた独立した視覚的トークンに分割して処理します。内部的には、画面上のすべてのインタラクティブなオブジェクトを検出するオブジェクト検出モデルと、検出されたアイコンの役割を自然言語で説明するアイコンキャプショニングモデルを、二段階構造(Dual-stage Architecture)で統合し、完璧な画面解読能力を実現し、それにより、さまざまなオペレーティングシステムのインターフェースにおけるエージェントの誤動作率を劇的に低下させました。

従来のスクリーン制御方式は、主にアプリケーション内部のソースコードやウェブブラウザのドキュメントオブジェクトモデル(Document Object Model、DOM)ツリーに完全に依存していたため、ソースコードが隠蔽されたクローズドなソフトウェアやモバイルアプリ、仮想マシン環境では、自動化シナリオを設計することがほぼ不可能でした。一方、OmniParser v2は、個別の内部システムAPIやコードソースのサポートなしに、画面のピクセル値のみに基づいて、ボタン、入力ウィンドウ、チェックボックスなどの位置をミリ秒単位で把握します。このツールは、視覚的オブジェクトの境界ボックス(Bounding Box)検出技術を最大限に活用し、解像度の変化やウィンドウのサイズ変更などの環境変数にも歪みなくリアルタイムで対応します。特に、アイコンの視覚的形状を把握した後、詳細な機能の説明をテキストで補完することで、ビジョン言語モデルがマウスのクリック領域を外れないように完全に誘導し、ウェブサイトが改修されたり、UIレイアウトが変更されたりしても、視覚的特徴のみで要素を捉え、中断のない自動化を継続します。

実際の生命工学研究現場では、遺伝子配列の解析やタンパク質構造の可視化の過程で、ウェブブラウザとローカルのレガシー分析プログラムを同時に操作する必要があり、煩雑なGUIの繰り返し作業が頻繁に発生します。OmniParser v2を、Windows 11制御用のツールスイートであるOmniToolと高性能視覚モデルと連携させると、タンパク質構造設計の自動化パイプラインを構築できます。たとえば、1920x1080のサイズの分析プログラム画面のスクリーンショットを、YOLOv9-Eベースの検出器に送信すると、画面上の数十個の微細なタンパク質レンダリングオプションボタンが、平均1〜2秒以内に検出されます。その後、検出されたターゲットのクリックポイントデータに基づいて、自動化エージェントがタンパク質データベース(RCSB PDB)から標的タンパク質を自動的に検索および選択し、ダウンロードされた分子ドッキングデータファイルを開いて、特定の活性部位(Active Site)を占有するマウス操作を、間違いなく定量的に実行することで、研究者のデータ取得時間と分析の生産性を最大化します。

💻 必要なスペック

🧠RAM

NVIDIA GPU 8GB以上推奨(YOLOv9-EおよびFlorence-2モデルのローカル推論時に必須、RTX 3060以上推奨)、CPU使用時は単一スクリーンショット処理に約10〜60秒かかる

💾ストレージ

約 2GB(モデルチェックポイントを含む全体パッケージのインストール用)

インストール

4-1. クイックスタート

git clone https://github.com/microsoft/OmniParser.git cd OmniParser conda create -n "omni" python==3.12 -y && conda activate omni pip install -r requirements.txt

4-2. 詳細なインストール

YOLOv9-E 検出器の重みダウンロード(Hugging Face PR #37 を反映)

huggingface-cli download microsoft/OmniParser-v2.0 icon_detect_v3/model.pt --revision refs/pr/37 --local-dir weights

Florence-2 キャプション重みのダウンロードとフォルダ整理

for f in icon_caption/{config.json,generation_config.json,model.safetensors}; do
huggingface-cli download microsoft/OmniParser-v2.0 "$f" --local-dir weights;
done mv weights/icon_caption weights/icon_caption_florence

Gradio デモの実行により、Web インターフェースで視覚化動作をテストする

python gradio_demo.py

🧬 バイオ活用シナリオ

🔬

🔬 WebベースのPDB分子検索および分析の自動化

OmniParser v2(YOLOv9-E)+ Claude 3.5 Sonnetの組み合わせにより、RCSB PDBウェブサイトで特定の標的タンパク質IDを入力し、3Dビューアを操作するプロセスを100%視覚的に追跡し、5秒以内に活性部位(Active Site)情報を抽出およびキャプチャするプロセスを自動化 → バーチャルスクリーニングパイプラインの前処理を高速化

🧬

🧬 大規模な配列アライメントツールClustalWのGUI自動制御

ローカルの遺伝子解析プログラム(BioEdit)の画面で、OmniParser v2(1920x1080)とWindows VM制御ツールキット(OmniTool)を組み合わせて、200件の配列をロードし、パラメータを設定(Gap Open Penalty = 10.0)、実行ボタンをクリックするまでの一連の視覚ベースのマウスイベントを、誤差範囲2ピクセル以内に完全に自動化 → 配列分析における研究者の手作業を90%以上削減

💊

🏥 臨床試験の患者マッチング用EMRシステムの自律検索

ウェブEMRソリューションの複雑なタブUI環境で、OmniParser v2のアイコンキャプショニング(Florence-2)機能を利用して、「患者記録の照会」ボタンと「検索フィールド」を誤認することなく正確に識別(クリック精度95%以上)、患者の疾患コードおよびバイオマーカー情報を自動入力し、マッチングを進める → 精密臨床マッチング産業におけるデータ収集の自動化に貢献

FAQ

OmniParser (OmniParser v2)とは何ですか?

マイクロソフトリサーチが2025年2月に発表したOmniParser v2は、コンピューター画面のスクリーンショットを、機械が読み取れる構造化データに変換する汎用スクリーンパーシングツールです。従来の大型ビジョン言語モデル(Vision Language Model、VLM)が、コンピューター画面の画像だけを見てマウスのクリック座標を正確に計算できず、位置のずれという問題を抱えていたのを根本的に解決するために開発されました。大規模言語モデル(Large Language Model)が自然言語テキストをトークンに分割して精密に処理するように、OmniParser v2は、画面内のすべてのグラフィック要素を、幾何学的座標と機能の説明がマッピングされた独立した視覚的トークンに分割して処理します。内部的には、画面上のすべてのインタラクティブなオブジェクトを検出するオブジェクト検出モデルと、検出されたアイコンの役割を自然言語で説明するアイコンキャプショニングモデルを、二段階構造(Dual-stage Architecture)で統合し、完璧な画面解読能力を実現し、それにより、さまざまなオペレーティングシステムのインターフェースにおけるエージェントの誤動作率を劇的に低下させました。 従来のスクリーン制御方式は、主にアプリケーション内部のソースコードやウェブブラウザのドキュメントオブジェクトモデル(Document Object Model、DOM)ツリーに完全に依存していたため、ソースコードが隠蔽されたクローズドなソフトウェアやモバイルアプリ、仮想マシン環境では、自動化シナリオを設計することがほぼ不可能でした。一方、OmniParser v2は、個別の内部システムAPIやコードソースのサポートなしに、画面のピクセル値のみに基づいて、ボタン、入力ウィンドウ、チェックボックスなどの位置をミリ秒単位で把握します。このツールは、視覚的オブジェクトの境界ボックス(Bounding Box)検出技術を最大限に活用し、解像度の変化やウィンドウのサイズ変更などの環境変数にも歪みなくリアルタイムで対応します。特に、アイコンの視覚的形状を把握した後、詳細な機能の説明をテキストで補完することで、ビジョン言語モデルがマウスのクリック領域を外れないように完全に誘導し、ウェブサイトが改修されたり、UIレイアウトが変更されたりしても、視覚的特徴のみで要素を捉え、中断のない自動化を継続します。 実際の生命工学研究現場では、遺伝子配列の解析やタンパク質構造の可視化の過程で、ウェブブラウザとローカルのレガシー分析プログラムを同時に操作する必要があり、煩雑なGUIの繰り返し作業が頻繁に発生します。OmniParser v2を、Windows 11制御用のツールスイートであるOmniToolと高性能視覚モデルと連携させると、タンパク質構造設計の自動化パイプラインを構築できます。たとえば、1920x1080のサイズの分析プログラム画面のスクリーンショットを、YOLOv9-Eベースの検出器に送信すると、画面上の数十個の微細なタンパク質レンダリングオプションボタンが、平均1〜2秒以内に検出されます。その後、検出されたターゲットのクリックポイントデータに基づいて、自動化エージェントがタンパク質データベース(RCSB PDB)から標的タンパク質を自動的に検索および選択し、ダウンロードされた分子ドッキングデータファイルを開いて、特定の活性部位(Active Site)を占有するマウス操作を、間違いなく定量的に実行することで、研究者のデータ取得時間と分析の生産性を最大化します。

OmniParser (OmniParser v2)はいつ使いますか?

マイクロソフトリサーチが2025年2月に発表したOmniParser v2は、コンピューター画面のスクリーンショットを、機械が読み取れる構造化データに変換する汎用スクリーンパーシングツールです。従来の大型ビジョン言語モデル(Vision Language Model、VLM)が、コンピューター画面の画像だけを見てマウスのクリック座標を正確に計算できず、位置のずれという問題を抱えていたため、それを根本的に解決するために開発されました。大規模言語モデル(Large Language Model)が自然言語テキスト

OmniParser (OmniParser v2)のバイオ研究での活用例は何ですか?

🔬 WebベースのPDB分子検索および分析の自動化: OmniParser v2(YOLOv9-E)+ Claude 3.5 Sonnetの組み合わせにより、RCSB PDBウェブサイトで特定の標的タンパク質IDを入力し、3Dビューアを操作するプロセスを100%視覚的に追跡し、5秒以内に活性部位(Active Site)情報を抽出およびキャプチャするプロセスを自動化 → バーチャルスクリーニングパイプラインの前処理を高速化

📄 公式ドキュメント🐙 GitHub

📝 アップデートノート

まだアップデートノートはありません。

🧪 関連「生命のコード」

関連する「生命のコード」記事はまだありません。