PandaProbe
AIエージェントのライフサイクル管理を行うオープンソースのエンジニアリングプラットフォーム
PandaProbeは、Chirpz AIが2026年4月に公開したオープンソースのエージェントエンジニアリングプラットフォームであり、AIエージェントのライフサイクル全体を、セッション、トレース、スパンという3つの階層でキャプチャし、可視化するオブザーバビリティツールである。GPTやClaudeなどのLLMを活用したエージェントが、ツール呼び出し、サブエージェントの分岐、ユーザーとの対話を経て複雑な軌跡を生み出す際、PandaProbeはこれらの軌跡全体を1つのダッシュボードで追跡、評価、監視できるようにする。フロントエンドはNext.js、バックエンドはFastAPI、非同期タスク処理にはCelery + Redis、データ保存にはPostgreSQL 16を使用するマイクロサービスアーキテクチャで構成されている。
従来のLLMオブザーバビリティツールは、単一の呼び出し単位でのトークン数や遅延時間の測定に重点を置いているため、マルチターンエージェントで発生するループ、一貫性のないツールの使用、ユーザーとエージェント間の不協調など、軌跡レベルの失敗を捉えることができない。PandaProbeは、この問題を解決するために、自社の研究論文TRACER(Trajectory Risk Aggregation for Critical Episodes in Agentic Reasoning、arXiv:2602.11409)で提案された不確実性検出メトリックをプラットフォームに組み込んだ。TRACERは、コンテンツベースの驚き度(content-aware surprisal)、状況認識シグナル(situational-awareness signal)、意味・語彙の繰り返し追跡、ツールの整合性評価など、複数のシグナルをテールに焦点を当てたリスク集約(tail-focused risk aggregation)方式で組み合わせることで、τ²-benchベンチマークにおいて、既存のツールと比較して、最大37.1%のAUROC、最大55%のAUARCの改善を達成した。単純な心拍数測定器ではなく、心電図、血圧、酸素飽和度を同時に測定し、危険なエピソードを早期に発見する多重センサーモニタリングのように、PandaProbeはエージェントの「健康状態」を軌跡全体にわたって立体的に診断する。
生命工学の研究者の視点から見ると、PandaProbeは実験自動化エージェントパイプラインの品質管理に役立つ。例えば、LangGraphで構築されたマルチオミクス分析エージェントが、データの前処理、統計分析、可視化、レポートの生成まで、10段階以上のツールを呼び出す場合、各段階のLLMの判断プロセスとツール呼び出しの結果をセッション単位で記録し、スケジュールされた評価(scheduled eval)によって、本番環境のトラフィックにおける品質の低下を自動的に検出することができる。LangGraph、CrewAI、Claude Agent SDK、OpenAI Agents SDK、Google ADKなどの主要なフレームワークと、1行のコードを追加するだけで統合でき、セルフホスト(Docker Compose)とマネージドクラウド(無料のHobbyティアは月100トレースから)の両方をサポートするため、機密データを扱う研究環境でも、データの主権を維持しながら導入することができる。
💻 必要なスペック
不要(GPUを使用せず、CPU専用のウェブサービス)
DockerイメージとPostgreSQLのデータを含めて2〜5GB。トレースの蓄積に応じて増加。
⚡ インストール
4-1. 簡単な始め方(SDK — クラウドまたはセルフホストエンドポイントへの接続)
pip install "pandaprobe[openai,anthropic,gemini]"
export PANDAPROBE_API_KEY="your-api-key"
export PANDAPROBE_PROJECT_NAME="my-project"
import pandaprobe
from pandaprobe.openai import wrap_openai
from openai import OpenAI
client = wrap_openai(OpenAI())
# 以降は通常のOpenAI呼び出し — 自動的にトレースされます
4-2. セルフホスト(Docker Compose)
git clone https://github.com/chirpz-ai/pandaprobe.git
cd pandaprobe
./start.sh
# ダッシュボード: http://localhost:3000
# API: http://localhost:8000
🧬 バイオ活用シナリオ
🔬 マルチステップ実験エージェントの品質管理
LangGraphベースの分析エージェントが10ステップ以上のツールを呼び出す際、セッション単位で全体の軌跡を記録し、TRACERメトリックでループやツールの誤使用を自動的に検知。スケジュールされた評価を日次のcronで設定すると、本番トラフィックで品質の低下が発生した場合に即座に通知を受け取り、エージェントのバージョン間のパフォーマンスの変化を定量的に比較可能。
🧬 機密データ環境におけるエージェントの監査
患者データや未公開のオミクスデータを処理するエージェントに対して、Docker Composeによるセルフホストでデータの主権を維持。すべてのLLM呼び出し、ツール結果、エージェントの判断ログを内部PostgreSQLに保存し、コンプライアンス監査の際に軌跡レベルの証拠を提出可能。
🤖 マルチエージェントオーケストレーションのデバッグ
CrewAIまたはClaude Agent SDKで構成されたサブエージェントチェーンにおいて、不確実性の高い区間(クリティカルエピソード)を可視化。スパン単位で各サブエージェントのLLM応答の驚き度とツールの整合性を追跡し、LLM-as-judge評価で全体のセッションの正確性と有用性をスコアリングして、ボトルネック区間に集中して改善。
FAQ
PandaProbeとは何ですか?
PandaProbeは、Chirpz AIが2026年4月に公開したオープンソースのエージェントエンジニアリングプラットフォームであり、AIエージェントのライフサイクル全体を、セッション、トレース、スパンという3つの階層でキャプチャし、可視化するオブザーバビリティツールである。GPTやClaudeなどのLLMを活用したエージェントが、ツール呼び出し、サブエージェントの分岐、ユーザーとの対話を経て複雑な軌跡を生み出す際、PandaProbeはこれらの軌跡全体を1つのダッシュボードで追跡、評価、監視できるようにする。フロントエンドはNext.js、バックエンドはFastAPI、非同期タスク処理にはCelery + Redis、データ保存にはPostgreSQL 16を使用するマイクロサービスアーキテクチャで構成されている。 従来のLLMオブザーバビリティツールは、単一の呼び出し単位でのトークン数や遅延時間の測定に重点を置いているため、マルチターンエージェントで発生するループ、一貫性のないツールの使用、ユーザーとエージェント間の不協調など、軌跡レベルの失敗を捉えることができない。PandaProbeは、この問題を解決するために、自社の研究論文TRACER(Trajectory Risk Aggregation for Critical Episodes in Agentic Reasoning、arXiv:2602.11409)で提案された不確実性検出メトリックをプラットフォームに組み込んだ。TRACERは、コンテンツベースの驚き度(content-aware surprisal)、状況認識シグナル(situational-awareness signal)、意味・語彙の繰り返し追跡、ツールの整合性評価など、複数のシグナルをテールに焦点を当てたリスク集約(tail-focused risk aggregation)方式で組み合わせることで、τ²-benchベンチマークにおいて、既存のツールと比較して、最大37.1%のAUROC、最大55%のAUARCの改善を達成した。単純な心拍数測定器ではなく、心電図、血圧、酸素飽和度を同時に測定し、危険なエピソードを早期に発見する多重センサーモニタリングのように、PandaProbeはエージェントの「健康状態」を軌跡全体にわたって立体的に診断する。 生命工学の研究者の視点から見ると、PandaProbeは実験自動化エージェントパイプラインの品質管理に役立つ。例えば、LangGraphで構築されたマルチオミクス分析エージェントが、データの前処理、統計分析、可視化、レポートの生成まで、10段階以上のツールを呼び出す場合、各段階のLLMの判断プロセスとツール呼び出しの結果をセッション単位で記録し、スケジュールされた評価(scheduled eval)によって、本番環境のトラフィックにおける品質の低下を自動的に検出することができる。LangGraph、CrewAI、Claude Agent SDK、OpenAI Agents SDK、Google ADKなどの主要なフレームワークと、1行のコードを追加するだけで統合でき、セルフホスト(Docker Compose)とマネージドクラウド(無料のHobbyティアは月100トレースから)の両方をサポートするため、機密データを扱う研究環境でも、データの主権を維持しながら導入することができる。
PandaProbeはいつ使いますか?
AIエージェントのライフサイクル管理を行うオープンソースのエンジニアリングプラットフォーム
PandaProbeのバイオ研究での活用例は何ですか?
🔬 マルチステップ実験エージェントの品質管理: LangGraphベースの分析エージェントが10ステップ以上のツールを呼び出す際、セッション単位で全体の軌跡を記録し、TRACERメトリックでループやツールの誤使用を自動的に検知。スケジュールされた評価を日次のcronで設定すると、本番トラフィックで品質の低下が発生した場合に即座に通知を受け取り、エージェントのバージョン間のパフォーマンスの変化を定量的に比較可能。
📝 アップデートノート
まだアップデートノートはありません。
🧪 関連「生命のコード」
関連する「生命のコード」記事はまだありません。