10月5日、New Relicが「AI Agent Observability: The 8 Best Tools for Production Agents」と題した記事を公開した。この記事では、本番環境で動くAIエージェントの可観測性を確保するための主要ツール8種を、トレーシング・品質評価・既存スタックとの統合という観点から比較・整理している。
なぜ今、AIエージェントの可観測性が問題になるのか
デモでは正常に動いていたAIエージェントが、本番投入後にツールコールで停止したり、ハルシネーションを起こしたり、2つのステップ間をループして10分間トークンを浪費したりする――しかし誰もその原因を説明できない。
この問題の本質は、LangGraph、CrewAI、AutoGen、OpenAI Agents SDKといったフレームワークが生み出すシステムの非決定性にある。同じ入力でも実行ごとに異なるパスをたどるため、「リクエストとレスポンス」のパターンを前提に設計された従来の監視ツールでは対応できない。可視化すべき対象は、HTTPステータスコードではなくトレース・ツールコール・モデルの挙動だ。
記事では、この可視性の欠如を埋めるツールを選ぶ前に「どの運用上の問題を解決したいのか」を明確にすることを推奨している。基本的な実行トレーシング(どのツールコールが発火したか、どこでレイテンシが積み上がったか)が必要なチームもあれば、出力品質の劣化やハルシネーションの検出が課題のチームもある。
ツール選定の4つの評価軸
記事が各ツールを評価した基準は以下の4点だ。
- マルチエージェントワークフロー全体のトレース・スパンの深さ(単一LLMコールだけでなく)
- 評価と品質スコアリング(ハルシネーション・バイアス検出を含む)
- 既存テレメトリとの統合(APM、インフラ、ログ)
- デプロイモデル(セルフホスティング・VPCデプロイの可否)
8ツールの概要
New Relic
APM・インフラ・ログの可観測性プラットフォームにAIエージェント監視を統合。エージェントのトレースが独立したツールではなく、既存のテレメトリと同一画面に表示される。LangGraph、Strands、AutoGenをサポートし、OpenTelemetryのGenAIセマンティック規約にマップされたデータも受け付ける。Agents Service Mapでマルチエージェント間のハンドオフをリアルタイムに可視化できる点が特徴。トレードオフ:フレームワークカバレッジは拡張中のため、利用前に自分のフレームワークがサポートリストに含まれているか確認が必要。
Datadog
New Relicと同様にAPM・インフラ・リアルユーザーモニタリングとエージェントトレーシングを統合。OpenAI、Anthropic、Gemini、BedrockのほかLangChain、CrewAI、Pydantic等をサポート。ツール・エージェント・エンベディング・リトリーバルのスパンは無料で含まれる。トレードオフ:プラットフォーム全体のコストが高く、費用の予測が難しいという評判がある。
Langfuse
MITライセンスのオープンソースコアを持つ、フレームワーク非依存のテレメトリプラットフォーム。自社VPCへのセルフホスティングが可能で、データの完全な所有権を重視するチーム向け。LLM-as-a-judge、ヒューリスティック評価、人間レビューによる出力スコアリングを備える。100以上のモデルプロバイダー・フレームワークに対応したプロンプト管理機能もある。トレードオフ:APM・インフラテレメトリとの相関はない。
LangSmith
LangChain・LangGraphを開発したチームが作ったネイティブ可観測性プラットフォーム。同一チームが開発しているため、LangChainフレームワークとの統合が最もスムーズ。専用トレースデータベース「SmithDB」で数百万トレースの高速クエリを実現。トレードオフ:セルフホスティングの詳細はティアによって異なるため要確認。APM・インフラテレメトリとの相関はない。
Arize(Phoenix / AX)
LLMエージェント以前からMLの埋め込みやモデルドリフトの監視を手がけてきたプラットフォーム。Observe(トレーシング)・Evaluate(スコアリング)・Learn(デプロイ前テスト)の3機能を持つ。オープンソース版のPhoenixはElastic License 2.0(MITやApacheより制限が多い)のため、ライセンス条件の確認が必要。
Braintrust
評価ファーストの設計思想を持つプラットフォーム。本番トレースをワンクリックで評価データセットに変換し、実際のユーザー失敗事例に対してリグレッションテストを実施できる。プロンプトやモデルの比較実験が中心機能。トレードオフ:インフラ・APMテレメトリとの相関は薄い。
Comet(Opik)
MLの実験追跡を起点にAIエージェントワークフローへ拡張したプラットフォーム。Apache 2.0ライセンスのオープンソースで、30以上のメトリクスによる出力スコアリングと、6種のアルゴリズムを持つPrompt Optimizerが特徴。セルフホスト可能。トレードオフ:エージェント可観測性分野での認知度はLangfuseやLangSmithより低い。
Confident AI
DeepEvalというオープンソースのLLMテストフレームワークの上に構築されたプラットフォーム。CI/CDパイプラインへの評価組み込みを重視し、OWASPのAIエージェント向けTop 10に準拠したレッドチーミング(プロンプトインジェクション等の攻撃テスト)にも対応。トレードオフ:常時監視ダッシュボードよりテスト・CI主軸の設計のため、本番での行動可視化が主目的のチームには向かない。
評価精度の現実:LLM-as-a-judgeの落とし穴
記事が引用しているGalileoの2026年 AI評価レポートによれば、チューニングなしのLLMジャッジが人間の専門家と一致する割合は**66〜68%**にとどまる。マルチジャッジのコンセンサス、キャリブレーション、ファインチューニングといった手法を組み合わせることでこのギャップは大幅に縮まるという。専用の評価レイヤーを持つ意義はここにある。
また、PagerDutyの2026年 AI-First Operations調査では、回答者の**51%**が「複数ツールを単一プラットフォームに統合することで運用のレジリエンスが向上する」と回答している。エージェントトレースが既存のAPMやログと切り離された別ツールに存在する場合、インシデント時の根本原因分析がタイムスタンプの手動突き合わせ作業になりかねない。
どちらを選ぶか:プラットフォーム拡張 vs. 専用評価ツール
記事の結論はシンプルだ。すでにフルスタックの可観測性プラットフォームを運用していて「エージェントが何をしているか見えない」という問題を抱えるチームは、そのプラットフォームを拡張する方が現実的。一方、プロンプト品質の継続的評価やレッドチーミングを大規模に行う必要があるチームは、既存の可観測性ツールに加えてAIネイティブな評価プラットフォームを組み合わせる構成が有効だ。
詳細はAI Agent Observability: The 8 Best Tools for Production Agentsを参照していただきたい。