2026年版 AIエージェントのオブザーバビリティツール ベスト13:本番エージェントのトレース、評価、監視

きれいな最終回答の裏に隠れた誤ったツール呼び出しを、検査用レンズで浮かび上がらせるAIエージェントのオブザーバビリティのイメージ

Turn this article into takeaways for your work.

Each assistant summarizes the article only for you and suggests best practices for your work.

2026年8月更新。エージェントをLangChainまたはLangGraphで動かしているなら、LangSmithとLangfuseが最も広くカバーしており、無料でセルフホストしたい場合はLangfuseが適しています。すでに監視しているAPMやインフラのデータと並べてエージェントのトレースを見たいなら、Datadog Agent Observabilityがそのために作られています。そして、本当に必要なのがダッシュボードではなくevaluationであるなら、問題が起きてからグラフを眺めるのではなく、エージェントの挙動を体系的にテストするBraintrust、Galileo、Maxim AIが優れています。本ガイドでは、すでにツールを呼び出し、自律的に複数ステップの行動を取るエージェントを、段階的なロールアウトの途中ではなくその先の段階で、トレース、評価、監視するために作られた13ツールを比較します。

以下の各ツールは、2026年8月時点で各社の料金ページと照合しており(ベンダーが料金を公開していない場合はその旨を記載しています)、本番運用で実際に差が出る4点で評価しています。ツール呼び出しをすべてトレースするのか、それとも最終回答だけなのか。OpenTelemetryに対応しているのか、それとも独自SDKに縛られるのか。スケジュールに沿ってエージェントを評価するのか、それともダッシュボードを表示するだけなのか。そしてエージェントのトレース量が増えたとき、請求額がどう増えるのか。このカテゴリは取り込み量で課金されるため、予想外の請求の多くはここから生じます。

重要なポイント

  • AIオブザーバビリティを何らかの形で導入している組織は89%に上りますが、テストセットに対するオフライン評価を実施しているのは52.4%、本番トラフィックに対するオンライン評価を実施しているのはわずか37.3%です。エージェントを見ることと、実際にテストすることの間にあるギャップです。出典はLangChainのState of Agent Engineering調査(実務者1,340人が対象、2025年11月18日から12月2日に実施)です。
  • 本番稼働中のエージェントに限ると、94%が何らかのオブザーバビリティを備えていますが、個々のステップとツール呼び出しをトレースしているのは71.5%にとどまり、残りは粗い入出力ログしか見られていません。出典は同じLangChainの調査です。
  • エージェントを評価しているチームのうち、53.3%がLLM-as-judgeの手法を使い、59.8%は依然として人によるレビューに頼っており、両方を併用するケースも多くあります。出典はLangChainのレポートです。
  • Gartnerは、agentic AIプロジェクトの40%以上が2027年末までに中止されると予測しており、主な原因はモデルの品質ではなく、事業価値の不明確さとリスク管理の不備だとしています。
  • 自律型エージェントについて成熟したガバナンスモデルを持つ組織は21%にとどまる一方、大半は2年以内にエージェントの活用を拡大する計画です。出典はDeloitteのState of AI in the Enterpriseレポートです。
  • MITのNANDAイニシアチブは、2025年に企業の生成AIパイロットの95%が測定可能な財務リターンを生み出せなかったと報告しています。研究者はこのギャップを、モデルの品質ではなく運用上の規律の欠如に結びつけています。2025年8月にFortuneが報じました。

比較早見表

ツール 最適な用途 開始価格 主な強み 主な制約
LangSmith すでにLangChainまたはLangGraphで開発しているチーム 無料(1シート)、Plusは$39/seat/mo 深いネイティブトレースに加え、後で移行する場合にも使える本物のOTLPエンドポイント データセットとevalのUXが、LangChain型のアプリを前提にしている
Langfuse ロックインなしで無料でセルフホストしたいチーム 無料(セルフホスト)、Cloudは$29/moから 完全なオープンソースで、全プランでOpenTelemetryネイティブ 複数年のデータ保持が必要になるとCloud Proは$199/moに跳ね上がる
Arize (Phoenix and AX) まずオープンソース、後でエンタープライズに移行したいチーム 無料(Phoenix、セルフホスト)、AXは$50/moから OpenInference/OTelネイティブで、有料の入門プランでもevalsは無制限 商用のAX製品自体をセルフホストするにはEnterpriseが必要
Datadog Agent Observability すでにDatadog APMを利用しているチーム 40Kスパン/月まで無料、Proは$160/mo エージェントのトレースが、すでに監視しているAPMやインフラのデータと並ぶ SaaSのみで、どのプランでもセルフホストは不可
Braintrust evaluationとCIで制御するリリースを軸にしたいチーム 無料、Proは$249/mo テストしてから出荷するワークフローを軸にしたLLM-as-judgeとカスタムスコアラー オンプレミスまたはホスト型プライベート環境にはEnterpriseが必要
W&B Weave MLの実験管理にすでにWeights and Biasesを使っているチーム 無料、Proは$60/moから W&Bで実行を追跡しているMLチームにとって使い慣れた環境 OpenTelemetry対応が、自社の料金ページやドキュメントに記載されていない
Comet Opik 予算を抑えつつ、本格的な有料プランも使いたいチーム 無料(オープンソースまたはクラウド)、Proは$19/mo 最安の有料プランでもOpenTelemetryに完全対応し、LLM-as-judgeも利用可能 多くの構成で、LangSmithやLangfuseより認知度が低い
Helicone とにかく最速でセットアップしたいチーム 無料、Proは$79/mo プロキシを1行差し替えるだけで導入でき、Sessionsが呼び出しをまとめてエージェントのトレース全体にする ネイティブのevaluationとLLM-as-judgeの機能が、専門ツールに比べて薄い
HoneyHive OpenTelemetryの自動計装がすぐ使えるツールを求めるチーム 無料、Enterpriseは要見積もり 50以上のライブラリを自動計装し、無料プランでもオンラインとオフラインのevalsに対応 FreeとEnterpriseの間に、公開されたセルフサーブのプランがない
Galileo 専用に作られたジャッジモデルを求めるエンタープライズチーム 無料、Proは$100/mo(年払い) Lunaエバリュエーターファミリーに加え、エンタープライズプランではリアルタイムのguardrailsを提供 OpenTelemetry対応と中間プランの料金詳細が、どちらも公開情報では乏しい
Pydantic Logfire すべてを1つのOTelバックエンドにまとめたい多言語チーム 無料、Teamは$49/mo Python、Go、Java、JS、Rustにわたって明示的にOpenTelemetryネイティブ まず汎用のオブザーバビリティ基盤であり、エージェントのevals専用ではない
Traceloop (OpenLLMetry) ダッシュボードだけでなく計装レイヤーそのものを求めるチーム 無料(OpenLLMetry SDK)、Traceloopは50Kスパン/月まで無料 最初からOpenTelemetryネイティブで、SDKはApache-2.0ライセンス 無料プランのデータ保持期間が24時間しかない
Maxim AI ローンチ前にエージェントの会話をシミュレーションしたいチーム 無料、Professionalは$29/seat/mo シミュレーション実行で、顧客に届く前にマルチターンのエージェントの挙動をテストできる チームが数人を超えると、シート単位の料金が急速に膨らむ

「エージェントのオブザーバビリティ」が実際に意味すること

AIエージェントは、目視で確認できる1つの出力を生成するわけではありません。コンテキストを読み、行動を決め、ツールを呼び出し、返ってきた結果を読み、再び判断します。これを5回繰り返すこともあれば、50回繰り返すこともあります。AIエージェントのオブザーバビリティとは、最終回答だけでなく、このループ全体を計装することを意味します。そのため、データパイプラインや、複数ステップの意思決定の連鎖に触れない単発のモデル呼び出しの監視まで含む一般的なAIオブザーバビリティよりも、対象の狭い仕事になります。また、自社が運用しているものにこの話がどこまで当てはまるのかは、率直に見極める必要があります。Menlo Venturesは、本番環境で現在「AIエージェント」と呼ばれているもののうち、自ら計画し、観察し、適応するものは16%にすぎないことを、State of Generative AI in the Enterpriseレポートで明らかにしました。残りの大半は、エージェントの看板を掲げた固定手順のワークフローです。固定ワークフローにトレースツールはほとんど必要ありません。次の一手を自分で決めるシステムには必要です。

エージェントのループを1つのトレースレンズで開いて見せた、AIエージェントのオブザーバビリティとは何かを示すイメージ

この区別が、このリストのどのツールでもまず確認すべき点です。すべてのツール呼び出しと返ってきた結果を見せてくれるのか、それとも入力されたプロンプトと出力された回答だけなのか。サポートエージェントが誤った注文IDで返金APIを呼び出し、その後も何食わぬ顔で丁寧に謝罪したとしても、出力だけのログでは問題なく見えます。実際に何が起きたかを捉えられるのは、ステップ単位のトレースだけです。

本ガイドは、エージェントそのものを扱うものでもありません。まだエージェントのプラットフォームやフレームワークを選んでいない場合は、2026年版 AIエージェントプラットフォーム ベストから、コード中心の道を選ぶならオープンソースAIエージェントフレームワーク ベストから始めてください。本ガイドが扱うのは、そのエージェントが稼働した後に追加するものです。また、2026年版 AIツール ベストで見つかる製品とも別物です。AIツールは人間の1つの作業を支援するため、入力と出力が1つずつあり、手作業で確認できます。エージェントは、誰も1行ずつレビューしない一連のステップをまたいで動きます。そのため、書き起こしではなくトレースが必要になるのです。

とはいえ、より大きな問題はどのツールを買うかではありません。多くのチームが監視で止まってしまうことです。何らかのAIオブザーバビリティを導入している組織は89%ですが、オフライン評価を実施しているのは52.4%、本番トラフィックでオンライン評価を実施しているのは37.3%にとどまります(前述のLangChainの調査による)。ダッシュボードを見ても、エージェントが動いていることは分かりますが、正しいかどうかは分かりません。それに答えるのがevaluationであり、多くのチームが飛ばしてしまう工程です。だからこそ、後付けの「監視」に含めるのではなく、以下で独立した購入基準として扱っています。

2026年版 AIエージェントのオブザーバビリティツールの選び方

多くのチームは、フレームワークのドキュメントが勧めるツールをそのまま選びます。LangChainで構築したならLangSmith、Pydantic AIで構築したならLogfireといった具合です。しかし、今後2年間のエージェントの運用方法に本当に合うかどうかは確認していません。候補を絞る前に、次の6つの質問に答えてください。

エージェントのトレースが6つの診断ステーションを通過する、オブザーバビリティ選定前の6つの質問を示すイメージ

  1. すべてのツール呼び出しをトレースするのか、それとも最終回答だけなのか。 ステップ単位のフルトレースなら、正しいツールを誤ったパラメータで呼び出したエージェントや、失敗したステップを繰り返した末に諦めたエージェントを捉えられます。出力だけのログでは、どちらも見逃します。
  2. OpenTelemetryに対応しているのか、それとも独自SDKに縛られるのか。 標準のOTLPトレースを取り込み、OpenTelemetry GenAIのセマンティック規約(gen_ai.*属性セット)にマッピングできるツールなら、コードを再計装することなく後からバックエンドを入れ替えられます。独自SDK専用のツールは、導入時は安く済みますが、乗り換えるときに高くつきます。
  3. 実際にevaluationを実行するのか、それともダッシュボードを眺めるだけなのか。 最初のインシデントの後ではなく、購入する前に決めてください。オフライン評価は、変更を出荷する前に固定のテストセットを実行します。オンライン評価は、出荷後に本番トラフィックをスコアリングします。ほとんどのチームは最終的に両方が必要になりますが、どちらもない状態から始めます。どちらのモードも前提とするテストセットの作り方は、AIエージェントの評価とテストの方法で解説しています。
  4. LLM-as-judgeにリリースの可否判断を任せられるか。 LangChainの調査によると、evaluationを実施しているチームの53.3%がLLM-as-judgeの手法を使っています。しかし、あるモデルが別のモデルの成果物を採点する以上、人がレビューしたルーブリックと定期的な抜き取り確認は依然として必要で、返ってきたスコアを鵜呑みにしてはいけません。
  5. コンプライアンスやデータレジデンシーのためにセルフホストが必須か。 エージェントのトレースに顧客の個人情報、健康データ、その他VPCの外に出せない情報が含まれる可能性があるなら、トレース機能がどれほど優れていても、SaaS専用のツールは即座に候補から外れます。
  6. トレース量が増えると、請求額はどう増えるのか。 このカテゴリはシートではなく取り込み量(スパン、トレース、イベント、ログ)で課金されます。そのため、エージェントが1日に数十回ではなく数千回動くようになると、「無料」のパイロットはすぐに高額になりかねません。

トレースの粒度とOpenTelemetry対応

ツール すべてのツール呼び出しをトレース OpenTelemetry対応 セルフホストの選択肢
LangSmith はい、実行ツリー全体 はい、GenAIセマンティック規約へのマッピングに対応したOTLPエンドポイント Enterpriseのみ
Langfuse はい、トレースとスパンのツリー全体 はい、全プランでネイティブ対応 はい、無料(オープンソース)
Arize (Phoenix and AX) はい、OpenInference経由のスパン単位 はい、OpenTelemetry上に構築 Phoenixは可能(無料)、AXはEnterpriseのみ
Datadog Agent Observability はい、プロンプト、検索、ツール呼び出し、判断 はい、各言語でOTelに完全対応 不可
Braintrust はい、トレース内のスパン はい、記載のあるOTel連携経由 Enterpriseのみ
W&B Weave はい、操作単位のトレース 公開情報に記載なし Personalプランのみ(1ユーザー、ローカル)
Comet Opik はい、スパン単位 はい、全プランでネイティブ対応 はい、無料(オープンソース)
Helicone はい、Sessions経由(ツール呼び出し、ベクトルクエリ) 部分的、OpenLLMetryの非同期連携経由 Enterpriseのみ
HoneyHive はい、自動計装 はい、PythonとTypeScriptのネイティブSDK Enterprise(セルフホスト、ハイブリッド、シングルテナント)
Galileo はい、エージェントグラフのトレース 公開情報に記載なし Enterprise(ホスト型、VPC、オンプレミス)
Pydantic Logfire はい、計装した場合(汎用のOTelスパン) はい、明示的にOTelネイティブで多言語対応 Enterprise(セルフホストの選択肢)
Traceloop (OpenLLMetry) はい、設計上そのとおり はい、これが製品の中核 Enterprise(エアギャップ環境を含むオンプレミス)
Maxim AI 部分的、ログベースで、シミュレーションでステップの詳細が加わる 公開情報に記載なし Enterprise(VPC内)

評価アプローチ

ツール オフライン評価 オンライン評価 LLM-as-judge
LangSmith はい、全プラン はい、全プラン はい、チューニング済みエバリュエーターは公開ベータ
Langfuse はい、全プラン はい、全プラン はい、全プラン
Arize (Phoenix and AX) はい、データセットベース はい、本番のトレースとスパンに対して はい、Enterpriseでは「agent as a judge」も利用可能
Datadog Agent Observability はい、本番トレースから作成したデータセット はい、組み込みとカスタムのエバリュエーター はい
Braintrust はい、実験 はい、サンプリングとスコア経由 はい、カスタムのコードスコアラーも利用可能
W&B Weave はい はい、本番モニタリング はい、「LLM-as-a-judge」指標
Comet Opik はい、テストスイートとデータセット はい はい、全プラン
Helicone 限定的 限定的 中核機能ではない
HoneyHive はい はい、サンプリング対応 はい、またはコードベースのスコアリング
Galileo はい、無料プランでも無制限 はい はい、Lunaエバリュエーターファミリー
Pydantic Logfire 限定的(汎用プラットフォーム) 限定的 中核機能ではない
Traceloop (OpenLLMetry) はい、両プランにEvaluation Dashboardあり 公開情報に詳細なし 公開情報に詳細なし
Maxim AI はい、シミュレーション実行も可能 はい、Professionalプラン以上 はい、「evaluator store」経由

料金モデルと無料プランの取り込み量

ツール 課金単位 無料プランの取り込み量 最安の有料プラン
LangSmith トレース、それを超える分はコンピュートとストレージの単位 5,000トレース/月 $39/seat/mo
Langfuse 「ユニット」(オブザベーション) 50,000ユニット/月 $29/mo
Arize AX スパン 25,000スパン/月 $50/mo
Datadog Agent Observability LLM呼び出しのスパンのみ 40,000スパン/月 $160/mo
Braintrust 処理データ、スコア、モデルクレジット 10,000スコア/月 $249/mo
W&B Weave 取り込んだWeaveデータのGB数 1 GB/月 $60/mo
Comet Opik スパン 25,000スパン/月 $19/mo
Helicone リクエスト 10,000リクエスト/月 $79/mo
HoneyHive イベント 10,000イベント/月 Enterprise(要見積もり)
Galileo トレース 5,000トレース/月 $100/mo(年払い)
Pydantic Logfire レコード(ログ、スパン、メトリクスの合計) 10,000,000レコード/月 $49/mo
Traceloop (OpenLLMetry) スパン 50,000スパン/月 Enterprise(要見積もり)
Maxim AI ログ 10,000ログ/月 $29/seat/mo

1. LangSmith:LangChainとLangGraphのチームに最も深いトレース

LangSmithはLangChain自身のオブザーバビリティと評価のプラットフォームです。すでにLangChainまたはLangGraphで開発しているなら、セットアップの手間がほとんどかからないことにそれが表れています。環境変数でトレースが有効になり、すべてのチェーン、ツール呼び出し、リトライが完全な実行ツリー上の実行として表示されます。あまり知られていませんが、LangSmithはLangChainのトラフィック専用に縛られているわけではありません。本物のOTLPエンドポイントを公開し、標準のOpenTelemetry GenAI属性(gen_ai.system、gen_ai.prompt、gen_ai.completionなどのフィールド)を自社のスキーマにマッピングするため、混在した構成のチームでもすべてを1か所に送れます。

evaluationは後付けではなく最初から組み込まれています。オンラインとオフラインのevals、データセットの作成、人によるアノテーションキューは全プランで利用でき、チューニング済みのエバリュエーターはPlusとEnterpriseで公開ベータとして提供されています。無料のDeveloperプランは1シートが上限で、2人以上のアクセスが必要になったチームがPlusへ移行する主な理由になっています。

得られるもの 得られないもの
LangChainとLangGraphのアプリ向けの深いネイティブトレースに加え、本物のOTLPエンドポイント Developerプランは1シートが上限
オンラインとオフラインのevals、データセット管理、人によるアノテーションが全プランで利用可能 データセットとevalのUXが、LangChain型のアプリを前提にしている
EnterpriseでSaaS、ハイブリッド、完全セルフホストのデプロイに対応 Enterprise未満ではセルフホストできない

料金: Developerは$0/seat(5,000トレース/月を含む、最大1シート、保持期間14日)。Plusは$39/seat/月で、シート数は無制限(10,000トレース/月を含み、小規模なサーバーレスデプロイを1つ無料で利用可能)。Enterpriseは要見積もりで、SaaS、ハイブリッド、セルフホストを選択可能。含まれる量を超えた使用分は、コンピュートユニットあたり$1.50、ストレージユニットあたり$1.00です。出典:langchain.com/pricing。

最適な用途: LangChainまたはLangGraphでエージェントをすでに構築しており、そのフレームワークをネイティブに理解するトレースを求めるチーム。


2. Langfuse:オープンソースの標準、無料でセルフホスト

Langfuseがこのカテゴリでオープンソースの定番であるのには理由があります。トレース、評価、プロンプト管理、データセットという製品の全機能が、オープンソースライセンスのもとで無料でセルフホストでき、ローカル環境にはDocker Compose、本番運用にはKubernetesのテンプレートが用意されています。これは「無料プランを骨抜きにしたオープンコア」とはまったく異なる提案であり、ベンダーロックインを気にする多くのチームがここから始める理由です。

OpenTelemetry対応は、クラウドでもセルフホストでも全プランに及びます。つまり、OTelで計装されたエージェントなら、Langfuse専用のSDKを重要な経路に入れることなくLangfuseに接続できます。evaluationも同様に充実しており、LLM-as-judgeのエバリュエーター、データセット、実験が無料のHobbyプランでも利用でき、一部の競合のように有料プランの裏に隠されてはいません。

得られるもの 得られないもの
機能制限付きの無料プランではなく、完全オープンソースの無料セルフホスト Cloud Proの3年間のデータ保持は$199/moに跳ね上がる
クラウドでもセルフホストでも、全プランでOpenTelemetryネイティブの取り込み チームでの共同作業機能は、Proの上にさらに$300/mo加算される
無料のHobbyプランにもLLM-as-judge、データセット、実験を含む エンタープライズ機能(SCIM、監査ログ、稼働率SLA)は$2,499/moから

料金: Hobbyは無料(50,000ユニット/月、2ユーザー、データアクセス30日)。Coreは$29/月または$348/年(100,000ユニット/月、ユーザー数無制限、アクセス90日)。Proは$199/月または$2,388/年(100,000ユニット/月、アクセス3年、アノテーションキュー無制限、SOC 2/ISO 27001レポート、Teamsアドオンは+$300/月)。Enterpriseは$2,499/月(監査ログ、SCIM、カスタムのレート制限、稼働率SLA)。超過分は100,000ユニットあたり$8から、大量利用時は100,000あたり$6まで下がります。セルフホストは、どの規模でも無料でオープンソースです。出典:langfuse.com/pricing。

最適な用途: セルフホストによって全機能を無料で使いたく、後で乗り換えたくなってもベンダーロックインのないチーム。


3. Arize (Phoenix and AX):オープンソースからエンタープライズまでOpenTelemetryネイティブ

Arizeは、このカテゴリの両端を1つのブランドでカバーしています。Phoenixはオープンソースでセルフホスト型の製品です。OpenTelemetry上に直接構築され、Arize独自のOpenInference計装で動作し、OTLP経由でトレースを受け取り、Docker、Kubernetes、あるいはすでに使っているクラウドで無料で動かせます。Arize AXはその商用版で、同じOTelネイティブの中核の上に、チーム管理、より長い保持期間、エンタープライズ向けの制御を加えた、段階的な料金のホスト型プラットフォームです。

AXのFreeプランとProプランはどちらも、evaluationとユーザー数が無制限で、このカテゴリの有料の入門プランとしては異例の太っ腹です(多くの競合はLLM-as-judgeを上位プランに限定しています)。evaluationは本番のトレースとオフラインのデータセットの両方に対応し、Enterpriseでは、単発のモデル呼び出しではなく複数ステップのエージェント実行を採点するために作られた「agent as a judge」モードが加わります。

得られるもの 得られないもの
OpenTelemetryとOpenInference上にネイティブ構築された、無料でセルフホスト可能なPhoenix Phoenix Cloudのホスト型の料金は公開されていない
AX FreeとAX Proの両方で、evalsとユーザー数が無制限 商用のAX製品自体をセルフホストするにはEnterpriseが必要
セッションのサポートとマルチモーダルのトレース(画像、音声、PDF) AX FreeとProはSaaS専用

料金: Phoenixは無料のオープンソースで、セルフホスト型。AX Freeは$0/月(25,000トレーススパン/月、ストレージ1 GB、保持期間15日)。AX Proは$50/月(50,000スパン/月、ストレージ10 GB、保持期間30日)。AX Enterpriseは要見積もりで、SaaSまたはセルフホスト。出典:arize.com/pricingおよびarize.com/docs/phoenix。

最適な用途: 無料でOpenTelemetryネイティブのオープンソースツールから始め、ベンダーを変えずにエンタープライズ向けプラットフォームへ本格的にアップグレードしたいチーム。


4. Datadog Agent Observability:すでに監視しているインフラのデータの隣にエージェントのトレース

Datadogのこのカテゴリへの参入製品は、発売時の名称はLLM Observabilityでしたが、現在は同社のAI製品群の中でAgent Observabilityとして位置づけられています。その強みは深さではなく、統合にあります。インフラ、APM、ログのデータがすでにDatadogにあるなら、エージェントのトレースは、すでに見ているのと同じサービス、ホスト、ユーザーセッションと関連づけて表示され、別に確認しなければならない5つ目のタブに分かれることはありません。

トレースは実行経路全体(プロンプト、検索ステップ、ツール呼び出し、エージェントの判断)をカバーし、各ステップでレイテンシ、トークン使用量、リトライ、エラーを記録します。OpenTelemetryにネイティブ対応し、Python、Node.js、Java向けのSDKも提供されています。料金は実際のLLM呼び出しに絞られています。ツール、ワークフロー、エージェント、検索のスパンは無料でトレースでき、LLMプロバイダーを呼び出すスパンだけが従量制の上限に数えられます。すべてのスパン種別を同じように課金する競合とは、明確に異なる課金モデルです。

得られるもの 得られないもの
エージェントのトレースを、既存のAPM、インフラ、RUMのデータと関連づけて表示 SaaSのみで、セルフホストやオンプレミスの選択肢はない
課金対象はLLM呼び出しのスパンのみで、ツールとワークフローのスパンは無料でトレース可能 十分な価値を得るには、既存または新規のDatadogとの契約が必要
ハルシネーション、プロンプトインジェクション、個人情報の露出向けの組み込みエバリュエーター 対応フレームワークの一覧は充実しているが、純粋なOTel専業ツールより範囲が狭い

料金: 40,000 LLMスパン/月まで無料。Proは$160/月で、最大100,000 LLMスパン/月まで、それを超える分は従量課金です。トレースの保持期間を30日、60日、90日に延ばすアドオンがあります。出典:datadoghq.com/product/llm-observability。

最適な用途: すでにAPMとインフラ監視にDatadogを使っており、新しい単体のベンダーではなく同じ場所でエージェントのトレースを見たいチーム。


5. Braintrust:ダッシュボードだけでなくevaluationを軸に設計

Braintrustは、トレースツールに後付けした機能ではなく、evaluationを主力製品として打ち出しています。全プランでプロジェクト、データセット、プレイグラウンド、実験が無制限に利用でき、「Loop」機能が自律的に評価を反復します。人がルーブリックを1つずつ書かなくても、テストケースを生成し、スコアラーを改善していきます。このevaluation中心の設計は、CIで制御するリリースプロセスを求めるチームに自然に合います。新しいプロンプトやモデルのバージョンを出荷する前にevalスイートを実行し、顧客に気づかれた後ではなく前に問題を見つけます。

料金体系には、予算を組む前に理解しておくべき独特な点があります。月額料金が、BraintrustのAIプロキシを通じたモデルクレジットのプールを兼ねているのです。そのため、$249のProプランは、モデル利用料の上に乗る定額のプラットフォーム料金ではなく、$249分の使えるクレジットに、別途従量計測されるデータ処理量とスコアリング量が加わるものです。OpenTelemetryは、ネイティブSDKや100以上のプロバイダーとフレームワークの連携と並んで、対応連携として記載されています。

得られるもの 得られないもの
evaluation中心の設計:LLM-as-judge、カスタムのコードスコアラー、自律的なeval反復 Braintrust自身のドキュメントは、OTelを主要な取り込み経路として前面に出していない
無料のStarterプランでも、プロジェクト、データセット、実験が無制限 オンプレミスまたはホスト型プライベート環境にはEnterpriseが必要
モデルプロバイダーとエージェントフレームワークにまたがる100以上の構築済み連携 Proの月額料金がモデルクレジットを兼ねるため、慣れるまで少し時間がかかる

料金: Starterは無料(モデルクレジット$10/月、処理データ1 GB/月、10,000スコア/月、保持期間14日)。Proは$249/月(モデルクレジット$249/月、処理データ5 GB/月、50,000スコア/月、保持期間30日)。Enterpriseは要見積もりで、大量処理やプライバシーが重要なワークロード向けにオンプレミスまたはホスト型プライベート環境のデプロイに対応。超過分:処理データはStarterが$4/GB、Proが$3/GB。スコアはStarterが1,000件あたり$2.50、Proが1,000件あたり$1.50。出典:braintrust.dev/pricing。

最適な用途: 監視ではなくevaluationを、エージェントの変更を出荷する際の中心に据えたいチーム。


6. W&B Weave:すでにWeights and Biasesを使っているチーム向け

Weaveは、多くのMLチームがすでにトレーニングの実行管理に使っている実験追跡プラットフォームであるWeights and Biasesを、LLMとエージェントのオブザーバビリティへと拡張した製品です。この出自こそが最大の売りです。MLチームがモデルのトレーニングと評価の履歴をすでにW&Bで管理しているなら、Weaveは、別ログインの別ツールではなく、同じレジストリとダッシュボードの中にエージェントのトレース、評価、本番モニタリングをまとめてくれます。

Weaveは操作単位でトレースし、デコレートした関数が行う各推論の入力、出力、メタデータを記録します。LLM-as-a-judge指標とPIIのリダクションは、無料プランを含む全プランに含まれます。一方で、少なくとも料金ページやマーケティングページのどこにも、OpenTelemetry対応を掲げていません。そのため、OTelによる移植性が「あれば望ましい」ではなく必須要件なら、LangfuseやArizeより見劣りします。

得られるもの 得られないもの
トレーニングの実行にすでにW&Bを使っているMLチームにとって、使い慣れた統一環境 OpenTelemetry対応が、自社サイトのどこにも記載されていない
無料プランを含む全プランでLLM-as-a-judge指標とPIIリダクションが利用可能 Weaveのデータ取り込みの超過料金が、ストレージの超過料金より著しく高い
ローカルでの実験向けに、1ユーザーのセルフホスト型Personalプランを無料で提供 高度なEnterpriseのセルフホストには個別見積もりが必要

料金: Freeは$0/月(最大5シート、ストレージ5 GB/月、Weaveデータ取り込み1 GB/月)。Proは$60/月から(最大10シート、ストレージ100 GB/月、Weaveデータ取り込み1.5 GB/月、30日間のトライアル)。Enterpriseは要見積もり。超過分:ストレージは$0.03/GB、Weaveデータ取り込みは$0.10/MB。ローカルのDocker/Python環境向けに、1ユーザーのセルフホスト型Personalプランが無料で用意されています。出典:wandb.ai/site/pricing。

最適な用途: Weights and Biasesですでに実験を実行しており、同じプラットフォームでエージェントのトレースも扱いたいMLチーム。


7. Comet Opik:オープンソースに加え、ここで最も安い本格的な有料プラン

Cometは、確立されたML実験追跡プラットフォームであり、Weights and Biasesの直接の競合です。そのCometがLLMとエージェントのオブザーバビリティへの答えとしてOpikを開発し、オープンソース化しました。そのためOpikには、Langfuseと同じ「セルフホストなら永久無料」という選択肢に加え、ホスト型のFree Cloudプランと、月額$19という、この比較の中で飛び抜けて安い有料のPro Cloudプランがあります。

OpikのOpenTelemetry対応は全プランでネイティブで、PythonとJavaScript以外の言語にも及びます(CometはRubyとJavaのサポートを明示しています)。LLM-as-judgeによるevaluation、カスタム指標、テストスイートは、Enterpriseに限定されず、すべての有料プランに含まれます。Enterpriseでは、エージェントの障害の原因を突き止めるための自然言語によるデバッグアシスタント「OpikAssist」が加わります。

得られるもの 得られないもの
OTelへの完全対応とLLM-as-judgeを含む、月額$19のPro Cloudプラン LangSmithやLangfuseに比べて、エコシステムと認知度が小さい
ホスト型のFree Cloudプランに加えて、無料のオープンソースのセルフホスト型も選べる Proでも、60日を超えるデータ保持は追加料金がかかる
多くの競合より幅広い言語でネイティブのOpenTelemetry対応 AIによるデバッグ(OpikAssist)はEnterprise限定

料金: Open Sourceは無料で、セルフホスト型。Free Cloudは$0/月(最大10チームメンバー、25,000スパン/月、保持期間60日)。Pro Cloudは$19/月(最大50メンバー、100,000スパン/月、保持期間60日)。Enterpriseは要見積もりで、オンプレミスを含む柔軟なデプロイに対応。超過分:追加スパンは100,000あたり$5(Pro)。保持期間を400日に延長する場合は100,000スパンあたり$29(Pro)。出典:comet.com/site/pricing。

最適な用途: 機能を絞った無料プランではなく、本物のOpenTelemetry対応とLLM-as-judgeによるevaluationを求める、予算重視のチーム。


8. Helicone:プロキシ方式で最速のセットアップ

Helicone本来の設計はプロキシです。APIの呼び出し先をOpenAIやAnthropicに直接向ける代わりにHeliconeに向けると、コードをほとんど変えずに自動でログが記録されます。これは今でも最短で価値を得られる経路であり、計装に手を加えずにコスト、レイテンシ、リクエスト単位の可視性が欲しいチームにとって、セットアップの速さは他に並ぶものがありません。

複数ステップのエージェントの可視化は、HeliconeのSessions機能で実現されます。関連する呼び出し(LLM呼び出し、ベクトルデータベースへのクエリ、ツール呼び出し)をまとめ、バラバラのリクエストの山ではなく、エージェントの実行全体を1つのビューにします。プロキシを経由せずにOTel形式のログを取りたいチーム向けには、OpenLLMetryベースの非同期連携も用意されています。Heliconeにないのは、少なくとも目玉機能としては、強力なevaluationレイヤーです。目立ったLLM-as-judgeも、体系的なオフライン評価の製品もなく、監視とコストのツールが第一で、evaluationプラットフォームとしては遠く及びません。

得られるもの 得られないもの
1行のプロキシ連携で、このカテゴリで最速級のセットアップ ネイティブのevaluationとLLM-as-judgeの機能が、専門ツールに比べて薄い
Sessions機能が、ツール呼び出しとベクトルクエリをまとめてエージェントのトレース全体にする Proの基本のデータ保持期間1か月は、LangfuseやCometと比べて短い
$79/moのProプランでもシート数は無制限 オンプレミスのデプロイにはEnterpriseが必要

料金: Hobbyは無料(10,000リクエスト/月、ストレージ1 GB、1シート、保持期間7日)。Proは$79/月(シート数無制限、含まれる量を超えるリクエストとストレージは従量課金、保持期間1か月)。Teamは$799/月(5組織、保持期間3か月、SOC 2とHIPAAに準拠)。Enterpriseは要見積もりで、SAML SSOとオンプレミスのデプロイに対応。出典:helicone.ai/pricing。

最適な用途: リクエスト単位のコストとレイテンシの可視化を数分で稼働させたく、evaluationは必要なら別のツールに任せるチーム。


9. HoneyHive:OpenTelemetryネイティブだが、セルフサーブの中間プランがない

HoneyHiveの技術的な基盤は本当に強力です。PythonとTypeScript向けのネイティブOpenTelemetry SDKを備え、LangChain、LangGraph、OpenAI Agents SDKを含む50以上の主要ライブラリを自動で計装します。無料プランでも、両方の種類のevaluationが利用できます。自動評価向けのコードベースのチェックとLLM-as-judgeスコアリングに加えて、人によるアノテーションキュー、本番トラフィックに対するサンプリング付きのオンライン評価、オフラインの実験です。

2026年8月時点での問題は、料金の段階構成そのものです。HoneyHiveの公開料金ページには、Freeの開発者向けプラン(10,000イベント/月、最大5ユーザー、保持期間30日)と、個別見積もりのEnterpriseプランしか載っていません。その中間にある、セルフサーブで申し込める有料プランは見当たりません。そのため、無料枠を使い切ったチームは、LangSmith、Langfuse、Comet Opikのように「アップグレード」をクリックするのではなく、そのまま営業との商談に進むことになります。

得られるもの 得られないもの
50以上のライブラリを自動計装する、ネイティブのOpenTelemetry SDK FreeとEnterpriseの間に、公開されたセルフサーブのプランがない
無料プランで、自動評価(コードまたはLLM-as-judge)と人による評価の両方を利用可能 10,000イベント/月を超えるには、営業への問い合わせが必要
Enterpriseではセルフホスト、ハイブリッド、シングルテナントのデプロイを選べる 無料プランの超過料金は公開されていない

料金: Free/Developerは$0/月(10,000イベント/月、最大5ユーザー、保持期間30日)。Enterpriseは個別見積もり(ユーザー数無制限、保持期間のカスタマイズ、SAML/SSO、専任のTAM)。出典:honeyhive.ai/pricing。

最適な用途: 自動計装されたOpenTelemetryトレースをすぐに使いたく、無料枠を超えたら営業との商談にそのまま進むことに抵抗がないチーム。


10. Galileo:専用に作られたジャッジモデルによるエンタープライズ向けevaluation

Galileoは、GenAIとagenticアプリケーション向けに作られたオブザーバビリティ、評価、guardrailsのプラットフォームを自任しており、最も明確な差別化要因はその評価アプローチです。ジャッジ役として動かす汎用のLLMだけに頼るのではなく、Galileoは、評価のたびにフロンティアモデルをフルで呼び出すよりも速く、安く、一貫性の高いスコアリングを狙って、目的に合わせてチューニングした小型のエバリュエーターモデル群「Luna」を自社で構築しました。

evaluationは無料プランでも無制限で、多くの競合がLLM-as-judgeを有料プランの裏に隠しているこのカテゴリでは、異例の太っ腹です。Enterpriseでは、リアルタイムのguardrailsと、専用の低レイテンシ推論基盤が加わります。顧客に届く前に不適切なエージェントの行動を止めたいチーム向けで、事後にログを残すだけではありません。Galileoの公開ページから分かりにくいのは、OpenTelemetry対応と中間プランの料金の詳細です。Proプランの月額$100という数字は、明示的に年払いの料金であり、月払いに比べて33%の割引とされていますが、月払いの金額は直接記載されていません。

得られるもの 得られないもの
無料プランでも、カスタムevaluationが無制限 OpenTelemetry対応が公開されていない
汎用のLLM-as-judgeプロンプトだけでなく、専用に作られたLunaエバリュエーターモデル Proの月払い料金は直接記載されておらず、年払いの料金のみ
Enterpriseでリアルタイムのguardrailsと専用の推論基盤 デプロイの柔軟性(VPC、オンプレミス)はEnterprise限定の機能

料金: Freeは$0/月(5,000トレース/月、ユーザー数無制限、カスタムevals無制限)。Proは年払いで$100/月で、月払いに比べて33%の割引と説明されています(50,000トレース/月、標準のRBAC、高度な分析)。Enterpriseは要見積もりで、ホスト型、VPC、オンプレミスのデプロイに対応。出典:galileo.ai/pricing。

最適な用途: 汎用のLLMに自分の領域を採点させるのではなく、専用に作られたジャッジモデルとリアルタイムのguardrailsを求めるエンタープライズチーム。


11. Pydantic Logfire:エージェントにも適した、汎用のOpenTelemetryバックエンド

PydanticとPydantic AIを手がけるチームによるLogfireは、最初からOpenTelemetry上に構築されており、「OTelネイティブ」を明示的に掲げています。すでにOTelスパンを出力しているフレームワークなら、Python、JavaScriptとTypeScript、Rust、Go、Java、あるいはこのプロトコルを話せるその他の言語を問わず対応します。多言語の構成を運用するチームにとっては、Pythonだけを完全にサポートするツールに対する大きな利点です。GoのマイクロサービスもJavaのレガシーシステムもPythonのエージェントも、同じ関連づけられたビューに集約できます。

多言語のテレメトリが1つのトレースの器に流れ込む、AIエージェント向けOpenTelemetryバックエンドを示すイメージ

率直なトレードオフとして、Logfireはまず汎用のオブザーバビリティ基盤です。エージェントがOTelで計装された単なるワークロードの1つであるためエージェントのトレースにも適していますが、エージェントのevaluation専用に作られた製品ではありません。Langfuse、Braintrust、Galileoのように、LLM-as-judgeや体系的なオフライン評価を売りにしてはいません。ログ、トレース、メトリクスが1か所にまとまり、評価のロジックは自分で作るか、専門ツールと組み合わせることになります。

得られるもの 得られないもの
Python、Go、Java、JS、Rustにわたって明示的にOpenTelemetryネイティブ エージェントのevaluation専用ではなく、強力なLLM-as-judge機能はない
エントリープランだけでなく、全有料プランに10 million records/月を含む 専用のシングルテナントまたはセルフホストのデプロイにはEnterpriseが必要
LLM呼び出しだけでなく、多言語構成全体の統一ビュー SDKはオープンソースだが、サーバーとUIはクローズドソース

料金: Personalは無料(管理者1人とゲスト2人、10 million records/月、保持期間30日)。Teamは$49/月(5シートを含み、12シートまで1シートあたり+$25、10 million records/月、保持期間30日)。Growthは$249/月(シート数無制限、10 million records/月、保持期間は最大90日)。Enterpriseは要見積もり(クラウドのマルチテナント、専用シングルテナント、またはセルフホスト)。超過分:TeamとGrowthでは追加100万レコードあたり$2。出典:pydantic.dev/pricing。

最適な用途: LLM専用の別ツールではなく、エージェントを含むすべてのサービスにまたがる1つのOpenTelemetryバックエンドを求める、多言語のエンジニアリングチーム。


12. Traceloop (OpenLLMetry):OpenTelemetryの計装レイヤーそのもの

Traceloopは、OpenTelemetryをLLMとエージェントのアプリケーション向けに拡張した、Apache 2.0ライセンスの完全オープンソースの計装ライブラリであるOpenLLMetryを開発しました。自社のホスト型プラットフォームは、そこで生成されたトレースを活用する方法のリファレンス実装です。このリストの多くのツールは既存の製品にOTel対応を後から追加しましたが、OpenLLMetryのLLM呼び出し向けセマンティック規約は並行して作られ、このカテゴリ全体が今まさに収束しつつある、より広いOTel GenAIセマンティック規約の取り組みの形成にも貢献しました。

この出自により、Traceloopはここで最も純粋なOTelファーストの選択肢です。OpenLLMetry自体は、このリストの競合を含む、OTel互換のどのバックエンドでも無料で使えます。Traceloop自身のプラットフォームは、収集されたデータを見る場所の1つで、Monitoring Dashboard、Evaluation Dashboard、プロンプト管理を備えています。本当の制約は無料プランの保持期間で、24時間です。アクティブなデバッグには十分ですが、先週のパターンを振り返るには足りません。

得られるもの 得られないもの
最初からOpenTelemetryネイティブで、SDKはどのOTelバックエンドでも動作する 無料プランのデータ保持期間が24時間しかない
Apache 2.0ライセンスのOpenLLMetry SDKは、機能制限なしで本当に無料 FreeとEnterpriseの間に、公開されたセルフサーブのプランがない
AWS、GCP、Azure、Kubernetesにまたがるオンプレミスのデプロイ(エアギャップ環境を含む) evaluation機能の詳細が、evaluation専業のツールに比べて公開されていない

料金: OpenLLMetry SDKは無料のオープンソース(Apache 2.0)で、OTel互換のどのバックエンドでも利用可能。Traceloop Free Foreverは$0/月(最大50,000スパン/月、最大5シート、保持期間24時間)。Enterpriseは要見積もり(シート数無制限、保持期間のカスタマイズ、SOC 2、オンプレミスのデプロイ)。出典:traceloop.com/pricing。

最適な用途: OpenTelemetryの計装そのものを移植可能にしておきたく、トレースをTraceloopで見ることも、OTelに対応したほかのどこかへ送ることも選べるようにしたいチーム。


13. Maxim AI:エージェントが顧客と話す前のシミュレーションテスト

Maxim AIの差別化要因はシミュレーションです。ログに残った本番のトレースをエバリュエーターで再生するだけでなく、エージェントが実際の顧客に届く前に、シミュレーションしたマルチターンの会話を対象に実行できます。単発の呼び出しではなく、やり取りの全体をエージェントがどう扱うかをテストするのです。これは「この1つの応答は適切に見えたか」とはまったく異なる問いであり、エージェントが本番に入った後は、本番トラフィックに対するオンライン評価と組み合わせて使えます。

エントリープランの料金はボリューム単位ではなくシート単位で、このリストの大半とは異なるモデルです。Professionalは$29/seat/月でシミュレーション実行とオンラインevalsが使え、Businessは$49/seat/月でPII管理とスケジュール実行が加わります。この構造は小さなチームなら予算を立てやすい一方、大きなチームではすぐに高額になります。コストがエージェントのトラフィックではなく人数に比例して増えるためです。OpenTelemetry対応もセルフホストも、Enterpriseプランのin-VPCデプロイを除いて、公開情報には記載がありません。

得られるもの 得られないもの
シミュレーション実行で、単発の呼び出しだけでなく、ローンチ前にマルチターンのエージェントの挙動をテスト シート単位の料金は、エージェントのトラフィックではなく人数に比例して増える
「evaluator store」経由のLLM-as-judgeに加え、カスタムのエバリュエーターと人によるレビュー OpenTelemetry対応が公開されていない
Enterpriseでin-VPCのデプロイに対応し、SOC 2 Type II、ISO 27001、HIPAA、GDPRをカバー 無料プランの3日間のデータ保持は、この比較で最も短い

料金: Developerは永久無料(最大3シート、1ワークスペース、10,000ログ/月、保持期間3日)。Professionalは$29/seat/月(シート数無制限、最大3ワークスペース、100,000ログ/月、保持期間7日、シミュレーション実行とオンラインevalsを含む)。Businessは$49/seat/月(ワークスペース数無制限、500,000ログ/月、保持期間30日)。Enterpriseは要見積もり(in-VPCのデプロイ、カスタムSSO)。超過分:ProfessionalとBusinessでは10,000ログあたり$1。出典:getmaxim.ai/pricing。

最適な用途: 個々の応答を事後に採点するだけでなく、エージェントが会話全体をどう扱うかを、稼働前にシミュレーションしたいチーム。


AIエージェントのオブザーバビリティ導入でよくある失敗

失敗 具体的な状況 代わりにすべきこと
トレースだけ導入して終わりにする 正しさを誰も採点していないため、数か月間、失敗した実行が1件もないきれいなダッシュボード evaluationを第2フェーズのプロジェクトではなく、初日から予算に組み込む
OTel対応があれば完全に移植できると思い込む 「OTel連携」が取り込みしかカバーしておらず、evalとデータセットのレイヤーは対象外だったと後で気づく evaluationとデータセットが、トレースと一緒に移行できるのか、ベンダーに固定されるのかを確認する
フレームワークのドキュメントが最初に挙げるツールを選ぶ LangChainのクイックスタートで使われているからとLangSmithを選び、代替案と比較しない セットアップの速さだけでなく、自社の保持期間、コンプライアンス、evalの要件で評価する
無料プランの単位の定義を無視する 1回のエージェント実行が10から20スパンを消費しうることを確認せず、「スパン」で予算を立てる 無料プランの上限を比較する前に、エージェントの1回の実行あたりの実際の月間量を見積もる
LLM-as-judgeを正解として扱う 人による抜き取り確認なしに、ジャッジのスコアだけで変更を出荷する 特に重要なリリースの前には、LLM-as-judgeと定期的な人によるレビューを組み合わせる
どのプランでもセルフホストできると思い込む セルフホストにEnterpriseが必要なツールで、オンプレミスの展開計画を立ててしまう アーキテクチャを決める前に、セルフホストまたはVPCのデプロイが可能なプランとその価格を確認する
更新の前に料金を再確認しない 変化の速いカテゴリで、数か月前のレビューサイトの数字をもとに予算を立てる ベンダーの料金ページを直接再確認する。取り込み量ベースの料金は頻繁に変わる

選び方:意思決定フレームワーク

| 必要なもの | 選ぶ製品 | 理由 |

最後のマトリクスは、技術的な制約を、それぞれ大きく異なる強みを持つツールに対応づけたものです。

6つの絞りを備えた検査機器で示した、AIエージェントのオブザーバビリティの意思決定フレームワークのイメージ |---|---|---| | LangChainまたはLangGraphで構築したエージェント向けの最も深いトレース | LangSmith | ネイティブの実行ツリーのトレースに加え、後で移行する場合にも使える本物のOTLPエンドポイント | | ロックインなしで無料でセルフホストしたい | Langfuse | 完全なオープンソースで、セルフホストを含む全プランでOpenTelemetryネイティブ | | APMやインフラのダッシュボードと結びついたOTelバックエンド | Datadog Agent Observability | エージェントのスパンが、すでに監視しているのと同じインフラとRUMのデータの隣に並ぶ | | evaluationとCIで制御するリリースを主な仕事にしたい | Braintrust | スコアラー、実験、自律的なeval反復のワークフローを軸に設計されている | | 完全なOTel対応とLLM-as-judgeを備えた最安の本格的な有料プラン | Comet Opik | 月額$19のProプランで、その下には無料のオープンソースの選択肢もある | | コード変更を最小限に抑えた最速のセットアップ | Helicone | プロキシを1行差し替えるだけで導入でき、Sessionsが後から呼び出しをまとめてエージェントのフロー全体にする | | 汎用のLLMプロンプトではなく、専用に作られたジャッジモデル | Galileo | Lunaエバリュエーターファミリーに加え、エンタープライズプランではリアルタイムのguardrails | | Pythonに限らない多言語構成全体で1つのOTelバックエンド | Pydantic Logfire | Python、Go、Java、JavaScript、Rustにわたって明示的にOTelネイティブ | | ローンチ前にマルチターンのエージェントの会話をシミュレーションしたい | Maxim AI | シミュレーション実行で、単発の呼び出しだけでなく会話全体の挙動をテストできる | | VPCの外に出せない規制対象のデータ | Arize AX、Langfuse、またはTraceloop | 3製品とも、営業との商談だけでなく、本物のセルフホストまたはオンプレミスの道を提供している |


AIエージェントのオブザーバビリティツールに関するよくある質問

AIエージェントのオブザーバビリティツールとは何ですか?

AIエージェントが本番環境で稼働した後に、そのエージェントをトレース、評価、監視するプラットフォームです。実行のきっかけ、呼び出したツール、返ってきた結果、次の行動をどう決めたかを記録します。エージェントは1つの入力と1つの出力ではなく、判断の連鎖であるため、単発のモデル呼び出しを見ることとは別の仕事になります。

エージェントのオブザーバビリティは、一般的なAIやLLMのオブザーバビリティとどう違いますか?

一般的なAIオブザーバビリティは、データパイプライン、単発のモデル呼び出し、出力の品質を対象とします。エージェントのオブザーバビリティは、複数ステップのループをトレースすることを指します。5ステップでも50ステップでもかかる実行全体で、すべてのツール呼び出し、そのパラメータ、結果を追います。最終回答しか記録しないツールでは、そのループのどこで問題が起きたのか分かりません。

「トレースの粒度」とは何で、なぜ重要ですか?

ツールが、エージェントが取ったすべてのステップ(各ツール呼び出し、その入力と結果)を見せてくれるのか、それとも最終出力だけなのか、ということです。粒度が細かければ、正しいツールを誤ったパラメータで呼び出したエージェントや、失敗したステップを繰り返した末に黙って諦めたエージェントを捉えられます。最終回答がもっともらしく見えても、出力だけのログではどちらも見逃します。

OpenTelemetry GenAIセマンティック規約への対応とは何で、なぜ重要ですか?

OpenTelemetryは、トレースのためのベンダー中立の標準です。そのGenAIセマンティック規約は、LLMとエージェントのスパンに特化した共通の属性名(gen_ai.systemやgen_ai.promptなど)を定義しています。ネイティブに対応しているツールなら、OTelで計装されたどのアプリからもトレースを取り込め、コードを再計装することなく後からバックエンドを入れ替えられます。独自SDKでしか動かないツールは、導入は速くても乗り換えは難しくなります。

オンライン評価とオフライン評価の違いは何ですか?

オフライン評価は、変更を出荷する前に固定のテストセットをエージェントに対して実行し、顧客に届く前に退行を見つけます。オンライン評価は、出荷後に本番トラフィックをサンプリングしてスコアリングし、テストセットが想定しなかったドリフトやエッジケースを見つけます。LangChainの2025年の調査によると、オフラインevalsを実施している組織は52.4%、オンラインevalsを実施している組織は37.3%にすぎず、多くのチームは少なくとも一方が欠けています。

LLM-as-judgeによる評価は信頼できますか?

役に立ちますが、万能ではありません。LangChainの調査によると、エージェントを評価しているチームの53.3%がLLM-as-judgeの手法を使っています。人によるレビューだけよりはるかに規模を拡大できるためです。しかし、あるモデルが別のモデルの成果を採点する以上、人がレビューしたルーブリックと、実際の結果に対する定期的な抜き取り確認は依然として必要で、とりわけ本当に重要なリリースの前には欠かせません。

セルフホストとSaaSのオブザーバビリティツールのどちらを選ぶべきですか?

エージェントのトレースに、VPCの外に出せない規制対象や機密性の高いデータが含まれる可能性がある場合、または利便性よりもベンダーロックインの回避を重視する場合は、セルフホストを選びます。Langfuse、Arize Phoenix、Comet Opikはいずれも、無料のオープンソースによるセルフホストの道を本当に用意しています。最初のトレースまでの速さを重視する場合や、ベンダーのSOC 2やHIPAAの対応で自社のコンプライアンス要件がすでに満たされている場合は、SaaSを選びます。

このカテゴリの料金は通常どう増えていきますか?また、何を予算に見込むべきですか?

ここにあるほぼすべてのベンダーが、シートではなく取り込み量(スパン、トレース、イベント、ログ)で課金します。そのため重要なのは人数ではなく、エージェントの実際の月間量です。1回のエージェント実行だけで10から20スパンが生成されることもあるため、月25,000や50,000ユニットの「太っ腹な」無料枠も、エージェントが1日に数百回動くようになればすぐに使い切ってしまいます。無料枠の見出しの数字だけでなく、課金単位と超過料金を確認してから契約してください。

オブザーバビリティツールとevaluationツールは別々に必要ですか?

必ずしもそうではありません。LangSmith、Langfuse、Arize、Datadog、Comet Opik、Braintrustは、いずれもトレースとevaluationを1つの製品に統合しています。HeliconeとPydantic Logfireは、トレースと一般的なオブザーバビリティに重心があり、evaluationは薄いレイヤーです。そのため、どちらかの上に本格的なevaluationを重ねたいチームは、BraintrustやGalileoのような専門ツールと組み合わせることになるでしょう。

小規模なチームとエンタープライズのチームでは、どのツールから始めるべきですか?

コンプライアンス上の義務がない小規模なチームは、太っ腹な無料プランから始めるのがよいでしょう。Langfuse、Comet Opik、Arize AXはいずれも、単なるお試しではなく、本物の機能を無料で提供しています。ガバナンスとデータレジデンシーの要件があるエンタープライズのチームは、セルフホストと監査ログのサポートを重視してください。Langfuse、Arize、Datadog、TraceloopのEnterpriseプランと、GalileoのVPCおよびオンプレミスの選択肢は、最初からそのために作られています。


次にやること

すでに本番で動いているエージェントのうち、最もボリュームが多いもの、または顧客への露出が最も大きいものを1つ選び、契約する前に、候補に挙げたツールの無料プランで2週間計装してみてください。最終回答だけでなく、そのエージェントが行うすべてのツール呼び出しを見られることを確認し、実際のケースによる小さなテストセットに対して、少なくとも1回はオフライン評価を実行します。不具合のある実行で実際に何がまずかったのかをツールが示せない、あるいはevaluationが組み込まれているのではなく後付けに感じられるなら、ダッシュボードがどれほどきれいでも、そのツールは合っていません。

エージェントのプラットフォーム自体をまだ比較している段階なら、2026年版 エンタープライズ向けAIエージェントプラットフォーム ベストと2026年版 AIコーディングエージェント ベストが、最も一般的な2つの出発点を扱っています。また、計画、実行、観察というループ自体をまず定義する必要があるなら、AIエージェントとはから始めてください。

About the author

Camellia

Camellia

Principal Product Marketing Strategist

Camellia is Principal Product Marketing Strategist at Rework, helping B2B buyers pick the right software with confidence. With 6+ years in product marketing and 150+ SaaS tools evaluated across CRM, project management, and sales engagement, Camellia turns competitive intelligence into clear, honest comparisons. Readers get vendor evaluations they can trust to cut through marketing noise and decide faster.