多くの企業と同様に、優れたAIシステムへの投資と導入を求めるプレッシャーにさらされていることでしょう。そして現時点では、すでにかなりの予算をそこに投じてきたことと思います。 

しかし、その次に何が起こるかを考える人はあまりにも少ないのが現状です。つまり、価値の証明、従業員への影響、そして株主へのバリューです。 

エンタープライズAI予算の93%はテクノロジー自体に費やされています:インフラ、モデル、デプロイメント。残りの7%は、それが実際に機能しているかどうかを把握するために使われています。多くのビルダーやリーダーは、これらすべてをうまく機能させるために必要なアナリティクスレイヤーが欠けていることに気づきました。

こうしたリーダーとの会話で浮かび上がってきたこと、そしてなぜすべてが見た目通りではないのかをご紹介します。 

異論1:「エージェント測定ツールは自分たちで構築できる。」

もちろん、できます。2026年ですから、それは分かっています。そして「自分たち」とはエンジニアチームを意味するわけでもありません。CursorとフリーのPMが午後の空き時間を使って、エージェントの会話を分析するものをバイブコーディングすることができます。

それで、動作するプロトタイプ、クールなデモ、そしてスケールさせる段階になって初めて気づく、じわじわと進む品質の問題が手に入ります。スケール時には、リピートしないユーザーという漏れるバケツを抱えることになるでしょう。 

私たちは社内でも同じ課題に直面しました。「LLMを使ってエージェントの会話を分析し始めたとき、結果は確認するまで良好に見えていました。私たちのソリューションは問題を自信を持って誤分類し、予測できない形で指示から逸脱していました」と、Agent AnalyticsのシニアプロダクトマネージャーであるDanielle Gohは述べています。「私たちが求める出力を得るまでに、実際に製品に関する意思決定を行えるようになるまでには、数か月にわたる方法論の反復と改善が必要でした。」 

自分が構築したものを信頼する必要がありますが、そこが怖くてコストのかかる部分です。自社開発の分類器が「ユーザーの40%がXについて質問している」や「このユースケースがトレンドになっている」と伝えるたびに、頭の中で計算してしまいます。それは本当のことなのか?正しいユーザーセグメントを見ているのか?モデルが変わったときに分類がずれてしまったのか?更新されましたか?新しい問題のカテゴリ全体を見逃していましたか?それは、どのように尋ねればよいかわからなかったからですか?これは本物のパターンなのか、それともLLMが自信を持ってトレンドを幻覚しているのでしょうか?

それが、独自のAI測定ツールを構築することの実際のリスクです。そして最終的には、ビジネスコストとなります。スプリントでの構築コスト、メンテナンスの負担、そして実際に行動する代わりに自社ツールのアウトプットを監査するために費やす時間です。 

TicketmasterのBrian MuehlenkampがAgent Analyticsを導入する前、彼はまさにこれを行っていました。チャットログを一件一件手動で読み込み、インタラクションがうまくいったかどうかを確認していました。「非常に手作業で、一件一件対応していた」と彼は言いました。「結局、手間に見合う成果が得られないため、十分な注意を払えなくなっていた。」

信頼できる構造化データを手に入れた彼は、それを活用して大量発生している問題テーマを特定し、エージェントのナレッジベースを改善してその問題に対処することで、激怒プロンプトを53%削減することに成功しましたrate. これは、ログを目視確認したり、静的なスプレッドシートをアップロードしたり、データのクエリに何時間も費やしたりするだけでは得られない、体系化された質の高い成果です。

市場を勝ち取るエージェントの構築に注力してください。私たちは、それを実現するための実績あるツールを構築しました。

反論2:「LangSmithやArizeのようなAIオブザーバビリティツールはすでに導入しています。」

結構です。そのまま使い続けてください。開発者向けオブザーバビリティツールは、構築された目的において優れた性能を発揮します。トレース、レイテンシ、評価、トークンコスト、幻覚検出などです。エージェントが午前2時にダウンした場合、チームが連絡するのはそのツールです。それらのツールはシステムが正常かどうかを教えてくれますが、その問いは重要です。

しかし、誰のオブザーバビリティスタックも答えるように設計されていない第二の問いがあります。それは、ユーザーは実際に価値を得ているのか、というものです。

これらは同じ問いではありません。エージェントが完璧な稼働率、クリーンなトレース、1.2秒の応答時間を持っていても、ユーザーが質問を9回言い換え、フラストレーションを感じて諦め、二度と戻ってこないことがあります。開発ツールはそのインタラクションを完了したセッションとみなしますが、Agent Analytics がリスクのあるユーザーエクスペリエンスとしてフラグを立てます。

Technical AI Observability

Is the system working?

Messages:26 (13 turns)
Avg Response Time:1.2s
Token Usage:Within limits
Errors:0
Status:Completed
VERDICT: SYSTEM HEALTHY

Focuses on technical performance, uptime, and infrastructure health.

VS

Product-level AI Observability

Is the experience driving value?

Task intent mismatch:High
User re-prompts:9 rephrases
Goal achieved:No
Task abandoned:Yes
Frustration signal:Critical
VERDICT: USER FAILED

Focuses on user behavior, outcomes, and business impact.

もう一つの問題は、やはりデータの孤立です。現在、ほとんどのユーザーはエージェントを独立したシステムとして体験していません。従来のSaaS製品を操作し、摩擦ポイントに当たり、エージェントを開いて、必要なものを得るか離脱するかのどちらかです。ユーザージャーニー全体で何が起きているかを把握することで、エージェントが機能しているかどうかがはるかによくわかります。エージェントのデータが、製品アナリティクスの他の部分から切り離された別の可観測性ツールに存在する場合、その全体像を失ってしまいます。エージェントの利用状況をリテンション、コンバージョン、チャーンと結びつけることができません。エージェントはブラックボックスの中のブラックボックスになってしまいます。

開発ツールはLLMを監視します。Agent Analyticsは、ユーザーが本番環境でリアルタイムに体験することを監視します。両者は補完的であり、優れたチームはその両方を活用しています。実際にどのような形になるかはこちらをご覧ください。

異論3:「PIIとセキュリティに関する懸念があります。」

まったくもっともな懸念です。高度に規制された業界にいる場合でも、初めての大きなAI投資の承認を最近得たばかりの場合でも、セキュリティのハードルは複雑で長い手続きの連続となることがあります。

このハードルを容易にするために、Conversations APIを通じてAgent Analyticsに送信する情報のレベルを実際に決定することができます。Pendoに届く前に、チームは自社側で編集、変換、サニタイズを行うことができます。「John SmithのNew York City行き3月30日の旅行を予約して」というユーザープロンプトは「旅行の予約」になります。インテントシグナル、採用データ、リテンション相関は保持されます。機密情報はどこにも送られません。

ほとんどのチームにとって、これによりAgent Analyticsを活用することが可能になります。法務チームなどがさらに詳細を必要とする場合は、trust.pendo.ioおよびデータ収集とセキュリティに関するドキュメントをご覧ください。または、Pendoの最高情報セキュリティ責任者から直接エージェントデータの収集方法をお読みください。

異論4:「ユーザーがほんの数人しかいません。まだ早すぎます。」

これは私たちが最も気になる異論です。なぜなら、非常に合理的に見えながら、実は逆説的だからです。

現在エージェントに5人のユーザーがいるとしたら、自問してみてください:5人から20人に増やす準備ができているかどうかをどのように判断しますか?その決断は実際にどのようなものですか?どのデータを使いますか?

正直な答えが「1人のユーザーが素晴らしいと言ったら」や「クレームがなければ」であれば、それは盲目的な楽観主義であり、正当な製品判断ではありません。楽観主義は重要ですが、それだけではスケールしません。

Ticketmasterの友人、Brianの話に戻りましょう。彼は30〜35人のパワーユーザーのパイロットグループから始めました。彼らが気に入ることはわかっていました。なぜなら、すでにデモを見せた人たちだったからです。しかし、気に入ることとデータでそれを証明することは別物です。

Agent Analyticsは、採用が実際に行われていることを確認するメトリクスを提供し、新たに浮上した問題を明らかにし、アクセスを希望する全員に開放する確信を構築するのに役立ちました。その結果:エージェントを試したユーザーの81.6%のユーザーリテンション、そして初期パイロットを超えた約60%のユーザーベース成長を達成しました。「メトリクスがそれを裏付けていたので、予想よりもはるかに早くフェーズ2に移行する自信が持てました」と彼は語っています。

Brianが全体を説明するのを聞きたい方へ — PendoのMCP(Model Context Protocol)サーバーを使って継続的改善ループを実行する方法も含めて — 5月19日にライブで参加します。こちらから参加登録してください。

Brianのような他のPMもAgent Analyticsで成果を上げています。Pushpayは、ユーザーがわずか3〜4回のプロンプトでエージェントとの会話を離脱していることを発見しました。離脱が発生している正確な箇所を把握することで、チームは実際の行動に基づいてその特定のエクスペリエンスを再設計し、ユーザーが重要な情報を見つけるのにかかる時間が1〜2分から10秒に短縮されました。

これらの改善はいずれも、「十分な」ユーザー数が集まるまで待った結果ではありません。実際、すべてのケースで非常に早期のベータ段階から開始し、早期に測定し、パターンになる前に摩擦を発見し、ユーザーの信頼と採用を失う前に迅速な判断を下しました。 開始する適切なタイミングはユーザー1人目の時点でした。しかし、今すぐ始めても遅くはありません。

Pendo Agent Analyticsは、本番環境でのAIエージェントインタラクション向けに特化して構築されています。ユースケースの分類、問題の検出、そしてユーザーおよびプロダクト全体の成果への影響を把握できます。サムズアップ/サムズダウンだけでは決してわからないことが、すべてわかります。

チームが数分で失敗しているエージェントエクスペリエンスを特定する方法をご覧ください。 Agent Analyticsの実際の動作を見る