エージェント型AIへの投資は大幅に増加し、戦略的な重要性も高まっています。18か月前、AIエージェントはパイロットプログラムや概念実証の領域にとどまっていました。しかし今日では、あらゆる規模の組織において、カスタマーサポートのフロー、従業員のオンボーディング、社内ナレッジベース、そして数多くのワークフローに組み込まれるようになっています。

CFOはもはやAI支出を傍観しているだけではありません。今日、彼らは予算を主導し、その説明責任を求めています。取締役会はAIが導入されているかどうか、そしてそれが持続的なビジネス価値をどのように生み出しているかを知りたがっており、そのため以下のパターンを注意深く検討する価値があります。 

93% のエンタープライズAI予算はテクノロジー自体に充てられており、インフラ、モデル、デプロイメントが支出の大部分を占めています。残りの7%は行動変容に充てられており、その投資のリターンを実現するために必要な導入と測定。

これは野心の失敗ではなく、組織がエージェントを大規模に展開し始めた時点でのツールエコシステムの状況を反映しているに過ぎません。エージェントを構築するためのツールは急速に成熟しました。ユーザーがエージェントをどのように体験するかを理解するためのツールはまだ追いついておらず、その両者のギャップこそが、AIの価値の相当部分が静かに消えてしまいます。

エージェントは技術的に申し分なくても、それでも失敗することがある 

今日、AIエージェントの監視における主流のアプローチは、開発者向けオブザーバビリティスタックから来ています。トレース、スパン、レイテンシ測定、トークン消費量、幻覚検出、エラーレートなどがその例です。LangSmith、Arize、Braintrustといったツールはエンジニアがエンジニアのために構築したものであり、その役割を十分に果たしています。これらのツールは、エージェントが実行中に役立ち、次のような質問に答えるのに役立ちます: 

  • エージェントは応答しましたか?
  • どのくらい時間がかかりましたか?
  • トークンあたりのコストはいくらでしたか?
  • ハルシネーションは発生しましたか?
  • APIはどこで失敗しましたか?

これらは必要な質問ですが、それだけでは十分ではありません。

エージェントは一見完璧に見えることがあります——高速なレスポンス、低いエラー率、クリーンなトレース——それでも、構築された目的である人々のニーズを満たせていないことがあります。ユーザーが実際に必要としていたことを一貫して見逃しながら、質問に素早く答えることができます。サポートを開く方が簡単だとユーザーが感じたためにほとんど使われていないにもかかわらず、優れた稼働率を誇ることができます。チケット。 

一方、プロダクト担当者は、異なる種類のオブザーバビリティに関する質問をしています: 

  • ユーザーは必要なものを得られましたか?
  • どこでフラストレーションを感じていますか?
  • 実際にどのようなユースケースが生まれていますか?
  • 導入は拡大していますか、それとも停滞していますか?
  • スケールする価値はありますか?

どちらの質問も重要です。しかし、AIへの投資がビジネス価値をもたらしているかどうかを示すのは、そのうちの一方だけです。そして現時点では、ほとんどの組織においてその指標はほぼ計測されていません。

誰も追跡していないハイブリッドSaaSとエージェント体験

エージェントを単独で測定しても全体像が把握できない構造的な理由は、ユーザーはエージェントを単独で体験するわけではないからです。

ほとんどのエンタープライズ環境では、エージェントはより広範なソフトウェア体験の中に組み込まれています。ユーザーはダッシュボードを操作し、摩擦ポイントに直面し、AIエージェントに頼ります。その後にユーザーが何をするか(タスクを完了するか、サポートチケットを開くか、あるいは完全に離脱するか)は、エージェントの応答そのものよりも、エージェントが成功したかどうかをはるかに雄弁に物語りますitself. The full session is the unit of measurement that matters.

そのデータが別々のシステムに存在している場合、特定のワークフローで苦労しているユーザーが、その後のエージェントとのやり取りを離脱しやすいという事実を把握することができません。また、より適切に設計されたUIであれば自己解決できたはずの質問を、エージェントが対応しているという事実も見えてきません。クリックベースのソフトウェアからエージェント型ソフトウェアへの移行は、ユーザーエクスペリエンス全体にわたって発生しており、そのように把握できる必要があります。

Pendoはその全体像を捉えます:エージェントとのインタラクションの前、最中、そして後にユーザーが行うことを、既存のすべてのプロダクトアナリティクスとともに、単一のデータセットで確認できます。

ユーザーエクスペリエンスが変化する中で実際に何が起きているかを把握するには、それが唯一の方法です。そして、それに答えるために構築されたのがPendo Agent Analyticsです。

Agent Analyticsが実際に測定するもの

Pendoが2025年6月にAgent Analyticsをリリースした際、その前提はシンプルなものでした。AIエージェントの影響を測定することは、他の重要なプロダクト機能を測定することと大きく変わらないはずだ、というものです。 

採用。エンゲージメントの深さ。リテンション。タスク完了率。そして、チャーンになる前に離脱を予測する摩擦シグナル。1年が経過した今、そのフレームワークは維持されつつも、エージェントの健全性を示す先行指標となる特定の指標群を中心に、より明確になってきました。プロダクト担当者はエージェントのパフォーマンス指標を測定する必要があり、のように: 

  1. 問題発生率: エージェントがユーザーのニーズを解決できなかった会話の割合。繰り返しのガイダンス、タイムアウト、スクリプト外の応答。摩擦の先行指標。
  2. レイジプロンプト率: ユーザーが繰り返し言い換えたり、すべて大文字を使用したり、失敗したプロンプトを連続して送信したりすること。レイジクリックの会話版に相当します。
  3. リテンション率: 時間の経過とともにエージェントに戻ってくるユーザーの割合。目新しさではなく、持続的な価値を示す最も明確なシグナルです。

これらの主要指標が(Agent Analyticsで収集されるその他の指標とともに)意味を持つのは、製品におけるユーザーのその他のエクスペリエンスと並行して追跡されるからです。問題発生率(Issue Rate)が単独で上昇している場合はシグナルの一つです。問題発生率が上昇し製品全体の採用率や定着率の急激な低下と相関するレートは、実用的なインテリジェンスです。

優れた製品を生み出すのと同じ原則がエージェントにも適用される

Pendoは、創業当初から変わらない2つの信念のもとに構築されました。 

第一に:ユーザーがソフトウェアをどのように体験しているかを真に理解するには、複数の種類のシグナルが必要です。定量データはユーザーが何をするかを教えてくれます。定性フィードバックはユーザーが何を考えているかを教えてくれます。センチメントはユーザーがどう感じているかを教えてくれます。ビジュアルリプレイはユーザーが実際に見たものを正確に示してくれます。そして会話データ——第5の、そして最新のディメンション——は、ユーザーがエージェントに伝える内容と、それがユーザー体験に与える影響を把握できます。これらを組み合わせることで、全体像を把握することができます。

2つ目の信念が1つ目を有用なものにします。それは、アナリティクスとガイダンスは同じツールに属するべきだということです。ユーザーがどこで苦労しているかを理解することは、それに対処できる場合にのみ価値があります。対応する手段を持たないインサイトは、高コストな認識に過ぎません。

どちらの考え方も、AIエージェントに直接当てはまります。Agent Analyticsは、これらすべての側面を会話型AIに拡張します。Issue Rate、Rage Prompt Rate、Retentionなどの定量的な指標は、大規模なパターンを明らかにし、Session Replayでは、ユーザーの忍耐が切れた瞬間を正確に特定し、センチメントはユーザーがプロンプトに対してどのように感じているかを明らかにし、定性的なシグナルはユーザーがエージェントに現在できないことをさせたいと思っていることを示します。これらのいずれかの側面で摩擦ポイントが浮上した場合、Pendo Guides を使えば、プロダクトチームはエンジニアリングスプリントなしに即座に対応できます。

これら5つのシグナルとそれに対応する機能が1つのプラットフォームに集約されると、問いは「エージェントはどのように機能しているか?」から「エージェントはユーザーの製品の使い方をどのように変えているか?」へと変わります。 

デプロイしたものと、ユーザーが実際に求めているもの

すべてのエージェントは目的を持って構築されています。オンボーディングに関する質問への対応、経費精算のサポート、関連ドキュメントの提示などです。これらは意図されたユースケース、つまりチームが意図的に設計し投資したワークフローです。しかし、ユーザーは自分自身のやり方でエージェントと対話し、エージェントが想定していない質問をしたり、設計されていないワークフローを試みたりします。誰も予想していなかった用途です。

Pendoは、セマンティッククラスタリング(手動タグ付けなしにテーマ別にプロンプトをグループ化する手法)を通じて、こうした新たなユースケースを自動的に把握します。これにより、実際にエンゲージメントを促進している行動と、意図したユースケースが静かに無視されている状況を可視化できます。

決済プロバイダーのPushpayは、ユーザーがAgent Analyticsとのやり取りをわずか3〜4回のプロンプトで離脱していることを把握しました。ユーザーが離脱した正確な箇所を確認することで、ドロップオフが発生していたことで、チームは仮定ではなく実際のユーザーリクエストに基づいてその特定のエクスペリエンスを再設計することができました。現在、彼らはAI検索ツールの定期的なモニタリングにAgent Analyticsを使用しており、それを活用したユーザーが重要な情報へのアクセス時間を1〜2分から10秒に短縮したことを確認しています。

エージェントの行動をビジネス成果に結びつける

CFOにとって最も重要な測定指標は、必ずしも導入率そのものではなく、リターンです。AIエージェントへの投資対効果を証明するには、エージェントとのインタラクションをその後のビジネス成果に結びつける必要があります。

Pendoは、エージェントをユーザーのワークフローの一部として扱うコンバージョンファネルとパス比較を通じてこれを実現します。予約アシスタントを利用したユーザーは、より高い割合で予約を完了することができるでしょうか?AIを活用した経費ツールを使用している従業員は、従来のクリックベースのパスをたどる従業員よりも早くレポートを完了できるでしょうか?エージェント型の方法は、それが置き換えたものよりも実際に優れているのでしょうか?

社内向けデプロイメントでは、ROIのケースは多くの場合、労働面で測定されます。エージェントが処理しているルーティンクエリの数と、それによって何が解放されるかという観点です。顧客向けデプロイメントでは、リテンションと満足度データに現れます。いずれの場合も、証明にはエージェントのインタラクションをその後に起こることと結びつける必要があり、それが可能なのはデータが同じ場所に存在する場合に可能です。

取締役会がすでに問いかけているAI ROIの質問に答える

今この瞬間も、あなたの組織のどこかで、誰かがAIのROIに関するスライドを作成しています。それは取締役会、予算レビュー、あるいはリーダーシップのオフサイトのためかもしれません。そして不都合な真実は、ほとんどの組織において、そのスライドはデプロイメント指標——稼働中のエージェント数、送信されているプロンプト数、どれだけの費用が費やされたか—それが唯一利用可能なデータだからです。

デプロイメント指標は、取締役会が実際に問いかけている質問に答えるものではありません。彼らが知りたいのは、投資が機能しているかどうか、ユーザーがツールを導入して生産性向上を実感しているかどうか、そしてこれが発展の基盤となるのか(あるいは終了すべき高コストな実験なのか)ということです。それらの答えには別の種類のデータが必要であり、現時点では、ほとんどの組織にはそれが備わっていません。

それがAgent Analyticsが埋めるギャップです。エンジニアリングスタックが提供するよう設計されていなかった層、つまりユーザーの体験を追加します。ユーザーが何を必要としていたか、それを得られたかどうか、どこで諦めたか、そしてそれが拡大・維持・撤退のいずれを意味するかを明らかにします。このビデオで仕組みをご覧ください。