今、AIを構築するすべてのプロダクトチームがいずれ直面する問いを誰かが投げかけます:それは本当に役に立っているのか?
「動いているか」ではありません。それはインフラチームが答えられます。より難しい問いは、ユーザーが実際に使っているか、投げかけられた内容を処理できているか、そしてそのエクスペリエンスが価値を生み出しているのか、それとも静かに人々を諦めさせているのか、ということです。
それらの答えはサーバーログの中にはありません。
それが、Pendoが独自に埋めるAIのオブザーバビリティと導入のギャップです。Pendoは、ユーザーがAIエージェントとどのようにやり取りするか、何を尋ねるか、エージェントがどこで失敗するか、どのユースケースが導入を促進するか、そしてエージェントとのやり取りがワークフローを改善するのか新たな摩擦を生み出すのかを、チームが理解するのを助けます。
そして、これはほとんどの「エージェントオブザーバビリティ」コンテンツが扱う分野とは異なります。この用語を検索すると、分散トレーシング、スパンキャプチャ、トークン監視、OpenTelemetry標準に関するガイドが見つかるでしょう。
それはエージェントを稼働させ続けるエンジニアにとって価値あるインフラです。しかしプロダクトチームには異なる可視性のレイヤーが必要です:ユーザーが実際に何をしているか、成功しているか、どこで問題が起きているか、そしてそれがビジネスが重視する成果に影響を与えているかどうかです。
この記事ではそのレイヤーを解説します。初日から追跡する価値のある5つのシグナル、それを省略したときにチームが痛い目を見る2つのポイント、そして適切な可視性が整ったときの姿について説明します。
AIオブザーバビリティには2つの定義がある
エンジニアが「 「エージェントオブザーバビリティ」、 または「 「AIオブザーバビリティ」 」について話すとき、それは具体的な意味を持ちます。すべてのモデル呼び出しをトレースし、ツールの呼び出しをキャプチャし、インフラストラクチャレベルでレイテンシ、トークンコスト、障害率を監視することです。
しかし「 プロダクト 」チームがこれについて話すとき、少し異なる意味を持ちます。実際のユーザーがエージェントとどのようにやり取りしているか、何を達成しようとしているか、エクスペリエンスが実際に期待に応えているか、そしてこのAI投資が成果を上げているかどうかを理解することです。
異なるオーディエンスに向けたこれらの別々の問いは補完的であり、一緒に扱われるべきです。インフラストラクチャオブザーバビリティは「 どのように エージェントが動作しているか」を示し、AIエージェント利用オブザーバビリティは「 それが価値を生み出しているかどうか」を示します.
この2つの混同は、プロダクトチームがエージェントオブザーバビリティへの投資を怠る理由の一つです。エンジニアリング側の監視が全体像をカバーしていると思い込んでいますが、実際にはそうではありません。トレースデータは会話がエラーなく完了したことを示せますが、ユーザーが同じ質問を4回繰り返し、必要な回答を得られず、エージェントから離脱したことは示せません。特定の種類のリクエストが一貫して未回答であることや、特定のアカウントコホートがまったく関与していないことも示せません。
それらこそが、プロダクトの意思決定を左右するシグナルです。そして、それらにはまったく異なる種類のオブザーバビリティが必要です。
最初期のベータフェーズから追跡する価値のある5つのAIエージェント利用シグナル
測定なしでは、裏付けとなるデータなしにロードマップや成長に関する意思決定を行うことになります。
1) プロンプトの量とトレンド
利用は増加しているか、横ばいか、それともローンチ直後のスパイク後に減少しているか?リテンションカーブは、ユーザーがエージェントを再び使いたいと思うほど価値を感じているかどうかを示す、最も正直なシグナルです。初期の新鮮さが薄れた後の停滞は、パターンになる前に調査する価値があります。
2) ユースケースの分布
ユーザーは実際に何を尋ねているか?ここは、ほとんどのチームが最初の本当の驚きに直面する場所です。採用されるユースケースは、必ずしも設計されたものとは限りません。インテントの分布を理解することで、カバレッジを深めるべき場所、レスポンスを改善すべき場所がわかり、時には予想外の高価値なユースケースが明らかになることもあります。
3) 失敗とフラストレーションのシグナル
ユーザーが同じプロンプトを連続して繰り返したり、サポートされていないレスポンスに当たったり、会話の途中で離脱したりするのはどこか?中には、エージェントに向かって悪態をついているユーザーもいます。すべて大文字で入力しているユーザーもいます。彼らはチケットを送るのではなく、テキストボックスにフラストレーションをぶつけ、何かが変わることを期待しているだけです。
これらのシグナルは、たまにある任意のサムズダウンよりも価値があります。サムズダウンは、まだフィードバックを送るほど関与しているユーザーを必要とします。レイジプロンプトや全大文字の入力は、本当に行き詰まっているユーザーから来るものであり、誰かが評価を決めるかどうかに関わらず現れます。それらはランダムなノイズでもありません。カバレッジやエージェントの動作における特定のギャップの周りにクラスター化されます。
4) セグメント別の採用状況
どのアカウントやユーザーコホートが継続的に関与しているか?一度エージェントを試して消えてしまったのはどこか?アカウントレベルの採用データは、リーチの問題があるのか、品質の問題があるのか、あるいはその両方なのかを教えてくれます。また、次の更新の会話の前に注意が必要なセグメントも明らかにします。
5) エージェントが製品全体の行動に与える影響
エージェントの利用は、製品の他の部分でのより良い成果と相関しているか?タスク完了の迅速化、サポート量の低下、リテンションの強化と相関しているか?それとも、エージェントのアクティビティはビジネスが実際に重視する成果から切り離されて孤立して存在しているか?その問いへの答えこそが、AIフィーチャーをビジネスケースへと変えるものです。
エージェントの可観測性が重要な理由
効果的なものをスケールする
エージェントが一部のユーザーに浸透し始めると、成功と見なして次に進みたくなるものです。しかし、可視性のない導入は脆弱です。
どのユースケースがエンゲージメントを促進しているか、どのユーザーセグメントが最も価値を得ているか、そしてエージェントの利用状況が重要な成果(リテンション、タスク完了率、収益への影響など)にどのように結びついているかを把握する必要があります。それこそが、より多くの投資を行い、カバレッジを拡大し、勘ではなく確信を持って次の機能を優先するための根拠となります。feel.
ユーザーが諦める前に問題を修正する
これはより難しい問題です(そして、ほとんどのチームが過小評価しているものでもあります)。
AIは完璧ではありません。ユーザーがやってきて、もっともな質問をして、不十分な回答や不完全な回答を受け取り、そのまま去ってしまいます。サポートチケットを送ることもなく、アンケートに答えることもなく、ただ戻ってこないのです。
このドロップオフこそが、エージェント型ソフトウェアの「漏れるバケツ」であり、プロダクトレベルのエージェントAIオブザーバビリティが検出するよう設計されているものです。QBRで苦情が表面化したり、顧客との通話で誰かが手を挙げたりする頃には、同じ壁にぶつかって静かに離れていったユーザーをすでに失っています。通常であれば問題を検知するフィードバックループが製品の問題はここでは機能しません。最も悪い体験をしているユーザーは、それをあなたに伝える可能性も最も低いのです。
この問題に先手を打っているチームは、フィードバックを待って問題を発見しようとはしていません。彼らはシグナルを観察しています。繰り返されるプロンプト、サポートされていないリクエストの発生率、会話の離脱パターンなどです。特定の種類の質問が一貫して失敗していることが把握できれば、数四半期ではなく数日で対処できます。それは単により良いユーザーexperience. It's a retention strategy.
AI オブザーバビリティプラットフォームとして Agent Analytics が明らかにすること
Pendo Agent Analyticsは、製品内にエージェントを組み込む製品チームのために特別に構築されています。会話型AIとのユーザーインタラクションをキャプチャします。ユーザーが何を尋ねるか、会話がどのように展開されるか、どこで問題が発生するか、そしてエージェントの使用状況がプロダクト内でユーザーが行うその他のすべての操作と連携します。
以下の情報が明らかになります:
- 大規模な会話とプロンプト。 ユーザーが送信した実際のプロンプトと会話スレッド全体を、ユースケース、ユーザータイプ、アカウント別にセグメント化して確認できます。集計データではなく、実際のデータです。
- ユースケースの自動検出。 Agent Analytics は、プロンプトを意味的類似性によってグループ化し、ユーザーが実際に関心を持っているユースケース(構築を想定していなかったものも含む)を明らかにします。インテントを手動でタグ付けしたり分類したりする必要はありません。パターンは自然に浮かび上がります。
- 問題検出とレイジープロンプトトラッキング。 失敗やフラストレーションのシグナルは自動的にフラグが立てられます。ユーザーが同じことを繰り返したり、行き詰まったり、同じ箇所で会話を離脱したりしている場合、わざわざ探しに行かなくても把握できます。
- 実験。 異なるエージェント構成、プロンプト、またはカバレッジの変更を直接比較します。実際に成果を改善するものを、推測ではなく実測で把握しましょう。
- 製品横断的なコンテキスト。 Agent AnalyticsはPendo内に組み込まれているため、エージェントの動作をユーザーが製品内で行うその他すべての操作と関連付けることができます。エージェントとのインタラクションの前後にユーザーが何をしているか、エージェントの利用状況がリテンションやタスク完了率とどのように相関しているか、そしてエージェントが製品全体のジャーニーの中でどのような位置づけにあるかを把握できます。
OSAICのプロダクトリーダー、Christopher Penneyはこう述べています:
「Agent Analyticsは、顧客のニーズに関するまったく新しいレベルのインサイトを開いてくれます。顧客が何に悩んでいるか、何を尋ねているか、直接聞かなくてもわかるのです。」
ほとんどのチームは、ローンチ当日の指標が維持されないことを手遅れになってから気づきます。それは、シグナルがチャーンに変わる前に捉えるための可観測性レイヤーを整備していなかったためです。
Pendo Agent Analyticsが、最初のプロンプトからビジネス成果まで、全体像をどのように把握するかをご覧ください。