AIはここ3年間、LinkedInのフィードを席巻しており、エージェントを評価するツールも同様の速さで登場しています。
現在、エージェントのオブザーバビリティと測定に関しては、OpenAI EvalsやLangSmith、Arizeなど、開発者向けの選択肢が豊富に揃っています。
しかし、この議論において明らかに過小評価されている重要な声が一つあります。それは、開発をリードするAIプロダクトマネージャー(PM)です。
評価・エージェント測定ツールは競合するのではなく、共存すべきである
開発者向けに構築されたエージェント評価ツールは、トレース、レイテンシ、モデルの動作といったシステムレベルの診断に優れています。これらはエージェントのデバッグと修正という技術的な作業のために構築されており、分析の主な単位はラン、トレース、または評価スイートです。
しかし、技術的なパフォーマンスよりも、エージェントがユーザー、ワークフロー、ビジネス成果にどう影響するかを重視する場合はどうでしょうか?エージェントが良い仕事をしているか(あるいは悪い仕事をしているか)を把握したいだけで、何百ものログを精査する時間がない場合はどうでしょうか?
プロダクト担当者はこのような問いに答える必要があります。そのためには、エージェントおよびより広範なアプリ体験の中で、ユーザーの会話、ファネル、セッションを可視化する必要があります。
どちらか一方だけを使用している場合、AIエージェントの利用状況をビジネス成果に結びつけることはほぼ不可能です。しかし、開発者向けとPM向けの測定ツールを組み合わせることで、エージェント開発ライフサイクルにおいて互いを補完し合います。だからこそ、多くのチーム(そして確かに最高のチーム)は両方を活用しています。
PMがプロダクト中心の測定によってより効果的に解決できる4つのユースケースを探ってみましょう。
1. エージェントを誰がどのように使っているかを素早く把握する
開発ツールはチェーンが何回実行されたかを示しますが、エンタープライズアカウントが実際にエージェントを採用しているかどうかを即座に教えてくれるようには設計されていません。利用が最も活発なのはどの部門ですか?スーパーユーザーはこれを活用していますか?それとも、このAIツールで全く新しいオーディエンスにリーチしていますか?
AIエージェント測定ツールは、アプリの他のデータと連携することで、役割、アカウント、ワークフロー全体にわたる会話型AIのパフォーマンスをセグメント化して比較できます。これにより、どのペルソナやユースケースがエージェント体験から実際に恩恵を受けているか、そして従来の手法と比べてどこでより多くの摩擦やリスクが生じているかを把握できます。
これをより広範なプロダクトエクスペリエンスの一部として捉えることで、エージェントの長期的な影響を理解し始めることができます。
2. ユーザーのセンチメントとリスクを監視する
評価スイートはモデルが幻覚を起こしたときにフラグを立てますが、不正確な出力を受け取り、さらに3回試みた末に離脱した不満を抱えたユーザーを示すことはできません。すべて大文字で入力する、同じ質問を何度も繰り返す、機密ファイルや顧客データを共有する——こうした種類の会話にフラグを立てることは、エージェントの成功を確保するために不可欠です。
AIエージェントの失敗と潜在的なリスクを明らかにするために、PMはユーザーの会話に基づく自動的な問題検出とセンチメント監視を必要としています。それにより、以下のことが可能になります:
- ユースケース別にエージェントの問題やエラーをフィルタリングし、エージェントが解決に苦労していることを把握する(そしてAIロードマップの優先順位を決めて修正する)
- 激怒の瞬間の前後および最中における、特定のユーザーとエージェントのやり取りのリプレイを視聴し、会話データを確認する。
- 影響を受けたユーザーと彼らが達成しようとしていたことに結び付けながら、コンプライアンス違反またはリスクのある行動をハイライトする。
どのユースケースが不満を持つユーザー(またはリスクのある行動)につながっているかを注意深く監視することで、最終的に会社の成長と評判を守ることができます。
3. エージェントの使用状況をビジネス成果に結びつける
オブザーバビリティプラットフォームはレイテンシやトークンコストを追跡しますが、エージェントがリテンションを促進しているか、ワークフローを加速しているか、または満足度を損なっているかを seamlessに教えてくれるわけではありません。
この問いに答えるために、プロダクト中心の測定手法はエージェントの使用状況をプロダクト体験とビジネス指標(タスク完了率、コンバージョン率、ユーザーフィードバック、ワークフロー速度)に直接マッピングします。これにより、PMは各エージェントを、技術的なベンチマークだけでなく実際の成果に対してパフォーマンスをレビューできる機能またはデジタル従業員として扱うことができます。
PM中心の測定ツールを使えば、重要な問いに答えることができます:
- エージェントの使用状況はコンバージョンとどのように相関していますか?リテンションは?満足度は?
- どのタイプのユーザーがエージェントに最も関与し、成功していますか?最も少ないのは?
- ユーザーはどのようにしてエージェントを最初に発見していますか?どのチャネルが最も多くの採用を促進しましたか?
- エージェント体験と従来のUIのどちらが、満足度と収益成長との相関が強いですか?
4. フィードバックを収集する
評価ツールは精度と検索パフォーマンスを測定しますが、ユーザーが何を考え、何を感じているかを把握する手段を備えていないことがほとんどです。ユーザーは満足しているのか?混乱しているのか?解約を検討しているのか?エージェントの利用状況をユーザーフィードバックと結びつける手段がなければ、「何が起きたか」には答えられても、「なぜそうなったか」には答えられません。
PMファーストのエージェント測定により、ユーザーのセンチメントと満足度を総合的に把握できます。エージェント利用の前と後のユーザーフィードバックを分析し、行動データのコンテキストで確認し、ユーザーの行動のリプレイを視聴できます。これはVOCの究極の形であり、エージェントの影響を完全に描き出します。ユーザーが言ったこと、行ったこと、そして感じたことを。
ケーススタディ:プロダクト担当者がAIエージェントのパフォーマンスを評価する方法
PendoチームはPMを中心とした測定ツールであるAgent Analyticsを毎日活用しています。活用方法の一つは、ClaudeやChatGPTなどの人気ツールにおける社内AI利用状況のモニタリングです。もう一つの活用例は、平易な言葉のプロンプトをアプリ内ガイドに変換するAIガイド作成ツールの導入状況のモニタリングです。
AIガイド作成ツールを担当するPMのAlejandroは、Agent Analyticsのレポートを活用して、誰がその機能を使っているか、どのくらいの頻度で使っているか、どのようなユースケースがあるかを把握しました。
Alejandroは、人気のユースケース(動画を使ったガイドの作成)がサポートされていないことを発見し、これをロードマップで優先事項とし、ガイドを活用してツールの機能を伝え、ユーザーの期待値を適切に設定しました。
また、Alejandroはエージェントとのやり取りのセッションリプレイを確認し、AIガイド作成ワークフローでデッドクリックが発生していることを発見しました。これにより、開発修正を早急に求めるための重要な根拠を得ることができました。Daoの言葉を借りれば、「Agent Analyticsは優れたプロダクトの基本を置き換えるものではありません。しかし、自分自身のスキルを加速・増幅させるものとして機能します。」
PMのために構築された初のAIエージェント測定ツール
開発者はトレースおよび評価ツールを使用してチェーンが失敗した原因を診断します。PMはプロダクト中心の測定ツールを使用して、どのユースケースが課題を抱えているかを特定し、詳細な技術的診断のために特定のシナリオをエンジニアリングチームに引き渡します。
どちらの役割にも専門的な測定が必要であり、それぞれに設計されたツールを使用します。Agent Analyticsのセルフガイドツアーを体験することで、導入促進、摩擦の軽減、AIのROI証明を今すぐ始めましょう。