L'IA domine nos fils LinkedIn depuis trois ans, et les outils d'évaluation des agents ont émergé tout aussi rapidement.
Il existe désormais une multitude d'options destinées aux développeurs en matière d'observabilité et de mesure des agents, d'OpenAI Evals et LangSmith à Arize.
Mais une voix majeure a été nettement sous-représentée dans cette conversation : le chef de produit IA (PM) qui pilote le développement.
Les outils d'évaluation et de mesure des agents doivent coexister, et non se concurrencer
Les outils d'évaluation d'agents conçus pour les développeurs excellent dans les diagnostics au niveau système, comme les traces, la latence et le comportement des modèles. Ils sont pensés pour le travail technique de débogage et de correction des agents, et leur unité d'analyse principale est une exécution, une trace ou une suite d'évaluations.
Mais que se passe-t-il si vous vous souciez moins des performances techniques et davantage de l'impact des agents sur les utilisateurs, les flux de travail et les résultats commerciaux ? Et si vous vouliez simplement savoir si votre agent fait du bon (ou du mauvais) travail, sans avoir le temps de parcourir des centaines de journaux ?
Les équipes produit doivent répondre à ce type de questions. Pour cela, elles ont besoin d'une visibilité sur les conversations des utilisateurs, les entonnoirs et les sessions au sein des agents et de l'expérience applicative globale.
Lorsque vous n'utilisez qu'un seul type d'outil, il est presque impossible de relier l'utilisation des agents IA aux résultats commerciaux. Mais ensemble, les outils de mesure orientés développeurs et ceux orientés PM se complètent dans le cycle de développement agentique. C'est pourquoi de nombreuses équipes (et certainement les meilleures) utilisent les deux.
Explorons quatre cas d'usage que les PMs peuvent mieux résoudre grâce à une mesure centrée sur le produit.
1. Voir rapidement qui utilise votre agent (et comment)
Les outils de développement vous indiquent combien de fois une chaîne a été exécutée, mais ils ne sont pas conçus pour vous dire instantanément si vos comptes entreprise adoptent réellement votre agent. L'utilisation est-elle plus forte au sein d'un département ? Vos super-utilisateurs s'y engagent-ils ? Ou touchez-vous un public entièrement nouveau avec cet outil IA ?
Les outils de mesure des agents IA, connectés au reste des données de votre application, vous permettent de segmenter et de comparer les performances de l'IA conversationnelle selon les rôles, les comptes et les flux de travail. Cela vous indique quels personas et quels cas d'usage bénéficient réellement d'une expérience agentique, et là où elle génère plus de friction ou de risque que son équivalent plus traditionnel.
En traitant cela comme une partie de votre expérience produit globale, vous pouvez commencer à comprendre l'impact à long terme de votre agent.
2. Surveiller le sentiment des utilisateurs et les risques
Les suites d'évaluation signalent les hallucinations d'un modèle, mais elles ne vous montrent pas l'utilisateur frustré qui a reçu ce mauvais résultat, a réessayé trois fois, puis a abandonné. Écrire en majuscules, poser la même question plusieurs fois, partager des fichiers confidentiels et des données clients — signaler ces types de conversations est essentiel pour garantir le succès d'un agent.
Pour mettre en évidence les échecs et les risques potentiels d'un agent IA, les chefs de produit ont besoin d'une détection automatique des problèmes et d'une surveillance du sentiment basée sur les conversations des utilisateurs. Vous pouvez alors :
- Filtrer les problèmes et erreurs de l'agent par cas d'usage, afin de voir ce que votre agent peine à résoudre (et prioriser votre feuille de route IA pour y remédier)
- Regarder des replays et consulter les données conversationnelles de l'interaction exacte entre l'utilisateur et l'agent avant, pendant et après les moments de frustration intense.
- Mettre en évidence les comportements non conformes ou risqués tout en les reliant aux personnes concernées et à ce qu'elles cherchaient à accomplir.
Surveiller de près les cas d'usage qui génèrent des utilisateurs mécontents (ou des comportements risqués) vous aidera à terme à protéger la croissance et la réputation de votre entreprise.
3. Relier l'utilisation des agents aux résultats métier
Les plateformes d'observabilité suivent la latence et les coûts en tokens, mais elles ne vous indiquent pas clairement si votre agent favorise la rétention, accélère les flux de travail ou nuit à la satisfaction.
Pour vous aider à répondre à cette question, la mesure centrée sur le produit associe directement l'utilisation des agents à l'expérience produit et aux métriques métier : taux de complétion des tâches, taux de conversion, retours utilisateurs et vitesse des flux de travail. Cela permet aux PMs de traiter chaque agent comme une fonctionnalité ou un employé numérique dont les performances peuvent être évaluées par rapport aux résultats réels, et pas seulement aux benchmarks techniques.
Avec un outil de mesure centré sur le PM, vous pouvez répondre aux questions importantes :
- Comment l'utilisation des agents est-elle corrélée aux conversions ? À la rétention ? À la satisfaction ?
- Quels types d'utilisateurs sont les plus engagés et les plus performants avec l'agent ? Les moins ?
- Comment les utilisateurs découvrent-ils l'agent pour la première fois ? Quels canaux ont généré le plus d'adoption ?
- Votre expérience avec l'agent ou l'interface utilisateur traditionnelle présente-t-elle une corrélation plus forte avec la satisfaction et la croissance des revenus ?
4. Recueillir des retours
Les outils d'évaluation mesurent la précision et les performances de récupération, mais ils n'incluent pas souvent de moyens pour capturer ce que les utilisateurs pensent ou ressentent. Les utilisateurs sont-ils satisfaits ? Confus ? Envisagent-ils de se désabonner ? Sans un moyen de relier l'utilisation de l'agent aux retours des utilisateurs, vous pouvez répondre à « ce qui s'est passé », mais pas au « pourquoi ».
La mesure de l'agent axée sur les PM vous offre une vue holistique du sentiment et de la satisfaction des utilisateurs. Analysez les retours des utilisateurs avant et après l'utilisation de l'agent, visualisez-les dans le contexte des données comportementales, et regardez les replays de leur comportement. C'est le Graal de la VOC, et cela dresse le tableau complet de l'impact de votre agent : ce que les utilisateurs ont dit, ce qu'ils ont fait, et ce qu'ils ont ressenti.
Étude de cas : Comment les responsables produit évaluent les performances des agents IA
L'équipe Pendo utilise notre outil de mesure centré sur les PM, Agent Analytics, chaque jour. L'une des façons dont nous l'utilisons est de surveiller l'utilisation interne de l'IA sur des outils populaires comme Claude et ChatGPT. Une autre façon dont nous l'avons utilisé est de surveiller l'adoption de notre outil de création de guides IA, qui transforme des invites en langage naturel en guides intégrés à l'application.
Le PM derrière notre outil de création de guides IA, Alejandro, a utilisé les rapports d'Agent Analytics pour voir qui utilisait la fonctionnalité, à quelle fréquence, et quels étaient les cas d'usage.
Lorsqu'Alejandro a constaté qu'un cas d'usage populaire (la création d'un guide avec une vidéo) n'était pas pris en charge, il l'a priorisé dans la feuille de route, a utilisé des guides pour communiquer les capacités de l'outil et a contribué à aligner les attentes des utilisateurs.
Alejandro a également regardé des replays de session des interactions avec l'agent et a découvert des clics sans effet dans le workflow de création de guide par IA. Cela lui a fourni les preuves dont il avait besoin pour obtenir un correctif de développement dans les plus brefs délais. Comme le dit Dao : « Agent Analytics ne remplace pas de bons fondamentaux produit. Mais il agit comme un accélérateur ou un amplificateur de vos propres compétences. »
Le premier outil de mesure d'agent IA conçu pour les PMs
Les développeurs utilisent des outils de traçage et d'évaluation pour diagnostiquer pourquoi une chaîne a échoué. Les PMs utilisent des outils de mesure centrés sur le produit pour identifier les cas d'usage en difficulté, puis transmettent des scénarios spécifiques à l'ingénierie pour un diagnostic technique approfondi.
Les deux rôles nécessitent une mesure spécialisée — et utilisent des outils conçus pour chacun. Faites une visite guidée en autonomie d'Agent Analytics en action pour commencer à stimuler l'adoption, réduire les frictions et prouver votre retour sur investissement en IA.