Si vous êtes comme la plupart des entreprises, vous êtes sous pression pour investir dans de grands systèmes d'IA et les déployer. Et à ce stade, vous avez probablement déjà consacré une bonne partie de votre budget à cela. 

Mais trop peu de personnes réfléchissent à ce qui se passe ensuite : prouver la valeur, l'impact sur les employés et la valeur pour les actionnaires. 

93 % du budget IA des entreprises est consacré à la technologie elle-même : l'infrastructure, les modèles, le déploiement. Les 7 % restants servent à comprendre si tout cela fonctionne réellement. De nombreux concepteurs et dirigeants ont réalisé qu'il leur manquait la couche analytique pour faire fonctionner l'ensemble.

Voici ce qui est ressorti des conversations avec ces dirigeants, et pourquoi les apparences peuvent être trompeuses. 

Objection 1 : « Nous pourrions simplement créer nous-mêmes des outils de mesure des agents. »

Bien sûr que vous pourriez. Nous sommes en 2026. Nous le savons. Et « vous-même » ne désigne même pas une équipe d'ingénieurs. Un PM avec Cursor et un après-midi de libre peut coder en mode vibe quelque chose qui analyse ses conversations avec les agents.

Cela vous donnera un prototype fonctionnel, une démo sympa, et un problème de qualité qui couve et que vous ne ressentirez pas avant d'avoir un panier percé d'utilisateurs qui ne reviennent pas au moment de passer à l'échelle. 

Nous avons été confrontés au même défi en interne : « Lorsque nous avons utilisé pour la première fois un LLM pour analyser les conversations des agents, les résultats semblaient excellents jusqu'à ce que nous les vérifiions. Notre solution classifiait de manière erronée les problèmes avec assurance et s'écartait de ses instructions de façons que nous n'avions pas prévues », a déclaré Danielle Goh, Sr. Product Manager pour Agent Analytics. « Pour obtenir des résultats que nous aurions actually make a product decision around took months of iterating and improving our methodology." 

Vous devez avoir confiance en ce que vous construisez, et c'est là que les choses deviennent inquiétantes et coûteuses. Chaque fois que votre classificateur maison vous indique « 40 % des utilisateurs posent des questions sur X » ou « ce cas d'usage est en hausse », vous faites le calcul dans votre tête. Est-ce réel ? Examine-t-il le bon segment d'utilisateurs ? La classification a-t-elle dérivé lorsque le modèle mis à jour ? Avons-nous manqué une catégorie entière de nouveaux problèmes parce que nous ne savions pas comment les demander ? S'agit-il d'un véritable schéma ou le LLM hallucine-t-il avec assurance une tendance ?

C'est le véritable risque de construire votre propre outil de mesure de l'IA. Et à terme, cela devient un coût pour l'entreprise : le sprint pour le développer, la charge de maintenance, et les heures passées à auditer les résultats de votre propre outil plutôt qu'à agir dessus. 

Avant que Brian Muehlenkamp de Ticketmaster dispose d'Agent Analytics, il faisait exactement cela : lire manuellement les journaux de chat un par un, en essayant de déterminer si un l'interaction s'était bien passée ou non. « C'était très manuel, un par un », a-t-il dit. « Au point où je ne lui accordais tout simplement pas la diligence nécessaire, parce que le jeu n'en valait pas la chandelle. »

Une fois qu'il disposait de données fiables et structurées en lesquelles il pouvait réellement avoir confiance, il les a utilisées pour identifier un thème de problème à volume élevé, a amélioré la base de connaissances de l'agent pour y remédier, et a obtenu une réduction de 53 % des invites de rage rate. Il s'agit d'un gain de qualité systématisé que vous ne pouvez pas obtenir en parcourant des journaux à l'œil, en téléchargeant des feuilles de calcul statiques et en passant des heures à interroger vos données.

Concentrez vos efforts sur la création de l'agent qui vous permettra de conquérir le marché. Nous avons conçu l'outil, éprouvé, pour vous aider à y parvenir.

Objection 2 : « Nous avons déjà un outil d'observabilité de l'IA, comme LangSmith ou Arize. »

Bien. Continuez à l'utiliser. Les outils d'observabilité pour développeurs sont excellents dans ce pour quoi ils ont été conçus : traces, latence, évaluations, coûts en tokens, détection des hallucinations. Si votre agent tombe en panne à 2 h du matin, c'est à eux que votre équipe fera appel. Ces outils vous indiquent si le système est en bonne santé, et cette question est importante.

Mais il y a une deuxième question à laquelle aucune pile d'observabilité n'a été conçue pour répondre : mes utilisateurs tirent-ils réellement de la valeur ?

Ce ne sont pas les mêmes questions. Un agent peut avoir une disponibilité parfaite, des traces propres et un temps de réponse de 1,2 seconde, tandis qu'un utilisateur reformule sa question neuf fois, abandonne par frustration et ne revient jamais. Votre outil de développement considère cette interaction comme une session complétée, alors que Agent Analytics le signale comme une expérience utilisateur à risque.

Technical AI Observability

Is the system working?

Messages:26 (13 turns)
Avg Response Time:1.2s
Token Usage:Within limits
Errors:0
Status:Completed
VERDICT: SYSTEM HEALTHY

Focuses on technical performance, uptime, and infrastructure health.

VS

Product-level AI Observability

Is the experience driving value?

Task intent mismatch:High
User re-prompts:9 rephrases
Goal achieved:No
Task abandoned:Yes
Frustration signal:Critical
VERDICT: USER FAILED

Focuses on user behavior, outcomes, and business impact.

L'autre problème, encore une fois, est l'isolation des données. Actuellement, la plupart des utilisateurs ne vivent pas les agents comme un système autonome. Ils naviguent dans votre produit SaaS traditionnel, rencontrent un point de friction, ouvrent l'agent, et obtiennent ce dont ils ont besoin ou abandonnent. Ce qui se passe tout au long du parcours utilisateur vous en dit bien plus sur le bon fonctionnement de votre agent. Lorsque les données de l'agent se trouvent dans un outil d'observabilité distinct, cloisonné du reste de vos analyses produit, vous perdez complètement cette vue d'ensemble. Vous ne pouvez pas relier l'utilisation de l'agent à la rétention, à la conversion ou au taux d'attrition. L'agent devient une boîte noire dans une boîte noire.

Les outils de développement surveillent vos LLM. Agent Analytics surveille ce que les utilisateurs vivent, en direct en production. Ils sont complémentaires, et les meilleures équipes utilisent les deux. Voici à quoi cela ressemble en pratique.

Objection 3 : « Nous avons des préoccupations concernant les données personnelles et la sécurité. »

Tout à fait légitime. Que vous évoluiez dans un secteur fortement réglementé ou que vous ayez simplement obtenu récemment l'approbation pour votre premier grand investissement en IA, l'obstacle de la sécurité peut représenter un ensemble complexe et long de démarches administratives à surmonter.

Pour vous faciliter la tâche, vous pouvez en réalité décider du niveau d'information que vous envoyez à Agent Analytics via l'API Conversations. Avant que quoi que ce soit n'atteigne Pendo, votre équipe peut effectuer des suppressions, des transformations et une désensibilisation de votre côté. La requête utilisateur « Réserver un voyage à New York le 30 mars pour John Smith » devient « réservation de voyage ». Vous conservez le signal d'intention, les données d'adoption, la corrélation de rétention. Les informations sensibles ne vont nulle part.

Pour la plupart des équipes, cela leur permet de tirer parti d'Agent Analytics. Si vous ou vos équipes juridiques avez besoin de plus de détails, consultez trust.pendo.io et notre documentation sur la collecte de données et la sécurité. Ou lisez comment nous collectons les données des agents directement auprès du Responsable de la Sécurité des Systèmes d'Information de Pendo.

Objection 4 : « Nous n'avons que quelques utilisateurs. C'est trop tôt. »

C'est celle qui nous touche vraiment, parce qu'elle est si raisonnable et pourtant si à rebours de la réalité.

Si vous avez actuellement cinq utilisateurs sur votre agent, demandez-vous : comment décidez-vous quand vous êtes prêt à passer de cinq à 20 ? À quoi ressemble concrètement cette décision ? Quelles données utiliserez-vous ?

Si la réponse honnête est « si un utilisateur nous dit que c'est super » ou « nous ne recevons aucune plainte », c'est de l'optimisme aveugle, pas une décision produit légitime. Et bien qu'important, l'optimisme seul ne passe pas à l'échelle.

Revenons à notre ami chez Ticketmaster, Brian. Il a commencé avec un groupe pilote de 30 à 35 utilisateurs expérimentés, et il savait qu'ils l'apprécieraient parce que c'était à eux qu'il l'avait déjà présenté. Mais apprécier quelque chose et avoir les données pour le prouver sont deux choses différentes.

Agent Analytics lui a fourni les métriques pour confirmer que l'adoption était réelle, faire remonter les problèmes émergents et bâtir la conviction nécessaire pour ouvrir l'accès à quiconque le souhaitait. Le résultat : 81,6 % de rétention des utilisateurs parmi les personnes ayant essayé l'agent, et environ 60 % de croissance de la base d'utilisateurs au-delà du pilote initial. « Cela m'a donné la confiance nécessaire pour passer à la phase deux bien plus rapidement que prévu, parce que j'avais les métriques pour l'étayer », a-t-il expliqué.

Si vous souhaitez entendre Brian présenter l'ensemble du processus — notamment la façon dont il utilise le serveur MCP (Model Context Protocol) de Pendo pour exécuter une boucle d'amélioration continue — il nous rejoint en direct le 19 mai. Réservez votre place ici.

D'autres chefs de produit comme Brian obtiennent également des résultats avec Agent Analytics : Pushpay a découvert que les utilisateurs abandonnaient les conversations avec l'agent après seulement trois ou quatre invites. En identifiant précisément où se produisaient les abandons, leur équipe a pu repenser cette expérience spécifique en se basant sur des comportements réels, et les utilisateurs sont passés d'une à deux minutes pour trouver des informations critiques à seulement dix secondes.

Aucune de ces améliorations n'est venue d'une attente d'un nombre « suffisant » d'utilisateurs. En réalité, dans tous les cas, ils ont commencé en version bêta très précoce, en mesurant tôt, en détectant les frictions avant qu'elles ne deviennent un schéma récurrent, et en prenant des décisions rapides avant de perdre la confiance et l'adoption des utilisateurs. Le bon moment pour commencer, c'était dès le premier utilisateur. Mais maintenant, c'est bien aussi.

Pendo Agent Analytics est conçu spécifiquement pour les interactions avec les agents IA en production : classification des cas d'usage, détection des problèmes et impact sur les résultats globaux des utilisateurs et des produits. Tout ce que le simple pouce levé/pouce baissé ne vous dira jamais.

Découvrez comment les équipes identifient les expériences d'agent défaillantes en quelques minutes. Voir Agent Analytics en action