KI dominiert seit drei Jahren unsere LinkedIn-Feeds, und Tools zur Bewertung von Agenten sind ebenso schnell entstanden. 

Inzwischen gibt es eine Fülle von entwicklerspezifischen Optionen für Agent-Observability und -Messung, von OpenAI Evals und LangSmith bis hin zu Arize

Doch eine wichtige Stimme ist in dieser Diskussion auffällig unterrepräsentiert: der KI-Produktmanager (PM), der die Entwicklung leitet. 

Evaluierungs- und Agentenmesstools sollten koexistieren, nicht konkurrieren

Für Entwickler konzipierte Agent-Evaluierungstools sind hervorragend für Diagnosen auf Systemebene geeignet, wie Traces, Latenz und Modellverhalten. Sie sind für die technische Arbeit des Debuggens und Behebens von Agenten ausgelegt, und ihre primäre Analyseeinheit ist ein Run, Trace oder Eval-Suite.

Aber was, wenn Sie sich weniger um die technische Leistung sorgen und mehr darum, wie Agenten Benutzer, Workflows und Geschäftsergebnisse beeinflussen? Was, wenn Sie einfach wissen möchten, ob Ihr Agent gute (oder schlechte) Arbeit leistet, und Sie keine Zeit haben, Hunderte von Logs zu durchsuchen? 

Produktverantwortliche müssen solche Fragen beantworten. Dazu benötigen sie Einblick in Benutzerkonversationen, Funnels und Sitzungen innerhalb von Agenten und der übergeordneten App-Erfahrung. 

Wenn Sie nur eines von beiden verwenden, ist es nahezu unmöglich, die Nutzung von KI-Agenten mit Geschäftsergebnissen zu verknüpfen. Zusammen ergänzen sich jedoch entwickler- und PM-zentrierte Messtools im agentischen Entwicklungslebenszyklus. Deshalb verwenden viele Teams (und sicherlich die besten Teams) beide. 

Lassen Sie uns vier Anwendungsfälle erkunden, die PMs mit produktzentrierter Messung besser lösen können. 

1. Schnell sehen, wer Ihren Agenten verwendet (und wie)

Entwicklertools zeigen Ihnen, wie oft eine Chain ausgeführt wurde, aber sie sind nicht dafür ausgelegt, Ihnen sofort zu sagen, ob Ihre Enterprise-Accounts Ihren Agenten tatsächlich einsetzen. Ist die Nutzung in einer Abteilung am stärksten? Engagieren sich Ihre Power-User damit? Oder erreichen Sie mit diesem KI-Tool ein völlig neues Publikum?  

KI-Agentenmesstools, die mit dem Rest Ihrer App-Daten verbunden sind, ermöglichen es Ihnen, die Leistung von Konversations-KI nach Rollen, Accounts und Workflows zu segmentieren und zu vergleichen. So erfahren Sie, welche Personas und Anwendungsfälle tatsächlich von einer agentischen Erfahrung profitieren und wo sie mehr Reibung oder Risiko verursacht als ihr traditionelleres Pendant. 

Wenn Sie dies als Teil Ihres umfassenderen Produkterlebnisses betrachten, können Sie beginnen, die langfristigen Auswirkungen Ihres Agenten zu verstehen. 

2. Nutzerstimmung und Risiken überwachen

Eval-Suites erkennen, wenn ein Modell halluziniert, zeigen Ihnen jedoch nicht den frustrierten Nutzer, der diese fehlerhafte Ausgabe erhalten hat, es dreimal erneut versucht hat und dann abgewandert ist. Großbuchstaben beim Tippen, mehrfaches Stellen derselben Frage, das Teilen vertraulicher Dateien und Kundendaten – das Markieren solcher Konversationen ist entscheidend für den Erfolg eines Agenten. 

Um die Fehler und potenziellen Risiken eines KI-Agenten aufzudecken, benötigen PMs eine automatische Problemerkennung und Stimmungsüberwachung auf Basis von Nutzerkonversationen. Dann können Sie: 

  • Agenten-Probleme und -Fehler nach Anwendungsfall filtern, um zu sehen, womit Ihr Agent Schwierigkeiten hat (und Ihre KI-Roadmap entsprechend priorisieren, um dies zu beheben)
  • Replays ansehen und Konversationsdaten der genauen Nutzer- und Agenteninteraktion vor, während und nach Momenten der Frustration einsehen.
  • Nicht konforme oder riskante Verhaltensweisen hervorheben und dabei nachverfolgen, wer betroffen war und was die Person zu tun versuchte.

Wenn Sie genau beobachten, welche Anwendungsfälle zu unzufriedenen Nutzern (oder riskantem Verhalten) führen, können Sie letztendlich das Wachstum und den Ruf Ihres Unternehmens schützen. 

3. Agent-Nutzung mit Geschäftsergebnissen verknüpfen

Observability-Plattformen verfolgen Latenz und Token-Kosten, sagen Ihnen jedoch nicht nahtlos, ob Ihr Agent die Kundenbindung fördert, Workflows beschleunigt oder die Zufriedenheit beeinträchtigt. 

Um Ihnen bei der Beantwortung dieser Frage zu helfen, ordnet eine produktzentrierte Messung die Agent-Nutzung direkt der Produkterfahrung und Geschäftskennzahlen zu: Aufgabenabschluss, Konversionsraten, Nutzerfeedback und Workflow-Geschwindigkeit. Dies ermöglicht es PMs, jeden Agenten wie ein Feature oder einen digitalen Mitarbeiter zu behandeln, dessen Leistung anhand tatsächlicher Ergebnisse und nicht nur technischer Benchmarks bewertet werden kann. 

Mit einem PM-zentrierten Messwerkzeug können Sie die wichtigen Fragen beantworten: 

  • Wie korreliert die Agent-Nutzung mit Konversionen? Kundenbindung? Zufriedenheit? 
  • Welche Nutzertypen sind am stärksten engagiert und erfolgreich mit dem Agenten? Am wenigsten? 
  • Wie entdecken Nutzer den Agenten erstmals? Welche Kanäle haben die meiste Akzeptanz gefördert?
  • Hat Ihre Agent-Erfahrung oder die traditionelle Benutzeroberfläche eine stärkere Korrelation mit Zufriedenheit und Umsatzwachstum? 

4. Feedback einholen

Eval-Tools messen Genauigkeit und Abrufleistung, bieten jedoch häufig keine Möglichkeit, die Gedanken und Gefühle der Nutzer zu erfassen. Sind die Nutzer zufrieden? Verwirrt? Planen sie, ihr Abonnement zu kündigen? Ohne eine Möglichkeit, die Agent-Nutzung mit dem Nutzerfeedback zu verknüpfen, können Sie zwar beantworten, „was passiert ist", aber nicht „warum".

Die PM-first-Agent-Messung gibt Ihnen einen ganzheitlichen Überblick über die Nutzerstimmung und -zufriedenheit. Analysieren Sie Nutzerfeedback von vor und nach der Agent-Nutzung, betrachten Sie es im Kontext von Verhaltensdaten und sehen Sie sich Wiedergaben ihres Verhaltens an. Das ist der heilige Gral der VOC und zeichnet das vollständige Bild der Wirkung Ihres Agenten: was Nutzer gesagt haben, was sie getan haben und wie sie sich gefühlt haben.

Fallstudie: Wie Produktverantwortliche die Leistung von KI-Agenten bewerten

Das Pendo-Team nutzt unser PM-zentriertes Messwerkzeug, Agent Analytics, täglich. Eine Möglichkeit, wie wir es einsetzen, ist die Überwachung der internen KI-Nutzung in gängigen Tools wie Claude und ChatGPT. Eine weitere Möglichkeit besteht darin, die Einführung unseres KI-gestützten Guide-Erstellungstools zu überwachen, das einfache Textprompts in In-App-Guides umwandelt.

Der PM hinter unserem KI-gestützten Guide-Erstellungstool, Alejandro, nutzte die Berichte von Agent Analytics, um zu sehen, wer das Feature nutzte, wie häufig und für welche Anwendungsfälle.

Als Alejandro feststellte, dass ein häufiger Anwendungsfall (das Erstellen eines Leitfadens mit einem Video) nicht unterstützt wurde, priorisierte er dies auf der Roadmap, nutzte Leitfäden, um zu kommunizieren, wozu das Tool in der Lage ist, und half dabei, die Erwartungen der Nutzer zu kalibrieren. 

Alejandro sah sich außerdem Session-Replays von Agent-Interaktionen an und entdeckte Dead Clicks im KI-gestützten Leitfaden-Erstellungsworkflow. Dies lieferte ihm die dringend benötigten Belege, um so schnell wie möglich eine Entwicklerkorrektur durchzusetzen. Wie Dao es formuliert: „Agent Analytics ersetzt keine soliden Produktgrundlagen. Aber es wirkt als Beschleuniger oder Verstärker Ihrer eigenen Fähigkeiten." 

Das erste KI-Agent-Messwerkzeug, das für PMs entwickelt wurde

Entwickler verwenden Tracing- und Evaluierungstools, um zu diagnostizieren, warum eine Chain fehlgeschlagen ist. PMs verwenden produktzentrierte Messwerkzeuge, um zu identifizieren, bei welchen Anwendungsfällen es Probleme gibt, und übergeben dann spezifische Szenarien zur technischen Tiefendiagnose an das Engineering. 

Beide Rollen benötigen spezialisierte Messverfahren – und verwenden dafür jeweils geeignete Tools. Machen Sie eine selbstgeführte Tour durch Agent Analytics, um die Akzeptanz zu steigern, Reibungsverluste zu reduzieren und Ihren KI-ROI nachzuweisen.