Agentische Investitionen waren erheblich und zunehmend strategisch. Vor achtzehn Monaten waren KI-Agenten größtenteils auf Pilotprogramme und Proof-of-Concepts beschränkt. Heute werden sie in Kundensupport-Abläufe, das Onboarding von Mitarbeitern, interne Wissensdatenbanken und unzählige andere Workflows in Organisationen jeder Größe integriert.

CFOs beobachten KI-Ausgaben nicht länger aus der Distanz. Heute verantworten sie das Budget und fordern Rechenschaft dafür. Vorstände wollen wissen, ob KI eingesetzt wird und wie sie dauerhaften Geschäftswert schafft – was das folgende Muster besonders aufmerksam zu betrachten lohnt. 

93% des KI-Budgets von Unternehmen fließt in die Technologie selbst, wobei Infrastruktur, Modelle und Bereitstellung den Großteil der Ausgaben ausmachen. Die verbleibenden 7 % entfallen auf die Verhaltensänderung, Einführung und Messung, die erforderlich sind, um den Return on Investment zu realisieren.

Dies ist kein Versagen des Ehrgeizes, sondern spiegelt lediglich wider, wo das Tooling-Ökosystem stand, als Organisationen begannen, Agenten in großem Maßstab einzusetzen. Die Tools zum Erstellen von Agenten reiften schnell. Die Tools zum Verstehen, wie Benutzer sie erleben, holen noch auf, und die Lücke zwischen diesen beiden Dingen ist der Ort, an dem ein erheblicher Teil des KI-Werts leise verschwindet.

Agenten können technisch einwandfrei sein und trotzdem scheitern 

Heute stammt der vorherrschende Ansatz zur Überwachung von KI-Agenten aus dem Developer-Observability-Stack: Traces, Spans, Latenzmessungen, Token-Verbrauch, Halluzinationserkennung, Fehlerraten. Tools wie LangSmith, Arize und Braintrust wurden von Entwicklern für Entwickler gebaut und erfüllen ihre Aufgabe gut. Sie zeigen Ihnen, ob Ihr Agent running and help you answer questions, like: 

  • Hat der Agent geantwortet?
  • Wie lange hat es gedauert?
  • Was hat es pro Token gekostet?
  • Hat er halluziniert?
  • Wo ist die API fehlgeschlagen?

Das sind notwendige Fragen, aber sie allein reichen nicht aus.

Ein Agent mag auf den ersten Blick perfekt wirken – schnelle Antworten, niedrige Fehlerquoten, saubere Traces – und dennoch den Menschen, für die er entwickelt wurde, nicht gerecht werden. Er kann Fragen schnell beantworten und dabei konsequent verfehlen, was die Nutzer tatsächlich benötigten. Er kann eine hervorragende Verfügbarkeit aufweisen und trotzdem kaum genutzt werden, weil es den Nutzern einfacher erschien, einen Support zu öffnen ticket. 

Produktverantwortliche hingegen stellen andere Arten von Beobachtbarkeitsfragen: 

  • Haben die Nutzer das bekommen, was sie brauchten?
  • Wo werden sie frustriert?
  • Welche Anwendungsfälle entstehen tatsächlich?
  • Wächst die Akzeptanz oder stagniert sie?
  • Lohnt es sich, dies zu skalieren?

Beide Fragenkomplexe sind wichtig. Aber nur einer zeigt Ihnen, ob Ihre KI-Investition einen geschäftlichen Mehrwert liefert – und für die meisten Unternehmen bleibt diese Spalte derzeit weitgehend ungemessen.

Die hybride SaaS- und agentische Erfahrung, die niemand verfolgt

Es gibt einen strukturellen Grund, warum die Messung von Agenten isoliert ein unvollständiges Bild ergibt: Benutzer erleben Agenten nicht isoliert.

In den meisten Unternehmensumgebungen ist ein Agent in eine umfassendere Softwareerfahrung eingebettet. Ein Benutzer navigiert durch ein Dashboard, stößt auf einen Reibungspunkt und wendet sich an einen KI-Agenten. Was er danach tut (ob er die Aufgabe abschließt, ein Support-Ticket öffnet oder den Vorgang ganz abbricht), sagt weit mehr darüber aus, ob der Agent erfolgreich war, als die Antwort des Agentenitself. The full session is the unit of measurement that matters.

Wenn diese Daten in separaten Systemen gespeichert sind, können Sie nicht erkennen, dass Nutzer, die mit einem bestimmten Workflow Schwierigkeiten haben, eher dazu neigen, die darauffolgende Agent-Interaktion abzubrechen. Sie können nicht erkennen, dass Ihr Agent Fragen beantwortet, die eine besser gestaltete Benutzeroberfläche von selbst beantwortet hätte. Der Übergang von klickbasierter Software zu agentischer Software ist happening across the entire user experience, and you need to be able to see it that way.

Pendo erfasst diese vollständige Ansicht: was Benutzer vor, während und nach Agent-Interaktionen tun – in einem einzigen Datensatz, zusammen mit all Ihren bestehenden Produktanalysen.

Es ist die einzige Möglichkeit zu verstehen, was tatsächlich passiert, wenn sich die Benutzererfahrung verändert. Und genau das wurde mit Pendo Agent Analytics entwickelt, um es zu beantworten.

Was Agent Analytics tatsächlich misst

Als Pendo Agent Analytics im Juni 2025 einführte, war die Prämisse einfach: Die Messung der Wirkung eines KI-Agenten sollte ähnlich aussehen wie die Messung jeder anderen bedeutenden Produktfunktion. 

Adoption. Engagement-Tiefe. Bindung. Aufgabenerfüllung. Und die Reibungssignale, die das Abbrechen vorhersagen, bevor es zur Abwanderung wird. Nach einem Jahr hat sich dieser Rahmen bewährt und sich um eine spezifische Gruppe von Kennzahlen geschärft, die sich als führende Indikatoren für die Gesundheit von Agenten herausgestellt haben. Produktverantwortliche müssen Agent-Performance-Metriken messen, like: 

  1. Problemrate: Der Anteil der Gespräche, bei denen der Agent das Anliegen des Nutzers nicht lösen kann. Wiederholte Anleitungen, Timeouts, nicht skriptkonforme Antworten. Der führende Indikator für Reibungspunkte.
  2. Rage-Prompt-Rate: Nutzer, die Anfragen wiederholt umformulieren, Großbuchstaben verwenden oder schnell aufeinanderfolgende fehlgeschlagene Prompts senden. Das konversationelle Äquivalent eines Rage-Klicks.
  3. Wiederkehrrate: Der Anteil der Nutzer, die im Laufe der Zeit zum Agenten zurückkehren. Das deutlichste Signal für dauerhaften Wert gegenüber bloßer Neuheit.

Was diese Schlüsselkennzahlen – neben den anderen, die in Agent Analytics erfasst werden – bedeutsam macht, ist, dass sie zusammen mit dem Rest der Nutzererfahrung im Produkt verfolgt werden. Eine steigende Problemrate isoliert betrachtet ist ein Signal. Eine steigende ProblemRate, die mit einem starken Rückgang der allgemeinen Produktakzeptanz oder -bindung korreliert, ist verwertbare Intelligenz.

Die gleichen Prinzipien, die großartige Produkte liefern, gelten auch für Agenten

Pendo wurde auf zwei Überzeugungen aufgebaut, die seit Anfang an Bestand haben. 

Das Erste: Um wirklich zu verstehen, wie Nutzer Software erleben, braucht man mehr als eine Art von Signal. Quantitative Daten sagen Ihnen, was Nutzer tun. Qualitatives Feedback sagt Ihnen, was sie denken. Stimmungsdaten sagen Ihnen, wie sie sich fühlen. Visuelle Wiedergaben zeigen Ihnen genau, was sie gesehen haben. Und Konversationsdaten – die fünfte und neueste Dimension – erfassen, was users say to your agent and how it impacts their experience. Together, they give you the full picture.

Die zweite Überzeugung macht die erste nützlich: Analysen und Guidance gehören in dasselbe Tool. Zu verstehen, wo Nutzer Schwierigkeiten haben, ist nur dann wertvoll, wenn man darauf reagieren kann. Erkenntnisse ohne die Möglichkeit zu handeln sind lediglich teures Bewusstsein.

Beide Überzeugungen lassen sich direkt auf KI-Agenten anwenden. Agent Analytics erweitert all diese Dimensionen auf konversationelle KI: Quantitative Metriken wie Issue Rate, Rage Prompt Rate und Retention zeigen Muster in großem Maßstab auf; Session Replay ermöglicht es Ihnen, die genau dem Moment, in dem die Geduld eines Nutzers erschöpft war; die Stimmung zeigt, wie Nutzer über das empfinden, was sie eingeben; und qualitative Signale enthüllen, was Nutzer vom Agenten erwarten, was dieser derzeit nicht leisten kann. Wenn ein Reibungspunkt in einer dieser Dimensionen auftaucht, Pendo Guides ermöglichen es Produktteams, sofort darauf zu reagieren – ohne einen Engineering-Sprint.

Wenn diese fünf Signale und die Fähigkeit, auf sie zu reagieren, in einer Plattform vereint sind, verschiebt sich die Frage von „Wie läuft der Agent?" zu „Wie verändert der Agent die Art und Weise, wie Menschen mein Produkt nutzen?" 

Was Sie bereitgestellt haben vs. was Nutzer tatsächlich wollen

Jeder Agent wird mit einem bestimmten Zweck entwickelt: Onboarding-Fragen beantworten, bei der Spesenabrechnung helfen, relevante Dokumentation bereitstellen. Das sind die vorgesehenen Anwendungsfälle: die Workflows, die ein Team bewusst entworfen und in die es investiert hat. Aber Benutzer interagieren mit Agenten auf ihre eigene Weise, stellen Fragen, für die der Agent nicht konzipiert wurde, und versuchen Workflows niemand erwartet hatte.

Pendo macht diese emergenten Anwendungsfälle automatisch sichtbar – durch semantisches Clustering, das Prompts thematisch gruppiert, ohne manuelles Tagging – sodass Sie erkennen können, welche Verhaltensweisen tatsächlich das Engagement fördern und welche beabsichtigten Anwendungsfälle still und leise ignoriert werden.

Pushpay, ein Zahlungsanbieter, stellte fest, dass Nutzer Gespräche mit Agent Analytics bereits nach drei oder vier Eingaben abbrachen. Genau zu sehen, wo die drop-off was happening let the team redesign that specific experience based on real user requests rather than assumptions. They now use Agent Analytics for regular monitoring of their AI search tool, and have found users leveraging it decreased their time to access critical information from 1-2 minutes to 10 seconds.

Agent-Verhalten mit Geschäftsergebnissen verknüpfen

Die Messfrage, die für einen CFO am wichtigsten ist, betrifft möglicherweise nicht explizit die Akzeptanz, sondern den Return. Und der Weg, den Return on Investment eines KI-Agenten nachzuweisen, besteht darin, Agent-Interaktionen mit nachgelagerten Geschäftsergebnissen zu verknüpfen.

Pendo tut dies durch Konversionstrichter und Pfadvergleiche, die den Agenten als einen Schritt im Workflow des Nutzers und nicht als separates System behandeln. Hat ein Nutzer, der mit dem Buchungsassistenten interagiert, eine höhere Rate des Abschlusses einer Reservierung? Schließt der Mitarbeiter, der das KI-gestützte Spesenwerkzeug verwendet, seinen Bericht schneller ab als derjenige, der den traditionellen klickbasierten Weg verfolgt? Ist die agentische Methode tatsächlich besser als das, was sie ersetzt hat?

Bei internen Deployments wird der ROI-Nachweis häufig in Arbeitsstunden gemessen: Wie viele Routineanfragen bearbeitet der Agent, und welche Kapazitäten werden dadurch freigesetzt? Bei kundenseitigen Deployments zeigt er sich in Bindungs- und Zufriedenheitsdaten. In beiden Fällen erfordert der Nachweis, die Agenten-Interaktion mit dem zu verknüpfen, was danach passiert – und das ist nur möglich, wenn die Daten an derselben Stelle gespeichert sind.

Die KI-ROI-Fragen beantworten, die Ihr Vorstand bereits stellt

Irgendwo in Ihrer Organisation bereitet gerade jemand eine Folie über den ROI von KI vor. Vielleicht für ein Vorstandsmeeting, eine Budgetüberprüfung oder ein Führungskräfte-Offsite. Und die unbequeme Wahrheit ist, dass diese Folie bei den meisten Organisationen auf Deployment-Metriken basiert – wie viele Agenten aktiv sind, wie viele Prompts gesendet werden, wie viel ausgegeben wurde – denn das sind die einzigen verfügbaren Daten.

Deployment-Metriken beantworten nicht die Frage, die Vorstände tatsächlich stellen. Sie möchten wissen, ob die Investition sich auszahlt, ob die Nutzer die Tools annehmen und Produktivitätssteigerungen erzielen, und ob dies eine Grundlage ist, auf der man aufbauen kann (oder ein teures Experiment, das man beenden sollte). Diese Antworten erfordern eine andere Art von Daten, und derzeit verfügen die meisten Organisationen haben es nicht.

Das ist die Lücke, die Agent Analytics schließt. Es fügt die Ebene hinzu, die Ihr Engineering-Stack nie dafür ausgelegt war bereitzustellen: die Erfahrung des Nutzers. Was sie brauchten, ob sie es bekommen haben, wo sie aufgegeben haben und was das dafür bedeutet, ob Sie ausbauen, halten oder zurückziehen. Sehen Sie in diesem Video, wie es funktioniert.