Wenn Sie wie die meisten Unternehmen sind, stehen Sie unter Druck, großartige KI-Systeme zu investieren und einzusetzen. Und wahrscheinlich haben Sie bisher einen erheblichen Teil Ihres Budgets dafür aufgewendet.
Aber viel zu wenige Menschen denken darüber nach, was als Nächstes passiert: den Nutzen nachweisen, die Auswirkungen auf die Mitarbeiter und den Wert für die Aktionäre.
93 % des KI-Budgets von Unternehmen fließen in die Technologie selbst: Infrastruktur, Modelle, Bereitstellung. Die verbleibenden 7 % werden dafür aufgewendet, zu verstehen, ob davon überhaupt etwas funktioniert. Viele Builder und Führungskräfte haben erkannt, dass ihnen die Analyse-Ebene fehlt, die alles zum Laufen bringt.
Hier ist, was in Gesprächen mit diesen Führungskräften zur Sprache kam – und warum nicht alles so ist, wie es scheint.
Einwand 1: „Wir könnten die Tools zur Agent-Messung einfach selbst entwickeln."
Natürlich könntest du das. Es ist 2026. Das wissen wir. Und „wir selbst" bedeutet nicht einmal ein Team von Ingenieuren. Ein PM mit Cursor und einem freien Nachmittag kann etwas zusammen-viben, das seine Agent-Gespräche analysiert.
Das bringt dir einen funktionierenden Prototyp, eine coole Demo und ein schwellendes Qualitätsproblem, das du erst dann spürst, wenn du einen undichten Eimer an nicht zurückkehrenden Nutzern hast – genau dann, wenn es darum geht, das Ganze zu skalieren.
Wir standen intern vor der gleichen Herausforderung: „Als wir zum ersten Mal ein LLM zur Analyse von Agent-Gesprächen einsetzten, sahen die Ergebnisse großartig aus – bis wir sie überprüften. Unsere Lösung kategorisierte Probleme mit großer Überzeugung falsch und wich auf unvorhersehbare Weise von ihren Anweisungen ab", sagte Danielle Goh, Sr. Product Manager für Agent Analytics. „Um zu einer Ausgabe zu gelangen, der wiractually make a product decision around took months of iterating and improving our methodology."
Sie müssen dem vertrauen, was Sie entwickeln, und genau da wird es beängstigend und teuer. Jedes Mal, wenn Ihr selbst entwickelter Klassifikator Ihnen sagt: „40 % der Nutzer fragen nach X" oder „dieser Anwendungsfall liegt im Trend", rechnen Sie im Hinterkopf nach. Ist das real? Schaut er auf das richtige Nutzersegment? Hat sich die Klassifikation verschoben, als das Modellaktualisiert? Haben wir eine ganze Kategorie neuer Probleme übersehen, weil wir nicht wussten, wie wir danach fragen sollten? Ist dies ein echtes Muster oder halluziniert das LLM selbstsicher einen Trend?
Das ist das eigentliche Risiko, wenn man sein eigenes KI-Messwerkzeug entwickelt. Und irgendwann wird es zu einem Geschäftskostenfaktor: der Sprint, um es zu bauen, der Wartungsaufwand und die Stunden, die man damit verbringt, die Ergebnisse des eigenen Tools zu prüfen, anstatt auf sie zu reagieren.
Bevor Ticketmasters Brian Muehlenkamp Agent Analytics hatte, tat er genau das: Er las Chat-Protokolle manuell einzeln durch und versuchte festzustellen, ob ein Interaktion gut verlief oder nicht. „Es war sehr manuell, sehr eins nach dem anderen", sagte er. „Bis zu dem Punkt, wo ich ihm einfach nicht mehr die nötige Sorgfalt widmete, weil der Aufwand den Nutzen nicht wert war."
Sobald er über zuverlässige, strukturierte Daten verfügte, denen er wirklich vertrauen konnte, nutzte er diese, um ein häufig auftretendes Problem zu identifizieren, verbesserte die Wissensdatenbank des Agenten, um es zu beheben, und erzielte eine Reduzierung der Rage-Prompts um 53 % rate. Dies ist ein systematisierter, qualitativer Gewinn, den Sie nicht durch das Überfliegen von Logs, das Hochladen statischer Tabellen und stundenlange Datenbankabfragen erzielen können.
Konzentrieren Sie Ihre Bemühungen auf den Aufbau des Agenten, der Ihnen den Markt sichert. Wir haben das Werkzeug entwickelt – bewährt –, um Ihnen dabei zu helfen.
Einwand 2: „Wir haben bereits ein KI-Observability-Tool, wie LangSmith oder Arize."
Gut. Verwenden Sie es weiter. Entwickler-Observability-Tools sind hervorragend in dem, wofür sie entwickelt wurden: Traces, Latenz, Evals, Token-Kosten, Halluzinationserkennung. Wenn Ihr Agent um 2 Uhr morgens ausfällt, ist das das Team, das Sie anrufen werden. Diese Tools zeigen Ihnen, ob das System gesund ist – und diese Frage ist wichtig.
Aber es gibt eine zweite Frage, für deren Beantwortung kein Observability-Stack konzipiert wurde: Erhalten meine Nutzer tatsächlich einen Mehrwert?
Das sind nicht dieselben Fragen. Ein Agent kann eine perfekte Betriebszeit, saubere Traces und eine Antwortzeit von 1,2 Sekunden aufweisen, während ein Nutzer seine Frage neunmal umformuliert, frustriert aufgibt und nie wiederkommt. Ihr Entwicklungstool wertet diese Interaktion als abgeschlossene Sitzung, wohingegen Agent Analytics markiert es als eine gefährdete Benutzererfahrung.
Technical AI Observability
Is the system working?
Focuses on technical performance, uptime, and infrastructure health.
Product-level AI Observability
Is the experience driving value?
Focuses on user behavior, outcomes, and business impact.
Das andere Problem ist, wie bereits erwähnt, die Datenisolierung. Derzeit erleben die meisten Nutzer Agenten nicht als eigenständiges System. Sie navigieren durch Ihr herkömmliches SaaS-Produkt, stoßen auf einen Reibungspunkt, öffnen den Agenten und erhalten entweder das, was sie brauchen, oder brechen ab. Was sich über die gesamte User Journey hinweg abspielt, sagt Ihnen weit mehr darüber, ob Ihr Agent funktioniert. Wenn Agent-Daten in einem separaten Observability-Tool gespeichert sind, das vom Rest Ihrer Produktanalyse isoliert ist, verlieren Sie dieses Gesamtbild vollständig. Sie können die Agentennutzung nicht mit Retention, Conversion oder Churn verknüpfen. Der Agent wird zu einer Black Box innerhalb einer Black Box.
Dev-Tools überwachen Ihre LLMs. Agent Analytics überwacht, was Nutzer erleben – live in der Produktion. Sie ergänzen sich, und die besten Teams nutzen beide. So sieht das in der Praxis aus.
Einwand 3: „Wir haben Bedenken hinsichtlich PII und Sicherheit."
Völlig berechtigt. Ob Sie in einer stark regulierten Branche tätig sind oder gerade erst die Genehmigung für Ihre erste große KI-Investition erhalten haben – die Sicherheitshürde kann ein komplexes, langwieriges Geflecht aus bürokratischen Anforderungen sein.
Um Ihnen diese Hürde zu erleichtern, können Sie tatsächlich selbst festlegen, welche Informationen Sie über die Conversations API an Agent Analytics senden. Bevor irgendetwas Pendo erreicht, kann Ihr Team auf Ihrer Seite redigieren, transformieren und bereinigen. Der Nutzer-Prompt „Reise nach New York City am 30. März für John Smith buchen" wird zu „Reise buchen". Sie behalten das Intent-Signal, die Adoptionsdaten und die Retention-Korrelation. Die sensiblen Details gehen nirgendwo hin.
Für die meisten Teams ermöglicht dies die Nutzung von Agent Analytics. Wenn Sie oder Ihre Rechtsabteilung weitere Details benötigen, besuchen Sie trust.pendo.io und unsere Dokumentation zu Datenerfassung und Sicherheit. Oder lesen Sie, wie wir Agentendaten erfassen – direkt vom Chief Information Security Officer von Pendo.
Einwand 4: „Wir haben nur wenige Nutzer. Es ist noch zu früh."
Das ist der Einwand, der uns wirklich beschäftigt, weil er so nachvollziehbar und doch so verkehrt ist.
Wenn Sie derzeit fünf Nutzer für Ihren Agenten haben, fragen Sie sich: Wie entscheiden Sie, wann Sie bereit sind, von fünf auf 20 zu wachsen? Wie sieht diese Entscheidung tatsächlich aus? Welche Daten werden Sie verwenden?
Wenn die ehrliche Antwort lautet „wenn ein Nutzer uns sagt, dass es großartig ist" oder „wir keine Beschwerden erhalten", ist das blinder Optimismus, keine legitime Produktentscheidung. Und obwohl wichtig, skaliert Optimismus allein nicht.
Kehren wir zu unserem Freund bei Ticketmaster zurück: Brian. Er startete mit einer Pilotgruppe von 30 bis 35 Power-Usern, und er wusste, dass sie es mögen würden, weil es genau die Personen waren, denen er es bereits vorgeführt hatte. Aber etwas zu mögen und die Daten zu haben, die das belegen, sind zwei verschiedene Dinge.
Agent Analytics gab ihm die Kennzahlen, um zu bestätigen, dass die Adoption real war, aufkommende Probleme zu identifizieren und die Überzeugung aufzubauen, den Zugang für alle zu öffnen, die ihn wollten. Das Ergebnis: 81,6 % Nutzer-Retention unter den Personen, die den Agenten ausprobierten, und ein Wachstum der Nutzerbasis von rund 60 % über die ursprüngliche Pilotgruppe hinaus. „Es gab mir die Zuversicht, viel schneller als erwartet in Phase zwei überzugehen, weil ich die Kennzahlen hatte, die das unterstützten", beschrieb er.
Wenn Sie hören möchten, wie Brian das Ganze durchgeht – einschließlich der Nutzung von Pendos MCP-Server (Model Context Protocol) für einen kontinuierlichen Verbesserungskreislauf – ist er am 19. Mai live dabei. Sichern Sie sich hier Ihren Platz.
Andere PMs wie Brian erzielen ebenfalls Erfolge mit Agent Analytics: Pushpay stellte fest, dass Nutzer Agent-Gespräche nach nur drei oder vier Eingaben abbrachen. Da das Team genau sehen konnte, wo der Abbruch stattfand, konnte es diese spezifische Erfahrung auf Basis echten Verhaltens neu gestalten – und die Nutzer benötigten statt einer bis zwei Minuten nur noch zehn Sekunden, um wichtige Informationen zu finden.
Keine dieser Verbesserungen entstand durch Abwarten, bis „genug" Nutzer vorhanden waren. Tatsächlich starteten alle in einer sehr frühen Betaphase, maßen frühzeitig, erkannten Reibungspunkte, bevor sie zum Muster wurden, und trafen schnelle Entscheidungen, bevor das Vertrauen und die Akzeptanz der Nutzer verloren gingen. Der richtige Zeitpunkt zum Starten war beim ersten Nutzer. Aber jetzt funktioniert auch.
Pendo Agent Analytics wurde speziell für KI-Agent-Interaktionen in der Produktion entwickelt: Anwendungsfall-Klassifizierung, Problemerkennung und Auswirkungen auf übergeordnete Nutzer- und Produktergebnisse. Alles, was Daumen-hoch/Daumen-runter allein Ihnen niemals verraten wird.
Sehen Sie, wie Teams fehlerhafte Agent-Erfahrungen in Minuten identifizieren. Agent Analytics in Aktion ansehen