Si eres como la mayoría de las empresas, estás bajo presión para invertir e implementar excelentes sistemas de IA. Y a estas alturas, probablemente ya has destinado una buena parte de tu presupuesto a esto.
Pero muy pocas personas piensan en lo que viene después: demostrar el valor, el impacto en los empleados y el retorno para los accionistas.
El 93% del presupuesto empresarial de IA se destina a la tecnología en sí: infraestructura, modelos, implementación. El 7% restante se destina a comprender si algo de eso realmente está funcionando. Muchos desarrolladores y líderes se dieron cuenta de que les falta la capa de análisis para hacer que todo funcione.
Esto es lo que ha surgido en conversaciones con estos líderes, y por qué no todo es lo que parece.
Objeción 1: "Podríamos simplemente construir herramientas de medición de agentes nosotros mismos."
Por supuesto que podrías. Es 2026. Lo sabemos. Y "nosotros mismos" ni siquiera significa un equipo de ingenieros. Un PM con Cursor y una tarde libre puede programar a su ritmo algo que analice las conversaciones de su agente.
Eso te dará un prototipo funcional, una demo genial y un problema de calidad de combustión lenta que no sentirás hasta que tengas un balde con fugas de usuarios que no regresan cuando llegue el momento de escalar esto.
Enfrentamos el mismo desafío internamente: "Cuando usamos por primera vez un LLM para analizar conversaciones de agentes, los resultados parecían excelentes hasta que los verificamos. Nuestra solución estaba clasificando incorrectamente los problemas con total confianza y desviándose de sus instrucciones de maneras que no predijimos", dijo Danielle Goh, Gerente de Producto Senior de Agent Analytics. "Llegar a un resultado que actually make a product decision around took months of iterating and improving our methodology."
Necesitas confiar en lo que construyes, y ahí es donde las cosas se vuelven aterradoras y costosas. Cada vez que tu clasificador casero te dice "el 40% de los usuarios están preguntando sobre X" o "este caso de uso está en tendencia", estás haciendo los cálculos mentalmente. ¿Es real? ¿Está analizando el segmento de usuarios correcto? ¿Hubo una deriva en la clasificación cuando el modelo ¿actualizado? ¿Nos perdimos una categoría completa de nuevos problemas porque no sabíamos cómo solicitarla? ¿Es esto un patrón genuino o el LLM está alucinando con confianza una tendencia?
Ese es el riesgo real de crear tu propia herramienta de medición de IA. Y con el tiempo, se convierte en un costo para el negocio: el sprint para construirla, la carga de mantenimiento y las horas que dedicas a auditar los resultados de tu propia herramienta en lugar de actuar en consecuencia.
Antes de que Brian Muehlenkamp de Ticketmaster tuviera Agent Analytics, hacía exactamente esto: leer manualmente los registros de chat uno por uno, tratando de determinar si un la interacción había salido bien o no. "Era muy manual, muy uno por uno", dijo. "Al punto en que simplemente no le estaba dando la debida diligencia porque el esfuerzo no valía la pena."
Una vez que tuvo datos confiables y estructurados en los que realmente podía confiar, los utilizó para identificar un tema de problema de alto volumen, mejoró la base de conocimientos del agente para abordarlo y logró una reducción del 53% en los prompts de frustración tasa. Esta es una victoria de calidad sistematizada que no puedes obtener revisando registros a ojo, cargando hojas de cálculo estáticas y pasando horas consultando tus datos.
Enfoca tus esfuerzos en construir el agente que te gane el mercado. Nosotros construimos la herramienta, probada, para ayudarte a lograrlo.
Objeción 2: "Ya tenemos una herramienta de observabilidad de IA, como LangSmith o Arize."
Bien. Sigue usándolo. Las herramientas de observabilidad para desarrolladores son excelentes en lo que fueron diseñadas para hacer: trazas, latencia, evaluaciones, costos de tokens, detección de alucinaciones. Si tu agente falla a las 2 am, ese es el equipo al que llamarás. Esas herramientas te dicen si el sistema está saludable, y esa pregunta importa.
Pero hay una segunda pregunta que ninguna pila de observabilidad fue diseñada para responder: ¿mis usuarios realmente están obteniendo valor?
Esas no son la misma pregunta. Un agente puede tener un tiempo de actividad perfecto, trazas limpias y un tiempo de respuesta de 1,2 segundos mientras un usuario reformula su pregunta nueve veces, se rinde frustrado y nunca regresa. Tu herramienta de desarrollo considera esa interacción como una sesión completada, mientras que Agent Analytics lo marca como una experiencia de usuario en riesgo.
Technical AI Observability
Is the system working?
Focuses on technical performance, uptime, and infrastructure health.
Product-level AI Observability
Is the experience driving value?
Focuses on user behavior, outcomes, and business impact.
El otro problema, una vez más, es el aislamiento de datos. Actualmente, la mayoría de los usuarios no experimentan los agentes como un sistema independiente. Navegan por su producto SaaS tradicional, encuentran un punto de fricción, abren el agente y obtienen lo que necesitan o se van. Lo que ocurre a lo largo de todo el recorrido del usuario le dice mucho más sobre si su agente está funcionando. Cuando los datos del agente viven en una herramienta de observabilidad separada, aislada del resto de los análisis de su producto, pierde esa imagen por completo. No puede conectar el uso del agente con la retención, la conversión o la pérdida de clientes. El agente se convierte en una caja negra dentro de una caja negra.
Las herramientas de desarrollo monitorean sus LLMs. Agent Analytics monitorea lo que los usuarios experimentan, en vivo en producción. Son complementarias, y los mejores equipos usan ambas. Así es como se ve eso en la práctica.
Objeción 3: "Tenemos preocupaciones sobre PII y seguridad."
Completamente válido. Ya sea que esté en una industria altamente regulada o que acabe de obtener la aprobación para su primera gran inversión en IA, el obstáculo de seguridad puede ser una colección compleja y larga de trámites burocráticos que navegar.
Para facilitar este obstáculo, en realidad puede decidir qué nivel de información envía a Agent Analytics a través de la API de Conversaciones. Antes de que algo llegue a Pendo, su equipo puede redactar, transformar y sanear en su extremo. El mensaje del usuario, "Reservar viaje a Nueva York el 30 de marzo para John Smith" se convierte en "reserva de viaje". Usted conserva la señal de intención, los datos de adopción, la correlación de retención. Los detalles confidenciales no van a ningún lado.
Para la mayoría de los equipos, esto les permite aprovechar Agent Analytics. Si usted o sus equipos legales necesitan más detalles, visite trust.pendo.io y nuestra documentación de recopilación de datos y seguridad. O bien, lea cómo recopilamos datos de agentes directamente del Director de Seguridad de la Información de Pendo.
Objeción 4: "Solo tenemos unos pocos usuarios. Es demasiado pronto."
Esta es la que realmente nos llega, porque es tan razonable y, sin embargo, tan equivocada.
Si actualmente tiene cinco usuarios en su agente, pregúntese: ¿cómo está decidiendo cuándo está listo para pasar de cinco a 20? ¿Cómo se ve realmente esa decisión? ¿Qué datos utilizará?
Si la respuesta honesta es "si un usuario nos dice que es genial" o "no recibimos quejas", eso es optimismo ciego, no una decisión de producto legítima. Y aunque es importante, el optimismo por sí solo no escala.
Revisitemos a nuestro amigo en Ticketmaster, Brian. Comenzó con un grupo piloto de 30 a 35 usuarios avanzados, y sabía que les gustaría porque eran a quienes ya se lo había demostrado. Pero que les guste y tener los datos para probarlo son cosas diferentes.
Agent Analytics le dio las métricas para confirmar que la adopción era real, identificar los problemas emergentes y construir la convicción para abrir el acceso a cualquiera que lo quisiera. El resultado: 81,6% de retención de usuarios entre las personas que probaron el agente, y aproximadamente 60% de crecimiento de la base de usuarios más allá del piloto inicial. "Me dio la confianza para pasar a la fase dos mucho más rápido de lo que anticipaba, porque tenía las métricas para respaldarlo", describió.
Si quieres escuchar a Brian explicar todo el proceso — incluyendo cómo usa el servidor MCP (Model Context Protocol) de Pendo para ejecutar un ciclo de mejora continua — se unirá a nosotros en vivo el 19 de mayo. Reserva tu lugar aquí.
Otros PMs como Brian también están encontrando éxito con Agent Analytics: Pushpay descubrió que los usuarios abandonaban las conversaciones con el agente después de solo tres o cuatro indicaciones. Ver exactamente dónde ocurría la deserción permitió a su equipo rediseñar esa experiencia específica basándose en el comportamiento real, y los usuarios pasaron de tardar uno o dos minutos en encontrar información crítica a solo diez segundos.
Ninguna de estas mejoras llegó esperando hasta tener "suficientes" usuarios. De hecho, en todos los casos comenzaron en una beta muy temprana, midiendo desde el principio, detectando la fricción antes de que se convirtiera en un patrón y tomando decisiones rápidas antes de perder la confianza y la adopción de los usuarios. El momento adecuado para empezar fue con el primer usuario. Pero ahora también funciona.
Pendo Agent Analytics está diseñado específicamente para interacciones con agentes de IA en producción: clasificación de casos de uso, detección de problemas e impacto en los resultados generales de usuarios y productos. Todo lo que los pulgares arriba/abajo por sí solos nunca te van a decir.
Descubre cómo los equipos identifican experiencias de agentes fallidas en minutos. Ver Agent Analytics en acción