Las inversiones en agentes han sido significativas y cada vez más estratégicas. Hace dieciocho meses, los agentes de IA eran en gran medida el dominio de programas piloto y pruebas de concepto. Hoy en día, se están integrando en flujos de atención al cliente, incorporación de empleados, bases de conocimiento internas y muchos otros flujos de trabajo en organizaciones de todo tamaño.

Los CFOs ya no observan el gasto en IA desde la distancia. Hoy, son dueños del presupuesto y exigen rendición de cuentas por él. Las juntas directivas quieren saber si la IA está siendo implementada y cómo está generando valor empresarial duradero, lo que hace que el siguiente patrón valga la pena examinar detenidamente. 

El 93% del presupuesto empresarial de IA se destina a la tecnología en sí, con la infraestructura, los modelos y la implementación consumiendo la gran mayoría del gasto. El 7% restante se destina al cambio de comportamiento, adopción y la medición necesarias para obtener el retorno de esa inversión.

Esto no es un fracaso de ambición, simplemente refleja el estado del ecosistema de herramientas cuando las organizaciones comenzaron a implementar agentes a escala. Las herramientas para construir agentes maduraron rápidamente. Las herramientas para comprender cómo los usuarios las experimentan aún están al día, y la brecha entre esas dos cosas es donde una cantidad significativa del valor de la IA desaparece silenciosamente.

Los agentes pueden ser técnicamente impecables, pero aun así fallar 

Hoy en día, el enfoque dominante para monitorear agentes de IA proviene del stack de observabilidad para desarrolladores: trazas, spans, mediciones de latencia, consumo de tokens, detección de alucinaciones, tasas de error. Herramientas como LangSmith, Arize y Braintrust fueron creadas por ingenieros para ingenieros, y hacen bien su trabajo. Te dicen si tu agente está en ejecución y te ayuda a responder preguntas como: 

  • ¿Respondió el agente?
  • ¿Cuánto tiempo tardó?
  • ¿Cuál fue el costo por token?
  • ¿Alucinó?
  • ¿Dónde falló la API?

Estas son preguntas necesarias, pero no son suficientes por sí solas.

Un agente puede parecer perfecto a primera vista —respuestas rápidas, bajas tasas de error, trazas limpias— y aun así estar fallando a las personas para las que fue creado. Puede responder preguntas rápidamente mientras que de manera consistente no logra lo que los usuarios realmente necesitaban. Puede tener un excelente tiempo de actividad mientras permanece en gran medida sin uso porque los usuarios encontraron más fácil abrir un soporte ticket. 

Las personas de producto, por otro lado, están haciendo diferentes tipos de preguntas de observabilidad: 

  • ¿Los usuarios obtuvieron lo que necesitaban?
  • ¿Dónde se están frustrando?
  • ¿Qué casos de uso están surgiendo realmente?
  • ¿La adopción está creciendo o estancándose?
  • ¿Vale la pena escalar esto?

Ambos conjuntos de preguntas importan. Pero solo uno te indica si tu inversión en IA está generando valor empresarial, y para la mayoría de las organizaciones en este momento, esa columna está en gran medida sin medir.

La experiencia híbrida de SaaS y agentes que nadie está rastreando

Hay una razón estructural por la que medir los agentes de forma aislada ofrece una imagen incompleta: los usuarios no experimentan los agentes de forma aislada.

En la mayoría de los entornos empresariales, un agente se encuentra dentro de una experiencia de software más amplia. Un usuario navega por un panel, encuentra un punto de fricción y recurre a un agente de IA. Lo que hace después (si completa la tarea, abre un ticket de soporte o abandona por completo) dice mucho más sobre si el agente tuvo éxito que la respuesta del agente en sí misma. La sesión completa es la unidad de medida que importa.

Cuando esos datos viven en sistemas separados, no puedes ver que los usuarios que tienen dificultades con un flujo de trabajo en particular son más propensos a abandonar la interacción con el agente que sigue. No puedes ver que tu agente está respondiendo preguntas que una interfaz de usuario mejor diseñada habría respondido por sí sola. La transición del software basado en clics al software agéntico es ocurriendo en toda la experiencia del usuario, y necesitas poder verlo de esa manera.

Pendo captura esa visión completa: lo que los usuarios hacen antes, durante y después de las interacciones con el agente, en un único conjunto de datos, junto con todos tus análisis de producto existentes.

Es la única manera de entender lo que realmente está ocurriendo a medida que cambia la experiencia del usuario. Y es lo que Pendo Agent Analytics fue creado para responder.

Qué mide realmente Agent Analytics

Cuando Pendo lanzó Agent Analytics en junio de 2025, la premisa era sencilla: medir el impacto de un agente de IA debería parecerse mucho a medir cualquier otra capacidad de producto significativa. 

Adopción. Profundidad de participación. Retención. Finalización de tareas. Y las señales de fricción que predicen el abandono antes de que se convierta en pérdida de clientes. Un año después, ese enfoque se ha mantenido y se ha afinado en torno a un conjunto específico de métricas que resultan ser los indicadores adelantados de la salud agéntica. Los responsables de producto necesitan medir las métricas de rendimiento de los agentes, like: 

  1. Tasa de problemas: La proporción de conversaciones en las que el agente no logra resolver la necesidad del usuario. Orientación repetida, tiempos de espera agotados, respuestas fuera del guion. El indicador principal de fricción.
  2. Tasa de Prompts Frustrados: Usuarios que reformulan repetidamente, usan mayúsculas o envían prompts fallidos en rápida sucesión. El equivalente conversacional de un clic de frustración.
  3. Tasa de Retención: La proporción de usuarios que regresan al agente con el tiempo. La señal más clara de valor duradero frente a novedad.

Lo que hace que estas métricas clave, además de las demás capturadas en Agent Analytics, sean significativas es que se rastrean junto con el resto de la experiencia del usuario en el producto. Una tasa de problemas en aumento de forma aislada es una señal. Una tasa de problemas en aumento La tasa que se correlaciona con una caída pronunciada en la adopción general del producto o en su retención es inteligencia accionable.

Los mismos principios que generan grandes productos también se aplican a los agentes

Pendo se construyó sobre dos creencias que se han mantenido desde el principio. 

El primero: para comprender genuinamente cómo los usuarios experimentan el software, necesitas más de un tipo de señal. Los datos cuantitativos te dicen qué hacen los usuarios. Los comentarios cualitativos te dicen qué piensan. El sentimiento te dice cómo se sienten. Las repeticiones visuales te muestran exactamente lo que vieron. Y los datos conversacionales —la quinta y más nueva dimensión— capturan lo que los usuarios dicen a tu agente y cómo impacta en su experiencia. Juntos, te dan el panorama completo.

La segunda creencia es lo que hace útil a la primera: el análisis y la orientación pertenecen a la misma herramienta. Comprender dónde tienen dificultades los usuarios solo es valioso si puedes actuar al respecto. La información sin la capacidad de responder es simplemente una conciencia costosa.

Ambas creencias se aplican directamente a los agentes de IA. Agent Analytics extiende todas estas dimensiones a la IA conversacional: métricas cuantitativas como Issue Rate, Rage Prompt Rate y Retention revelan patrones a escala; Session Replay te permite ver el el momento exacto en que se agotó la paciencia de un usuario; el sentimiento revela cómo se sienten los usuarios sobre lo que están solicitando; y las señales cualitativas revelan lo que los usuarios quieren que el agente haga y que actualmente no puede. Cuando un punto de fricción aparece en cualquiera de esas dimensiones, Pendo Guides permite a los equipos de producto actuar de inmediato, sin un sprint de ingeniería.

Cuando esas cinco señales y la capacidad de responder a ellas viven en una sola plataforma, la pregunta pasa de "¿cómo está funcionando el agente?" a "¿cómo está cambiando el agente la forma en que las personas usan mi producto?" 

Lo que implementaste vs. lo que los usuarios realmente quieren

Cada agente se construye con un propósito: gestionar preguntas de incorporación, ayudar con el registro de gastos, mostrar documentación relevante. Esos son los casos de uso previstos: los flujos de trabajo que un equipo diseñó e invirtió deliberadamente. Pero los usuarios interactúan con los agentes en sus propios términos, haciendo preguntas para las que el agente no fue diseñado e intentando flujos de trabajo nadie anticipó.

Pendo detecta automáticamente estos casos de uso emergentes mediante agrupación semántica —agrupando indicaciones por tema sin etiquetado manual— para que puedas ver qué comportamientos están impulsando realmente la participación y qué casos de uso previstos están siendo ignorados silenciosamente.

Pushpay, un proveedor de pagos, descubrió que los usuarios abandonaban las conversaciones después de solo tres o cuatro indicaciones con Agent Analytics. Ver exactamente dónde drop-off was happening let the team redesign that specific experience based on real user requests rather than assumptions. They now use Agent Analytics for regular monitoring of their AI search tool, and have found users leveraging it decreased their time to access critical information from 1-2 minutes to 10 seconds.

Conectar el comportamiento de los agentes con los resultados del negocio

La pregunta de medición que más le importa a un CFO puede no ser la adopción en sí, sino el retorno. Y la forma de demostrar el retorno de una inversión en agentes de IA es conectar las interacciones de los agentes con los resultados empresariales posteriores.

Pendo hace esto a través de embudos de conversión y comparaciones de rutas que tratan al agente como un paso en el flujo de trabajo del usuario en lugar de un sistema separado. ¿Un usuario que interactúa con el asistente de reservas tiene una tasa más alta de completar una reserva? ¿El empleado que usa la herramienta de gastos impulsada por IA cierra su informe más rápido que el que sigue el camino tradicional basado en clics? ¿La forma agéntica es realmente mejor que lo que reemplazó?

Para los despliegues de uso interno, el caso de ROI se mide frecuentemente en términos de trabajo: ¿cuántas consultas rutinarias gestiona el agente y qué libera eso? Para los despliegues orientados al cliente, se refleja en los datos de retención y satisfacción. En ambos casos, la prueba requiere conectar la interacción del agente con lo que ocurre después, lo cual solo es posible cuando los datos viven en el mismo lugar.

Respondiendo las preguntas sobre el ROI de la IA que su junta directiva ya está haciendo

En algún lugar de su organización ahora mismo, alguien está preparando una diapositiva sobre el ROI de la IA. Puede ser para una reunión de directorio, una revisión de presupuesto o un retiro de liderazgo. Y la incómoda verdad es que, para la mayoría de las organizaciones, esa diapositiva se basa en métricas de implementación: cuántos agentes están activos, cuántos prompts se están enviando, cuánto fue gastado—porque esos son los únicos datos disponibles.

Las métricas de implementación no responden la pregunta que realmente hacen los directorios. Quieren saber si la inversión está funcionando, si los usuarios están adoptando las herramientas y obteniendo ganancias de productividad, y si esto es una base sobre la cual construir (o un experimento costoso que debe cerrarse). Esas respuestas requieren un tipo diferente de datos, y en este momento, la mayoría las organizaciones no lo tienen.

Esa es la brecha que Agent Analytics cierra. Agrega la capa que tu stack de ingeniería nunca fue diseñado para proporcionar: la experiencia del usuario. Lo que necesitaban, si lo obtuvieron, dónde se rindieron y qué significa eso para decidir si expandes, mantienes o retrocedes. Vea cómo funciona en este video.