La IA ha dominado nuestros feeds de LinkedIn durante los últimos tres años, y las herramientas para evaluar agentes han surgido con la misma rapidez.
Ahora existe una gran cantidad de opciones específicas para desarrolladores en materia de observabilidad y medición de agentes, desde OpenAI Evals y LangSmith hasta Arize.
Pero una voz importante ha estado notablemente subrepresentada en esta conversación: el product manager (PM) de IA que lidera el desarrollo.
Las herramientas de evaluación y medición de agentes deben coexistir, no competir
Las herramientas de evaluación de agentes creadas para desarrolladores son excelentes para diagnósticos a nivel de sistema, como trazas, latencia y comportamiento del modelo. Están diseñadas para el trabajo técnico de depuración y corrección de agentes, y su unidad de análisis principal es una ejecución, traza o conjunto de evaluaciones.
Pero ¿qué pasa si te importa menos el rendimiento técnico y más cómo los agentes impactan a los usuarios, los flujos de trabajo y los resultados del negocio? ¿Qué pasa si simplemente quieres saber si tu agente está haciendo un buen (o mal) trabajo y no tienes tiempo para revisar cientos de registros?
Los profesionales de producto necesitan responder preguntas como estas. Para hacerlo, necesitan visibilidad sobre las conversaciones de los usuarios, los embudos y las sesiones dentro de los agentes y la experiencia general de la aplicación.
Cuando solo se usa una u otra herramienta, es casi imposible vincular el uso del agente de IA con los resultados del negocio. Pero juntas, las herramientas de medición centradas en el desarrollo y en el PM se complementan mutuamente en el ciclo de vida del desarrollo agéntico. Por eso muchos equipos (y sin duda los mejores) usan ambas.
Exploremos cuatro casos de uso que los PMs pueden resolver mejor con una medición centrada en el producto.
1. Ver rápidamente quién usa tu agente (y cómo)
Las herramientas para desarrolladores te muestran cuántas veces se ejecutó una cadena, pero no están diseñadas para decirte de inmediato si tus cuentas empresariales están adoptando realmente tu agente. ¿El uso es mayor dentro de un departamento? ¿Tus usuarios más activos están interactuando con él? ¿O estás llegando a un público completamente nuevo con esta herramienta de IA?
Las herramientas de medición de agentes de IA, conectadas con el resto de los datos de tu aplicación, te permiten segmentar y comparar el rendimiento de la IA conversacional entre roles, cuentas y flujos de trabajo. Esto te indica qué personas y casos de uso se benefician realmente de una experiencia agéntica, y dónde genera más fricción o riesgo que su contraparte más tradicional.
Al tratar esto como parte de tu experiencia de producto más amplia, puedes comenzar a comprender el impacto a largo plazo de tu agente.
2. Monitorea el sentimiento del usuario y los riesgos
Los conjuntos de evaluación señalan cuándo un modelo alucina, pero no te muestran al usuario frustrado que recibió esa mala respuesta, lo intentó tres veces más y luego abandonó. Escribir todo en mayúsculas, hacer la misma pregunta varias veces, compartir archivos confidenciales y datos de clientes: marcar este tipo de conversaciones es esencial para garantizar un agente exitoso.
Para detectar los fallos y los riesgos potenciales de un agente de IA, los PMs necesitan detección automática de problemas y monitoreo del sentimiento basado en las conversaciones de los usuarios. Entonces, puedes:
- Filtrar los problemas y errores del agente por caso de uso, para que puedas ver con qué está teniendo dificultades tu agente (y priorizar tu hoja de ruta de IA para solucionarlo)
- Ver repeticiones y datos conversacionales de la interacción exacta entre el usuario y el agente antes, durante y después de los momentos de frustración.
- Destacar comportamientos no conformes o riesgosos, vinculándolos a quién se vio afectado y qué estaba intentando hacer.
Mantener un control cercano sobre qué casos de uso generan usuarios insatisfechos (o comportamientos riesgosos) te ayudará en última instancia a proteger el crecimiento y la reputación de tu empresa.
3. Conecta el uso del agente con los resultados de negocio
Las plataformas de observabilidad rastrean la latencia y los costos de tokens, pero no te indican de forma fluida si tu agente está impulsando la retención, acelerando los flujos de trabajo o afectando la satisfacción.
Para ayudarte a responder esto, la medición centrada en el producto mapea el uso del agente directamente con la experiencia del producto y las métricas de negocio: finalización de tareas, tasas de conversión, retroalimentación de usuarios y velocidad de los flujos de trabajo. Esto permite a los PMs tratar a cada agente como una funcionalidad o empleado digital cuyo rendimiento puede evaluarse frente a resultados reales, no solo frente a indicadores técnicos.
Con una herramienta de medición centrada en el PM, puedes responder las preguntas importantes:
- ¿Cómo se correlaciona el uso del agente con las conversiones? ¿La retención? ¿La satisfacción?
- ¿Qué tipos de usuarios están más comprometidos y tienen más éxito con el agente? ¿Cuáles menos?
- ¿Cómo descubren los usuarios el agente por primera vez? ¿Qué canales han impulsado más la adopción?
- ¿La experiencia de tu agente o la interfaz de usuario tradicional tienen una correlación más fuerte con la satisfacción y el crecimiento de ingresos?
4. Recopilar comentarios
Las herramientas de evaluación miden la precisión y el rendimiento de recuperación, pero a menudo no incluyen formas de capturar lo que los usuarios piensan o sienten. ¿Los usuarios están satisfechos? ¿Confundidos? ¿Planean cancelar? Sin alguna manera de vincular el uso del agente con los comentarios de los usuarios, puedes responder «qué ocurrió», pero no «por qué».
La medición del agente centrada en el PM te ofrece una visión holística del sentimiento y la satisfacción del usuario. Analiza los comentarios de los usuarios antes y después del uso del agente, visualízalos en el contexto de los datos de comportamiento y observa repeticiones de su comportamiento. Es el santo grial de la VOC y pinta el panorama completo del impacto de tu agente: lo que los usuarios dijeron, lo que hicieron y cómo se sintieron.
Caso de estudio: Cómo los responsables de producto evalúan el rendimiento de los agentes de IA
El equipo de Pendo usa nuestra herramienta de medición centrada en el PM, Agent Analytics, todos los días. Una forma en que la utilizamos es monitoreando el uso interno de IA en herramientas populares como Claude y ChatGPT. Otra forma en que la hemos usado es monitoreando la adopción de nuestra herramienta de creación de guías con IA, que convierte indicaciones en lenguaje natural en guías dentro de la aplicación.
El PM detrás de nuestra herramienta de creación de guías con IA, Alejandro, usó los informes de Agent Analytics para ver quién utilizaba la función, con qué frecuencia y cuáles eran los casos de uso.
Cuando Alejandro descubrió que un caso de uso popular (crear una guía con un video) no era compatible, lo priorizó en la hoja de ruta, utilizó guías para comunicar las capacidades de la herramienta y ayudó a establecer las expectativas de los usuarios.
Alejandro también observó repeticiones de sesiones de interacciones con agentes y encontró clics fallidos en el flujo de trabajo de creación de guías con IA. Esto le proporcionó la evidencia que necesitaba para exigir una corrección por parte del equipo de desarrollo lo antes posible. Como lo expresa Dao: «Agent Analytics no reemplaza los fundamentos sólidos de producto. Pero sí actúa como un acelerador o amplificador de tus propias habilidades».
La primera herramienta de medición de agentes de IA creada para PMs
Los desarrolladores utilizan herramientas de rastreo y evaluación para diagnosticar por qué falló una cadena. Los PMs utilizan herramientas de medición centradas en el producto para identificar qué casos de uso presentan dificultades y luego transfieren escenarios específicos a ingeniería para un diagnóstico técnico profundo.
Ambos roles necesitan medición especializada y utilizan herramientas diseñadas para cada uno. Realiza un recorrido autoguiado de Agent Analytics en acción para comenzar a impulsar la adopción, reducir la fricción y demostrar el retorno de inversión de tu IA.