A IA tem dominado nossos feeds do LinkedIn nos últimos três anos, e ferramentas para avaliar agentes surgiram com a mesma rapidez.
Agora, há uma infinidade de opções voltadas para desenvolvedores quando se trata de observabilidade e medição de agentes, desde o OpenAI Evals e o LangSmith até o Arize.
Mas uma voz importante tem sido visivelmente sub-representada nessa conversa: o gerente de produto de IA (PM) que lidera o desenvolvimento.
As ferramentas de avaliação e medição de agentes devem coexistir, não competir
As ferramentas de avaliação de agentes criadas para desenvolvedores são ótimas em diagnósticos de nível de sistema, como rastreamentos, latência e comportamento do modelo. Elas foram criadas para o trabalho técnico de depuração e correção de agentes, e sua unidade primária de análise é uma execução, rastreamento ou conjunto de avaliações.
Mas e se você se importar menos com o desempenho técnico e mais com o impacto dos agentes nos usuários, fluxos de trabalho e resultados de negócios? E se você simplesmente quiser saber se o seu agente está fazendo um bom (ou mau) trabalho, sem ter tempo para analisar centenas de logs?
As pessoas de produto precisam responder a perguntas como essa. Para isso, elas precisam de visibilidade sobre conversas, funis e sessões de usuários dentro dos agentes e na experiência mais ampla do aplicativo.
Quando você usa apenas uma ou outra ferramenta, é quase impossível vincular o uso do agente de IA aos resultados de negócios. Mas juntas, as ferramentas de medição voltadas para desenvolvedores e para PMs se complementam no ciclo de vida de desenvolvimento agêntico. É por isso que muitas equipes (e certamente as melhores) usam as duas.
Vamos explorar quatro casos de uso que os PMs podem resolver melhor com a medição centrada no produto.
1. Veja rapidamente quem usa seu agente (e como)
As ferramentas de desenvolvimento mostram quantas vezes uma cadeia foi executada, mas não foram projetadas para informar instantaneamente se suas contas empresariais estão realmente adotando seu agente. O uso é mais forte em um departamento específico? Seus super usuários estão interagindo com isso? Ou você está alcançando um público totalmente novo com essa ferramenta de IA?
As ferramentas de medição de agentes de IA, conectadas ao restante dos dados do seu aplicativo, permitem segmentar e comparar o desempenho da IA conversacional entre funções, contas e fluxos de trabalho. Isso indica quais personas e casos de uso realmente se beneficiam de uma experiência agêntica e onde ela gera mais atrito ou risco do que sua contraparte mais tradicional.
Ao tratar isso como parte de sua experiência de produto mais ampla, você pode começar a entender o impacto de longo prazo do seu agente.
2. Monitore o sentimento do usuário e os riscos
Os conjuntos de avaliação sinalizam quando um modelo alucina, mas não mostram o usuário frustrado que recebeu aquela saída incorreta, tentou mais três vezes e depois abandonou. Digitar em letras maiúsculas, fazer a mesma pergunta várias vezes, compartilhar arquivos confidenciais e dados de clientes — sinalizar esses tipos de conversas é essencial para garantir um agente bem-sucedido.
Para revelar as falhas e os riscos potenciais de um agente de IA, os PMs precisam de detecção automática de problemas e monitoramento de sentimento com base nas conversas dos usuários. Assim, você pode:
- Filtrar problemas e erros do agente por caso de uso, para ver com o que seu agente está tendo dificuldade (e priorizar seu roadmap de IA para corrigir isso)
- Assistir a replays e visualizar dados de conversas da interação exata entre o usuário e o agente antes, durante e após momentos de frustração.
- Destacar comportamentos não conformes ou arriscados, mantendo a conexão com quem foi afetado e o que estava tentando fazer.
Manter um olhar atento sobre quais casos de uso levam a usuários insatisfeitos (ou comportamentos de risco) vai, em última análise, ajudá-lo a proteger o crescimento e a reputação da sua empresa.
3. Conecte o uso do agente aos resultados de negócios
As plataformas de observabilidade rastreiam latência e custos de tokens, mas não informam de forma integrada se o seu agente está impulsionando a retenção, acelerando fluxos de trabalho ou prejudicando a satisfação.
Para ajudá-lo a responder a isso, a mensuração centrada no produto mapeia o uso do agente diretamente para a experiência do produto e métricas de negócios: conclusão de tarefas, taxas de conversão, feedback dos usuários e velocidade do fluxo de trabalho. Isso permite que os PMs tratem cada agente como um recurso ou funcionário digital cujo desempenho pode ser avaliado em relação a resultados reais, não apenas a benchmarks técnicos.
Com uma ferramenta de mensuração centrada no PM, você pode responder às perguntas importantes:
- Como o uso do agente se correlaciona com conversões? Retenção? Satisfação?
- Quais tipos de usuários são mais engajados e bem-sucedidos com o agente? E os menos?
- Como os usuários estão descobrindo o agente pela primeira vez? Quais canais impulsionaram mais a adoção?
- A experiência com o seu agente ou a interface de usuário tradicional tem uma correlação mais forte com a satisfação e o crescimento da receita?
4. Colete feedback
As ferramentas de avaliação medem a precisão e o desempenho de recuperação, mas geralmente não incluem formas de capturar o que os usuários estão pensando ou sentindo. Os usuários estão satisfeitos? Confusos? Planejando cancelar? Sem uma maneira de vincular o uso do agente ao feedback dos usuários, você consegue responder "o que aconteceu", mas não "por quê."
A medição de agentes com foco em PM oferece uma visão holística do sentimento e da satisfação dos usuários. Analise o feedback dos usuários de antes e depois do uso do agente, visualize-o no contexto dos dados comportamentais e assista às reproduções do comportamento deles. É o santo graal da VOC e apresenta o quadro completo do impacto do seu agente: o que os usuários disseram, o que fizeram e como se sentiram.
Estudo de caso: Como os profissionais de produto estão avaliando o desempenho de agentes de IA
A equipe da Pendo usa nossa ferramenta de medição centrada em PM, o Agent Analytics, todos os dias. Uma das formas como a utilizamos é monitorando o uso interno de IA em ferramentas populares como Claude e ChatGPT. Outra forma como a utilizamos é monitorando a adoção da nossa ferramenta de criação de guias com IA, que transforma prompts em linguagem simples em guias no aplicativo.
O PM responsável pela nossa ferramenta de criação de guias com IA, Alejandro, usou os relatórios do Agent Analytics para ver quem estava usando o recurso, com que frequência e quais eram os casos de uso.
Quando Alejandro descobriu que um caso de uso popular (criar um guia com um vídeo) não era compatível, ele priorizou isso no roadmap, usou guias para comunicar o que a ferramenta é capaz de fazer e ajudou a alinhar as expectativas dos usuários.
Alejandro também assistiu a replays de sessões de interações com agentes e encontrou cliques sem resposta acontecendo no fluxo de criação de guias com IA. Isso lhe deu evidências valiosas para defender uma correção de desenvolvimento o mais rápido possível. Como Dao coloca, "O Agent Analytics não substitui bons fundamentos de produto. Mas funciona como um acelerador ou amplificador das suas próprias habilidades."
A primeira ferramenta de mensuração de agentes de IA criada para PMs
Desenvolvedores usam ferramentas de rastreamento e avaliação para diagnosticar por que uma cadeia falhou. PMs usam ferramentas de mensuração centradas no produto para identificar quais casos de uso estão com dificuldades e, em seguida, repassam cenários específicos para a engenharia realizar um diagnóstico técnico aprofundado.
Ambas as funções precisam de mensuração especializada — e usam ferramentas projetadas para cada uma. Faça um tour autoguiado do Agent Analytics em ação para começar a impulsionar a adoção, reduzir o atrito e comprovar o ROI da sua IA.