Se você é como a maioria das empresas, está sob pressão para investir e implementar ótimos sistemas de IA. E a essa altura, provavelmente já destinou uma boa parte do seu orçamento para isso. 

Mas poucas pessoas pensam no que acontece depois: comprovar o valor, o impacto nos colaboradores e o retorno para os acionistas. 

93% do orçamento de IA empresarial vai para a própria tecnologia: infraestrutura, modelos, implantação. Os 7% restantes vão para entender se alguma coisa está realmente funcionando. Muitos desenvolvedores e líderes perceberam que estão sem a camada de análise para ajudar a fazer tudo funcionar.

Veja o que surgiu nas conversas com esses líderes e por que nem tudo é o que parece. 

Objeção 1: "Poderíamos simplesmente criar nossas próprias ferramentas de medição de agentes."

Claro que você poderia. Estamos em 2026. Sabemos disso. E "nós mesmos" nem significa uma equipe de engenheiros. Um PM com o Cursor e uma tarde livre consegue criar algo no estilo vibe-code que analisa as conversas dos seus agentes.

Isso vai te dar um protótipo funcional, uma demonstração interessante e um problema de qualidade de combustão lenta que você não vai sentir até ter um balde furado de usuários que não retornam quando chegar a hora de escalar isso. 

Enfrentamos o mesmo desafio internamente: "Quando usamos um LLM pela primeira vez para analisar conversas de agentes, os resultados pareciam ótimos até que os verificamos. Nossa solução estava categorizando incorretamente os problemas com confiança e se desviando de suas instruções de maneiras que não previmos", disse Danielle Goh, Gerente de Produto Sênior de Agent Analytics. "Chegar a um resultado que actually make a product decision around took months of iterating and improving our methodology." 

Você precisa confiar no que constrói, e é aí que as coisas ficam assustadoras e caras. Toda vez que seu classificador caseiro diz "40% dos usuários estão perguntando sobre X" ou "esse caso de uso está em alta", você está fazendo as contas mentalmente. Isso é real? Está analisando o segmento de usuários correto? A classificação sofreu desvio quando o modelo atualizado? Perdemos uma categoria inteira de novos problemas porque não sabíamos como solicitá-la? Isso é um padrão genuíno ou o LLM está alucinando com confiança uma tendência?

Esse é o risco real de criar sua própria ferramenta de medição de IA. E, eventualmente, isso se torna um custo para o negócio: o sprint para construí-la, o ônus de manutenção e as horas gastas auditando os resultados da sua própria ferramenta em vez de agir com base neles. 

Antes de Brian Muehlenkamp, do Ticketmaster, ter o Agent Analytics, ele fazia exatamente isso: lia manualmente os registros de chat um por um, tentando determinar se um a interação correu bem ou não. "Era muito manual, muito um por um", disse ele. "A ponto de eu simplesmente não estar dando a devida atenção porque o esforço não valia a pena."

Depois de ter dados confiáveis e estruturados nos quais podia realmente confiar, ele os utilizou para identificar um tema de problema de alto volume, aprimorou a base de conhecimento do agente para resolvê-lo e obteve uma redução de 53% nos prompts de raivataxa. Essa é uma vitória sistematizada e de qualidade que você não consegue apenas observando logs, fazendo upload de planilhas estáticas e passando horas consultando seus dados.

Concentre seus esforços na criação do agente que vai conquistar o mercado para você. Nós construímos a ferramenta, comprovada, para ajudá-lo a fazer isso.

Objeção 2: "Já temos uma ferramenta de observabilidade de IA, como LangSmith ou Arize."

Ótimo. Continue usando. As ferramentas de observabilidade para desenvolvedores são excelentes no que foram criadas para fazer: rastreamentos, latência, avaliações, custos de tokens, detecção de alucinações. Se o seu agente cair às 2 da manhã, é para elas que sua equipe vai ligar. Essas ferramentas dizem se o sistema está saudável, e essa pergunta é importante.

Mas há uma segunda pergunta que nenhuma stack de observabilidade foi projetada para responder: meus usuários estão realmente obtendo valor?

Essas não são a mesma pergunta. Um agente pode ter uptime perfeito, rastreamentos limpos e um tempo de resposta de 1,2 segundo enquanto um usuário reformula sua pergunta nove vezes, desiste com frustração e nunca mais volta. Sua ferramenta de desenvolvimento considera essa interação uma sessão concluída, enquanto Agent Analytics sinaliza como uma experiência de usuário em risco.

Technical AI Observability

Is the system working?

Messages:26 (13 turns)
Avg Response Time:1.2s
Token Usage:Within limits
Errors:0
Status:Completed
VERDICT: SYSTEM HEALTHY

Focuses on technical performance, uptime, and infrastructure health.

VS

Product-level AI Observability

Is the experience driving value?

Task intent mismatch:High
User re-prompts:9 rephrases
Goal achieved:No
Task abandoned:Yes
Frustration signal:Critical
VERDICT: USER FAILED

Focuses on user behavior, outcomes, and business impact.

O outro problema, novamente, é o isolamento de dados. Atualmente, a maioria dos usuários não experimenta agentes como um sistema independente. Eles navegam pelo seu produto SaaS tradicional, encontram um ponto de atrito, abrem o agente e obtêm o que precisam ou desistem. O que acontece ao longo de toda a jornada do usuário revela muito mais sobre se o seu agente está funcionando. Quando os dados do agente ficam em uma ferramenta de observabilidade separada, isolados do restante da análise do seu produto, você perde essa visão por completo. Você não consegue conectar o uso do agente à retenção, conversão ou churn. O agente se torna uma caixa preta dentro de uma caixa preta.

As ferramentas de desenvolvimento monitoram seus LLMs. O Agent Analytics monitora o que os usuários experimentam, ao vivo em produção. Eles são complementares, e as melhores equipes usam ambos. Veja como isso funciona na prática.

Objeção 3: "Temos preocupações com PII e segurança."

Completamente justo. Seja você de um setor altamente regulamentado ou que acabou de obter aprovação para seu primeiro grande investimento em IA, o obstáculo de segurança pode ser um processo complexo e longo de burocracia a ser navegado.

Para tornar esse obstáculo mais fácil para você, é possível decidir qual nível de informação você envia ao Agent Analytics por meio da API de Conversas. Antes que qualquer coisa chegue ao Pendo, sua equipe pode redigir, transformar e higienizar os dados do seu lado. O prompt do usuário "Reserve viagem para Nova York em 30 de março para John Smith" se torna "reserva de viagem". Você mantém o sinal de intenção, os dados de adoção e a correlação de retenção. Os detalhes sensíveis não vão a lugar nenhum.

Para a maioria das equipes, isso permite aproveitar o Agent Analytics. Se você ou suas equipes jurídicas precisarem de mais detalhes, acesse trust.pendo.io e nossa documentação de coleta de dados e segurança. Ou leia como coletamos dados de agentes diretamente do Diretor de Segurança da Informação do Pendo.

Objeção 4: "Temos apenas alguns usuários. É cedo demais."

Essa é a que realmente nos incomoda, porque é tão razoável e ao mesmo tempo tão equivocada.

Se você atualmente tem cinco usuários no seu agente, pergunte a si mesmo: como você está decidindo quando está pronto para ir de cinco para 20? Como essa decisão realmente se parece? Quais dados você usará?

Se a resposta honesta for "se um usuário nos disser que é ótimo" ou "não recebemos reclamações", isso é otimismo cego, não uma decisão legítima de produto. E embora importante, o otimismo sozinho não escala.

Vamos revisitar nosso amigo no Ticketmaster, Brian. Ele começou com um grupo piloto de 30 a 35 usuários avançados, e sabia que eles gostariam porque eram aqueles para quem ele já havia feito demonstrações. Mas gostar e ter dados para comprovar são coisas diferentes.

O Agent Analytics forneceu a ele as métricas para confirmar que a adoção era real, identificar os problemas emergentes e construir a convicção para abrir o acesso a qualquer pessoa que quisesse. O resultado: 81,6% de retenção de usuários entre as pessoas que experimentaram o agente, e aproximadamente 60% de crescimento da base de usuários além do piloto inicial. "Isso me deu confiança para avançar para a fase dois muito mais rápido do que eu esperava, porque tinha as métricas para embasar isso", ele descreveu.

Se você quiser ouvir Brian explicar tudo — incluindo como ele usa o servidor MCP (Model Context Protocol) da Pendo para executar um ciclo de melhoria contínua — ele estará conosco ao vivo no dia 19 de maio. Garanta seu lugar aqui.

Outros PMs como Brian também estão obtendo sucesso com o Agent Analytics: a Pushpay descobriu que os usuários abandonavam as conversas com o agente após apenas três ou quatro prompts. Ver exatamente onde ocorria o abandono permitiu que a equipe redesenhasse aquela experiência específica com base no comportamento real, e os usuários passaram de um a dois minutos para encontrar informações críticas para apenas dez segundos.

Nenhuma dessas melhorias veio de esperar até que houvesse usuários "suficientes". Na verdade, em todos os casos eles começaram em beta muito inicial, medindo cedo, identificando atritos antes que se tornassem um padrão e tomando decisões rápidas antes de perder a confiança e a adoção dos usuários. O momento certo para começar foi no primeiro usuário. Mas agora também funciona.

Pendo Agent Analytics foi desenvolvido especificamente para interações com agentes de IA em produção: classificação de casos de uso, detecção de problemas e impacto nos resultados gerais de usuários e produtos. Tudo o que curtir/não curtir sozinho jamais vai te dizer.

Veja como as equipes estão identificando experiências de agente com falhas em minutos. Veja o Agent Analytics em ação