Análise de agente
Qual é o impacto real do seu agente de IA?
Saber que o seu agente deu uma boa resposta é a parte fácil. A Análise de agente vincula rastreios e avaliações à conversão, retenção e receita, para que possa associar a qualidade do agente ao impacto real no negócio.

Sessions
Which users only engaged with our agent once?
What are my agents' most common failure modes?
What questions are being answered badly?
How and why are users using the create_theme tool?
One dataset query timed out, but the chart and session pulls gave me enough to isolate it. The drop traces to a single cohort:
- Affected cohort: users on Safari 17.4 (iOS)
- Window: Wed 09:12 – 17:48 UTC
- Likely cause: the v3.8 payments SDK rollout introduced a CORS preflight that failed on Safari iOS
Reverting the rollout for that platform should recover the rate within an hour. Want me to open a 48h follow-up cohort to confirm?

Quando as análises tradicionais ficam aquém
A maioria das ferramentas de análise foram criadas para cliques e visualizações das páginas, não para raciocínio e chamadas de ferramentas. Os agentes podem ter alucinações, ignorar instruções e desviar-se do caminho com confiança. Todos os utilizadores que passam tempo com o seu agente parecem igualmente envolvidos. Quem realmente o considerou útil e voltou?
Vá além da observabilidade
Conheça o impacto dos seus agentes no produto e na receita.
Qualidade de IA
O que o agente fez
Resultados de produtos
O que o utilizador fez a seguir
01 Observe
Inspecione rastreios, perguntas, chamadas de ferramentas, respostas, latência e custo. O registo bruto do que o agente realmente fez.
02 Avalie
Classifique a qualidade, a intenção, a resolução e os modos de falha. Veja onde o agente ajuda, onde fica confuso e onde adiciona risco.
03 Decida
Vincule esses sinais de qualidade à conversão, retenção e receita. O agente realmente fez o utilizador avançar?
04 Implemente
Ajuste as perguntas, execute experiências, acione guias e personalize o próximo passo com base no que aprendeu.

As interações dos traces passam automaticamente a ser eventos da Amplitude
Cada mensagem do utilizador, cada chamada de ferramenta e cada resposta do agente torna-se um evento da Amplitude, com o mesmo user_id dos restantes dados do seu produto. Ao contrário das ferramentas de observabilidade que se ficam pelo trace, o Agent Analytics decompõe estas conversas em eventos, tornando-as diretamente consultáveis nos mesmos funis, coortes e análises de retenção que já utiliza.
As perguntas a que pode finalmente responder
01
A atualização do nosso modelo aumentou a conversão de registos esta semana ou prejudicou-a?
02
Qual é o delta de conversão quando o agente responde corretamente em comparação com quando alucina?
03
Que tópicos do agente se correlacionam com a intenção de expansão e quais se correlacionam com o risco de abandono?
O modelo de maturidade da Análise de agente
A maioria das ferramentas de observabilidade ficam pelos níveis mais baixos de maturidade. A Análise de agente leva ao topo, associando a qualidade da IA ao percurso do utilizador e à receita.
Qual é o valor da IA em dólares?
Como afeta a utilização da IA a jornada do utilizador?
O que está o agente realmente a fazer?
O agente fê-lo corretamente?
Posso ver o que aconteceu?
Dentro do Agent Analytics






As execuções de produção surpreendem as equipas com perguntas para as quais nunca prepararam o modelo. Leia o prompt do utilizador, a resposta do agente, as ferramentas que chamou e o contexto que extraiu e depois aceda diretamente à Gravação de sessões para ver o que correu mal.
One dataset query timed out, but the chart and session pulls gave me enough to isolate it. The drop traces to a single cohort:
- Affected cohort: users on Safari 17.4 (iOS)
- Window: Wed 09:12 – 17:48 UTC
- Likely cause: the v3.8 payments SDK rollout introduced a CORS preflight that failed on Safari iOS
Reverting the rollout for that platform should recover the rate within an hour. Want me to open a 48h follow-up cohort to confirm?
Evaluators
BETADetect when responses cite unsupported facts
Did the agent successfully complete the user's task?
Rate the quality of the agent's tool selection
Cluster reasons users abandon the checkout flow
Description
Grades every matching session for Tool Use Quality and writes the verdict back to the session as a property — available in charts, segments, and exports.
Grading prompt
Edit5 — fully correct, efficient, and well-justified
3 — partially correct or with minor issues
1 — incorrect, unsafe, or off-task
Weigh tool selection and reasoning, not just the final answer.
Label distribution · last 30 days
Configuration
Monitor
Last 30 daysChat AgentSearch…Agent Adoption
Active users for Chat Agent
Agent Activity
Conversation volume for Chat Agent
Failure Rate
Errored sessions for Chat Agent
Daily Spend
Inference cost for Chat Agent
Done. Here’s the median weekly check-ins per location over the last 30 days:
Downtown Flagship and Riverside stand out — they drive 2–3x the check-ins of every other location. Worth a closer look at staffing and class capacity there.
View chart →Response accuracy
Member friction
Resolved the request
Member intent topic
Overall quality
Comments
Aperfeiçoámo-la para nós próprios
Lançámos agentes na Amplitude, deparámo-nos com os mesmos problemas que encontrou e, como resultado disso, criámos o Agent Analytics. Ouça os dados e as histórias da equipa por trás disso.
Instrumente qualquer fornecedor de LLM
Wrappers nativos para os fornecedores que realmente usa. Uma ponte OpenTelemetry para o resto. Captura manual quando quiser controlo total.
Python e Node, SDK drop-in, ativo em minutos.
Análises de conteúdo opcionais
Criada especificamente para lhe permitir controlar o que sai do seu ambiente.
Envie conversas completas, as suas próprias etiquetas ou apenas metadados. Mude de modo por agente ou por origem de evento.
O Agent Analytics está em versão beta
Deixe de enviar com base em intuições
- Encontre os modos de falha que realmente lhe custam utilizadores.
- Avalie a conversão e a retenção por qualidade do agente.
- Ligue qualquer rastreio a gravações de sessões e experiências.
Registe-se para obter acesso antecipado
Junte-se à lista de espera
Perguntas frequentes
A camada de análise entre a observabilidade do LLM e a análise de produtos. Cada mensagem do utilizador, chamada da ferramenta, resposta do agente e fim da sessão torna-se um evento da Amplitude marcado com tópico, pontuação de qualidade e padrão comportamental, para que possa criar coortes, funis e curvas de retenção sobre a qualidade da sessão de IA.
As ferramentas de rastreio respondem a "O que fez o agente?" O Agent Analytics responde a "Funcionou para o utilizador?" Pode manter a sua ferramenta de rastreamento: o AmplitudeGenAIExporter adiciona a Amplitude como um segundo destino OpenTelemetry num registo de processador de intervalo.
Não. O SDK tem três modos de privacidade: metadata_only (apenas tokens, latência, custo e sinais comportamentais), customer_enriched (as suas próprias etiquetas, sem texto bruto) e full (enriquecimento gerido). A maioria das equipas começam com apenas metadados e sobrem de patamar à medida que a confiança aumenta.
Python no PyPI (pip install amplitude-ai) e Node.js / TypeScript no npm (npm install @amplitude/ai). Wrappers nativos para OpenAI, Anthropic, Gemini, Bedrock, Mistral e Azure OpenAI. Integrações de estrutura para LangChain, LlamaIndex, OpenAI Agents SDK, CrewAI e Claude Agent SDK. Tudo o que emita spans OpenTelemetry GenAI (OpenLIT, Traceloop e instrumentação OpenAI) flui através da ponte.
Cada evento de agente tem uma ID de gravação de sessão. A partir de qualquer sessão no explorador, a opção Ver gravação abre no momento em que a conversa começou, para que veja o agente falhar dentro do produto real que o utilizador estava a usar.
Cada evento contém a variante de experiência como uma propriedade, pelo que os testes A/B de prompt atribuem corretamente em conversas de várias interações. As pontuações de qualidade e os padrões comportamentais fluem para coortes que o Guides e o Activation visam em tempo real. O mesmo espaço de trabalho, o mesmo grafo de identidade.
Uma nova era de análise
Desde uma visão geral do agente em tempo real a avaliações e conjuntos de dados, cada visualização associa o que o agente fez ao que o utilizador fez a seguir.









