Agent Analytics
Quel est l'impact réel de votre agent IA ?
Savoir que votre agent a donné une bonne réponse est la partie la plus facile. Agent Analytics relie les traces et les évaluations à la conversion, à la rétention et aux revenus, afin que vous puissiez relier la qualité de l'agent à l'impact réel sur l'activité.

Sessions
Which users only engaged with our agent once?
What are my agents' most common failure modes?
What questions are being answered badly?
How and why are users using the create_theme tool?
One dataset query timed out, but the chart and session pulls gave me enough to isolate it. The drop traces to a single cohort:
- Affected cohort: users on Safari 17.4 (iOS)
- Window: Wed 09:12 – 17:48 UTC
- Likely cause: the v3.8 payments SDK rollout introduced a CORS preflight that failed on Safari iOS
Reverting the rollout for that platform should recover the rate within an hour. Want me to open a 48h follow-up cohort to confirm?

Lorsque l'analyse traditionnelle n'est pas à la hauteur
La plupart des outils d'analyse ont été conçus pour les clics et les pages vues, et non pour le raisonnement et les appels d'outils. Les Agents peuvent avoir des hallucinations, ignorer les instructions et dévier de leur trajectoire en toute confiance. Tous les utilisateurs qui passent du temps avec votre agent semblent tout aussi engagés. Qui a vraiment trouvé l'outil utile et y est revenu ?
Allez au-delà de l'observabilité
Découvrez l'impact de vos agents sur le produit et le chiffre d'affaires.
Qualité IA
Ce que l'agent a fait
Résultats du produit
Ce que l'utilisateur a fait ensuite
01 Observez
Inspectez les traces, les prompts, les appels d'outils, les réponses, la latence et le coût. L'enregistrement brut de ce que l'agent a réellement fait.
02 Évaluez
Notez la qualité, l'intention, la résolution et les modes d'échec. Découvrez où l'agent est utile, où il est confus et où il ajoute des risques.
03 Décidez
Reliez ces signaux de qualité à la conversion, à la rétention et aux revenus. L'agent a-t-il réellement fait progresser l'utilisateur ?
04 Déployez
Ajustez les prompts, lancez des expériences, déclenchez des guides et personnalisez l'étape suivante en fonction de ce que vous avez appris.

Les traces deviennent automatiquement des événements Amplitude
Chaque message d'utilisateur, appel d'outil et réponse d'agent est un événement Amplitude avec le même « user_id » que le reste de vos données produit. Contrairement aux outils d'observabilité qui s'arrêtent à la trace, Agent Analytics décompose ces conversations en événements, ce qui permet de les interroger directement dans les mêmes entonnoirs, cohortes et analyses de rétention que vous utilisez déjà.
Les questions auxquelles vous pouvez enfin répondre
01
Notre mise à niveau du modèle a-t-elle augmenté ou diminué la conversion des inscriptions cette semaine ?
02
Quel est le delta de conversion lorsque l'agent répond correctement par rapport à lorsqu'il hallucine ?
03
Quels sujets d'agent sont liés à l'intention d'expansion et lesquels sont liés au risque de désabonnement ?
Le modèle de maturité d'Agent Analytics
La plupart des outils d'observabilité s'arrêtent aux niveaux de maturité les plus bas. Agent Analytics vous mène au sommet, en reliant la qualité de l'IA au parcours utilisateur et aux revenus.
Quelle est la valeur de l'IA en dollars ?
Comment l'utilisation de l'IA affecte-t-elle le parcours utilisateur ?
Que fait réellement l'agent ?
L'agent l'a-t-il fait correctement ?
Puis-je voir ce qui s'est passé ?
Au cœur d'Agent Analytics






Les cycles de production surprennent les équipes avec des questions pour lesquelles elles n'ont jamais préparé le modèle. Lisez la requête de l'utilisateur, la réponse de l'agent, les outils qu'il a appelés et le contexte qu'il a extrait, puis passez directement à Session Replay pour voir ce qui n'a pas fonctionné.
One dataset query timed out, but the chart and session pulls gave me enough to isolate it. The drop traces to a single cohort:
- Affected cohort: users on Safari 17.4 (iOS)
- Window: Wed 09:12 – 17:48 UTC
- Likely cause: the v3.8 payments SDK rollout introduced a CORS preflight that failed on Safari iOS
Reverting the rollout for that platform should recover the rate within an hour. Want me to open a 48h follow-up cohort to confirm?
Evaluators
BETADetect when responses cite unsupported facts
Did the agent successfully complete the user's task?
Rate the quality of the agent's tool selection
Cluster reasons users abandon the checkout flow
Description
Grades every matching session for Tool Use Quality and writes the verdict back to the session as a property — available in charts, segments, and exports.
Grading prompt
Edit5 — fully correct, efficient, and well-justified
3 — partially correct or with minor issues
1 — incorrect, unsafe, or off-task
Weigh tool selection and reasoning, not just the final answer.
Label distribution · last 30 days
Configuration
Monitor
Last 30 daysChat AgentSearch…Agent Adoption
Active users for Chat Agent
Agent Activity
Conversation volume for Chat Agent
Failure Rate
Errored sessions for Chat Agent
Daily Spend
Inference cost for Chat Agent
Done. Here’s the median weekly check-ins per location over the last 30 days:
Downtown Flagship and Riverside stand out — they drive 2–3x the check-ins of every other location. Worth a closer look at staffing and class capacity there.
View chart →Response accuracy
Member friction
Resolved the request
Member intent topic
Overall quality
Comments
Nous l'avons perfectionné pour nous-mêmes
Nous avons déployé des agents chez Amplitude, rencontré les mêmes problèmes que vous et, par conséquent, créé Agent Analytics. Découvrez les données et les témoignages de l'équipe qui a travaillé sur ce projet.
Instrumentez n'importe quel fournisseur de LLM
Wrappers natifs pour les fournisseurs que vous utilisez réellement. Un pont OpenTelemetry pour le reste. Capture manuelle lorsque vous souhaitez un contrôle total.
Python et Node, SDK prêt à l'emploi, opérationnel en quelques minutes.
Analyse facultative du contenu
Spécialement conçu pour vous permettre de contrôler ce qui sort de votre environnement.
Envoyez des conversations complètes, vos propres étiquettes ou uniquement des métadonnées. Changez de mode par agent ou par source d'événement.
Agent Analytics est en version bêta
Arrêtez de livrer au hasard
- Trouvez les modes d'échec qui vous coûtent réellement des utilisateurs.
- Mesurez la conversion et la rétention en fonction de la qualité de l'agent.
- Connectez n'importe quelle trace à la session replay et aux expériences.
Inscrivez-vous pour bénéficier d'un accès anticipé
Rejoindre la liste d'attente
Questions fréquentes
La couche d'analyse entre l'observabilité du LLM et l'analyse de produit. Chaque message d'utilisateur, appel d'outil, réponse d'agent et fin de session devient un événement Amplitude étiqueté avec un sujet, un score de qualité et un modèle de comportement, ce qui vous permet de créer des cohortes, des entonnoirs et des courbes de rétention sur la qualité de la session d'IA.
Les outils de traçage répondent à la question « Qu'a fait l'agent ? » Agent Analytics répond à la question « Est-ce que cela a fonctionné pour l'utilisateur ? » Vous pouvez conserver votre outil de traçage : AmplitudeGenAIExporter ajoute Amplitude en tant que deuxième destination OpenTelemetry dans un enregistrement de processeur span.
Non. Le SDK dispose de trois modes de confidentialité : metadata_only (jetons, latence, coût et signaux comportementaux uniquement), customer_enriched (vos propres étiquettes, pas de texte brut) et full (enrichissement géré). La plupart des équipes commencent par le mode metadata_only et passent à un mode supérieur à mesure que la confiance se renforce.
Python sur PyPI (pip install amplitude-ai) et Node.js / TypeScript sur npm (npm install @amplitude/ai). Wrappers natifs pour OpenAI, Anthropic, Gemini, Bedrock, Mistral et Azure OpenAI. Intégrations de cadres pour LangChain, LlamaIndex, OpenAI Agents SDK, CrewAI et Claude Agent SDK. Tout ce qui émet des spans OpenTelemetry GenAI (OpenLIT, Traceloop et instrumentation OpenAI) passe par le pont.
Chaque événement d'agent comporte un identifiant de Session Replay. À partir de n'importe quelle session dans l'explorateur, View Replay s'ouvre au moment où la conversation a commencé, ce qui vous permet de voir l'agent échouer au sein du produit réel que l'utilisateur utilisait.
Chaque événement comporte la variante d'expérience en tant que propriété, de sorte que les tests A/B de prompt s'attribuent correctement dans les conversations à plusieurs tours. Les scores de qualité et les modèles de comportement sont intégrés dans des cohortes que Guides et Activation ciblent en temps réel. Même espace de travail, même graphe d'identité.
Une nouvelle ère de l'analyse
De la vue d'ensemble de l'agent en direct aux évaluations et aux ensembles de données, chaque vue relie ce que l'agent a fait à ce que l'utilisateur a fait ensuite.









