Agent Analytics
Was ist die tatsächliche Wirkung deines KI-Assistenten?
Zu wissen, dass dein Assistent eine gute Antwort gegeben hat, ist der einfache Teil. Agent Analytics verknüpft Ablaufverfolgung und Bewertung mit Konversion, Kundenbindung und Umsatz, sodass du die Assistentenqualität mit den tatsächlichen Auswirkungen auf dein Geschäft in Verbindung bringen kannst.

Sessions
Which users only engaged with our agent once?
What are my agents' most common failure modes?
What questions are being answered badly?
How and why are users using the create_theme tool?
One dataset query timed out, but the chart and session pulls gave me enough to isolate it. The drop traces to a single cohort:
- Affected cohort: users on Safari 17.4 (iOS)
- Window: Wed 09:12 – 17:48 UTC
- Likely cause: the v3.8 payments SDK rollout introduced a CORS preflight that failed on Safari iOS
Reverting the rollout for that platform should recover the rate within an hour. Want me to open a 48h follow-up cohort to confirm?

Wenn herkömmliche Analysen nicht ausreichen
Die meisten Analysetools wurden für Klicks und Seitenaufrufe entwickelt, nicht für logisches Denken und Tool-Aufrufe. Assistenten können halluzinieren, Anweisungen ignorieren und unbeirrt vom Kurs abkommen. Alle Nutzer:innen, die Zeit mit deinem Assistenten verbringen, scheinen gleichermaßen eingebunden zu sein. Aber wer fand ihn tatsächlich nützlich und verwendete ihn wieder?
Mehr als nur Observability
Erfahre, wie sich deine Assistenten auf das Produkt und den Umsatz auswirken.
KI-Qualität
Was der Assistent getan hat
Produktergebnisse
Was der/die Nutzer:in im Anschluss unternimmt
01 Beobachten
Überprüfe Ablaufverfolgungen, Prompts, Tool-Aufrufe, Antworten, Latenz und Kosten. Die Rohaufzeichnung dessen, was der Assistent tatsächlich getan hat.
02 Bewerten
Bewerte Qualität, Absicht, Lösung und Fehlermuster. Erfahre, wo der Assistent hilft, wo er verwirrt ist und wo er ein Risiko darstellt.
03 Entscheiden
Verknüpfe diese Qualitätssignale mit Konversion, Kundenbindung und Umsatz. Hat der Assistent den/die Nutzer:in tatsächlich weitergebracht?
04 Bereitstellen
Optimiere Prompts, führe Tests durch, löse Guides aus und personalisiere den nächsten Schritt basierend auf dem, was du gelernt hast.

Interaktionen aus der Ablaufverfolgung werden automatisch zu Amplitude-Ereignissen
Jede Nachricht von Nutzer:innen, jeder Tool-Aufruf und jede Antwort eines Assistenten ist ein Amplitude-Ereignis mit derselben „user_id“ wie die übrigen Produktdaten. Im Gegensatz zu Observability-Tools, die bei der Ablaufverfolgung enden, zerlegt Agent Analytics diese Gespräche in Ereignisse, sodass sie direkt in denselben Funneln, Kohorten und Kundenbindungsanalysen abgefragt werden können, die du bereits verwendest.
Die Fragen, die du endlich beantworten kannst
01
Hat unser Modell-Upgrade die Anmeldekonversion diese Woche erhöht oder beeinträchtigt?
02
Wie wirken sich korrekte Antworten im Vergleich zu Halluzinationen auf die Konversion aus?
03
Welche Assistenten-Themen korrelieren mit der Expansionsabsicht und welche mit dem Abwanderungsrisiko?
Das Reifegradmodell von Agent Analytics
Die meisten Observability-Tools decken nur die unteren Reifegrade ab. Agent Analytics bringt dich an die Spitze, indem es die KI-Qualität mit der User Journey und dem Umsatz verknüpft.
Welchen finanziellen Mehrwert bietet die KI?
Wie wirkt sich der Einsatz von KI auf die User Journey aus?
Was macht der Assistent eigentlich?
Hat der Assistent es richtig gemacht?
Kann ich sehen, was passiert ist?
Ein Blick hinter die Kulissen von Agent Analytics






Produktionsläufe überraschen Teams mit Fragen, auf die sie das Modell nie vorbereitet haben. Schau dir den Prompt, die Antwort des Assistenten, die von ihm aufgerufenen Tools und den abgerufenen Kontext an und gehe dann direkt zu Session Replay, um zu sehen, was schiefgelaufen ist.
One dataset query timed out, but the chart and session pulls gave me enough to isolate it. The drop traces to a single cohort:
- Affected cohort: users on Safari 17.4 (iOS)
- Window: Wed 09:12 – 17:48 UTC
- Likely cause: the v3.8 payments SDK rollout introduced a CORS preflight that failed on Safari iOS
Reverting the rollout for that platform should recover the rate within an hour. Want me to open a 48h follow-up cohort to confirm?
Evaluators
BETADetect when responses cite unsupported facts
Did the agent successfully complete the user's task?
Rate the quality of the agent's tool selection
Cluster reasons users abandon the checkout flow
Description
Grades every matching session for Tool Use Quality and writes the verdict back to the session as a property — available in charts, segments, and exports.
Grading prompt
Edit5 — fully correct, efficient, and well-justified
3 — partially correct or with minor issues
1 — incorrect, unsafe, or off-task
Weigh tool selection and reasoning, not just the final answer.
Label distribution · last 30 days
Configuration
Monitor
Last 30 daysChat AgentSearch…Agent Adoption
Active users for Chat Agent
Agent Activity
Conversation volume for Chat Agent
Failure Rate
Errored sessions for Chat Agent
Daily Spend
Inference cost for Chat Agent
Done. Here’s the median weekly check-ins per location over the last 30 days:
Downtown Flagship and Riverside stand out — they drive 2–3x the check-ins of every other location. Worth a closer look at staffing and class capacity there.
View chart →Response accuracy
Member friction
Resolved the request
Member intent topic
Overall quality
Comments
Wir haben es für unsere Anforderungen perfektioniert
Wir haben Assistenten bei Amplitude eingesetzt, sind auf die gleichen Probleme gestoßen wie du und haben daraufhin Agent Analytics entwickelt. Erfahre mehr über die Daten und Geschichten des Teams, das dahintersteckt.
Mach jeden LLM-Anbieter einsatzbereit
Native Wrapper für die Anbieter, die du tatsächlich nutzt. Eine OpenTelemetry-Bridge für den Rest. Manuelle Erfassung, wenn du die volle Kontrolle haben möchtest.
Python und Node, einfach integrierbares SDK, in wenigen Minuten einsatzbereit.
Analysen mit optionalen Inhalten
Speziell entwickelt, damit du kontrollieren kannst, was deine Umgebung verlässt.
Sende vollständige Gespräche, deine eigenen Labels oder nur Metadaten. Wechsle die Modi pro Assistent oder pro Ereignisquelle.
Agent Analytics ist in der Beta-Phase
Verlasse dich nicht mehr auf dein Bauchgefühl
- Finde die Fehlermuster, die dich tatsächlich Nutzer:innen kosten.
- Miss die Konversion und Kundenbindung nach Assistentenqualität.
- Verknüpfe jede Ablaufverfolgung mit Sitzungsaufzeichnungen und Experimenten.
Registrieren und frühzeitigen Zugang sichern
Auf die Warteliste setzen
Häufig gestellte Fragen
Die Analytics-Ebene zwischen LLM-Observability und Produktanalysen. Jede Nachricht von Nutzer:innen, jeder Tool-Aufruf, jede Antwort eines Assistenten und jedes Sitzungsende wird zu einem Amplitude-Ereignis, das mit Thema, Qualitätsbewertung und Verhaltensmuster versehen ist. So kannst du Kohorten, Funnel und Bindungskurven zur Qualität von KI-Sitzungen erstellen.
Tools zur Ablaufverfolgung beantworten die Frage „Was hat der Assistent getan?“ Agent Analytics beantwortet die Frage „Hat es für den/die Nutzer:in funktioniert?“ Du kannst dein Tool zur Ablaufverfolgung behalten: AmplitudeGenAIExporter fügt Amplitude als zweites OpenTelemetry-Ziel in einer Span-Prozessor-Registrierung hinzu.
Nein! Das SDK verfügt über drei Datenschutzmodi: metadata_only (nur Token, Latenz, Kosten und Verhaltenssignale), customer_enriched (deine eigenen Labels, kein Rohtext) und full (verwaltete Anreicherung). Die meisten Teams beginnen mit „metadata_only“ und führen ein Upgrade durch, sobald das Vertrauen wächst.
Python auf PyPI (pip install amplitude-ai) und Node.js/TypeScript auf npm (npm install @amplitude/ai). Native Wrapper für OpenAI, Anthropic, Gemini, Bedrock, Mistral und Azure OpenAI. Framework-Integrationen für LangChain, LlamaIndex, OpenAI Agents SDK, CrewAI und das Claude Agent SDK. Alles, was OpenTelemetry-GenAI-Spans ausgibt (OpenLIT, Traceloop und OpenAI-Instrumentierung), fließt über die Integration ein.
Jedes Assistentenereignis enthält eine Session-Replay-ID. View Replay öffnet sich von jeder Sitzung im Explorer aus in dem Moment, in dem das Gespräch begonnen hat, sodass du beobachten kannst, wie der Assistent in dem tatsächlichen Produkt, das der/die Nutzer:in verwendet hat, versagt hat.
Jedes Ereignis enthält die Experimentvariante als Eigenschaft, sodass A/B-Tests in mehrstufigen Gesprächen korrekt zugeordnet werden. Qualitätsbewertungen und Verhaltensmuster fließen in Kohorten ein, auf die Guides und Activation in Echtzeit abzielen. Derselbe Arbeitsbereich, derselbe Identitätsgraph.
Eine neue Ära der Analysen
Von einer Live-Übersicht des Assistenten bis hin zu Auswertungen und Datensätzen verbindet jede Ansicht das, was der Assistent getan hat, mit dem, was der/die Nutzer:in im Anschluss unternimmt.









