Análisis de agentes
¿Cuál es el impacto real de tu agente de IA?
Saber que tu agente dio una buena respuesta es la parte fácil. Análisis de agentes vincula los seguimientos y las evaluaciones con las conversiones, la retención y los ingresos, para que puedas relacionar la calidad del agente con el impacto real en el negocio.

Sessions
Which users only engaged with our agent once?
What are my agents' most common failure modes?
What questions are being answered badly?
How and why are users using the create_theme tool?
One dataset query timed out, but the chart and session pulls gave me enough to isolate it. The drop traces to a single cohort:
- Affected cohort: users on Safari 17.4 (iOS)
- Window: Wed 09:12 – 17:48 UTC
- Likely cause: the v3.8 payments SDK rollout introduced a CORS preflight that failed on Safari iOS
Reverting the rollout for that platform should recover the rate within an hour. Want me to open a 48h follow-up cohort to confirm?

Cuando el análisis tradicional se queda corto
La mayoría de las herramientas de análisis se crearon para medir clics y visitas a las páginas, no para el razonamiento y las llamadas a las herramientas. Los agentes pueden alucinar, ignorar las instrucciones y desviarse sin saberlo. Todos los usuarios que pasan tiempo con tu agente parecen igual de interesados. ¿A quién le pareció realmente útil y volvió?
Ve más allá de la observabilidad
Descubre el impacto de tus agentes en el producto y los ingresos.
Calidad de la IA
Qué ha hecho el agente
Resultados de los productos
Qué ha hecho después el usuario
01 Observa
Inspecciona los seguimientos, las indicaciones, las llamadas a herramientas, las respuestas, la latencia y el coste. El registro tal cual de lo que ha hecho realmente el agente.
02 Evalúa
Puntúa la calidad, la intención, la resolución y los modos de fallo. Descubre en qué casos ayuda el agente, en cuáles se confunde y cuándo supone un riesgo.
03 Decide
Vincula esas señales sobre la calidad con las conversiones, la retención y los ingresos. ¿El agente ha conseguido que el usuario avance?
04 Implementa
Ajusta las indicaciones, ejecuta experimentos, activa guías y personaliza el siguiente paso a partir de lo que has aprendido.

Los seguimientos se convierten automáticamente en eventos de Amplitude
Cada mensaje de usuario, llamada a una herramienta y respuesta del agente es un evento de Amplitude con el mismo «user_id» que el resto de los datos de tus productos. A diferencia de las herramientas de observabilidad que se detienen en el seguimiento, el Análisis de agentes descompone estas conversaciones en eventos, lo que permite consultarlas directamente en los mismos embudos, cohortes y análisis de retención que ya utilizas.
Las preguntas que por fin puedes responder
01
¿La mejora de nuestro modelo ha aumentado los registros esta semana o los ha reducido?
02
¿Cuál es la diferencia de conversiones cuando el agente responde correctamente en comparación con cuando se equivoca?
03
¿Qué temas del agente se correlacionan con la intención de expansión y cuáles con el riesgo de abandono?
El modelo de madurez de Análisis de agentes
La mayoría de las herramientas de observabilidad se quedan en los niveles más bajos de madurez. Análisis de agentes alcanza los más altos al relacionar la calidad de la IA con el recorrido de los usuarios y los ingresos.
¿Cuánto vale la IA en dinero?
¿Cómo afecta el uso de la IA al recorrido de los usuarios?
¿Qué está haciendo realmente el agente?
¿Lo ha hecho bien el agente?
¿Puedo ver qué ha sucedido?
Análisis de agentes internos






Las ejecuciones de producción sorprenden a los equipos con preguntas para las que nunca habían preparado el modelo. Lee la indicación del usuario, la respuesta del agente, las herramientas utilizadas y el contexto que ha extraído, y luego accede directamente a Session Replay para ver qué ha fallado.
One dataset query timed out, but the chart and session pulls gave me enough to isolate it. The drop traces to a single cohort:
- Affected cohort: users on Safari 17.4 (iOS)
- Window: Wed 09:12 – 17:48 UTC
- Likely cause: the v3.8 payments SDK rollout introduced a CORS preflight that failed on Safari iOS
Reverting the rollout for that platform should recover the rate within an hour. Want me to open a 48h follow-up cohort to confirm?
Evaluators
BETADetect when responses cite unsupported facts
Did the agent successfully complete the user's task?
Rate the quality of the agent's tool selection
Cluster reasons users abandon the checkout flow
Description
Grades every matching session for Tool Use Quality and writes the verdict back to the session as a property — available in charts, segments, and exports.
Grading prompt
Edit5 — fully correct, efficient, and well-justified
3 — partially correct or with minor issues
1 — incorrect, unsafe, or off-task
Weigh tool selection and reasoning, not just the final answer.
Label distribution · last 30 days
Configuration
Monitor
Last 30 daysChat AgentSearch…Agent Adoption
Active users for Chat Agent
Agent Activity
Conversation volume for Chat Agent
Failure Rate
Errored sessions for Chat Agent
Daily Spend
Inference cost for Chat Agent
Done. Here’s the median weekly check-ins per location over the last 30 days:
Downtown Flagship and Riverside stand out — they drive 2–3x the check-ins of every other location. Worth a closer look at staffing and class capacity there.
View chart →Response accuracy
Member friction
Resolved the request
Member intent topic
Overall quality
Comments
Lo perfeccionamos para nosotros mismos
Lanzamos agentes en Amplitude, nos topamos con los mismos problemas que tú y, como resultado, creamos Análisis de agentes. Conoce los datos y las historias del equipo que está detrás.
Instrumenta cualquier proveedor de LLM
Wrappers nativos para los proveedores con los que realmente trabajas. Un puente de OpenTelemetry para todo lo demás. Captura manual cuando quieres tener un control total.
SDK fácil de integrar y listo para usar en Python y Node en cuestión de minutos.
Análisis de contenido opcional
Diseñado específicamente para que puedas controlar lo que sale de tu entorno.
Envía conversaciones completas, tus propias etiquetas o solo metadatos. Cambia de modo por agente o por fuente de eventos.
Análisis de agentes está en fase beta
Deja de basarte en presentimientos
- Descubre los modos de fallo que realmente te hacen perder usuarios.
- Mide la conversión y la retención en función de la calidad del agente.
- Conecta cualquier seguimiento con Session Replay y los experimentos.
Regístrate para obtener acceso anticipado
Preguntas frecuentes
La capa de análisis entre la observabilidad de los LLM y el análisis de productos. Cada mensaje de usuario, llamada a la herramienta, respuesta del agente y final de sesión se convierte en un evento de Amplitude etiquetado con el tema, la puntuación de calidad y el patrón de comportamiento, para que puedas crear cohortes, embudos y curvas de retención sobre la calidad de las sesiones de IA.
Las herramientas de seguimiento responden a esta pregunta: «¿Qué hizo el agente?». El Análisis de agentes responde a esta otra: «¿Le funcionó al usuario?». Puedes conservar tu herramienta de seguimiento: AmplitudeGenAIExporter añade Amplitude como un segundo destino de OpenTelemetry con un único registro del procesador de intervalos.
No. El SDK tiene tres modos de privacidad: metadata_only (solo tókenes, latencia, coste y señales de comportamiento), customer_enriched (tus propias etiquetas, sin texto sin procesar) y full (enriquecimiento gestionado). La mayoría de los equipos empiezan con la opción de solo metadatos y luego se pasan a otra a medida que aumenta la confianza.
Python en PyPI (pip install amplitude-ai) y Node.js / TypeScript en npm (npm install @amplitude/ai). Contenedores nativos para OpenAI, Anthropic, Gemini, Bedrock, Mistral y Azure OpenAI. Integraciones de marcos para LangChain, LlamaIndex, OpenAI Agents SDK, CrewAI y el Claude Agent SDK. Todo lo que emita intervalos de GenAI de OpenTelemetry (instrumentación de OpenLIT, Traceloop y OpenAI) pasa a través del puente.
Cada evento de agente tiene un ID de Session Replay. View Replay se abre, desde cualquier sesión en el explorador, justo en el momento en el que comenzó la conversación, por lo que puedes ver el fallo del agente dentro del producto en cuestión que usase el usuario.
Cada evento incluye la variante del experimento como propiedad, por lo que las pruebas A/B de indicaciones se atribuyen correctamente en las conversaciones de varios turnos. Las puntuaciones de calidad y los patrones de comportamiento pasan a las cohortes a las que Guides y Activation se dirigen en tiempo real. El mismo espacio de trabajo, el mismo gráfico de identidad.
Una nueva era de los análisis
Todas las vistas, desde el resumen de un agente en tiempo real hasta las evaluaciones y los conjuntos de datos, relacionan lo que hizo el agente con lo que hizo el usuario a continuación.









