에이전트 분석
사용 중인 AI 에이전트의 실제 임팩트는 무엇인가요?
에이전트가 좋은 답변을 제공했다는 것을 아는 것은 쉬운 부분에 속합니다. 에이전트 분석은 트레이스 및 평가를 전환, 리텐션, 수익과 연결하여 에이전트 품질이 실제 비즈니스에 미친 영향을 알 수 있도록 합니다.

Sessions
Which users only engaged with our agent once?
What are my agents' most common failure modes?
What questions are being answered badly?
How and why are users using the create_theme tool?
One financing quote timed out, but inventory and trim data came back clean. Three cars fit your budget and safety bar:
- Best match: 2024 Kia Telluride EX — $43,190, IIHS Top Safety Pick+
- Runner-up: 2024 Honda Pilot EX-L — $44,700, seats 8
- Watch out: the Highlander XLE clears $46,800 once you add all-wheel drive
Two Tellurides are in stock at Northgate Kia. Want me to book a test drive this weekend?
Summary
Matched a $45k 3-row SUV request to three models and booked a Saturday test drive for the Telluride.
Usage
Configuration
Signals
Topic

기존의 분석 도구로는 부족할 때
대부분의 분석 도구는 추론 및 도구 호출이 아닌 클릭 수와 페이지 조회 수 분석을 위해 만들어졌습니다. 에이전트는 환각을 일으키거나, 지시를 무시하거나, 논점을 자신 있게 이탈할 수 있습니다. 에이전트와 상호작용하는 모든 사용자는 첫눈에는 동일한 참여도를 가지고 있는 것처럼 보입니다. 하지만 에이전트에서 실제로 도움을 받고 다시 방문하는 사용자는 누구인가요?
관찰 가능성 그 이상을 제공합니다
사용 중인 에이전트가 프로덕트 및 수익에 미치는 영향을 알아보세요.
AI 품질
에이전트가 수행한 작업
프로덕트 결과
그다음에 사용자가 한 일
01 관찰
트레이스, 프롬프트, 도구 호출, 응답, 대기 시간 및 비용을 조사합니다. 에이전트가 실제로 수행한 작업에 대한 원시 기록을 보여줍니다.
02 평가
품질, 의도, 해결, 실패 모드에 점수를 매겨 평가합니다. 에이전트가 도움이 되는 부분, 혼동하는 부분, 위험을 증가시키는 부분이 어디인지 확인하세요.
03 결정
이러한 품질 신호를 전환, 리텐션, 수익과 연결합니다. 에이전트가 실제로 사용자를 다음 단계로 이끌었는지 평가합니다.
04 배포
프롬프트를 조정하고, 실험을 진행하고, 가이드를 트리거하고, 학습한 내용을 바탕으로 다음 단계를 개인화합니다.

트레이스를 자동으로 Amplitude 이벤트화합니다
모든 사용자 메시지, 도구 호출 및 에이전트 응답은 나머지 프로덕트 데이터와 동일한 'user_id'를 가진 Amplitude 이벤트로 핸들링됩니다. 단순한 트레이싱에서 그치는 관찰 가능성 도구와 달리 에이전트 분석은 이러한 대화를 이벤트로 작게 분해하여 이미 사용 중인 것과 동일한 퍼널, 코호트 및 리텐션 분석에서 직접 쿼리할 수 있도록 처리합니다.
마침내 답을 찾을 수 있게 된 질문들
01
모델 업그레이드로 인해 이번 주의 가입 전환율이 상승했나요, 아니면 하락했나요?
02
에이전트가 올바르게 답변하는 경우와 잘못 답변하는 경우의 전환율 차이는 얼마인가요?
03
어떤 에이전트 주제가 확장 의도 또는 이탈 위험과 관련성이 있나요?
에이전트 분석 성숙도 모델
대부분의 관찰 가능성 도구는 낮은 성숙도 수준에서 멈추는 반면, 에이전트 분석은 AI 품질을 사용자 여정 및 수익과 연결하여 최고의 성과를 끌어냅니다.
AI의 달러 가치는 얼마일까요?
AI의 사용은 사용자 여정에 어떤 영향을 미치나요?
에이전트가 실제로 수행하는 작업은 무엇인가요?
에이전트가 작업을 올바르게 수행했나요?
무슨 일이 일어났는지 확인할 수 있나요?
에이전트 분석 들여다보기






생산 실행을 하다 보면 팀에서 모델 학습 시 예상하지 못했던 질문을 받고 당황하게 되는 경우가 있습니다. 사용자 프롬프트, 에이전트의 응답, 호출한 도구, 가져온 맥락을 읽은 다음 바로 사용자 행동 리플레이로 이동하여 무엇이 잘못되었는지 확인하세요.
One financing quote timed out, but inventory and trim data came back clean. Three cars fit your budget and safety bar:
- Best match: 2024 Kia Telluride EX — $43,190, IIHS Top Safety Pick+
- Runner-up: 2024 Honda Pilot EX-L — $44,700, seats 8
- Watch out: the Highlander XLE clears $46,800 once you add all-wheel drive
Two Tellurides are in stock at Northgate Kia. Want me to book a test drive this weekend?
Evaluators
BETADetect when responses cite unsupported facts
Did the agent successfully complete the user's task?
Rate the quality of the agent's tool selection
Cluster reasons users abandon the checkout flow
Description
Grades every matching session for Tool Use Quality and writes the verdict back to the session as a property — available in charts, segments, and exports.
Grading prompt
Edit5 — fully correct, efficient, and well-justified
3 — partially correct or with minor issues
1 — incorrect, unsafe, or off-task
Weigh tool selection and reasoning, not just the final answer.
Label distribution · last 30 days
Configuration
Monitor
Last 30 daysChat AgentSearch…Agent Adoption
Active users for Chat Agent
Agent Activity
Conversation volume for Chat Agent
Failure Rate
Errored sessions for Chat Agent
Daily Spend
Inference cost for Chat Agent
Done. Here’s the median weekly check-ins per location over the last 30 days:
Downtown Flagship and Riverside stand out — they drive 2–3x the check-ins of every other location. Worth a closer look at staffing and class capacity there.
View chart →Response accuracy
Member friction
Resolved the request
Member intent topic
Overall quality
Comments
우리 자신을 위해 완벽하게 만든 서비스
Amplitude는 에이전트를 출시하고, 고객과 동일한 문제를 겪었으며, 그 결과로 에이전트 분석 기능을 구축했습니다. 이를 가능하게 한 팀의 데이터와 이야기를 들어보세요.
모든 LLM 제공업체 데이터 분석 지원
여러분이 실제로 사용하는 제공업체에 맞는 네이티브 래퍼를 제공하고, 그 외는 OpenTelemetry 브리지를 사용하여 수집합니다. 완전한 제어가 필요한 경우 수동 캡처를 이용합니다.
단 몇 분이면 Python 및 Node와 드롭인 SDK를 사용한 서비스를 시작할 수 있습니다.
콘텐츠 선별 분석
사용자 환경에서 내보내는 내용을 제어할 수 있도록 특별히 설계되었습니다.
대화 전체를 전송하거나, 자체 라벨, 또는 메타데이터만 전송할 수도 있습니다. 에이전트 또는 이벤트 소스에 따라 모드를 전환하세요.
에이전트 분석은 현재 베타 버전입니다
감에 의존한 출시는 이제 그만
- 실제로 사용자 손실을 초래하는 실패 모드를 찾으세요.
- 에이전트 품질에 따른 전환 및 리텐션을 측정하세요.
- 모든 트레이스를 사용자 행동 리플레이 및 실험에 연결하세요.
자주 묻는 질문
LLM 관찰 가능성과 프로덕트 분석 사이에 존재하는 분석 계층입니다. 모든 사용자 메시지, 도구 호출, 에이전트 응답 및 세션 종료는 주제, 품질 점수 및 행동 패턴이 태그된 Amplitude 이벤트가 되어 AI 세션 품질에 대한 코호트, 퍼널 및 리텐션 곡선을 구축할 수 있는 재료가 됩니다.
트레이싱 도구는 '에이전트가 무엇을 했나요?'라는 질문에 답합니다. 에이전트 분석은 '에이전트가 사용자에게 도움을 주었나요?'라는 질문에 답합니다. AmplitudeGenAIExporter는 스팬 프로세서를 한 번만 등록하면 Amplitude를 두 번째 OpenTelemetry 대상으로 추가할 수 있어 현재 트레이싱 도구를 계속 사용하는 것도 가능합니다.
아니요. SDK에는 metadata_only(토큰, 대기 시간, 비용 및 행동 신호만 전송), customer_enriched(자체 라벨, 원시 텍스트 없음) 및 full(관리형 데이터 강화)의 세 가지 개인정보 보호 모드가 있습니다. 대부분의 팀은 metadata_only 모드로 시작한 후 신뢰가 쌓임에 따라 업그레이드합니다.
PyPI의 Python(pip install amplitude-ai) 및 npm의 Node.js/TypeScript(npm install @amplitude/ai) 언어를 지원합니다. OpenAI, Anthropic, Gemini, Bedrock, Mistral, Azure OpenAI를 위한 네이티브 래퍼 및 LangChain, LlamaIndex, OpenAI Agents SDK, CrewAI, Claude Agent SDK에 대한 프레임워크 통합도 지원됩니다. OpenTelemetry GenAI 스팬을 생성하는 모든 도구(OpenLIT, Traceloop, OpenAI 계측 등)의 데이터는 브리지를 통해 유입됩니다.
모든 에이전트 이벤트에는 사용자 행동 리플레이 ID가 붙어 있습니다. 탐색기의 모든 세션에서 리플레이는 대화가 시작되는 시점부터 열리므로 사용자가 사용하던 실제 제품 내에서 에이전트가 실패하는 것을 확인할 수 있습니다.
각 이벤트에는 실험 버전 정보가 속성으로 기록되므로, 여러 턴에 걸쳐 진행되는 대화에서도 프롬프트 A/B 테스트 결과를 올바른 실험군에 맞추어 분석할 수 있습니다. 품질 점수와 행동 패턴은 가이드 및 활성화가 실시간으로 타겟팅하는 코호트에 반영됩니다. 이는 Amplitude 에이전트 분석과 Amplitude 실험, Amplitude 가이드가 동일한 작업 공간 및 ID 그래프를 공유하기 때문입니다.
분석의 새로운 시대
실시간 에이전트 개요부터 평가 및 데이터 세트까지 모든 보기는 에이전트가 수행한 작업과 그다음에 사용자가 한 일을 연결하여 분석합니다.









