에이전트 분석

사용 중인 AI 에이전트의 실제 임팩트는 무엇인가요?

에이전트가 좋은 답변을 제공했다는 것을 아는 것은 쉬운 부분에 속합니다. 에이전트 분석은 트레이스 및 평가를 전환, 리텐션, 수익과 연결하여 에이전트 품질이 실제 비즈니스에 미친 영향을 알 수 있도록 합니다.

조기 액세스 신청하기
Amplitude Agent Analytics session view
Two Mira assistant chats comparing on-budget and over-budget hotel recommendations

기존의 분석 도구로는 부족할 때

대부분의 분석 도구는 추론 및 도구 호출이 아닌 클릭 수와 페이지 조회 수 분석을 위해 만들어졌습니다. 에이전트는 환각을 일으키거나, 지시를 무시하거나, 논점을 자신 있게 이탈할 수 있습니다. 에이전트와 상호작용하는 모든 사용자는 첫눈에는 동일한 참여도를 가지고 있는 것처럼 보입니다. 하지만 에이전트에서 실제로 도움을 받고 다시 방문하는 사용자는 누구인가요?

관찰 가능성 그 이상을 제공합니다

사용 중인 에이전트가 프로덕트 및 수익에 미치는 영향을 알아보세요.

AI 품질

에이전트가 수행한 작업

프로덕트 결과

그다음에 사용자가 한 일

01 관찰

트레이스, 프롬프트, 도구 호출, 응답, 대기 시간 및 비용을 조사합니다. 에이전트가 실제로 수행한 작업에 대한 원시 기록을 보여줍니다.

02 평가

품질, 의도, 해결, 실패 모드에 점수를 매겨 평가합니다. 에이전트가 도움이 되는 부분, 혼동하는 부분, 위험을 증가시키는 부분이 어디인지 확인하세요.

03 결정

이러한 품질 신호를 전환, 리텐션, 수익과 연결합니다. 에이전트가 실제로 사용자를 다음 단계로 이끌었는지 평가합니다.

04 배포

프롬프트를 조정하고, 실험을 진행하고, 가이드를 트리거하고, 학습한 내용을 바탕으로 다음 단계를 개인화합니다.

A raw trace of spans next to the same turn decomposed into Amplitude events

트레이스를 자동으로 Amplitude 이벤트화합니다

모든 사용자 메시지, 도구 호출 및 에이전트 응답은 나머지 프로덕트 데이터와 동일한 'user_id'를 가진 Amplitude 이벤트로 핸들링됩니다. 단순한 트레이싱에서 그치는 관찰 가능성 도구와 달리 에이전트 분석은 이러한 대화를 이벤트로 작게 분해하여 이미 사용 중인 것과 동일한 퍼널, 코호트 및 리텐션 분석에서 직접 쿼리할 수 있도록 처리합니다.

마침내 답을 찾을 수 있게 된 질문들

01

모델 업그레이드로 인해 이번 주의 가입 전환율이 상승했나요, 아니면 하락했나요?

02

에이전트가 올바르게 답변하는 경우와 잘못 답변하는 경우의 전환율 차이는 얼마인가요?

03

어떤 에이전트 주제가 확장 의도 또는 이탈 위험과 관련성이 있나요?

에이전트 분석 성숙도 모델

대부분의 관찰 가능성 도구는 낮은 성숙도 수준에서 멈추는 반면, 에이전트 분석은 AI 품질을 사용자 여정 및 수익과 연결하여 최고의 성과를 끌어냅니다.

L4수익 어트리뷰션

AI의 달러 가치는 얼마일까요?

L3행동 분석

AI의 사용은 사용자 여정에 어떤 영향을 미치나요?

L2시맨틱 인텔리전스

에이전트가 실제로 수행하는 작업은 무엇인가요?

L1평가 및 주장

에이전트가 작업을 올바르게 수행했나요?

L0트레이싱 및 원격 측정

무슨 일이 일어났는지 확인할 수 있나요?

에이전트 분석 들여다보기

생산 실행을 하다 보면 팀에서 모델 학습 시 예상하지 못했던 질문을 받고 당황하게 되는 경우가 있습니다. 사용자 프롬프트, 에이전트의 응답, 호출한 도구, 가져온 맥락을 읽은 다음 바로 사용자 행동 리플레이로 이동하여 무엇이 잘못되었는지 확인하세요.

도구 호출프롬프트 버전맥락 불러오기리플레이로 이동

모든 LLM 제공업체 데이터 분석 지원

여러분이 실제로 사용하는 제공업체에 맞는 네이티브 래퍼를 제공하고, 그 외는 OpenTelemetry 브리지를 사용하여 수집합니다. 완전한 제어가 필요한 경우 수동 캡처를 이용합니다.

your terminal
$
$

단 몇 분이면 Python 및 Node와 드롭인 SDK를 사용한 서비스를 시작할 수 있습니다.

콘텐츠 선별 분석

사용자 환경에서 내보내는 내용을 제어할 수 있도록 특별히 설계되었습니다.

TierWhat you sendWhat you get
Metadata OnlyTokens, cost, latency, behavioral signalsCost analytics, retention curves, funnel drop-off. No conversation content leaves your environment.
Customer EnrichedYour classification labelsFull topic and quality analytics. You run your own classifiers and send us the structured labels.
FullConversation contentAutomatic topic classification, quality scoring, and behavioral pattern detection.

대화 전체를 전송하거나, 자체 라벨, 또는 메타데이터만 전송할 수도 있습니다. 에이전트 또는 이벤트 소스에 따라 모드를 전환하세요.

에이전트 분석은 현재 베타 버전입니다

감에 의존한 출시는 이제 그만

  • 실제로 사용자 손실을 초래하는 실패 모드를 찾으세요.
  • 에이전트 품질에 따른 전환 및 리텐션을 측정하세요.
  • 모든 트레이스를 사용자 행동 리플레이 및 실험에 연결하세요.
조기 액세스 신청하기

자주 묻는 질문

LLM 관찰 가능성과 프로덕트 분석 사이에 존재하는 분석 계층입니다. 모든 사용자 메시지, 도구 호출, 에이전트 응답 및 세션 종료는 주제, 품질 점수 및 행동 패턴이 태그된 Amplitude 이벤트가 되어 AI 세션 품질에 대한 코호트, 퍼널 및 리텐션 곡선을 구축할 수 있는 재료가 됩니다.

트레이싱 도구는 '에이전트가 무엇을 했나요?'라는 질문에 답합니다. 에이전트 분석은 '에이전트가 사용자에게 도움을 주었나요?'라는 질문에 답합니다. AmplitudeGenAIExporter는 스팬 프로세서를 한 번만 등록하면 Amplitude를 두 번째 OpenTelemetry 대상으로 추가할 수 있어 현재 트레이싱 도구를 계속 사용하는 것도 가능합니다.

아니요. SDK에는 metadata_only(토큰, 대기 시간, 비용 및 행동 신호만 전송), customer_enriched(자체 라벨, 원시 텍스트 없음) 및 full(관리형 데이터 강화)의 세 가지 개인정보 보호 모드가 있습니다. 대부분의 팀은 metadata_only 모드로 시작한 후 신뢰가 쌓임에 따라 업그레이드합니다.

PyPI의 Python(pip install amplitude-ai) 및 npm의 Node.js/TypeScript(npm install @amplitude/ai) 언어를 지원합니다. OpenAI, Anthropic, Gemini, Bedrock, Mistral, Azure OpenAI를 위한 네이티브 래퍼 및 LangChain, LlamaIndex, OpenAI Agents SDK, CrewAI, Claude Agent SDK에 대한 프레임워크 통합도 지원됩니다. OpenTelemetry GenAI 스팬을 생성하는 모든 도구(OpenLIT, Traceloop, OpenAI 계측 등)의 데이터는 브리지를 통해 유입됩니다.

모든 에이전트 이벤트에는 사용자 행동 리플레이 ID가 붙어 있습니다. 탐색기의 모든 세션에서 리플레이는 대화가 시작되는 시점부터 열리므로 사용자가 사용하던 실제 제품 내에서 에이전트가 실패하는 것을 확인할 수 있습니다.

각 이벤트에는 실험 버전 정보가 속성으로 기록되므로, 여러 턴에 걸쳐 진행되는 대화에서도 프롬프트 A/B 테스트 결과를 올바른 실험군에 맞추어 분석할 수 있습니다. 품질 점수와 행동 패턴은 가이드활성화가 실시간으로 타겟팅하는 코호트에 반영됩니다. 이는 Amplitude 에이전트 분석과 Amplitude 실험, Amplitude 가이드가 동일한 작업 공간 및 ID 그래프를 공유하기 때문입니다.

분석의 새로운 시대

실시간 에이전트 개요부터 평가 및 데이터 세트까지 모든 보기는 에이전트가 수행한 작업과 그다음에 사용자가 한 일을 연결하여 분석합니다.