이 페이지에서

For AI agents: a documentation index is available at /docs/llms.txt. Append .md to any page URL for markdown, or send Accept: text/markdown.

에이전트 분석 요약

조기 액세스

이 기능은 Early Access 버전입니다. 다음 기간동안 기능의 일부 측면은 여전히 개발 중일 수 있으며 이 문서가 항상 최신 상태인 것은 아닐 수도 있습니다. 질문이 있으시면 다음으로 문의하십시오: Amplitude Support.

사용자에게 제공되는 AI 에이전트를 측정하고 개선하십시오. 에이전트 분석은 에이전트 추적을 이벤트로 분해하고, 모든 상호작용에 대해 구성 가능한 평가기를 실행하며, AI 세션 데이터를 공유된 사용자 ID의 제품 이벤트 데이터에 연결합니다. 제품 관리자는 에이전트의 행동을 비즈니스 결과와 연결시킵니다. 엔지니어는 프로덕션에 도달하기 전에 회귀 문제를 포착합니다.

AI 세션 데이터는 Amplitude 사용자 ID를 제품 이벤트 데이터와 공유하므로 에이전트 품질을 리텐션, 전환 및 수익과 연결시킬 수 있습니다. 에이전트 품질은 주제, 환각, 작업 완료 및 도구 오류를 포함합니다. 순수 옵저버빌리티 도구는 이러한 연결을 만들 수 없으며, 순수 프로덕트 분석 도구는 에이전트 품질을 충분히 엄격하게 측정하지 못합니다.

활용 사례

  • 그로쓰 PM은 지원 에이전트가 청구 질문에 답변하지 못한 세션을 필터링한 다음 코호트를 구성합니다. PM은 리텐션 차트를 실행하여 해당 코호트와 성공적인 세션을 가진 사용자를 비교합니다.
  • 한 ML 엔지니어는 새로운 시스템 프롬프트를 출시하고, 작업 완료 평가자가 하룻밤 사이에 8점 떨어지는 것을 지켜본 다음 스탠드업 전에 롤백합니다.
  • 한 재무 책임자가 LLM 지출을 주제별로 분석한 결과 반품 관련 세션은 개인화 추천 세션보다 비용이 3배 더 들지만 만족도는 낮다는 사실을 발견했습니다.
  • 플랫폼 팀은 매주 수동으로 진행되는 상호작용 샘플링을 자동화된 평가자로 대체하여 모든 세션에 대해 환각, 도구 오류, 작업 완료 여부 점수를 매깁니다.
  • 공급업체 관리팀은 동일한 조건에서 품질을 비교하기 위해 사내 에이전트에게 사용하는 것과 동일한 평가자를 사용하여 타사 AI 공급업체를 평가합니다.
  • 한 연구팀은 customer_enriched 모드를 통해 자체 오프라인 평가자를 연결하여 기본 평가자가 다루지 않는 사용자 지정 차원에서 세션을 채점합니다.

에이전트 분석의 작동 방식

Agent 분석은 각 에이전트 상호 작용을 이벤트 계층 구조로 모델링합니다. 동일한 사용자 ID가 이 계층 구조를 통해 기존 Amplitude 제품 데이터로 흐르므로 추적하는 다른 모든 것과 함께 에이전트 세션을 분석할 수 있습니다.

  • 세션: 사용자가 에이전트에게 처음부터 끝까지 완료하도록 전달하는 작업 단위(예: 챗봇 대화, 해결된 지원 티켓 또는 완료된 코딩 작업)입니다. Amplitude는 이미 추적한 ID에서 설정한 [Agent] Session ID속성으로 세션을 식별합니다.
  • 턴: 사용자 메시지, 에이전트의 도구 호출, AI 응답 등 세션 내에서 단일 왕복 교환입니다.
  • 스팬: 서브 턴 단위: 도구 호출, 벡터 검색, 순위 재지정, 가드레일 또는 사용자 지정 단계.
  • 에이전트: 명명된 오케스트레이션 유닛입니다. 에이전트는 하위 에이전트를 가질 수 있습니다.

모든 사용자 메시지, AI 응답 및 도구 호출은 독립적인 Amplitude 이벤트로 전송됩니다. 이 턴당 이벤트 모델은 추적 중심의 옵저버빌리티 도구와의 구조적 차이점입니다. 먼저 추적을 분해하지 않고도 유입 경로, 코호트, 리텐션 차트 및 세션 리플레이 링크에서 에이전트 이벤트를 직접 사용할 수 있습니다.

에이전트 세션 대 표준 분석 세션:

에이전트 세션은 Amplitude의 표준 분석 세션과 동일하지 않습니다.

에이전트 세션 [Agent] Session ID은 사용자가 에이전트에게 전달하는 단일 작업 단위입니다. Amplitude의 표준 분석 세션은 세션 리플레이 및 제품 보고서를 지원하는 사용자의 앱 또는 웹 방문입니다.$session_id 예를 들어 Amplitude를 열면 표준 분석 세션이 시작됩니다. Amplitude 내에서 글로벌 에이전트를 시작하면 에이전트 세션이 시작됩니다. 이 두 가지는 독립적입니다. 표준 분석 세션에는 여러 에이전트 세션이 포함될 수 있으며 단일 에이전트 세션은 여러 표준 분석 세션에 걸쳐 있을 수 있습니다. 자신의 스레드, 티켓, 콜 또는 실행 ID에서 에이전트 세션을 설정합니다.

이 구조를 바탕으로 Amplitude는 세 가지 방법으로 품질을 측정합니다.

  • 신호: 작업 완료, 응답 품질, 사용자 마찰 및 안전을 포함하여 Amplitude가 모든 세션에서 실행하는 상시 활성화된 강화 기능입니다. 여러분은 그것들을 구성하지 않습니다.
  • 평가자: 규칙 또는 LLM-as-judge를 사용하여 제품별 기준에 대해 Amplitude UI에서 정의하고 조정하는 점수자입니다. 또한 customer_enriched 모드를 통해 직접 만든 평가자를 가져올 수 있습니다.
  • 점수: 세션 또는 메시지에 첨부된 명시적인 사용자 피드백(좋아요 또는 싫어요, 선택 사항인 의견)입니다. AI 피드백이 Amplitude의 내장 AI에 대한 반응을 캡처하는 방식과 유사하게 점수는 사용자가 구축한 에이전트에 대한 반응을 캡처합니다. 점수는 앱에서 직접 전송하며, Amplitude는 이를 생성하지 않습니다. 방법을 알아보려면 사용자 피드백(점수) 보내기를 참조하십시오.

Node 또는 Python SDK로 계측합니다. 설정 세부 정보는 설정 페이지에 있습니다.

RBAC를 통한 액세스 관리

관리자는 역할 기반 액세스 제어(RBAC)를 통해 에이전트 분석을 사용할 수 있는 사용자를 제어합니다. 에이전트 분석에는 세 가지 권한 관리가 적용됩니다.

  • 에이전트 분석 객체 보기: 세션, 평가자 및 관련 객체를 봅니다. 역할이 에이전트 분석을 사용하려면 이 권한이 필요합니다.
  • 비활성 평가 및 실행 관리: 초안 평가자를 생성, 업데이트 및 삭제하고 드라이 런을 시작합니다.
  • 평가자 활성화: 평가자를 활성 평가자로 표시하고 실시간 평가자를 보관합니다.

시작하기

  • 에이전트 분석 설정에서는 계측 경로 선택, 개인 정보 보호 모드 설정 및 데이터 확인에 대해 설명합니다.
  • 에이전트 결과 분석에는 평가자, 점수 및 에이전트 데이터를 제품 코호트 및 차트에 연결하는 기능이 포함됩니다.

이 내용이 도움이 되었나요?