For AI agents: a documentation index is available at /docs/llms.txt. Append .md to any page URL for markdown, or send Accept: text/markdown.
에이전트 결과 분석
이 기능은 Early Access 버전입니다. 다음 기간동안 기능의 일부 측면은 여전히 개발 중일 수 있으며 이 문서가 항상 최신 상태인 것은 아닐 수도 있습니다. 질문이 있으시면 다음으로 문의하십시오: Amplitude Support.
이 페이지에서는 에이전트 분석 UI를 읽고, 평가자 결과를 해석하며, 에이전트 데이터를 Amplitude 코호트로 변환하는 방법을 설명합니다. 이 제품을 처음 사용하시는 경우, 에이전트 분석 요약부터 시작하십시오. 에이전트 데이터를 분석하기 전에 전송하도록 SDK를 설정하십시오.
에이전트 분석 열기
왼쪽 탐색 창에서 에이전트 분석 항목을 선택하여 Amplitude 앱 첫 사용 후 에이전트 분석을 엽니다. 이 항목은 세션, 데이터 세트, 평가자, 실행 및 _모니터링_에 대한 페이지로 확장됩니다. 최상위 항목을 선택하면 모니터링 페이지가 열립니다.
Agent 분석은 세션, 평가자 및 요약 지표의 범위를 선택한 프로젝트에 적용합니다. 데이터를 볼 프로젝트를 선택합니다.
URL 경로
URL 경로는 기존 슬러그를 사용하므로 llm-analyticsUI의 제품 이름이 Agent 분석이더라도 주소 표시줄에는 다음과 같은 경로가 표시됩니다./llm-analytics/<org>/sessions
에이전트 활동 모니터링
에이전트 분석 왼쪽 탐색 창에서 _모니터링_을 엽니다. 모니터링은 랜딩 페이지이므로 최상위 에이전트 분석 항목을 선택하면 모니터링도 열립니다.
모니터링은 선택한 프로젝트 및 시간 범위에서 에이전트 상태를 요약합니다. 이 페이지는 에이전트 활동 및 세션 볼륨, 상시 작동 신호에서 얻은 세션 품질, 비용 및 지연 시간 추세를 차트화합니다. 이러한 차트를 사용하여 개별 세션을 열기 전에 변화를 확인하고 에이전트 필터를 적용하여 한 에이전트에 초점을 맞추거나 에이전트를 비교하십시오.
프로젝트가 전체 에이전트 데이터를 전송하기 전에 모니터링은 차트 대신 SDK 설정을 위한 시작 가이드를 표시합니다.
세션 찾아보기
에이전트 분석 왼쪽 탐색 창에서 _세션_을 엽니다. 세션 목록에는 선택한 시간 범위의 모든 에이전트 세션이 표시됩니다. 이 기능을 사용하여 다음을 수행하십시오.
- 날짜, 에이전트, 평가자 결과, 오류 유형 또는 주제별로 필터링합니다.
- Amplitude 코호트별로 세션을 필터링하여 특정 사용자 그룹에 초점을 맞추십시오.
- URL 쿼리 매개 변수(예:
?agents=<agent-name>)를 통해 에이전트 이름으로 필터링합니다. - 가장 관련성이 높은 세션을 먼저 사용하여 상호 작용 콘텐츠를 검색합니다.
필터는 결합되어 있으므로 특정 날짜에 특정 평가자를 실패시킨 한 에이전트의 세션으로 범위를 좁힐 수 있습니다.
세션을 자세히 검사합니다.
전체 세션을 열어 세션 세부 정보 보기를 확인합니다. 이 뷰는 세션 데이터를 다음 5개의 탭으로 구성합니다.
- 스레드: 사용자와 AI 메시지의 상호작용 뷰입니다. 세션 ID를 포함합니다.
- 정보: 세션 ID, 에이전트, 모델, 비용, 토큰, 지연 시간을 포함한 세션 메타데이터입니다.
- 턴: 중첩된 툴 호출 및 스팬을 포함한 턴별 분석.
- 평가자: 세션에 대한 평가자 결과와 합격 또는 실패 상태 및 신호입니다.
- 검토: 세션 관련 항목을 검토하고 검토 설정과 레이블을 지정합니다.
세션 계층 구조는 _세션 > 턴 > 스팬_입니다. 스팬은 턴으로 롤업되고, 턴은 세션으로 롤업됩니다. Amplitude는 [Agent] Session ID속성으로 세션을 식별합니다.
세션에서 다음 작업을 수행할 수 있습니다.
- 사용자 활동을 선택하여 해당 사용자의 이벤트 타임라인을 엽니다. Amplitude는
[Agent]이벤트에 대한 타임라인을 필터링하고 세션에서 시작합니다. - 유사한 세션으로 필터링을 선택하여 유사한 측면을 가진 세션을 찾습니다.
- 이 세션을 특정 데이터 세트에 포함하려면 데이터 세트에 추가를 선택합니다.
유사한 세션 찾기
세션에 문제가 표시되면 제안 필터를 선택하여 동일한 패턴을 가진 다른 세션을 표시할 수 있습니다. 제안된 필터는 현재 보고 있는 세션에 기반하므로 광범위한 검색이 아닌 구체적인 예제로 시작할 때 가장 효과적입니다.
평가자 결과 읽기
Agent 분석은 신호와 평가자의 두 가지 계층으로 품질을 측정합니다.
신호는 Amplitude가 모든 종료된 세션에서 실행하는 상시 활성화된 보강 기능입니다. 여러분은 그것들을 구성할 필요가 없습니다. 기본 신호에는 작업 완료, 응답 품질, 사용자 마찰, 부정적 피드백, 사용자 의도, 세션 안전성과 코드 기반 데이터 품질 검사가 포함됩니다. Amplitude는 시간별로 신호가 작동하는 방식을 구체화하므로, 신호를 방향 표시기로 취급하십시오.
평가자는 사용자가 제품별 정확한 기준에 맞게 스스로 정의하고 조정하는 점수관리자입니다.
Enrichment는 이벤트 스트림의 두 이벤트에 결과를 기록합니다.
[Agent] Session Record: 세션당 하나의 이벤트입니다. 이 이벤트는 신호 결과, 세션 롤업(총 대화 수, 총 비용 및 토큰) 및[Agent] Has Data Quality Issues와 같은 플래그를 전달합니다.[Agent] Evaluator Result: 세션에서 실행되는 각 평가자 실행당 하나의 이벤트입니다. 주요 속성에는[Agent] Evaluator Name,[Agent] Evaluator Output Type,[Agent] Binary Label, ,[Agent] Rationale``[Agent] Evidence, 및[Agent] Evaluator Model이 포함됩니다.
이벤트 및 해당 속성의 전체 목록을 보려면 Agent 분석 이벤트 택소노미로 이동하십시오.
이러한 결과는 쿼리 가능한 Amplitude 이벤트로 표시되므로 단일 필터를 사용하여 "작업 완료에 실패한 세션의 사용자"와 같은 코호트를 구축할 수 있습니다. 데이터 품질 신호는 LLM 기반이 아니라 코드 기반(규칙 및 패턴 매칭)이므로 신호는 생성된 근거 대신 명확한 "문제 없음"이라는 결과를 반환합니다.
사용자 지정 평가자 생성 및 개선
신호는 자동으로 작동합니다. 제품별 기준을 측정하려면 에이전트 분석 왼쪽 탐색 창에서 열 수 있는 평가자 페이지에서 고유한 평가자를 생성하십시오. 이름, 심사 프롬프트 및 합격 기준을 사용하여 평가자를 정의한 다음, 이를 활성화하기 전에 테스트하십시오.
- 심사 프롬프트와 합격 기준을 갖춘 평가자를 생성합니다.
- 실행 페이지에서 샘플 세션이나 불러오기 데이터 세트 대상으로 실행하여 점수가 어떻게 산정되는지 확인합니다.
- 결과를 검토한 다음 심사 프롬프트를 수정하거나 평가자를 활성화하십시오.
평가자는 이진(참/거짓), 분류 및 점수 출력 유형을 지원합니다. 평가자를 활성화하여 새 세션에 점수를 매기십시오. 결과는 신호 데이터와 함께 쿼리할 수 있는 [Agent] Evaluator Result이벤트로 표시됩니다.
기본적으로 평가기는 Amplitude 관리 모델에서 실행됩니다. 대신 자체 LLM 공급자에서 이를 실행하려면 _AI 컨트롤_에 공급자 키를 추가하세요.
인간 검토자는 평가자의 정확성을 향상시킵니다. 검토자는 검토 탭에서 세션에 라벨을 지정하고 평가자의 결과를 수정하며, 검토된 라벨은 그라운드 트루스 데이터 세트를 구축합니다. 해당 데이터 세트에 대해 평가기를 다시 실행하여 수정된 프롬프트의 점수가 정상적으로 확인된 답변과 어떻게 달라지는지 비교합니다.
평가기 실행
실행 페이지는 요청 시 일련의 세션에 대해 평가자를 실행합니다. 실행 페이지에서는 평가기를 활성화하기 전에 평가기를 테스트하거나, 평가기 이전의 세션에 점수를 매길 수 있습니다. 에이전트 분석 왼쪽 탐색 창에서 _실행_을 엽니다.
실행을 시작하려면 실행 생성을 선택하고 한 명 이상의 평가자를 선택한 다음 점수를 매길 세션을 선택합니다. 여기에는 최근 세션의 샘플, 필터링된 세트 또는 불러오기 데이터 세트(데이터 세트 페이지에서 큐레이팅한 재사용 가능한 세션 세트)가 포함됩니다.
실행이 진행 중인 동안, 실행 창에는 실시간 X / N sessions진행률 표시줄과 전체 실패 수행 회수가 표시됩니다. 각 세션이 끝날 때 결과가 스트리밍되므로 전체 배치를 기다리지 않고도 초기 결과를 읽을 수 있습니다. Agent 분석은 실패했거나 시간이 초과된 세션을 격리하고, 평가자별 오류를 표시한 후 나머지 실행을 완료합니다. 실행을 일찍 중지하려면 취소를 선택합니다.
실행 중인 각 세션의 결과에는 모든 평가자의 결과(합격 또는 불합격, 등급 또는 점수), 실행된 심판 프롬프트, 이론적 근거 및 평가 지연 시간이 표시됩니다. 이러한 결과를 사용하여 심사 프롬프트를 구체화한 다음 출력이 예상과 일치할 때까지 재실행하십시오.
각 작업에는 특정 권한이 필요합니다.
| 동작 | 필요한 권한 |
|---|---|
| 필요에 따라 평가자 실행 | 비활성 평가 및 실행 관리 |
| 평가자를 활성화하여 새 세션에 자동으로 점수를 매기십시오. | 평가 활성화 |
데이터 세트 큐레이션
_데이터 세트_는 재사용할 수 있는 이름이 지정된 에이전트 세션 모음으로, 평가기를 반복적으로 실행할 수 있습니다. 데이터 세트는 일회성 현장 검사를 회귀 테스트 도구 모음으로 바꿉니다. 세션 세트를 수정하고 올바른 답을 설정한 다음 평가자의 프롬프트를 변경할 때마다 해당 세션에 대해 평가자를 다시 실행합니다. 에이전트 분석 왼쪽 탐색 창에서 _데이터 세트_를 엽니다.
한 모델, 한 제품 표면 또는 필터링된 사용자 집합의 세션과 같이 추적하려는 에이전트 활동의 모든 부분을 중심으로 데이터 세트를 구축하십시오. 먼저 일반적인 사례와 알려진 장애 모드를 다루는 몇 가지 대표적인 세션을 진행하십시오.
다음 두 가지 방법으로 세션을 데이터 세트에 추가할 수 있습니다.
- 세션에서: 세션을 열고 '데이터 세트에 추가' 컨트롤을 사용합니다. Amplitude는 세션의 에이전트와 일치하는 데이터 세트를 나열합니다.
- 대량: 세션 페이지에서 세션을 선택하고 한 번에 추가합니다. 데이터 세트에는 최대 1,000개의 세션이 포함되므로 가장 먼저 관심 있는 세션으로 필터링하십시오.
데이터 세트를 열어 해당 세션을 보고, 평가기 결과가 인라인으로 포함된 전체 세션의 스레드를 읽거나, 세션을 제거하거나, 데이터 세트를 JSON으로 다운로드하십시오.
그라운드 트루스 확립
데이터 세트의 가치는 그라운드 트루스, 즉 각 세션에 대해 검증된 정확한 답변에서 비롯됩니다. 세션을 추가할 때 Amplitude는 세션의 현재 평가기 결과를 기준선으로 스냅샷을 생성하므로 잘못된 결과만 검토하고 수정할 수 있습니다.
세션을 검토하려면 데이터 세트에서 이를 열고 잘못된 전체 평가기 결과를 변경하거나, 올바른 것으로 표시를 선택하여 동의하는 결과를 확인하십시오. 각 세션은 평가기를 검토함에 따라 보류 중에서 부분 또는 검증 단계로 전환됩니다. 평가는 세션에 첨부되므로, 세션은 레이블을 표시되는 모든 곳에 유지하며, 평가자의 프롬프트를 편집해도 수정사항은 그대로 유지됩니다.
정답 데이터가 준비되면 실행 페이지의 데이터 세트에 대해 평가자를 실행하고 평가자의 결과를 검증된 답변과 비교합니다. 결과를 검증된 답변과 비교하면 이를 활성화하기 전에 프롬프트 변경이 평가자를 향상시켰음을 확인할 수 있습니다.
상담원의 품질을 제품 행동과 연결
Agent 분석은 코호트를 통해 나머지 Amplitude와 연결됩니다. 코호트 연동은 독립형 에이전트 옵저버빌리티 도구와 차별화되는 핵심 요소입니다.
- Agent 분석에서 세션 집합을 필터링합니다.
- 해당 선택 항목으로부터 코호트를 생성합니다.
- 퍼널, 리텐션 또는 세그멘테이션과 같은 모든 표준 Amplitude 차트에서 코호트를 사용합니다.
예를 들어 세션이 작업 완료에 실패한 사용자로 코호트를 생성한 다음, 세션이 성공한 사용자의 코호트와 비교하여 이들의 30일 리텐션을 차트화합니다. 이 비교는 에이전트의 품질이 전환, 리텐션 또는 이탈 등의 결과와 연관되는지 여부를 보여줍니다.
사용자의 도구에서 에이전트 분석 쿼리
Amplitude MCP 서버는 에이전트 분석을 Claude 및 Cursor와 같은 AI 도구에 노출시킵니다. MCP 서버를 사용하여 메트릭, 세션, 스팬 및 대화를 쿼리하고, 스키마를 검사하고, 데이터 세트를 관리하며, 평가자를 생성, 업데이트 및 나열하십시오.
현재 도구 목록, 설정 및 인증 세부 사항을 보려면 Amplitude MCP로 이동하십시오.
이 내용이 도움이 되었나요?