エージェント分析
貴社のAIエージェントの実際の効果は?
エージェントが良い回答をしたと知ることは簡単です。エージェント分析では、トレースと評価をコンバージョン、リテンション、収益に関連付けるため、エージェントの品質を実際のビジネスへの効果に結びつけることができます。

Sessions
Which users only engaged with our agent once?
What are my agents' most common failure modes?
What questions are being answered badly?
How and why are users using the create_theme tool?
One dataset query timed out, but the chart and session pulls gave me enough to isolate it. The drop traces to a single cohort:
- Affected cohort: users on Safari 17.4 (iOS)
- Window: Wed 09:12 – 17:48 UTC
- Likely cause: the v3.8 payments SDK rollout introduced a CORS preflight that failed on Safari iOS
Reverting the rollout for that platform should recover the rate within an hour. Want me to open a 48h follow-up cohort to confirm?

従来の分析が不十分な場合
ほとんどの分析ツールは、推論やツール呼び出しのためではなく、クリック数やページビュー数のために構築されています。エージェントは、ハルシネーションを起こしたり、指示を無視したり、自信を持って間違った回答をすることがあります。エージェントに時間を費やすユーザーも、同じようにエンゲージメントしているように見えます。実際にそれを有用と感じ、再度利用したユーザーはいるのでしょうか?
オブザーバビリティの上を行く
貴社のエージェントが製品と収益に与える影響を把握しましょう。
AI品質
エージェントがとった行動
プロダクトの成果
ユーザーがとった次の行動
01 観察
トレース、プロンプト、ツール呼び出し、応答、レイテンシー、コストを検証します。エージェントが実際に行ったことの生のレコード。
02 評価
品質、意図、解決、失敗の種類をスコアリングします。エージェントがどこで役立ち、どこで混乱し、どこでリスクを加えるのかを確認します。
03 決定
これらの品質シグナルをコンバージョン、リテンション、収益に結びつけます。エージェントは実際にユーザーを進歩させたか?
04 展開
プロンプトを調整し、検証を実行し、ガイドをトリガーし、学んだことから次のステップをパーソナライズします。

トレースターンは自動的にAmplitude イベントになります
各ユーザーメッセージ、ツール呼び出し、エージェントの応答は、他の製品データと同じuser_idを持つAmplitude イベントです。トレースで終わってしまうオブザーバビリティツールとは異なり、エージェントAnalyticsはこれらの会話をイベントに分解し、既存のファネル、コホート、リテンション分析で直接クエリ可能にします。
ついに答えが得られる質問
01
モデルのアップグレードは、今週のサインアップコンバージョンを向上させたか、それとも悪影響を与えたか?
02
エージェントが正しく回答した場合とハルシネーションした場合のコンバージョンの差違はどのくらいか?
03
どのエージェントトピックが拡大意図と相関し、どのトピックが顧客離反リスクと相関しているか?
エージェント分析の成熟度モデル
ほとんどのオブザーバビリティツールは、低い成熟度レベルで終わってしまいます。エージェント分析は、AIの品質をユーザージャーニーと収益に結びつけることで、貴社を頂点まで導きます。
そのAIはドルに換算してどれだけの価値があるのか?
AIの使用はユーザージャーニーにどのように影響するか?
エージェントは実際に何をしているか?
エージェントは正しく行動したか?
何が起こったか確認できるか?
エージェント分析の内幕






プロダクションランでは、モデルがまったく準備不足の質問にチームが驚かされることがあります。ユーザーのプロンプト、エージェントの応答、呼び出したツール、取得したコンテキストを読み、次にセッションリプレイに直接移動して、何が問題だったかを確認しましょう。
One dataset query timed out, but the chart and session pulls gave me enough to isolate it. The drop traces to a single cohort:
- Affected cohort: users on Safari 17.4 (iOS)
- Window: Wed 09:12 – 17:48 UTC
- Likely cause: the v3.8 payments SDK rollout introduced a CORS preflight that failed on Safari iOS
Reverting the rollout for that platform should recover the rate within an hour. Want me to open a 48h follow-up cohort to confirm?
Evaluators
BETADetect when responses cite unsupported facts
Did the agent successfully complete the user's task?
Rate the quality of the agent's tool selection
Cluster reasons users abandon the checkout flow
Description
Grades every matching session for Tool Use Quality and writes the verdict back to the session as a property — available in charts, segments, and exports.
Grading prompt
Edit5 — fully correct, efficient, and well-justified
3 — partially correct or with minor issues
1 — incorrect, unsafe, or off-task
Weigh tool selection and reasoning, not just the final answer.
Label distribution · last 30 days
Configuration
Monitor
Last 30 daysChat AgentSearch…Agent Adoption
Active users for Chat Agent
Agent Activity
Conversation volume for Chat Agent
Failure Rate
Errored sessions for Chat Agent
Daily Spend
Inference cost for Chat Agent
Done. Here’s the median weekly check-ins per location over the last 30 days:
Downtown Flagship and Riverside stand out — they drive 2–3x the check-ins of every other location. Worth a closer look at staffing and class capacity there.
View chart →Response accuracy
Member friction
Resolved the request
Member intent topic
Overall quality
Comments
私たちはそれを、私たち自身のために完璧なものに仕上げました
Amplitude でエージェントを提供し、お客様と同じ問題に直面した結果、エージェント分析を開発しました。担当したチームから、そのデータとストーリーをお聞きください。
あらゆるLLMプロバイダーを測定
実際に使用中のプロバイダー用のネイティブラッパー。その他にはOpenTelemetryブリッジ。完全制御が必要な場合には手動キャプチャ。
PythonとNode、ドロップインSDK、数分で稼働。
コンテンツオプショナル分析
お客様だけの環境にあるものを制御可能するよう特化した設計です。
会話全体、独自のラベル、またはメタデータのみを送信します。エージェントごと、またはイベントソースごとにモードを切り替えます。
エージェント分析はベータ版です
バイブに頼るのはやめましょう
- 実際にユーザーの損失につながる失敗モードを見つけま。
- エージェントの品質でコンバージョンとリテンションを測定します。
- 任意のトレースをセッションリプレイや検証に接続します。
登録して早期アクセスを入手しましょう
ウェイティングリストに登録
よくある質問
LLMの可観測性とプロダクト分析の間の分析レイヤー。すべてのユーザーメッセージ、ツール呼び出し、エージェントの応答、セッションの終了は、トピック、品質スコア、行動パターンでタグ付けされたAmplitude イベントとなり、AIセッションの品質に関するコホート、ファネル、リテンション曲線を構築できます。
トレーシングツールは「エージェントは何をしたか?」という問いに答えます。エージェント分析は「ユーザーにとって有効だったか?」という問いに答えます。トレーシングツールはそのまま使用できます。AmplitudeGenAIExporter は、1つのスパンプロセッサ登録でAmplitude を2番目のOpenTelemetry送信先として追加します。
まったく違います。SDKには、metadata_only(トークン、レイテンシー、コスト、行動シグナルのみ)、customer_enriched(独自のラベル、未加工テキストなし)、full(管理された拡張)の3つのプライバシーモードがあります。ほとんどのチームは、metadata_only(メタデータのみ)で開始し、信頼が高まるにつれてアップグレードされます。
PyPIのPython(pip install amplitude-ai)およびnpmのNode.js/TypeScript(npm install @amplitude/ai)。OpenAI、Anthropic、Gemini、Bedrock、Mistral、Azure OpenAIのネイティブラッパー。LangChain、LlamaIndex、OpenAI Agents SDK、CrewAI、Claude Agent SDKのフレームワーク連携。OpenTelemetry GenAIスパン属性のあるものはすべて(OpenLIT、Traceloop、OpenAI計測)ブリッジを介して流入します。
すべてのエージェントイベントには、セッションリプレイIDが含まれています。エクスプローラーのどのセッションでも、会話開始時に「リプレイを表示」が開くため、ユーザーが使用していた実際の製品内でのエージェントの失敗を監視することができます。
各イベントはプロパティとして実験バリアントを持つため、プロンプトA/Bテストはマルチターン会話全体で正しいアトリビューションを提供します。品質スコアと行動パターンは、GuidesとActivationがリアルタイムでターゲットのコホートに流れ込みます。同じワークスペース、同じアイデンティティグラフです。
分析の新時代
ライブエージェントの概要から評価やデータセットまで、すべてのビューがエージェントがした行動とユーザーが次にした行動を結び付けます。









