エージェント分析

貴社のAIエージェントの実際の効果は?

エージェントが良い回答をしたと知ることは簡単です。エージェント分析では、トレースと評価をコンバージョン、リテンション、収益に関連付けるため、エージェントの品質を実際のビジネスへの効果に結びつけることができます。

Amplitude Agent Analytics session view
Two Mira assistant chats comparing on-budget and over-budget hotel recommendations

従来の分析が不十分な場合

ほとんどの分析ツールは、推論やツール呼び出しのためではなく、クリック数やページビュー数のために構築されています。エージェントは、ハルシネーションを起こしたり、指示を無視したり、自信を持って間違った回答をすることがあります。エージェントに時間を費やすユーザーも、同じようにエンゲージメントしているように見えます。実際にそれを有用と感じ、再度利用したユーザーはいるのでしょうか?

オブザーバビリティの上を行く

貴社のエージェントが製品と収益に与える影響を把握しましょう。

AI品質

エージェントがとった行動

プロダクトの成果

ユーザーがとった次の行動

01 観察

トレース、プロンプト、ツール呼び出し、応答、レイテンシー、コストを検証します。エージェントが実際に行ったことの生のレコード。

02 評価

品質、意図、解決、失敗の種類をスコアリングします。エージェントがどこで役立ち、どこで混乱し、どこでリスクを加えるのかを確認します。

03 決定

これらの品質シグナルをコンバージョン、リテンション、収益に結びつけます。エージェントは実際にユーザーを進歩させたか?

04 展開

プロンプトを調整し、検証を実行し、ガイドをトリガーし、学んだことから次のステップをパーソナライズします。

A raw trace of spans next to the same turn decomposed into Amplitude events

トレースターンは自動的にAmplitude イベントになります

各ユーザーメッセージ、ツール呼び出し、エージェントの応答は、他の製品データと同じuser_idを持つAmplitude イベントです。トレースで終わってしまうオブザーバビリティツールとは異なり、エージェントAnalyticsはこれらの会話をイベントに分解し、既存のファネル、コホート、リテンション分析で直接クエリ可能にします。

ついに答えが得られる質問

01

モデルのアップグレードは、今週のサインアップコンバージョンを向上させたか、それとも悪影響を与えたか?

02

エージェントが正しく回答した場合とハルシネーションした場合のコンバージョンの差違はどのくらいか?

03

どのエージェントトピックが拡大意図と相関し、どのトピックが顧客離反リスクと相関しているか?

エージェント分析の成熟度モデル

ほとんどのオブザーバビリティツールは、低い成熟度レベルで終わってしまいます。エージェント分析は、AIの品質をユーザージャーニーと収益に結びつけることで、貴社を頂点まで導きます。

L4収益のアトリビューション

そのAIはドルに換算してどれだけの価値があるのか?

L3行動分析

AIの使用はユーザージャーニーにどのように影響するか?

L2セマンティックインテリジェンス

エージェントは実際に何をしているか?

L1評価とアサーション

エージェントは正しく行動したか?

L0トレーシングとテレメトリ

何が起こったか確認できるか?

エージェント分析の内幕

プロダクションランでは、モデルがまったく準備不足の質問にチームが驚かされることがあります。ユーザーのプロンプト、エージェントの応答、呼び出したツール、取得したコンテキストを読み、次にセッションリプレイに直接移動して、何が問題だったかを確認しましょう。

ツール呼び出しプロンプトのバージョンコンテキストの取得リプレイにジャンプ

あらゆるLLMプロバイダーを測定

実際に使用中のプロバイダー用のネイティブラッパー。その他にはOpenTelemetryブリッジ。完全制御が必要な場合には手動キャプチャ。

your terminal
$
$

PythonとNode、ドロップインSDK、数分で稼働。

コンテンツオプショナル分析

お客様だけの環境にあるものを制御可能するよう特化した設計です。

TierWhat you sendWhat you get
Metadata OnlyTokens, cost, latency, behavioral signalsCost analytics, retention curves, funnel drop-off. No conversation content leaves your environment.
Customer EnrichedYour classification labelsFull topic and quality analytics. You run your own classifiers and send us the structured labels.
FullConversation contentAutomatic topic classification, quality scoring, and behavioral pattern detection.

会話全体、独自のラベル、またはメタデータのみを送信します。エージェントごと、またはイベントソースごとにモードを切り替えます。

エージェント分析はベータ版です

バイブに頼るのはやめましょう

  • 実際にユーザーの損失につながる失敗モードを見つけま。
  • エージェントの品質でコンバージョンとリテンションを測定します。
  • 任意のトレースをセッションリプレイや検証に接続します。
登録して早期アクセスを入手しましょう

登録して早期アクセスを入手しましょう

ウェイティングリストに登録

よくある質問

LLMの可観測性とプロダクト分析の間の分析レイヤー。すべてのユーザーメッセージ、ツール呼び出し、エージェントの応答、セッションの終了は、トピック、品質スコア、行動パターンでタグ付けされたAmplitude イベントとなり、AIセッションの品質に関するコホート、ファネル、リテンション曲線を構築できます。

トレーシングツールは「エージェントは何をしたか?」という問いに答えます。エージェント分析は「ユーザーにとって有効だったか?」という問いに答えます。トレーシングツールはそのまま使用できます。AmplitudeGenAIExporter は、1つのスパンプロセッサ登録でAmplitude を2番目のOpenTelemetry送信先として追加します。

まったく違います。SDKには、metadata_only(トークン、レイテンシー、コスト、行動シグナルのみ)、customer_enriched(独自のラベル、未加工テキストなし)、full(管理された拡張)の3つのプライバシーモードがあります。ほとんどのチームは、metadata_only(メタデータのみ)で開始し、信頼が高まるにつれてアップグレードされます。

PyPIのPython(pip install amplitude-ai)およびnpmのNode.js/TypeScript(npm install @amplitude/ai)。OpenAI、Anthropic、Gemini、Bedrock、Mistral、Azure OpenAIのネイティブラッパー。LangChain、LlamaIndex、OpenAI Agents SDK、CrewAI、Claude Agent SDKのフレームワーク連携。OpenTelemetry GenAIスパン属性のあるものはすべて(OpenLIT、Traceloop、OpenAI計測)ブリッジを介して流入します。

すべてのエージェントイベントには、セッションリプレイIDが含まれています。エクスプローラーのどのセッションでも、会話開始時に「リプレイを表示」が開くため、ユーザーが使用していた実際の製品内でのエージェントの失敗を監視することができます。

各イベントはプロパティとして実験バリアントを持つため、プロンプトA/Bテストはマルチターン会話全体で正しいアトリビューションを提供します。品質スコアと行動パターンは、GuidesActivationがリアルタイムでターゲットのコホートに流れ込みます。同じワークスペース、同じアイデンティティグラフです。

分析の新時代

ライブエージェントの概要から評価やデータセットまで、すべてのビューがエージェントがした行動とユーザーが次にした行動を結び付けます。