For AI agents: a documentation index is available at /docs/llms.txt. Append .md to any page URL for markdown, or send Accept: text/markdown.
多腕バンディット実験
従来のA/Bテストでは、Amplitude 実験は統計的に有意な結果に達するまで実験内のすべてのバリアントを評価します。そこから、勝ちバリアントを展開するか、すべてのユーザーをコントロールバリアントにロールバックするかを選択できます。 特定のバリアントが他のバリアントよりもパフォーマンスが優れている理由によって判断できます。
時には、その理由は重要ではない。 パフォーマンスの最も優れたバリアントを特定し、そこにできるだけ多くのトラフィックを送信することを目指します。例えば:
- ヒーロー画像、メッセージング、UI 要素の色変更を最適化します。
- 情報階層や操作順序など、製品内のレイアウトの変更。
- メニューやナビゲーションの最適化。
- 季節的または時間に依存するプロモーションやイベントのための広告最適化。
- ML モデルのハイパーパラメータチューニング。
従来のA/Bテストとは異なり、多腕バンディットは成功を判断するにあたり統計的有意性を用いません。また、コントロールやベースラインのバリアントも使用しません。また、Amplitude 実験では、2つの実験タイプで結果の表示方法も異なります。後のセクションでは、これらの違いについて説明します。
多腕バンディット実験ではトンプソンサンプリングを使用します。Amplitude 実験は、多腕バンディットに対する他の統計手法をサポートしていません。
始める前に
- 多腕バンディットの実験をローカルまたはリモートで評価できます。
- 多腕バンディットの実験を設定して、トラフィックを時間単位、毎日、または毎週再割り当てできます。
- Amplitude 実験では、トラフィックを再割り当てする前に、各バリアントで少なくとも100回のエクスポージャーが必要です。
- 多腕バンディットは、関連付けられたすべての相互排除グループとホールドアウトを尊重します。
- フラグ設定履歴には、各再割り当てが記録されています。 Amplitudeはユーザーの
ampex_data_monster下にエントリを作成します。
再割り当てスケジュール
再割り当ては、実験開始日とは関係なく、固定された時間帯に実行されます。 スケジュールは、選択した再割り当て頻度によって異なります。 これらの時間は設定できません。
多腕バンディット実験を作成する
多腕バンディット実験の作成は、Amplitude 実験でA/Bテストを作成することとほぼ同じです。次のセクションでは、その違いについて説明します。
多腕バンディットとA/Bテストの違い
メトリクス
多腕バンディット実験には、一次メトリクスが必要です。Amplitude 実験は、実験を最適化するにあたり主要なメトリクスを使用します。セカンダリメトリクスを含めることはできますが、Amplitude 実験はそれらをレポート作成にのみ使用します。
A/B テストでは、主要なメトリクスをガードレールメトリクスにすることができます。これは、実験が悪影響を及ぼすことを望まないメトリクスです。クリック率は、一般的なガードレールメトリックです。多腕バンディット実験ではメトリックに対して最適化が行われるため、ガードレールメトリックは適用されません。起こってほしくない変化に対して最適化することはできません。 多腕バンディット実験の一次メトリックは、成功メトリック(「増加する」または「減少する」)でなければなりません。Amplitude 実験は、バイナリメトリクスと連続メトリクスの両方をサポートしています。
多腕バンディットの実験で2つのメトリックを最適化するには、両方の加重平均値であるカスタムメトリックを作成します。最適化したいメトリクス間でトレードオフに直面している場合は、代わりに A/B テストを実行してください。
トラフィック割り当て
多腕バンディットの実験では、モデルがデータを収集する前にどのバリアントが最も効果的かを知ることができないため、常に均一な分布から割り当てを開始します。割り当てはデータが到着し始めた後に変更されます。
多腕バンディットは、バリアント間の割り当てのみを調整します。この方法は、ロールアウト率を調整しません。
信頼レベル
多腕バンディットの実験における信頼度の役割は、A/Bテストとは異なります。信頼レベルは、勝ちバリアントへのトラフィックを加速させることができます。 たとえば、実験の信頼度が95%で、多腕バンディットがすでに実験のトラフィックの95%以上を勝利したバリアントに割り当てている場合、Amplitude 実験は信頼度を前提として、その時点以降トラフィックの100%をそのバリアントに割り当てます。
所要時間の見積もりと MDE
多腕バンディットの実験では、最小検出効果(MDE)は持続時間の推定値を計算するのに役立ちます。これらの実験は自動化されており、メトリックに対して最適化されているため、MDE は実験が開始された後に実験に影響を及ぼすことはありません。
実験開始前に推定期間を計算するにあたり、Amplitude 実験は、1つを除くすべての変数が同じベースライン平均(履歴データから計算された値)を共有する場合に何が起こるかをシミュレートします。増加を測定する場合、例外バリアントにはmean * (1+MDE)があります。減少を測定する場合、例外バリアントにはmean * (1-MDE)があります。次に、Amplitude 実験は、多腕バンディットがすべてのトラフィックを1つのバリアントに割り当てるのにかかる時間を計算します。所要期間は最大31日間と見積もられています。
表示された結果
Amplitude 実験では、多腕バンディットの実行中はバリアントの切り替わりは表示されません。これらの実験ではバリアントの切り替わりは予想される動作であるためです。
Amplitude 実験は、多腕バンディット実験用のデータ品質カードを表示しません。この表示に関するほとんどのチェックは、このタイプの実験には適用されません。 実験の実行中は、トラフィック割り当てに影響を与える実験に変更を加えることはできません。
バンディットカードは、モニタリングカードの非累積露出チャートに似ていますが、100%に標準化されています。Bandits カードを使用すると、各バリアントが特定の日に受信したトラフィックの割合を視覚化できます。
通知
Amplitude 実験は、多腕バンディットがトラフィックの70%、80%、90%、または100%をバリアントに割り当てた場合に実験編集者に通知を送信します。Amplitude 実験はまた、バンディットが完了するのに長い時間がかかる場合や、実験の終了日が近づいた場合にも通知を送信します。通知はSlackやメール経由で送信できます。詳細については、「SlackとAmplitudeの統合」を参照してください。
通知を設定するには、[設定] > [個人設定] > [通知] に移動します。
これは役に立ちましたか?