For AI agents: a documentation index is available at /docs/llms.txt. Append .md to any page URL for markdown, or send Accept: text/markdown.
統計的推論のための逐次テスト
実験では、統計的推論の逐次テスト手法を使用しています。 逐次検定を使用すると、いつ結果を表示しても有効なままになります。その時点で行われた観測に基づいて、実験を早期に終了することができます。 情報に基づいた決定を下すために必要な観測値の数は、平均して、T検定や同様の手順で必要な数よりもはるかに少ないです。迅速に実験を行い、学んだことをプロダクトに組み込むことができ、実験プログラムのペースを加速することができます。
逐次テストには、T 検定よりもいくつかの利点があります。 まず第一に、実験を開始する前に有意性を達成するために必要な観測値の数を知る必要はありません。 バイナリ指標と連続指標には、シーケンシャルテストとTテストの両方を使用できます。裾の長い分布が中心極限定理の仮定に影響を与えることについて懸念がある場合は、外れ値に関するこの記事を参照してください。
十分な時間が与えられた場合、シーケンシャルテスト方法の統計的検出力は1です。検出すべき効果サイズがある場合、このアプローチでそれを検出できます。
この記事では、逐次テストの基本、それがAmplitude 実験にどのように適合するか、そしてそれをどのように活用するかについて説明します。
Amplitude 実験における仮説検定
A/B テストを実行する場合、実験はランダム化比較試験を使用して仮説検定を実施します。この試験では、Amplitudeはユーザーをトリートメントバリアントまたはコントロールのいずれかにランダムに割り当てます。コントロールは現在の状態でのプロダクトを表します。各トリートメントには、現在のベースラインプロダクトに対する一連の潜在的な変更が含まれています。実験では、あらかじめ決められたメトリクスに基づき、テスト統計量を用いてこれら2つの母集団のパフォーマンスを比較します。
仮説検定では、コントロールとテストバリアントの間のパフォーマンスの違いを探します。 Amplitude 実験は帰無仮説を検証します
$$ H_0:\ \delta = 0$$
where $$ \delta = \mu_{\text{treatment}} - \mu_{\text{control}} $$
処理の平均と対照の平均との間に違いがないことを示しています。
たとえば、テストバリアントのコンバージョン率を測定したいとします。 帰無仮説では、トリートメントバリアントとコントロールのコンバージョン率が同じであると仮定しています。
対立仮説は、トリートメントとコントロールの間に違いがあると述べています。Experimentの統計モデルは、トリートメントとコントロールの間の差異を調べるために逐次検定を使用しています。
さまざまなシーケンシャルテストオプションがあります。 Amplitude実験では、混合逐次確率比テスト(mSPRT)と呼ばれる一連の逐次検定を使用しています。重み関数 H は混合分布です。 帰無仮説に対する以下の尤度比の混合は、次のようなものです。
よくある質問
これは役に立ちましたか?