このページでは

For AI agents: a documentation index is available at /docs/llms.txt. Append .md to any page URL for markdown, or send Accept: text/markdown.

ボンフェローニ補正

実験では、含める各バリアントやメトリクスを独立した仮説とみなしてください。たとえば、新しいバリアントを追加するとき、そのバリアントの変化が実験結果に検出可能な影響をもたらすという仮説を提案します。

最も単純な実験は、仮説が1つしかありません。 単一仮説検定は貴重な洞察を生み出すことができます。 ただし、複数のメトリクスやバリアント、あるいは複数の仮説を含めるほうが、効率的であったり、より有益な知見が得られたりすることがよくあります。

多重仮説検定は、多重比較問題を通じて統計的有意性の計算に誤りをもたらす可能性があります。 エラーを犯す確率は、実行する仮説検定の数とともに増加します。

複数仮説検定に関する問題点

たとえば、サイトの「今すぐ購入」ボタンの色について実験を行ったとします。 サイトのデフォルト設定は青色なので、青色がコントロールになります。 緑色(バリアント #1)と紫色(バリアント #2)もテストしたいと思います。個々の仮説検定ごとに偽陽性率が0.05(5%)の場合、帰無仮説が真であるときに統計的に有意な結果が見つかる確率は次のようになります。

1 - 0.95^2 = 0.0975

この計算では、各テストが独立していることを前提としています。

十分なテストを実行すれば、何があっても最終的には統計的に有意な結果を得ることができます。 偽陽性率が 0.05 の場合、20 件の仮説検定のうち 1 件はランダムな偶然のみによって統計的有意性を示すと予想されます。

多重仮説修正は次のように問いかけます。この統計的に有意な結果は偶然によるものか、それとも本物なのでしょうか?

偽陽性

偽陽性率とは、次の間の比率です。

  • 誤って陽性と表現されたネガティブな事象の数、および
  • 実際のネガティブなイベントの総数。

すべての実験には偽陽性の結果が出るリスクがあります。 偽陽性とは、バリエーション間に実際の差が存在しないにもかかわらず、実験がいずれかの方向で決定的な結果を報告することを指します。

偽陽性の結果が発生するリスクは、実験に追加するメトリックまたはバリアントごとに増加します。 このリスクは、個々のメトリクスまたはバリアントごとの偽陽性率が同じままであっても増加します。

統計ツールは多重比較問題を補正し修正します。 Amplitude はボンフェローニ補正を使用します。

Amplitudeはデフォルトでボンフェローニ補正を有効にします。この機能は統計設定で手動でオフにすることができます。

ボンフェローニ補正

ボンフェローニ補正は多重比較問題を解決するための最も単純な統計手法です。 また、この方法はより保守的な方法の1つであり、他の手法よりも偽陰性のリスクが高いです。 たとえば、ボンフェローニ補正ではすべての比較にわたるp値の分布は考慮されていませんが、帰無仮説がすべての仮説について真である場合、その分布は均一になる可能性があります。

ボンフェローニ補正は、ファミリーワイズエラー率を制御し、信頼区間に適用されます。上記のボタン色の例では、0.1を2で割ると目標値である0.05になります。ファミリーワイズエラー率は制御されたままです。

この証明はブールの不等式から導かれます。

数学的には、ボンフェローニ補正は偽陽性率を実行した仮説検定の数で割ります。 これは、p値に仮説検定の数を掛けることと同じです。

Amplitude 実験は、処理回数とプライマリメトリクスおよびセカンダリメトリクスの数の両方に対して、ボンフェローニ補正を実行します。

  • ボンフェローニは、複数のトリートメントが存在する場合にプライマリメトリクスに適用されます。
  • ボンフェローニは、複数のセカンダリ メトリクスまたは複数のバリアントが存在する場合に、セカンダリ メトリクスに適用されます。

どちらの場合も、ボンフェローニ補正を適用するときに、Amplitudeは有意性列に情報アイコンを配置します。ツールチップには、修正済みおよび未修正のp値が表示されます。

これは役に立ちましたか?