このページでは

For AI agents: a documentation index is available at /docs/llms.txt. Append .md to any page URL for markdown, or send Accept: text/markdown.

T検定で実験データを分析する

T検定は、2つのデータ母集団の平均を比較して、その差が統計的に有意かどうかを判断します。AmplitudeはウェルチのT検定を使用しています。これはデータセットについていくつかの仮定を立てます:

  • 中心極限定理はメトリクスに適用されます。
  • どちらの集団も同じ分散を共有しません。
  • 期間推定器で指定されたサンプルサイズに達するまで、T検定を実行しないでください。

Z検定をお探しですか?

T検定はZ検定と同じオプションの多くをサポートしています。

次のいずれかの方法で T 検定を実行します。

  • 両側: メトリクスの任意の変化を、どちらの方向であっても検出します。
  • 片側性: 増加または減少のいずれか一方を調べますが、両方を調べることはしません。

T 検定は、バイナリと連続の両方のメトリックに対して機能します。

両側検定は統計的に有意な増加または減少を明示的に示しませんが、片側検定は明示的に示します。Increase を選択した場合、信頼区間の上限は正の無限大になります。Decrease の場合、信頼区間の下限は負の無限大です。

Amplitudeがt検定結果をどのように計算するか

各バリアントについて、Amplitudeはサンプル平均、サンプル分散、およびサンプルサイズを計算します。 次に、プールされていないウェルチのT検定を使用します。この検定では、各群の分散が等しいとは想定されていません。

プールされていないウェルチのT統計量

構文

t=Yˉ−Xˉs12N1+s22N2t = \frac{\bar{Y} - \bar{X}}{\sqrt{\frac{s_1^2}{N_1} + \frac{s_2^2}{N_2}}}

\bar{Y} および \bar{X} は標本平均、s_1^2 および s_2^2 は標本分散、N_1 および N_2 は標本サイズです。

ウェルチ=サタスウェイト自由度

構文

ν=(s12N1+s22N2)2(s12N1)2N1−1+(s22N2)2N2−1\nu = \frac{\left(\frac{s_1^2}{N_1} + \frac{s_2^2}{N_2}\right)^2}{\frac{\left(\frac{s_1^2}{N_1}\right)^2}{N_1 - 1} + \frac{\left(\frac{s_2^2}{N_2}\right)^2}{N_2 - 1}}

Amplitude は \nu ウェルチ–サタスウェイト自由度を使用して、p 値と信頼区間の T 分布を選択します。

信頼区間の境界

構文

下限=(Yˉ−Xˉ)−t1−α/2,νs12N1+s22N2\text{下限} = (\bar{Y} - \bar{X}) - t_{1 - \alpha/2, \nu}\sqrt{\frac{s_1^2}{N_1} + \frac{s_2^2}{N_2}}
上限=(Yˉ−Xˉ)+t1−α/2,νs12N1+s22N2\text{上限} = (\bar{Y} - \bar{X}) + t_{1 - \alpha/2, \nu}\sqrt{\frac{s_1^2}{N_1} + \frac{s_2^2}{N_2}}

\alpha は偽陽性率であり、t_{1 - \alpha/2, \nu} は T 限界値です。 片側テストの場合、Amplitudeはテストが評価しない方向に無制限の間隔を使用します。

二値メトリクスの場合、分散は p(1-p) です。ここで、p は成功したユーザーの割合です。連続数値メトリクスの場合、Amplitudeはサンプル平均からの二乗差の合計からサンプル分散を計算します:sum((x_i - mean)^2) / (n - 1)。ウィンソーライゼーションを設定した場合、Amplitudeは設定された上限と下限をユーザーごとの値に適用してから、平均値と分散を計算します。

比率メトリクスの場合、Amplitudeは比率の分散を計算する際にCov[X,Y] = 0を前提としています。分子と分母が相関している場合、この仮定は報告された不確実性に影響を与える可能性があります。

実験を実施していない場合やサンプルサイズが十分に大きい場合は、T 検定の代わりに逐次検定を使用してください。 テストオプションの違いについて詳しくは、こちらのブログをご覧ください。

T検定設定の構成

*「設定」*タブから T 検定設定にアクセスします。 必要な設定は、実行する T 検定の種類と、メトリックを移動させる方向によって異なります。 T検定を設定するには:

  1. [目標] パネルを編集し、メトリクスに対して [増加] または [減少] を選択します。
  2. 「分析設定」パネルを開きます。 統計設定 > 詳細 に移動します。T 検定統計方法を選択します。 実行したい T 検定の種類に基づいて、片側または両側を選択してください。たとえば、増加を調べるために両側 T 検定を実行するには、プライマリ メトリクスで増加を、統計設定で両側 T 検定を選択します。
  3. バリアントごとのサンプル数の下に必要なユーザー数を入力します。バリアントごとのサンプル数に入力するサンプルサイズがわからない場合は、AmplitudeのDuration Estimator(持続時間推定ツール)を使用してください。詳細については、ヘルプセンターの期間推定ツールを使用した実験の計画に関する記事を参照してください。

T検定ではまず、特定の偽陽性率および偽陰性率を制御するために必要なサンプルサイズを計算します。サンプルサイズのしきい値に達する前にデータを分析すると、エラー率が高くなります。ピーキングがどのように実験プロセスを中断させるかの詳細については、この記事をご覧ください。

  1. [保存] を選択して統計設定を T 検定に変更します。

T検定に必要なサンプルサイズを管理

T検定を実行する前に、最小サンプルサイズに達する必要があります。 データセットが小さすぎる場合、実験は警告を表示します。

累積エクスポージャーグラフとその表は、サンプルサイズの要件を示しています。このグラフには、Sample Size Target という名前の定数点線が表示されています。これは、各バリアントに必要なユーザーの総数を表しています。 グラフの隣にある表は、各バリアントがまだ必要とするユーザー数である「残りの露出数」を示しています。この情報は、T検定を実行する前に必要なユーザー数を確認し、T検定を使用して結果を解釈するまでに実験に必要な時間の見積もりを提供します。

必要なサンプルサイズに達しても、統計的に有意な結果が保証されるわけではありません。 たとえば、リフトが MDE よりも小さい場合、結果は統計的に有意でないことがよくあります。

Amplitudeが結果を計算する場合、

Amplitudeは両方のバリアントが要件を満たしている場合にのみp値と信頼区間を計算しますN >= exposure_target。

よくある質問

このセクションは、ファネル分析チャートにおける A/B テストに適用されます。 これは、実験結果チャートやAmplitude 実験のエンドツーエンド実験には適用されません。

Amplitudeはどのようにベースラインに対する改善を計算していますか?

ベースラインに対する改善は、ベースライン(B)の平均に対するバリアント(A)の平均の比率です: mean(A) / mean(B)。

各グループについて、Amplitudeは平均をk / nとして計算します。ここで、kはコンバージョン数、nはサンプルサイズです。

計算で合計ではなく一意のコンバージョンを使用するのはなぜですか?

Amplitudeは統計的有意性を確認する際に、合計ではなく一意のコンバージョンを使用します。合計値は、ファネル内でのユーザーの行動について誤った仮定を立てています。 集計合計は、ユーザーがファネルに入るたびに前回とは無関係であると仮定しています。この仮定は統計的有意性を計算する際には有効ではありませんが、合計は実験結果チャートやエンドツーエンドの Amplitude 実験での他の分析に役立ちます。

Amplitudeはどのように統計的有意性を計算しますか?

Amplitudeは標準化された統計手法を使用して統計的有意性を計算します。 この方法は機能によって異なります。例えば、順次テストまたは両側T検定です。デフォルトでは、Amplitude 実験と実験結果チャートは逐次テストを使用し、ファネル分析チャートは両尾 T 検定を使用します。分析結果を比較する場合、異なるテスト方法を使用するチャート間でp値が一致しない場合があります。

どちらの方法でも、Amplitudeはデフォルトで5%の偽陽性率を使用します。 有意性の閾値は (1 - p_value) > 95% です。Amplitude 実験で偽陽性率を変更できます。この値は、ファネル分析チャートで変更することはできません。

偽陽性を減らすために、Amplitude は有意性を宣言する前に最小サンプルサイズを要求しています。つまり、各バリアントについて 30 サンプル、5 回のコンバージョン、5 回の非コンバージョンです。Amplitudeはこれらの最小値を満たさないテストを自動的に統計的に有意でないものとして扱います。

これは役に立ちましたか?