このページでは

For AI agents: a documentation index is available at /docs/llms.txt. Append .md to any page URL for markdown, or send Accept: text/markdown.

実験用のMDEを設定する

実験を実行する前に、検出可能な影響の最小値(MDE)を設定して、成功をどのように測定するかを推定してください。MDEは、実験を実行することで見つけたい最小限の変化であると考えるべきです。MDEには標準的な計算方法が存在しないため、それを設定するには判断が必要です。Amplitude 実験では、デフォルトのMDEは2%です。MDE はお客様のビジネスニーズに直接関連しているため、各実験の設計段階において慎重に進めてください。MDEを設定する際は、主要なメトリックと関連するリスクを考慮してください。

MDE とメトリクスの目標タイプ

実験を作成する際には、成功またはガードレールという2つのメトリック目標タイプから選択できます。次のケーススタディは、目標タイプがどのようにMDEを変更できるかを示しています。

ある小規模な芸術団体のマーケティングディレクターは、Amplitude実験を使用して発券管理システムのアップデートを計画しています。 データサイエンスチームが存在しないため、ディレクターはどの実験を実施するか、どのように実施するかを決定します。 計画されている更新は次のとおりです。

  • ログインユーザーのページ訪問からチケット販売へのコンバージョンを増やすため、イベントページに「クイックチェックアウト」オプションを追加してください。
  • すべてのユーザーのチェックアウト期間中に、新しい支払いオプションを追加してください。

最初のアップデートの目標はコンバージョン率を上げることなので、成功メトリックは適切です。このメトリックは、マーケティングディレクターに新しいボタンが適切な場所に配置されているかどうか、コンバージョン率目標を達成するのに十分な程度に目に見える状態にあるかどうかを伝えます。マーケティングディレクターの次の会計四半期の目標は、チケット販売収入を3%増やすことです。 これらの企業目標は成功のメトリクスを形成し、テストの方向性を「増加」に、MDEを3%に設定します。

2 番目の更新は財務要件を満たしています。 チェックアウトプロセスに必要な変更として、ガードレールのメトリックは、新しい支払い方法が完了した売上を減少させないことを確認するのに役立ちます。過去4四半期にわたって、ユーザーの平均1%がプロセスを開始した後にチェックアウトを断念していました。 ガードレールのメトリック方向は減少しており、MDE は 1% です。

T検定(T-test)を実行する場合、Amplitudeの持続時間推定機能もMDEを設定するのに役立ちます。Amplitudeが提供する推奨MDEを確認するか、所要時間の見積もりが妥当になるまでMDEを変更してください。

MDEと主要メトリック

Amplitudeでは、MDEは主要メトリクスの管理平均と相対的です。たとえば、コントロールグループのコンバージョン率が 10% で、MDE が 2% (0.2) である場合、レートが 9.8% ~ 10.2% の範囲外に移動したときに Amplitude が変化を検出することを意味します。

チケットの導入事例では、以下の場合にチケット販売の主要なメトリックとして異なるMDEが必要になる場合があります。

  • この仮説検定実験は、航空券価格の年間割引期間中に実施されます。
  • チケット売上と正の相関関係にあるイベントの数は、前会計四半期と比べて大幅に減少しています。
  • この実験は、大規模な対面集会が禁止されている世界的なパンデミックの最中に実施されます。

実験を計画し、MDEを設定する際には、ビジネスニーズと状況を考慮してください。任意の実験の目標の1つは、できるだけ害を少なくすることです。

また、実験結果を分析するときに MDE を設定することもできます。

MDEと関連するリスク

実験ではリスクのない結果が得られるわけではなく、実験を実行するには時間がかかり、大規模なサンプルセットが必要になる場合があります。 これはコストが高くなり、ユーザーに悪影響を及ぼす可能性が高くなることを意味します。 MDEはサンプルサイズと逆の関係にあります。つまり、MDEが小さいほど、または「感度」が高いほど、統計的有意性に達するために必要なサンプルサイズは大きくなります。

リスクを評価するには、次の質問を使用してください。

  • 実験の推定コストや実行時間は、期待される結果に見合うものですか?
  • 実験でユーザーに起こりうる悪影響は何ですか?その結果は潜在的な損失に値するものですか?
  • 実験をする必要はあるのでしょうか?それとも機能リリースなどの他の選択肢を検討すべきでしょうか?
  • あなたが満足できる最小限の変化率は何パーセントですか? たとえば、2%、3%、5%の上昇が見られた場合、実験を展開しますか?
  • もしあなたの実験が年間購読者数を100人から105人に増やすなど、肯定的な結果を生んだとしたら、その変化は経営陣に伝えるのに十分な大きさですか?

よくある質問

これらの質問はAmplitude実験の推定期間に関するものです。 セットアップのガイダンスとローンチ前の計画については、「実験の期間を見積もる」を参照してください。

所要時間の見積もりはどのように機能しますか?

実験期間の見積もりは、統計的に有意な結果を生成するために実験を実行する必要がある時間を予測します。 期間の推定値は、プライマリメトリクスとシーケンシャルテストでのみ機能し、実験結果をサポートしません。

Amplitude 実験は、コントロールとバリアントの平均、分散、エクスポージャーを使用して、予想される動作を予測し、実験が統計的有意性に達するのに要する日数を計算します。データが増えるにつれて予測は改善されます。 これらの入力値のいずれかが実験中に大きく変化した場合、予測の精度は低下する可能性があります。

所要時間の見積もりと所要時間見積もりツールの違いは何ですか?

Amplitudeは、実験の実行中に逐次テストを使用して推定期間を計算します。期間推定器は T 検定を使用します。

推定期間が表示されないのはなぜですか?

所要時間の見積もりは、実験が次のすべての基準を満たしている場合に表示されます。

  • このメトリックはまだ統計的有意性に達していません。
  • 分析ウィンドウの終了日は過去です。
  • この実験には十分な観測結果があります。
  • 実験ステータスは、ロールアウトまたはロールバックの状態です。
  • 次の統計的条件のいずれも当てはまらない:
    • 絶対リフトは信頼区間の外にあります。
    • 信頼区間が反転します(信頼区間の下限 > 信頼区間の上限)。これは、実験の実行中にテスト群または対照群の平均値が変動した場合や、ロールアウトの重みやターゲット設定セグメントが変化した場合に発生することがあります。
    • 標準誤差は非常に小さいです。
    • この分散は負です。
    • コンバージョン率が1より大きいか0未満である場合(該当する場合)。

見積もりが表示されない場合、これらの基準の1つ以上が満たされていません。

見積もり期間に上限はありますか?

はい、上限は40日です。その理由:

  • 所要時間の推定はリアルタイムシミュレーションを使用しており、レイテンシはシミュレーションされた日数に応じて増加します。
  • 平均値と標準偏差は通常、時間の経過とともにあまり変化しません。特に実行時間が長い実験の場合です。
  • 短期的な予測は長期的な予測よりも正確に作成する方が簡単です。 (同じ理由で、10日以降の天気予報は日付が近づくにつれて頻繁に変更されます)
  • ほとんどの実験は完了するのに40日かかるべきではありません。

Amplitude実験はどのようにして1日のエクスポージャー数を決定していますか?

Amplitude実験は、1日のエクスポージャー数が一定であることを前提としています。Amplitudeは、今日までの累積エクスポージャー数を実験がこれまで実施された日数で割ることでこの値を計算します。

どのような種類のエラーが存在しますか?

所要時間はあくまでも概算です。 それを真実と受け取ってはいけません。次のような問題が発生する可能性があります:

  • 還元不可能な誤差:見積りプロセスに固有の誤差。 あなたはそれを訂正することはできません。各シミュレーションは異なるタイミングで統計的有意性に達します。これが複数のシミュレーションを実行する主な理由です。 実験が統計的有意性に達するのに要する時間自体が確率変数です。 時間はp値に依存し、p値は実験で収集されるデータによって異なります。 たとえ制御平均、制御標準偏差、処理平均、および処理標準偏差を知っていて、すべてに正規分布と独立性を強制した場合でも、実験では誤差をゼロにすることはできません。
  • 誤った推定値: Amplitude実験 が期間推定値を生成するとき、Amplitude は対照母集団平均、対照母集団標準偏差、およびサンプルからその他の量を推定します。 これらの見積もりは可能な限り良いものですが、それでも誤差の余地は残っています。
  • ドリフト: たとえば、現在の管理平均が 5 で、10 日後は 15 の場合、管理平均はドリフトを示します。 その典型的な例が季節性です。 モデルは仮説検定期間中にドリフトがないと仮定しているため、任意の入力におけるドリフトは推定値を劣化させます。

「しきい値に達しました」とはどういう意味ですか?

実験で「閾値に達しました」と表示され、期間推定器に「残り0日」と表示されている場合、信頼区間にはMDE(閾値)が含まれていません。

レコメンデーションメトリックがガードレールの場合、このメッセージは必ずしも悪いことではありません。なぜなら効果サイズは許可された量よりも小さいからです。

レコメンデーションメトリックが成功メトリックである場合、このメッセージは悪い兆候です。これは効果サイズが期待していたものよりも小さいためです。この場合は実験を終了してください。たとえ統計的有意性に達したとしても、その上昇幅が実質的有意性よりも小さい場合です。

「統計的有意性に達することは決してない」とはどういう意味ですか?

期間推定ツールが実験を完了するのに40日以上かかることを示している場合、Amplitudeは実験が2週間実行された後には統計的有意性に達する可能性は低いと仮定する場合があります。 このような場合、実験はこのメッセージを表示します。

これは役に立ちましたか?