For AI agents: a documentation index is available at /docs/llms.txt. Append .md to any page URL for markdown, or send Accept: text/markdown.
実験の期間を推定する
期間推定ツールを使用すると、構築を開始する前にどの実験アイデアが実行可能かを判断できます。期間推定ツールを使用すると、統計的有意性に達しない可能性のあるテストを実行することを避け、妥当な時間枠で結果を出すことができる実験に優先順位を付けることができます。
期間推定ツールはT検定をサポートしています。このワークフローでは、シーケンシャルテスト、ベイジアン方式、多腕バンディット方式は使用できません。
期間推定ツールを開く
実験の設定で、「期間を推定」を選択して期間推定ツールを開きます。
期間推定ツールを初めて開くと、空の状態が表示されます。トラフィックイベントと成功メトリックを追加すると、期間推定ツールはテストを実行するのに必要な時間を計算します。
見積もりを設定する
ステップ1:トラフィックイベントを追加する
+ イベントを追加 を選択し、実験を実施するトラフィックを表すイベントを選択します。
たとえば、ホームページをテストする場合は、Page Viewed を選択し、ホームページ URL 用のフィルタを追加します。
Duration Estimatorは、アナリティクスから過去29~30日間のトラフィックデータを取得し、結果パネルに1日あたりのユーザー数を表示します。
適切なイベントがない場合は、手動入力 を選択して、独自の毎日のトラフィック総量の推定値を入力してください。トラフィックは総トラフィックであり、各バリアントごとのトラフィックではありません。
ステップ2:成功メトリックを追加する
[+ メトリックを追加] を選択し、この実験で改善したいコンバージョンメトリックを選択します。
成功メトリックとは、実験によって変えようとしている訪問者の行動です。変更を加えることで、より多くの訪問者にどのような行動をとってもらいたいかを考えてください。
一般的な成功指標:
- コンバージョン: 訪問者は、サインアップ、購入、登録、購読などの重要なアクションを実行します。
- フォームの入力: 訪問者はフォームを送信するか、フローを完了します。
選択方法:
- 質問:
What action do you want more visitors to take? - そのアクションに一致するメトリクスを探します。
- 類似したメトリクスが表示された場合は、コンバージョンメトリクス(Amplitudeが
Conversion of...とマークしているもの)または公式の青いバッジ付きメトリクスを選択してください。
チームが頻繁に使用するメトリクスを選択してください。
たとえば、ホームページのヒーローバナーをテストし、より多くの訪問者にコースへ登録してもらいたい場合は、Conversion of registration: course enrolled を選択します。
期間予測ツールは、過去 29 ~ 30 日間の分析データから現在のコンバージョン率を計算し、結果パネルにそのレートを表示します (例: 78.8% -> 82.8%)。
必要なメトリックが表示されない場合:
- ドロップダウンの上部にある検索バーを使用して検索します。
- 下部にあるメトリックの作成を選択して、新しいメトリックを作成します。
- **[手動入力] **を選択して、独自のベースラインコンバージョン率を入力します。
ステップ3:最小検出可能効果(MDE)を設定する
相対的な MDE は、検出したい最小限の改善です。 デフォルトは5%です。これは、ベースラインを5%改善できるかどうかをテストすることを意味します。
たとえば、ベースラインコンバージョン率が78.8%で、MDEを5%に設定した場合、82.8%に到達できるかどうかをテストします。
MDEについてどのように考えるか:
- 抜本的で大胆な変更(例:ファーストビューのヒーローバナーのデザイン変更など):8%程度の大幅な上昇が期待できます。
- 微細な変更(ファーストビューより下のボタンテキストを変更するなど):2%程度のわずかな改善が期待できます。
- MDEが小さいほど、テスト時間ははるかに長くなります。
履歴データがない場合は、**[手動入力]**を選択して独自のベースラインコンバージョン率を入力してください。
結果を理解する
トラフィックと成功メトリクスを追加すると、推定所要時間 パネルに以下が表示されます。
- 期間: テストを実行するのに必要な日数 (例:
~130 days)。 - ユーザー数/日: 期間推定ツールがアナリティクスから取得する毎日のトラフィックです。
- リフト: ベースラインのコンバージョン率から目標コンバージョン率までの上昇幅を、MDE(最小検出効果)のパーセンテージで表したもの。
- 概要: 利害関係者と共有できる平易な言語による説明。
継続時間が非常に長い場合は、*[長時間持続]*警告バッジが表示されます。 [期間シナリオ]テーブルを使用して、さまざまなシナリオを検討できます。
[期間シナリオ] テーブルを使用して優先順位を付けます
期間シナリオ表は、期間見積もりツールの最も重要な部分です。 この表は、選択内容がテスト期間にどのように影響するかを示しています。そのため、テスト対象とタイミングについてより適切な決定を下すことができます。
表の読み方
行(信頼度レベル):
- 低(85%): 結果が本物であるという確信は低いが、結果はより迅速に得られる。
- 中(90%): バランスの取れたアプローチ(デフォルト設定)。
- 高(95%): 結果が本物であることはより確実ですが、時間がかかります。
- カスタム %: 独自の信頼レベルを入力します。
カラム(リフトサイズ/MDE):
- 2%: 小さくて微妙な変化(検出までに最も時間がかかります)。
- 5%:中程度の変化(デフォルト設定)。
- 8%: 大きくて大胆な変更(検出が最も速い)。
- カスタム %: 独自の MDE を入力します。
この表は選択した組み合わせを強調表示し、その他のすべてのシナリオの期間を示しています。
信頼レベルの考え方
信頼レベルは、結果に対して許容できるリスクの度合いです。何が問題なのかを考慮して選択してください。
95%の信頼性:間違いのコストが高い場合に使用します。
- 収益に重要なテスト(チェックアウトフロー、料金、サブスクリプション)。
- インパクトの高い配置(ホームページのメインビジュアル、ファーストビューのコンテンツ、ナビゲーション)。
- 機密性の高い、またはコストのかかる賭け(新しい機能、コンプライアンスが厳しい分野、高コストなビルド)。
90%の信頼性:速度と信頼性のバランスが必要な場合に使用します(デフォルト)。
- 時間的制約があるものの、誤った場合のコストが許容範囲内である、重要度が中程度の意思決定。
- エンゲージメント重視の結果(クリック率、ミッドファネルステップ)。
- 事前の証拠がある分野での反復的な改善。
信頼度85%:方向性を示すシグナルが必要な場合に使用します。
- 早期の検証(MVP、フォローアップするプロトタイプなど)。
- 低リスクのテスト(トラフィックの少ないページ、ファーストビューより下の変更)。
- トップラインを読めば十分な理解度の高い分野。
MDE(リフトサイズ)について考える方法
MDEは、実験アイデアの期待される影響を反映します。質問:How much lift do I realistically expect this change to drive?
大規模なMDE(8%以上):劇的な影響をもたらす大胆な変更に使用します。
- ホームページ上部の目立つ新しいCTA。
- キーフローの大幅な再設計。
- 収益を上げるプロモーション。
- この効果が大きいため、テストは迅速に解決します。
中程度のMDE(3~5%):劇的ではないが意味のある改善のために使用します。
- UX の強化。
- レイアウトの調整。
- 変更をコピー
- これは日常的な実験を行うための最もバランスの取れた選択肢です。
小規模なMDE(1~2%):微妙な調整や、わずかな利益が価値のある場合に使用します。
- マイクロコピーの変化。
- わずかな色調整。
- 漸進的なファネル最適化。
- これらは多くの時間とトラフィックを必要としますが、成熟した大規模な製品では大きな効果をもたらすことがあります。
優先順位付けには期間シナリオ表を使用します
シナリオ1:テストに時間がかかりすぎる
見積もりで MDE ~130 daysが 5% で信頼度が 90% である場合は、次の表を参照してください。
- MDE が 8% (大きな変化) の場合、期間は
~51 daysに短縮されます。 - 信頼度が 85% の場合(確実性が低い場合)、持続時間は
~102 daysに減少します。
意思決定の枠組み:
- より大きく、より大胆なアイデアをテストして、より早く結果を得ることはできますか?
- より迅速に結果を得るために、85%の信頼度を許容できるほどリスクは低いですか?
- それとも、これは信頼度が 90~95% という高いリスクを伴うテストなのでしょうか?
シナリオ2: 複数のテストアイデアを比較する
あなたのバックログには3つのテストアイデアがあります:
- ホームページのヒーローエリアの再設計(8%改善予定):
~51 days信頼度90%。 - CTAボタンのテキストの変更(5%改善を予想):
~130 days90%の信頼度で実施できます。 - フッターリンクの色の変化(予想される上昇率は2%):
~632 days90%の信頼度で確認できます。
決断:ヒーローの再設計は実行可能であり、迅速に結果を出すことができます。信頼度を 85% に下げれば、CTA の変更を実行する価値があるかもしれません (~102 days)。フッターの変更には1年以上かかるため、テストする価値は今すぐにはありません。
シナリオ3:テストポートフォリオのバランスを調整する
期間シナリオ表を使用して、バランスの取れたミックスを作成できます。
- インパクトの大きいテスト(MDE 8%、信頼度90~95%):四半期ごとに1~2回の主要なテストを実施し、2~4週間以内に解決します。
- 日常的な最適化(MDE が 3~5%、信頼度が 90%):定期的なテストを実施することで、3~6週間以内に着実に改善が実現します。
- クイック検証(MDE 5~8%、信頼度 85%):本格的な投資を行う前に、新しいアイデアの方向性を見極める。
シナリオ4:トラフィックの少ないページ
トラフィックの少ないページをテストする場合、すべてのシナリオで期間が非常に長い場合は、次のことが必要になる場合があります。
- トラフィックの多いページでテストしてください。
- トラフィックが増えるまで待ちます。
- より大きな効果が期待できるものをテストしてください。
期間シナリオ表ではこれらのトレードオフを可視化できるため、トラフィックとタイムラインの制約に合った実験に優先順位を付けることができます。
高度な設定を調整する(オプション)
詳細設定を選択して、追加のコントロールにアクセスできます。
- 信頼度レベル:低(85%)、中(90%)、または高(95%)。
- 統計的検出力: 真の効果を検出する確率 (デフォルトは 80%)。
- ロールアウト: 実験に公開する訪問者の割合(デフォルトは 100%)。
- バリアントの数: コントロールを含むバリアントの合計数。
- トラフィック配分:トラフィックがバリアント間でどのように分割されるか(デフォルトでは均等に分割)。
- 統計方法:T検定。
ほとんどのチームはこれらの設定を調整する必要はありません。 デフォルト設定は標準的なA/Bテストでうまく機能します。
テスト時間を短縮するためのヒント
予定期間がタイムラインで許容できるよりも長い場合は、これらのオプションを使用してください。
より大きなアイデアをテストする(MDEを増やす)
テスト期間を左右する最大の要因は、検出したい変更の大きさです。 変更が大きいほど、上昇幅が大きくなり、解決速度も速くなります。
たとえば、MDE を 5% から 8% に変更すると、期間を ~130 days から ~51 days に短縮できます。
質問:
- 微妙な調整ではなく、よりインパクトのあるバリエーションをテストすることはできますか?
- ボタンの色を変更する代わりに、CTAセクション全体を再設計することはできますか?
- マイクロコピーを微調整する代わりに、見出し全体を書き直すことはできますか?
インパクトの大きいアイデアはより早く解決できます。 インパクトの小さいアイデアは時間がかかりますが、成熟したトラフィック量の多い製品であれば、積み重ねることで効果を発揮します。
信頼度を下げる(許容できるリスクの場合)
信頼度が 90% から 85% に低下すると、持続時間は短縮されますが、偽陽性のリスクは高まります(勝者がいない場合に勝者と判定してしまう)。
たとえば、信頼度が 85% の場合、同じ 5% の MDE テストでは ~130 days ではなく ~102 days が必要となります。
質問:
- 間違ったことの代償はどれくらいでしょうか。
- これはリスクの低いテストですか(ファーストビューより下の変更、よく理解されている領域など)?
- 必要に応じてフォローアップテストで結果を検証できますか?
次のことについて信頼を低下させないでください:
- 収益に重要なテスト。
- インパクトの高い配置。
- まったく新しい機能や未知のカスタマーセグメント。
トラフィックの多いページまたはイベントを選択する
トラフィック量が少ないことは、テストに時間がかかりすぎる一般的な原因です。
質問: このテストをトラフィックの多いページで実行するか、より頻繁に発生するコンバージョンイベントを選択できますか?
ロールアウト率を向上
実験の対象を訪問者の50%のみとする場合、100%に増やすことで、期間を約半分に短縮できます。
バリアントの数を減らす
4 つのバリエーションをテストすることは、2 つのバリエーションをテストすることよりもはるかに時間がかかります。 1つの大規模な多バリアントテストではなく、複数の連続テストを検討してください。
テストを実行する価値があるかどうかを判断する
テストが実行不可能な場合もあります。 Duration Scenarios表にすべてのシナリオで数百日と表示されている場合、テストを構築する価値はおそらくありません。
避けるべき一般的な間違い
- 毎回95%の信頼度をデフォルトに設定します。これはリスクの高いテストには意味がありますが、リスクの低い実験を遅らせる可能性があります。
- 小さな重量の向上のみを追求する。MDEを1~2%改善しようとすると、大量のトラフィックと長時間の実行が必要になる場合があります。
- 期間チェックをスキップします。 適切な設定を行っていても、一部の実験では利用可能なトラフィックでは有意な結果に達することができません。
Duration Estimatorを使用すると、決して有意な結果に達しない可能性のあるテストに時間とリソースを費やす前に、この判断を下すことができます。
よくある質問
見積もりが「長期」と表示される理由
テストが統計的有意性に達するには長い時間がかかります。これは多くの場合、トラフィックが少ないかMDEが小さいためです。「期間シナリオ」表を使用して、より迅速な代替手段を検討してください。
30日分の履歴データがない場合はどうなりますか
時間枠を更新するか、**[手動入力]**を選択して独自のトラフィックとコンバージョンの推定値を入力してください。結果は、少なくとも数週間の安定したデータがある場合に最も正確です。
見積もりを確認した後でMDEを変更できますか?
はい 成功メトリックセクションでMDEの割合を調整すると、見積もりが自動的に更新されます。テスト設計にコミットする前に、MDEコントロールを使用してさまざまなシナリオを検討してください。
Last 29 days offset by 1とはどういう意味ですか
このラベルは、期間見積もりツールが計算に使用するデータの時間枠を示しています。Offset by 1これは、今日のデータが不完全であるため、計算から今日が除外されることを意味し、過去 29 日間のデータが参照されます。
常に高い信頼度(95%)を目指すべきでしょうか?
いいえ。多くの実験は中程度の信頼度(90%)で実行されており、これにより速度と精度のバランスが取れます。 リスクが高い場合や、意思決定前に最大限の確実性を確保する必要がある場合は、高い信頼度を使用してください。
成功メトリックを選択する方法
まずはWhat action do you want more visitors to take?質問することから始めます。次に、そのアクションに合致するメトリックを選択します。コンバージョン指標(AmplitudeがConversion of...とマークしているもの)は、多くの場合最良の選択肢です。
それでも確信が持てない場合は、目標に関連する指標を検索するか、[手動入力] を選択して独自の基準値を入力してください。
ライブ実験の期間の見積もりについてはどこで確認できますか?
Experiment期間の推定値を確認して、実験の実行中にExperimentが示す推定値を理解してください。
これは役に立ちましたか?