【えーびーてすと】
A/Bテスト とは?
最終更新:
💡 ユーザーの行動データで、変更の効果を比べる実験
ユーザーなどを無作為に異なるバージョンへ割り当て、行動データから変更の効果を比較する実験。通常はAとBの2案を比較し、事前に指標や判定方法を決めて結果の不確実性も評価する。
📌 このページのポイント
- 比較する案へ無作為に割り当て、同じ条件で効果を比べる
- 主要指標に加え、悪化して困る指標やデータ品質も確認する
- 必要な人数・期間・判定方法は、検出したい差などから設計する
- 有意差が出るまで続けるのではなく、事前に決めた方法で評価する
A/Bテストって具体的にどうするの?
たとえば購入ボタンを青いA案と赤いB案で比べるよ。ユーザーを無作為に割り当て、クリックや購入を記録する。同じ人への割り当てが途中で変わらないようにするなど、比較条件を設計するんだ。色が違うだけで特定の案が必ず良くなるわけではないよ。
数字が高い方を採用すればいい?
観測した差にはばらつきがあるので、差の大きさと不確実性を評価しよう。有意差があっても『偶然ではないと証明した』という意味ではなく、実用上の改善かも別に考える。主要指標が上がっても、エラー率など悪化して困る指標を確認するんだ。
何人集めればいいの?
現在の指標の水準、検出したい差、ばらつき、有意水準や検出力などによるよ。一律に数千人、1〜2週間とは決められない。固定期間・人数で判定する方法なら、必要量や観測期間を事前に設計する。差がはっきりしない結果もあり、必ず勝者を選ぶ実験ではないんだ。
途中で結果を見るのはダメ?
固定した人数で一度判定する検定なのに、何度も有意差を探して都合のよい時点で止めると、誤って効果ありとする率が増えるよ。一方、途中の判定を扱う逐次検定もある。監視と採用判断を区別し、使う分析方法に合った終了ルールを決めよう。
3案以上やバックエンドも比べられる?
A/B/nのように案を増やしたり、検索ロジックをフィーチャーフラグで振り分けたりもできるよ。3案あるだけで多変量テストになるわけではなく、多変量テストは複数の要素の組み合わせを比べる。比較を増やすなら、必要なデータ量や誤検出への対応も設計しよう。
まとめ:ざっくりこれだけ覚えればOK!
「A/Bテスト」って出てきたら「ユーザーを案ごとに分けて、変更の効果をデータで比べる実験」と思えばだいたいOK!
📖 おまけ:英語の意味
「A/B test」 = AとBを比較するテスト
💬 「A案とB案を実際のユーザーで試す」というシンプルな発想。Split testとも呼ばれる