【えーびーてすと】

A/Bテスト とは?

最終更新:
💡 ユーザーの行動データで、変更の効果を比べる実験

ユーザーなどを無作為に異なるバージョンへ割り当て、行動データから変更の効果を比較する実験。通常はAとBの2案を比較し、事前に指標や判定方法を決めて結果の不確実性も評価する。

📌 このページのポイント
A/Bテスト:変更の効果を比較 ユーザー 無作為割り当て 50% 50% A案 購入する 30 / 1,000人 クリック率 3% B案 購入する 40 / 1,000人 クリック率 4% 率の差だけで勝者を決めない
1:1の割り当てと仮の観測値。率が高いだけで勝者とはせず、差の不確実性も評価する。
ひよこ ひよこ
A/Bテストって具体的にどうするの?
ペンギン先生 ペンギン先生
たとえば購入ボタンを青いA案と赤いB案で比べるよ。ユーザーを無作為に割り当て、クリックや購入を記録する。同じ人への割り当てが途中で変わらないようにするなど、比較条件を設計するんだ。色が違うだけで特定の案が必ず良くなるわけではないよ。
ひよこ ひよこ
数字が高い方を採用すればいい?
ペンギン先生 ペンギン先生
観測した差にはばらつきがあるので、差の大きさと不確実性を評価しよう。有意差があっても『偶然ではないと証明した』という意味ではなく、実用上の改善かも別に考える。主要指標が上がっても、エラー率など悪化して困る指標を確認するんだ。
ひよこ ひよこ
何人集めればいいの?
ペンギン先生 ペンギン先生
現在の指標の水準、検出したい差、ばらつき、有意水準や検出力などによるよ。一律に数千人、1〜2週間とは決められない。固定期間・人数で判定する方法なら、必要量や観測期間を事前に設計する。差がはっきりしない結果もあり、必ず勝者を選ぶ実験ではないんだ。
ひよこ ひよこ
途中で結果を見るのはダメ?
ペンギン先生 ペンギン先生
固定した人数で一度判定する検定なのに、何度も有意差を探して都合のよい時点で止めると、誤って効果ありとする率が増えるよ。一方、途中の判定を扱う逐次検定もある。監視と採用判断を区別し、使う分析方法に合った終了ルールを決めよう。
ひよこ ひよこ
3案以上やバックエンドも比べられる?
ペンギン先生 ペンギン先生
A/B/nのように案を増やしたり、検索ロジックをフィーチャーフラグで振り分けたりもできるよ。3案あるだけで多変量テストになるわけではなく、多変量テストは複数の要素の組み合わせを比べる。比較を増やすなら、必要なデータ量や誤検出への対応も設計しよう。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「A/Bテスト」って出てきたら「ユーザーを案ごとに分けて、変更の効果をデータで比べる実験」と思えばだいたいOK!
📖 おまけ:英語の意味
「A/B test」 = AとBを比較するテスト
💬 「A案とB案を実際のユーザーで試す」というシンプルな発想。Split testとも呼ばれる

参考資料

← 用語集にもどる