【もでるひょうか】

モデル評価 とは?

最終更新:
💡 予測の得意・不得意を確かめる

機械学習モデルの予測性能を、目的に合うデータと指標で測ること。学習に使ったデータと評価用データを分け、評価結果の偏りや情報の漏れにも注意する。

📌 このページのポイント
モデル評価:何をどれだけ当てた? 100通の迷惑メール判定:仮の例 予測(モデルの判定) 迷惑 普通 実際は迷惑 実際は普通 8通 検出 TP 2通 見逃し FN 3通 誤検出 FP 87通 正しく除外 TN 同じ判定結果でも見る割合が違う 適合率 8 / 11 ≈ 72.7% 再現率 8 / 10 = 80% 正確度 95 / 100 = 95% F1 16 / 21 ≈ 76.2%
二値分類で迷惑メールを陽性とした例。実際の迷惑メールは10通、普通は90通です。緑は正しい判定、赤は誤り。用途に応じて見逃しと誤検出を別々に確認します。
ひよこ ひよこ
モデル評価って何をするの?
ペンギン先生 ペンギン先生
モデルの予測をデータと照らし合わせ、目的に合う指標で性能を測ることだよ。分類なら正解のラベルと比較する。数値を予測する回帰では、予測値と実測値の誤差などを使うんだ。
ひよこ ひよこ
正確度(Accuracy)だけ見ればいい?
ペンギン先生 ペンギン先生
例えば100通中1通だけ迷惑メールなら、全部を普通のメールと判定しても99%正解になるよ。でも迷惑メールは全て見逃す。検出したメールのうち本当に迷惑メールである割合が適合率、本当の迷惑メールのうち検出できた割合が再現率だよ。
ひよこ ひよこ
F1スコアは何が違うの?
ペンギン先生 ペンギン先生
適合率と再現率の調和平均だよ。どちらか片方だけ高くてもF1は高くなりにくい。ただし、誤検出と見逃しのどちらが困るかは用途次第だから、1つの値だけで良いモデルと決めないようにしよう。
ひよこ ひよこ
訓練データとテストデータを分けるのはなぜ?
ペンギン先生 ペンギン先生
学習したデータだけでは、答えを覚えたモデルも良く見えてしまうからだよ。最終評価のテストデータを使って設定を何度も調整すると、そのデータの情報が漏れる。調整用の検証データと最終評価を分けて考えるんだ。
ひよこ ひよこ
交差検証なら偏りをなくせる?
ペンギン先生 ペンギン先生
k分割交差検証は、k個に分けたデータの1つを評価用、残りを学習用としてk回繰り返す方式だよ。分割による結果の違いを調べられるが、データの偏りを全部なくすものではない。時系列などでは時間の順序に合う分割も必要だよ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「モデル評価」って出てきたら「目的に合う指標で予測性能を確かめること」と思えばだいたいOK!
📖 おまけ:英語の意味
「Model Evaluation」 = モデル評価
💬 Modelは機械学習モデル(数学的な予測関数)、Evaluationはそのパフォーマンスを測定・評価することを指すよ

参考資料

← 用語集にもどる