【せいかいりつ】

正解率 とは?

最終更新:
💡 分類した全件のうち、正しく当てた割合

分類した全件のうち正しく当てた割合を示す指標。迷惑メールの例で、計算方法、データの偏り、適合率・再現率などとの違いを解説します。

📌 このページのポイント
正解率:99%でも見逃すことがある通常:99件迷惑:1件全部を「通常メール」と予測する例正解率99 / 100 = 99%迷惑の検出0 / 1 = 0%何を当てたいか、内訳も一緒に確認しよう
説明用の100件。迷惑メールの再現率は0%です。クラスごとの再現率(通常100%・迷惑0%)を平均するbalanced accuracyは50%となり、正解率とは別の指標です。
ひよこ ひよこ
正解率は、どう計算する?
ペンギン先生 ペンギン先生
基本は、正しく分類した件数を全件数で割る。100件のうち90件が正しければ90%だね。二つの種類の分類では、どちらの種類を正しく当てた件数も、正解数に含めるよ。
ひよこ ひよこ
99%なら、とても良いモデル?
ペンギン先生 ペンギン先生
目的やデータの内訳によるよ。通常メール99件、迷惑メール1件の100件を考えよう。全部を通常メールと予測しても、99件は当たる。でも迷惑メールは1件も見つけていないんだ。
ひよこ ひよこ
見逃しは、どの指標で見る?
ペンギン先生 ペンギン先生
迷惑メールを検出したいなら、実際の迷惑メールのうち何件を見つけたか、という再現率がある。この例は0%。迷惑メールと判定したもののうち本当に迷惑メールだった割合は適合率で、別の問いだよ。
ひよこ ひよこ
種類ごとの成績を、同じ重みで見るには?
ペンギン先生 ペンギン先生
balanced accuracyは、各クラスの再現率を平均する指標だ。この例では通常メールが100%、迷惑メールが0%なので50%。普通の正解率の99%とは違う。指標の名前と数え方を明らかにしよう。
ひよこ ひよこ
何を評価すればよい?
ペンギン先生 ペンギン先生
見逃しと誤検出のどちらが問題になるかを考え、混同行列や適合率・再現率などを合わせて見る。F1も別の指標だ。学習に使ったデータだけの高得点で判断せず、評価対象の内訳と数え方を確認するんだ。
もっと詳しく知りたい人へ

迷惑メールと一度も判定しない場合の適合率は?

基本式の「正しく迷惑メールと判定した件数÷迷惑メールと判定した件数」は、分母が0になるため定義できません。ライブラリで代わりの値や警告を設定する場合もあります。計算上の扱いを確認し、良い成績だと解釈しないようにします。

一つのデータに複数のラベルを付ける場合も、同じ数え方?

評価方法を確認します。scikit-learnのaccuracy_scoreでは、複数ラベル分類は予測したラベルの集合が正解と完全に一致したサンプルを数えます。ラベル一つずつの正解割合とは違うため、何を1件の正解としたかを明示します。

ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「正解率」って出てきたら「分類した全件のうち、正しく当てた割合」と思えばだいたいOK!
📖 おまけ:英語の意味
「Accuracy」 = 正確さ。分類評価では正解率
💬 日常語の精度と、機械学習の適合率(Precision)は区別します。この記事では主に、1件に一つのクラスを予測する分類を扱います。

参考資料

← 用語集にもどる