【せいかいりつ】
正解率 とは?
最終更新:
💡 分類した全件のうち、正しく当てた割合
分類した全件のうち正しく当てた割合を示す指標。迷惑メールの例で、計算方法、データの偏り、適合率・再現率などとの違いを解説します。
正解率は、どう計算する?
99%なら、とても良いモデル?
目的やデータの内訳によるよ。通常メール99件、迷惑メール1件の100件を考えよう。全部を通常メールと予測しても、99件は当たる。でも迷惑メールは1件も見つけていないんだ。
見逃しは、どの指標で見る?
種類ごとの成績を、同じ重みで見るには?
balanced accuracyは、各クラスの再現率を平均する指標だ。この例では通常メールが100%、迷惑メールが0%なので50%。普通の正解率の99%とは違う。指標の名前と数え方を明らかにしよう。
何を評価すればよい?
もっと詳しく知りたい人へ
迷惑メールと一度も判定しない場合の適合率は?
基本式の「正しく迷惑メールと判定した件数÷迷惑メールと判定した件数」は、分母が0になるため定義できません。ライブラリで代わりの値や警告を設定する場合もあります。計算上の扱いを確認し、良い成績だと解釈しないようにします。
一つのデータに複数のラベルを付ける場合も、同じ数え方?
評価方法を確認します。scikit-learnのaccuracy_scoreでは、複数ラベル分類は予測したラベルの集合が正解と完全に一致したサンプルを数えます。ラベル一つずつの正解割合とは違うため、何を1件の正解としたかを明示します。
まとめ:ざっくりこれだけ覚えればOK!
「正解率」って出てきたら「分類した全件のうち、正しく当てた割合」と思えばだいたいOK!
📖 おまけ:英語の意味
「Accuracy」 = 正確さ。分類評価では正解率
💬 日常語の精度と、機械学習の適合率(Precision)は区別します。この記事では主に、1件に一つのクラスを予測する分類を扱います。