【ぶんるい】

分類(機械学習) とは?

最終更新:
💡 入力が、どのカテゴリに属するかを予測

入力がどのカテゴリに属するかを予測する機械学習のタスク。回帰・クラスタリングとの違い、判定のしきい値と評価指標を解説します。

📌 このページのポイント
分類:スコアと判定ルールを区別新しいメール → モデルのスコア迷惑メールのスコア:0.7(例)0.5以上なら迷惑迷惑メールと判定0.8以上なら迷惑通常メールと判定見逃しと誤判定を、実際の正解と比べる
左右は別のしきい値の比較で、同時に二カテゴリへ分類する図ではありません。数値は説明用で、スコアや判定が正解を保証するわけではありません。
ひよこ ひよこ
機械学習の分類は、何をするの?
ペンギン先生 ペンギン先生
入力がどのカテゴリに属するかを予測するよ。たとえば、正解の付いたメールを使って学習し、新しいメールが迷惑メールか通常のメールかを判定する。予測なので、間違えることもあるんだ。
ひよこ ひよこ
回帰やクラスタリングとは違う?
ペンギン先生 ペンギン先生
回帰は価格などの数値を予測するタスク。分類は決めたカテゴリを予測する。クラスタリングは、正解のカテゴリを使わずに似たデータをまとめる方法だよ。見た目が仕分けでも、目的や学習の仕方が違う。
ひよこ ひよこ
分類は、いつも二択?
ペンギン先生 ペンギン先生
二クラス分類だけではないよ。犬・猫・鳥などから一つを選ぶ多クラス分類もある。「料理」と「旅行」の両方を付けるように、複数のラベルを同時に予測する場合もある。カテゴリ同士が排他的かも考えよう。
ひよこ ひよこ
迷惑メールのスコアが0.7なら、迷惑メール?
ペンギン先生 ペンギン先生
どこから迷惑メールと判定するかという、しきい値によるよ。説明用に0.5以上と決めれば該当し、0.8以上なら該当しない。スコアがどんな意味を持つかも確認し、通常メールを遮断する損失と、迷惑メールを見逃す損失を考える。
ひよこ ひよこ
正解率99%なら、安心?
ペンギン先生 ペンギン先生
そうとは限らない。通常メール99通と迷惑メール1通を、全部「通常」と予測しても99%だ。その1通は見逃しているよ。迷惑メールのどれだけを見つけたか、迷惑メールと判定した中でどれだけが正しかったかなども確認するんだ。
もっと詳しく知りたい人へ

多クラス分類は、二択を繰り返す?

そのように組み合わせる方法も、複数のカテゴリを直接扱えるモデルもあります。カテゴリの数と、モデルの内部でどう解くかは別です。複数ラベルを同時に付けるタスクとも区別します。

しきい値を下げれば、品質が上がる?

迷惑メールと判定する範囲は広がりますが、通常メールを誤って遮断する場合も増えます。同じ評価データで、見逃し・誤判定と利用上の損失を比べて決めます。スコアだけで確実な正解が分かるわけではありません。

ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「分類」って出てきたら「入力がどのカテゴリに属するかを予測するタスク」と思えばだいたいOK!
📖 おまけ:英語の意味
「Classification」 = 分類・区分
💬 機械学習では、入力に対してカテゴリを予測するタスクを指します。

参考資料

← 用語集にもどる