【ぶんるい】
分類(機械学習) とは?
最終更新:
💡 入力が、どのカテゴリに属するかを予測
入力がどのカテゴリに属するかを予測する機械学習のタスク。回帰・クラスタリングとの違い、判定のしきい値と評価指標を解説します。
📌 このページのポイント
機械学習の分類は、何をするの?
入力がどのカテゴリに属するかを予測するよ。たとえば、正解の付いたメールを使って学習し、新しいメールが迷惑メールか通常のメールかを判定する。予測なので、間違えることもあるんだ。
回帰やクラスタリングとは違う?
回帰は価格などの数値を予測するタスク。分類は決めたカテゴリを予測する。クラスタリングは、正解のカテゴリを使わずに似たデータをまとめる方法だよ。見た目が仕分けでも、目的や学習の仕方が違う。
分類は、いつも二択?
二クラス分類だけではないよ。犬・猫・鳥などから一つを選ぶ多クラス分類もある。「料理」と「旅行」の両方を付けるように、複数のラベルを同時に予測する場合もある。カテゴリ同士が排他的かも考えよう。
迷惑メールのスコアが0.7なら、迷惑メール?
どこから迷惑メールと判定するかという、しきい値によるよ。説明用に0.5以上と決めれば該当し、0.8以上なら該当しない。スコアがどんな意味を持つかも確認し、通常メールを遮断する損失と、迷惑メールを見逃す損失を考える。
正解率99%なら、安心?
そうとは限らない。通常メール99通と迷惑メール1通を、全部「通常」と予測しても99%だ。その1通は見逃しているよ。迷惑メールのどれだけを見つけたか、迷惑メールと判定した中でどれだけが正しかったかなども確認するんだ。
もっと詳しく知りたい人へ
多クラス分類は、二択を繰り返す?
そのように組み合わせる方法も、複数のカテゴリを直接扱えるモデルもあります。カテゴリの数と、モデルの内部でどう解くかは別です。複数ラベルを同時に付けるタスクとも区別します。
しきい値を下げれば、品質が上がる?
迷惑メールと判定する範囲は広がりますが、通常メールを誤って遮断する場合も増えます。同じ評価データで、見逃し・誤判定と利用上の損失を比べて決めます。スコアだけで確実な正解が分かるわけではありません。
まとめ:ざっくりこれだけ覚えればOK!
「分類」って出てきたら「入力がどのカテゴリに属するかを予測するタスク」と思えばだいたいOK!
📖 おまけ:英語の意味
「Classification」 = 分類・区分
💬 機械学習では、入力に対してカテゴリを予測するタスクを指します。