【きょうしなしがくしゅう】

教師なし学習 とは?

最終更新:
💡 正解ラベルなしで、データの構造を探す

学習時に正解ラベルを与えず、データの分布や構造を捉える機械学習の方法。クラスタリングや次元削減などに使う。結果は特徴量や手法の設定に左右され、見つかったまとまりの意味や有用性を確認する必要がある。

📌 このページのポイント
正解ラベルを与えず、構造を探す 入力:ラベルなし 結果:分け方の一例 学習 同じ9点を、近さに基づいてグループ分け クラスタ数や距離の決め方は手法・設定による ほかに次元削減などもある 結果の意味や役立ち方は、別に確認する
色は学習後のグループを示す説明用の例。正解の分類や計算済みの実験結果ではない。
ひよこ ひよこ
正解ラベルなしで何を学ぶの?
ペンギン先生 ペンギン先生
データの分布や構造を捉えるよ。たとえば購買回数や金額が近い会員をグループに分ける。最初から「常連」などの正解ラベルを教えるわけではないんだ。
ひよこ ひよこ
グループの意味も分かるの?
ペンギン先生 ペンギン先生
計算で似たデータをまとめても、グループの意味や用途は別に確かめる必要があるよ。どんな特徴が多いかを見て、目的に合う分け方か検討するんだ。
ひよこ ひよこ
何個に分けるかも自動?
ペンギン先生 ペンギン先生
手法によるよ。k-meansはクラスタ数kを指定する。一方、DBSCANは近傍の範囲などを設定する方法で、最初にクラスタ数を指定する仕組みではない。同じデータでも設定で結果が変わるんだ。
ひよこ ひよこ
次元削減はグループ分けと同じ?
ペンギン先生 ペンギン先生
別の処理だよ。たとえばPCAは、データのばらつきを捉える軸へ変換する。少数の軸に絞れば、可視化や後の計算に使える。ただし落とした情報もあるので、目的に合うか確かめるよ。
ひよこ ひよこ
異常検知も教師なし学習なの?
ペンギン先生 ペンギン先生
ラベルなしのデータから外れた点を探す方法もあるよ。ただし、正常と分かっているデータから未知の異常を探す方法などもあり、異常検知がすべて同じ学習条件とは限らないんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「教師なし学習」って出てきたら「正解なしでデータのかたまりや構造を自動発見する学習方法だな」と思えればだいたいOK!
📖 おまけ:英語の意味
「Unsupervised Learning」 = 教師信号を与えない学習
💬 Unsupervisedは「監督されていない」という意味。ここでの教師は、学習時に与える正解ラベルなどの教師信号を指すよ。

参考資料

← 用語集にもどる