【きょうしなしがくしゅう】
教師なし学習 とは?
最終更新:
💡 正解ラベルなしで、データの構造を探す
学習時に正解ラベルを与えず、データの分布や構造を捉える機械学習の方法。クラスタリングや次元削減などに使う。結果は特徴量や手法の設定に左右され、見つかったまとまりの意味や有用性を確認する必要がある。
📌 このページのポイント
正解ラベルなしで何を学ぶの?
データの分布や構造を捉えるよ。たとえば購買回数や金額が近い会員をグループに分ける。最初から「常連」などの正解ラベルを教えるわけではないんだ。
グループの意味も分かるの?
計算で似たデータをまとめても、グループの意味や用途は別に確かめる必要があるよ。どんな特徴が多いかを見て、目的に合う分け方か検討するんだ。
何個に分けるかも自動?
手法によるよ。k-meansはクラスタ数kを指定する。一方、DBSCANは近傍の範囲などを設定する方法で、最初にクラスタ数を指定する仕組みではない。同じデータでも設定で結果が変わるんだ。
次元削減はグループ分けと同じ?
別の処理だよ。たとえばPCAは、データのばらつきを捉える軸へ変換する。少数の軸に絞れば、可視化や後の計算に使える。ただし落とした情報もあるので、目的に合うか確かめるよ。
異常検知も教師なし学習なの?
ラベルなしのデータから外れた点を探す方法もあるよ。ただし、正常と分かっているデータから未知の異常を探す方法などもあり、異常検知がすべて同じ学習条件とは限らないんだ。
まとめ:ざっくりこれだけ覚えればOK!
「教師なし学習」って出てきたら「正解なしでデータのかたまりや構造を自動発見する学習方法だな」と思えればだいたいOK!
📖 おまけ:英語の意味
「Unsupervised Learning」 = 教師信号を与えない学習
💬 Unsupervisedは「監督されていない」という意味。ここでの教師は、学習時に与える正解ラベルなどの教師信号を指すよ。