【くらすたりんぐ】
クラスタリング とは?
最終更新:
💡 答えのラベルなしで、似たものの集まりを探す
正解のグループ名を与えず、データの特徴や距離などに基づいて似たものをまとめる教師なし学習の手法。結果は、選んだ特徴・尺度・アルゴリズム・設定によって変わる。
📌 このページのポイント
- 正解ラベルを与えず、特徴に基づいてグループを作る
- k-meansはグループ数kを指定し、中心との距離を使う
- DBSCANは密度を使い、グループ数を先に決めずに扱える
- 特徴や尺度・設定で結果は変わり、グループの意味は解釈が必要
分類とクラスタリングは、何が違うの?
教師ありの分類では、スパム・正常などの正解ラベルを使って学ぶよ。クラスタリングではその答えを与えず、特徴や距離などから集まりを探すんだ。できたグループ番号が、そのまま意味のある名前になるわけではないよ。
k-meansは、どう動くの?
まずグループ数kと初期の中心を決める。各データを近い中心へ割り当て、グループの平均で中心を更新する、という手順を繰り返すよ。一定の変化量や反復数などで打ち切る。初期中心の選び方にはランダムやk-means++などがあるんだ。
例えば、何をグループにできる?
顧客の購入回数や購入金額などの特徴で、似た買い方の集まりを探す例があるよ。ただし、金額と回数の単位や大きさをどうそろえるかでも結果が変わる。グループの特徴を見て、何を表すかを人が解釈するんだ。
どんな形の集まりでも見つかる?
手法によるよ。k-meansは細長い集まりや輪のような形を扱うのが苦手な場合がある。DBSCANは密度に基づき、複雑な形やノイズを扱えるけれど、距離の設定や集まりごとの密度の違いにも影響される。どちらかが必ず正解、とは限らないんだ。
グループ分けできたら、分析は終わり?
使った特徴、設定を変えたときの安定性、目的に合う結果かを確認しよう。離れた点がノイズと判断されても、それだけで不正や故障と確定するわけではないよ。「計算上の集まり」と「その理由や業務上の意味」を分けて考えるとよいね。
まとめ:ざっくりこれだけ覚えればOK!
「クラスタリング」って出てきたら「正解ラベルなしで、似たデータの集まりを探す方法」と思えばだいたいOK!
📖 おまけ:英語の意味
「Clustering」 = 集まり・固まり(をつくること)
💬 Clusterは「ぶどうの房」や「星団」のように「同じものが集まったかたまり」という意味だよ