【けーみーんずほう】
k-means法(k平均法) とは?
最終更新:
💡 近い点を集めて、グループの中心を更新
数値データを、中心との距離を使ってk個のクラスタへ分ける教師なし学習の手法。割り当てと平均の更新、クラスタ数の選び方、初期値やデータの形による限界を説明します。
📌 このページのポイント
- 正解ラベルを使わず、数値データをk個のクラスタに分ける
- 近い中心への割り当てと、各グループの平均の更新を繰り返す
- kを先に指定し、初期値や特徴量の尺度も確認する
- グループの業務上の意味は、人が結果を見て判断する
k-meansは、どう分けるの?
k個の中心を用意し、各データを最も近い中心のグループへ割り当てる。その後、各グループの平均で中心を更新するよ。割り当てと更新を繰り返し、中心の変化が小さくなるなどの条件で止めるんだ。
顧客なら、優良・休眠・新規に分かれる?
購買金額や頻度などでグループを作ることはできるけど、その名前や意味が自動で決まるわけではないよ。結果を調べて業務上の意味を考える必要がある。金額と回数など、数値の尺度の違いにも注意しよう。
kは、どう選ぶの?
いくつかのkで試し、分かれ方やシルエットなどの指標、使う目的を比べるよ。指標だけで唯一の正解が決まるわけではない。例えば公式のシルエット分析の例でも、2個と4個のどちらがよいか一意には決めにくい場合があるんだ。
どんなデータでも、きれいに分けられる?
初期値で結果が変わり、最良の分け方に必ず到達するわけではないよ。k-means++は初期の中心を選ぶ工夫。細長い集まりや複雑な形ではうまく分かれないこともあるので、目的とデータに合わせて方法を比べよう。
まとめ:ざっくりこれだけ覚えればOK!
「k-means」って出てきたら「中心との距離でデータをk個のグループに分ける手法」と思えばだいたいOK!
📖 おまけ:英語の意味
「k-means」 = k個の平均
💬 kはグループの数、meansは「平均」。各グループの平均(中心点)を使ってデータを分類することからこの名前がついたよ