【じょうほうえんとろぴー】

情報エントロピー とは?

最終更新:
💡 1回の驚きではなく、結果全体の「平均の予測しにくさ」

結果の確率分布から、平均的な予測しにくさを数値にする指標。離散的な結果では、それぞれの情報量を確率で重み付けして平均する。対数の底を2にすると単位はビット。情報源の圧縮や、決定木の分割基準などに使う。

📌 このページのポイント
結果全体の、平均の予測しにくさ 公平なコイン 必ず表のコイン 表 裏 表 50% 50% 100% H = 1ビット H = 0ビット H = −Σ p log₂ p 底2の対数/確率0の項は0として扱う
左右とも結果は表と裏の2通りという例です。公平な場合の1ビットは、この2通りに限った最大値。Hは各結果の情報量を確率で重み付けした平均で、まれな出来事1回の情報量とは区別します。色はコインの面や比較を示し、高いほど危険という意味ではありません。
ひよこ ひよこ
情報エントロピーって、情報に「乱雑さ」があるってこと?
ペンギン先生 ペンギン先生
見た目が散らかっているという意味ではないよ。どの結果がどの確率で起きるかから、結果全体の平均的な予測しにくさを測る。まれな雪の知らせ1回の情報量と、天気全体のエントロピーは区別するんだ。
ひよこ ひよこ
コイン投げだとどうなるの?
ペンギン先生 ペンギン先生
表と裏が50%ずつなら1ビットで、2通りの結果に限れば最大だよ。表が100%と分かっていれば0。最大1ビットというのはコインの例で、結果の種類がもっと多ければ1ビットを超えることもあるんだ。
ひよこ ひよこ
どう計算するの?
ペンギン先生 ペンギン先生
確率pの結果1回の情報量は、底2なら−log₂ p。それを各結果の確率で重み付けして足すと、H = −Σ p log₂ pになるよ。公平なコインなら0.5×1を2つ足して1ビット。確率0の項は0として扱うんだ。
ひよこ ひよこ
データ圧縮とどう関係するの?
ペンギン先生 ペンギン先生
情報源の確率モデルや結果同士の依存関係を考えると、可逆圧縮の平均的な符号長の限界に関係するよ。繰り返しなど予測できる規則は圧縮に役立つ。ただし短いファイルやZIPには管理情報もあり、文字の出現頻度だけで最終サイズが決まるわけではないんだ。
ひよこ ひよこ
機械学習でも使うの?
ペンギン先生 ペンギン先生
分類の決定木では、ラベルがどれだけ混ざっているかを測る基準に使えるよ。親のエントロピーから、分割後の子のエントロピーの重み付き平均を引いたものが情報利得。すべての決定木がこの基準を使うわけではなく、ジニ不純度などを使う場合もあるんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「情報エントロピー」って出てきたら「確率から求めた、平均的な予測しにくさ」と思えばだいたいOK!
📖 おまけ:英語の意味
「Information Entropy」 = 情報の不確実さを表すエントロピー
💬 シャノンの1948年の論文で扱われた概念だよ。確率と対数の形が統計力学のエントロピーに対応するため、この名前を使っているんだ

参考資料

← 用語集にもどる