【もでるあっしゅく】
モデル圧縮 とは?
最終更新:
💡 AIを身軽にして、使う場所に合わせる
AIモデルの保存容量、必要メモリや計算の負担を減らす技術の総称。量子化、プルーニング、知識蒸留などがある。小ささと予測品質、実行速度のバランスを、用途と機器で確認する。
📌 このページのポイント
AIモデルは、なぜ圧縮するの?
量子化とプルーニングは、何が違うの?
知識蒸留は、ファイルを縮めること?
教師モデルの出力などを手掛かりに、生徒となる小さなモデルを学習させる方法だよ。元のファイルをZIPのように圧縮し、解凍して完全に同じモデルへ戻す話ではない。より小さなモデルで、必要な仕事ができるように学習するんだ。
小さくすれば、必ず速くなる?
答えの品質は、どう確かめるの?
もっと詳しく知りたい人へ
BitNetの「1ビット」は、重みが2種類だけということ?
方式によります。2024年のBitNet b1.58論文では、線形層の重みを-1・0・+1の3値にして、初めから学習する方式を説明しています。「1ビット系」という呼び方だけで2値と決めつけたり、既存のモデルを後から変換する量子化と同じに考えたりしないことが大切です。速度や品質の結果も、論文のモデル・学習・実行条件での結果です。
まとめ:ざっくりこれだけ覚えればOK!
「モデル圧縮」って出てきたら「AIモデルを小さく軽くして使いやすくする技術」と思えばだいたいOK!
📖 おまけ:英語の意味
「Model Compression」 = モデルの圧縮
💬 compressionは圧縮。モデルを小さく軽くするという意味で、ZIPのように解凍して元へ戻す方法とは限らないよ。
参考資料
- TensorFlow — Model optimization(目的、各手法)
- TensorFlow — Post-training quantization(表現の精度と機器)
- TensorFlow — Trim insignificant weights(ゼロ化と疎なモデル)
- TensorFlow — Sparse weights using structural pruning(対応機器と速度・品質)
- Keras — Knowledge Distillation(教師モデルと生徒モデルの学習)
- Ma et al. — The Era of 1-bit LLMs(BitNet b1.58の3値と学習方式)