【りょうしか(えーあいもでる)】
量子化(AIモデル) とは?
最終更新:
💡 数値の表し方を小さくして、AIモデルを軽くする
AIモデルの重みや活性値などを、少ないビット数の数値表現に変換する手法。容量や計算負荷の削減を狙うが、出力品質や速度への影響はモデル・方式・機器で異なる。
📌 このページのポイント
量子コンピューターを使うってこと?
小数を整数にすると、元の値が分からなくならない?
整数量子化では、スケールとゼロ点などを一緒に使うよ。単純な例なら、スケール0.01・ゼロ点0で整数31を0.31に対応させる。0.314159は近い値に丸められるので誤差が生じるんだ
モデルの性能はほとんど変わらないの?
保てる場合もあるけど、必ず小さな低下で済むとは限らないよ。どの数値を量子化するかや、使う入力によって出力品質への影響が違う。モデルに合う方式を選んで、量子化前後を評価するんだ
70Bのモデルなら、4ビットで35GBあれば足りる?
学習後でもできる?高速になる?
学習済みモデルに適用するPTQと、学習時に量子化の影響を考慮するQATがあるよ。速度は対応する演算や機器に依存し、変換の負荷で遅くなる場合もある。使用メモリと出力品質と速度を、使う環境で確認しよう
📖 おまけ:英語の意味
「Quantization」 = 値を限られた段階で表すこと(量子化)
💬 数値を一定の段階へ対応させる意味だよ。このページではAIモデルの数値表現を扱い、量子コンピューターを使うという意味ではないんだ