【ろらりょうしか】
LoRA量子化 とは?
最終更新:
💡 ベースを軽く保持し、追加した小さな部分を学習する
量子化したベースモデルとLoRAの追加学習を組み合わせる方法。代表的なQLoRAは4ビットのベースを固定し、LoRAアダプタを学習する。全体の必要メモリや得られる品質は、モデル・データ・設定で変わる。
📌 このページのポイント
LoRAに、何を足したの?
固定したベースは、計算しない?
計算には使うよ。ベースを通じて勾配を伝え、アダプタの更新へつなぐ。固定というのは、ベースの重みを学習で更新しないという意味だよ。入力から出力への計算を飛ばす、ということではないんだ。
計算も、全部4ビットなの?
24GBのGPUで70Bモデルを学べる?
品質を保証する仕組みではないよ。論文は評価した条件での結果を示しているので、自分の用途では学習後のモデルを確かめよう。データの品質、量子化の設定、学ぶ対象によって結果は変わる。メモリが一律10分の1になる、精度が必ず同じになる、と決めつけずに比べるんだ。
📖 おまけ:英語の意味
「QLoRA: Efficient Finetuning of Quantized LLMs」 = 量子化した大規模言語モデルの効率的な追加学習
💬 Dettmersらが2023年5月に発表した手法。量子化による保持メモリの削減と、低ランクの追加部分を学ぶLoRAを組み合わせるよ。