【きゅーろーら】
QLoRA とは?
公開:
💡 「70BモデルをノートPC1台で学習」——量子化とLoRAを合わせた省エネファインチューニング革命
量子化(Quantization)とLoRAを組み合わせた効率的なファインチューニング手法。4bitに量子化したモデルにLoRAアダプタを適用し、コンシューマGPUで大型LLMをファインチューニングできる。
📌 このページのポイント
- 4bit量子化で必要VRAMを75%以上削減
- LoRAアダプタのパラメータだけ更新するため高速
- 24GB GPUで65Bモデルのファインチューニングを実現
- Hugging Face PEFTライブラリで簡単に使える
そんなに節約できるの?どういう仕組みなの?
圧縮してから少ないパラメータだけ学習するんだね!精度は落ちないの?
なるほど、うまく分けてるんだね!Hugging Faceで使えるって気軽に試せそうだね!
そうだよ。PEFTとbitsandbytesライブラリを入れれば数行のコードで始められるんだ。2023年の登場で「個人でも大型LLMをファインチューニングできる」という常識が一気に広まった革命的な技術だよ。
まとめ:ざっくりこれだけ覚えればOK!
📖 おまけ:英語の意味
「Quantized LoRA」 = 量子化されたLoRA
💬 2023年にワシントン大学のDettmers らが発表。個人レベルで大型LLMのファインチューニングを可能にした画期的な論文だよ。