【ジージーユーエフ】

GGUF とは?

最終更新:
💡 推論用のモデルと設定をまとめるファイル形式

GGMLやllama.cppなどで推論に使うモデルを保存するバイナリファイル形式。重みとモデルの設定などを格納でき、浮動小数点の重みも量子化された重みも扱う。実行には対応するソフトウェアと十分なメモリが必要。

📌 このページのポイント
GGUF:モデルの重みと設定を保存 model.ggufヘッダー・メタデータモデルの設定などトークナイザー情報文字とトークンの対応など重みのテンソルF32 / F16 / 量子化形式量子化専用ではないllama.cpp対応モデルを推論Ollama取り込み設定で利用分割ファイルや補助モデルを使う構成もある対応ソフトウェア・必要メモリを確認
主な格納内容と利用先の例です。形式だけで起動や速度は決まらず、モデルと重みの形式への対応、メモリなどの実行条件が関わります。
ひよこ ひよこ
GGUFって、AIを動かすアプリなの?
ペンギン先生 ペンギン先生
モデルの情報を保存するファイル形式だよ。実行ソフトウェアそのものではない。対応するllama.cppなどが読み込み、モデルの構造や重みを使って推論する。OllamaにもGGUFを取り込む方法があるよ。
ひよこ ひよこ
GGUFなら全部量子化済み?
ペンギン先生 ペンギン先生
量子化した重みだけでなく、F32やF16などの浮動小数点の重みも保存できるよ。GGUFは入れ物の形式、量子化は重みの表現を変えて容量などを抑える方法なので、分けて考えよう。
ひよこ ひよこ
Q4_K_MやQ5_K_Sは何を表すの?
ペンギン先生 ペンギン先生
重みの量子化方式を区別する名前だよ。同じモデルでも方式によって容量や出力品質が変わる。混合した精度を使う方式もあるので、「Q4なら全ての重みがちょうど4ビット」とは限らない。用途に合うか実際に評価することも大切だね。
ひよこ ひよこ
一つのファイルがあれば必ず動く?
ペンギン先生 ペンギン先生
重みや読み込み用の情報をまとめられるけれど、分割されたGGUFや補助モデルを使う構成もあるよ。実行ソフトウェアがモデルの構造と重みの形式に対応し、十分なメモリも必要。CPUで動かせる環境もあるけれど、速度は別に確かめるんだ。
ひよこ ひよこ
以前のGGML形式やSafetensorsとは違う?
ペンギン先生 ペンギン先生
GGUFは以前の形式を引き継ぎ、メタデータを追加しやすくした形式だよ。Safetensorsなどの重みを変換して使うこともある。ただし拡張子を変えるだけでは変換にならず、対応するモデルと変換ツールが必要なんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「GGUF」って出てきたら「推論に使うモデルの重みと設定などを保存する形式」と思えればだいたいOK!
📖 おまけ:英語の意味
「GGUF」 = GGML系のモデル保存形式の名前
💬 GGML、GGMF、GGJTに続く保存形式だよ。モデルの設定をキーと値で記録し、新しい情報を追加しやすくしているよ

参考資料

← 用語集にもどる