最終更新:

Ollamaで使えるモデル比較2026年版 — Llama・Gemma・Mistral・Qwenを徹底解説


Ollamaモデル比較 2026 モデル名 サイズ RAM目安 日本語 おすすめ用途 Llama 3.x Meta 1B〜70B 4GB〜64GB △ 汎用会話・推論 Gemma 3 Google 1B〜27B 4GB〜32GB ○ 軽量・入門に最適 Mistral/Mixtral Mistral AI 7B〜47B 8GB〜48GB △ 効率重視・欧文 Qwen 2.5 Alibaba 0.5B〜72B 2GB〜80GB ◎ 日本語・多言語 Qwen2.5-Coder Alibaba 1.5B〜32B 4GB〜40GB ○ コーディング特化 日本語対応: ◎ 非常に得意 ○ 対応 △ 基本対応 RAM目安は最小サイズ〜最大サイズの範囲。実際は量子化設定で変わる場合あり。 入門おすすめ: ollama pull gemma3:4b 日本語重視: ollama pull qwen2.5:7b
Ollamaで使える主要LLMモデルの比較(2026年4月版)
ひよこ ひよこ
Ollamaをインストールしてみたんだけど、モデルがたくさんありすぎて何を選べばいいかわからないよ〜!
ペンギン先生 ペンギン先生
わかるよ〜!Ollamaのライブラリには100種類以上のモデルがあるからね。まず「自分は何のためにLLMを使いたいか」を決めると絞りやすくなるよ。
ひよこ ひよこ
モデルを選ぶとき、まず何を見ればいいの?
ペンギン先生 ペンギン先生
3つのポイントを見るといいよ。①パラメータ数(モデルの大きさ)、②使う言語(日本語対応してるか)、③用途(会話・コーディング・要約など)。この3つを組み合わせて選ぶんだ。
ひよこ ひよこ
パラメータ数って何なの?「7B」とか「70B」ってよく見るけど…
ペンギン先生 ペンギン先生
Bは「Billion(10億)」のことで、モデルの重みパラメータの数を表してるよ。7Bなら70億個のパラメータってこと。大きいほど賢いけど、必要なRAMも増えるんだ。目安はこんな感じ: 3B→RAM4GB以上、7B/8B→RAM8GB以上、14B→RAM16GB以上、70B→RAM64GB以上だよ。
ひよこ ひよこ
じゃあRAMが少ないPCだと大きいモデルは動かないんだね…。Llama 3っていうのはよく聞くけど、どんなモデルなの?
ペンギン先生 ペンギン先生
Llama 3はMeta(Facebookの親会社)が作ったオープンソースのモデルだよ。バージョンが3.1・3.2・3.3とあって、Llama 3.1は8Bと70Bの2サイズ展開で汎用性が高い。3.2は軽量化した1B・3Bも登場して、スマホや低スペックPCでも動くようになったんだ。3.3は70Bクラスとして今も現役の実用モデルだよ。上位にはLlama 4(Scout・Maverick)もあるけど、総パラメータが109B〜400BクラスのMoE構成で必要メモリが大きいから、普通のPCでOllamaを動かすなら3.3の70Bの方が現実的だね。
ひよこ ひよこ
LlamaはMetaなんだね!Googleは何か出してるの?
ペンギン先生 ペンギン先生
GoogleはGemma 4を出してるよ(2026年にGemma 3から刷新されたんだ)。E2B・E4B・12B・26B(MoE)・31Bとサイズ展開があって、12B以上はテキスト・画像に加えて音声まで理解できる「軽量なのに高性能」なモデルなんだ。特にGemma 4のE4Bは同サイズのLlamaより賢いと言われてて、ローカルLLM入門として超おすすめだよ。
ひよこ ひよこ
Mistralってのも聞いたことある!フランスの会社だよね?
ペンギン先生 ペンギン先生
そうそう、フランスのスタートアップMistral AIのモデルだよ。定番のMistral 7Bはコンパクトなのにかなり賢くて、昔から人気があるんだ。今の主力は「Mistral Small」シリーズで、3.2やその後継は画像入力や関数呼び出しの精度が上がっててビジネス用途にも強いよ。MoE構成のMixtral(8x7B・8x22B)も健在で、効率重視なら今も選択肢に入るね。
ひよこ ひよこ
Qwenも気になる!日本語が得意って聞いたけど…
ペンギン先生 ペンギン先生
今の主力はQwen 3.5だよ(2026年にQwen 2.5から大きく進化したんだ)。Alibabaが作ったモデルで、多言語対応がとにかく強いんだ。特に日本語・中国語・韓国語などアジア系言語の精度が高くて、Llama 3より日本語の文章が自然なことも多いよ。0.8B〜397B(MoE)まで超細かいサイズ展開に加えて、画像入力や256Kトークンの長文脈にも対応してるのが魅力だね。
ひよこ ひよこ
プログラミングの補助に使いたいときは専用モデルがあるの?
ペンギン先生 ペンギン先生
あるよ!今のコーディング特化モデルの代表は「Qwen3-Coder」だね。30B(実際に動く部分は3B程度のMoE構成)でも実務レベルのコード補完やリポジトリ全体の理解ができて、256K〜最大1Mトークンの長いコードベースにも対応してるんだ。以前定番だったCodellamaは今ではすっかり型落ちで、コードを書く用途ならQwen3-Coderを選んでおけば間違いないよ。
ひよこ ひよこ
日本語をメインに使いたい場合は、どのモデルがいいの?
ペンギン先生 ペンギン先生
日本語優先なら、まずQwen 3.5を試してみてほしいな。次にELYZA(日本語特化でLlamaベース)も有名だよ。Gemma 4も日本語・多言語対応が改善されてきてる。「ollama pull elyza:jp8b」みたいにコマンドを打つだけで使えるから、気軽に試せるよ。
ひよこ ひよこ
M1/M2のMacを持ってるんだけど、おすすめのモデルってある?
ペンギン先生 ペンギン先生
M1/M2 MacはAppleシリコンの統合メモリが強みで、16GBなら8Bモデルが快適に動くよ。おすすめはGemma 4のE4B〜12Bか、Llama 3.1の8Bだね。MetalによるGPUアクセラレーションがOllamaで自動で使われるから、CPUオンリーのWindowsより速いことも多いんだ。
ひよこ ひよこ
GPU無しのWindowsだとどのくらいのモデルまで動くの?RAM別に教えて!
ペンギン先生 ペンギン先生
CPUのみでのRAM別目安はこんな感じだよ。RAM8GB→3B〜7Bモデルが限界(速度は遅め)。RAM16GB→8B〜14Bモデルが実用的に動く。RAM32GB→30B前後も試せる。ただしCPUだと70Bは現実的じゃない。まずはGemma 4のE2BやE4Bから試してみるといいよ!
ひよこ ひよこ
実際にモデルを入れるときってどうやるの?コマンドが難しそう…
ペンギン先生 ペンギン先生
全然難しくないよ!ターミナルで「ollama pull モデル名」を打つだけ。例えばGemma 4のE4Bなら「ollama pull gemma4:e4b」、Qwen 3.5の4Bなら「ollama pull qwen3.5:4b」だね。ダウンロード後は「ollama run gemma4:e4b」で即チャットが始まるよ。
ひよこ ひよこ
モデルの賢さって数字で比較できるの?ベンチマークって聞いたことある!
ペンギン先生 ペンギン先生
そうだよ!よく使われるのはMMLU(一般知識テスト)とHumanEval(コーディングテスト)だね。2026年後半時点だと、Gemma 4のE4Bや中型のQwenモデルが、もっと大きいMoEモデルに匹敵するスコアを出して話題になってるんだ。ただしベンチマークが全てじゃなくて、実際に使ってみた使い心地も大事だよ。
ひよこ ひよこ
用途別でズバリ「これ使え!」ってモデルを教えてほしい!
ペンギン先生 ペンギン先生
じゃあズバリ言うよ!普通の会話・質問応答→Gemma 4のE4Bか12B。コーディング補助→Qwen3-Coderの30B。日本語重視→Qwen 3.5の4Bかelyza:jp8b。軽量で手軽に試したい→Gemma 4のE2BかE4B。高品質を求める(RAMに余裕あり)→Llama 3.3の70BかQwen 3.5の122Bだよ。
ひよこ ひよこ
2026年って新しいモデルがどんどん出てきてるよね?最新トレンドはどうなってるの?
ペンギン先生 ペンギン先生
2026年は「小型モデルの大躍進」の時代だよ!最新の商用モデルに迫る性能の4B〜27Bクラスのモデルが続々と登場してて、ローカルで動かすハードルがどんどん下がってる。ビジョン対応(画像を理解できる)はもう当たり前になって、Gemma 4みたいに音声入力まで扱えるモデルも出てきたんだ。テキスト・画像・音声をまとめて扱う「マルチモーダルなローカルAI」が新しいトレンドだね。
ひよこ ひよこ
すごい!ローカルでここまでできる時代なんだね。まずGemma 4のE4Bから試してみようかな!
ペンギン先生 ペンギン先生
それがベストな入門だと思うよ!「ollama pull gemma4:e4b」でダウンロードして「ollama run gemma4:e4b」で起動すれば5分で使い始められるよ。慣れてきたらQwen3-Coderでコーディング補助も試してみてね。自分のPCでLLMが動く感動、ぜひ味わってほしいな!