【ディープシーク】

DeepSeek とは?

最終更新:
💡 公開モデルで、効率的な学習と推論を探るDeepSeek

AI研究組織DeepSeekが開発・公開する大規模言語モデルのシリーズ。V3のようなMoEモデルや、推論能力を重視したR1、より小さい蒸留モデルなどがある。

📌 このページのポイント
MoE:一部のエキスパートを使う トークン の入力 ルーター 選ぶ Expert 1 選択 Expert 2 休止 Expert 3 選択 Expert 4 休止 結果を 合成 選択はトークンごとに変わる
V3の選択されるエキスパート部分を単純化した例。個数は実モデルと異なり、共有エキスパートやAttentionなどは省略しています。緑の矢印は選択した部分の計算の流れ。数学係などの固定担当ではありません。
ひよこ ひよこ
DeepSeekって一つのAIモデルなの?
ペンギン先生 ペンギン先生
開発組織の名前であり、公開するモデルのシリーズにも使われているよ。たとえばV3は文章やコードを扱う言語モデル、R1は推論能力を重視したモデル。ここではこの二つを例にするね。
ひよこ ひよこ
どうやって計算を効率化しているの?
ペンギン先生 ペンギン先生
V3はMoEを使い、トークンごとに一部のエキスパートを選んで計算するよ。「数学係」などの担当を人が固定しているわけではないんだ。共有エキスパートやAttentionなども働くので、選ばれた部分だけでモデル全体が完結するわけでもないよ。
ひよこ ひよこ
安く作れたって聞くけど、開発費全部の話?
ペンギン先生 ペンギン先生
V3の技術報告の費用は、そのモデルの正式な学習にかかったGPU時間をもとにした見積もりだよ。事前研究や実験の費用は含まない。開発総費用や別モデルの費用と、そのまま比べることはできないんだ。
ひよこ ひよこ
R1はどんなモデル?
ペンギン先生 ペンギン先生
強化学習などを使い、数学・コード・推論の課題で評価されたモデルだよ。R1から生成したデータで学習した小さい蒸留モデルもある。こちらはQwenやLlamaを基にしたDenseモデルで、全部がMoEではないんだ。性能は課題や設定によって変わるよ。
ひよこ ひよこ
自分のサーバーでも動かせるの?
ペンギン先生 ペンギン先生
公開された重みを使って動かす方法が案内されているよ。ただし必要なメモリや計算資源はモデルごとに違う。R1本体と蒸留版でも利用条件を確認しよう。重みの公開だけで、訓練データや開発過程の全てが公開されたとは言えないんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「DeepSeek」って出てきたら「V3やR1などを公開するAIモデルのシリーズ」と思えばだいたいOK!
📖 おまけ:英語の意味
「DeepSeek」 = 深く探す
💬 Deepは「深い」、Seekは「探す」という英語。DeepSeekは開発組織とモデル名に使われているよ。

参考資料

← 用語集にもどる