【すけーりんぐそく】

スケーリング則(Chinchilla) とは?

最終更新:
💡 モデルの大きさと学習量を、予算に合わせる

Chinchillaのスケーリング則は、言語モデルの学習計算量をモデルサイズと学習トークン数へどう配分するかを研究した経験則。「約20倍」の意味と適用条件、推論コストを重視する場合との違いを解説します。

📌 このページのポイント
Chinchilla:モデルと学習量の配分2022年の論文:同程度の学習計算予算Gopherパラメータ:2800億学習:3000億トークンより大きいモデルChinchillaパラメータ:700億学習:1.4兆トークン小さいモデルを多く学習1.4兆 ÷ 700億 ≈ 20(このモデルの比率)20倍が、すべての目的に最適とは限らない
HoffmannらのTable 1に基づく比較で、ネットワーク記号の大きさは模式的です。Chinchillaは論文の評価でGopherを上回りましたが、学習設定や推論予算の重視によって配分は変わります。
ひよこ ひよこ
モデルを大きくすれば、必ず良くなるという法則?
ペンギン先生 ペンギン先生
そう単純ではないよ。Chinchillaの研究は、決めた学習計算量の中で、モデルのパラメータ数と学習トークン数をどう配分すると損失が小さくなるかを調べたんだ。実験から推定した経験則で、すべての能力を保証する定理ではないよ。
ひよこ ひよこ
よく聞く「20倍」って何?
ペンギン先生 ペンギン先生
研究で作ったChinchillaは700億パラメータを1.4兆トークンで学習したので、割ると約20になるよ。推定方法や規模でも値は変わるから、どんなモデルでも20倍が必ず最適、という読み方は避けよう。トークン数は文字数でも文書数でもないんだ。
ひよこ ひよこ
それまでの大きなモデルと何が違ったの?
ペンギン先生 ペンギン先生
同程度の学習計算予算を使うGopherは2800億パラメータ、3000億トークンだったよ。Chinchillaは小さいモデルを多くのトークンで学習し、論文の評価でGopherを上回った。ただし性能を一本の直線で表せるわけではなく、学習設定などの違いもあるんだ。
ひよこ ひよこ
今のモデルも、この比率に合わせればいい?
ペンギン先生 ペンギン先生
目的次第だよ。学習計算量の効率だけでなく、利用時の推論コストも大事。Llama 3の論文では、小型モデルを学習計算上の最適点より長く学習し、同じ推論予算での性能を重視したと説明している。20倍を超えたから無駄、とは言えないんだ。
ひよこ ひよこ
データを増やすだけで、正確さも安全性も上がる?
ペンギン先生 ペンギン先生
それも保証できないよ。重複、品質、分野、モデル構造、学習方法によって結果は変わる。元の研究の計算量と損失の関係は設計の参考になるけど、欲しい能力や安全性は別に評価しよう。
もっと詳しく知りたい人へ

学習計算量が一定なのに、モデルとデータを両方増やすの?

一定の予算では、モデルを大きくすると学習できるトークン数を減らすなどの配分が必要です。「両方をおおむね同じ割合で増やす」という結果は、計算予算自体を増やす場合の最適配分の推定です。同じ予算のまま両方を倍増できる、という意味ではありません。

ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「Chinchillaのスケーリング則」って出てきたら「学習の計算予算を、モデルの大きさと学習量に配分する研究上の指針」と思えばだいたいOK!
📖 おまけ:英語の意味
「Chinchilla Scaling Laws」 = チンチラ・スケーリング則
💬 DeepMindが論文で使ったモデル名がChinchilla(げっ歯類のチンチラ)だったことから、この名前で呼ばれているよ

参考資料

← 用語集にもどる