【ぷれとれーにんぐ】

プレトレーニング(事前学習) とは?

最終更新:
💡 後の利用の土台となるモデルを、先に学習する

モデルを後の利用や追加学習の土台として先に訓練すること。言語モデルでは次のトークン予測や穴埋めなどを使いますが、対象データや学習方法はモデルによって異なります。

📌 このページのポイント
事前学習:後の利用の土台を作る訓練データ目的・収集品質を確認事前学習次トークン予測など事前学習済みモデル後の利用に再利用する重みを更新して適応ファインチューニング等重みを更新せず利用プロンプト・特徴抽出等学習課題は方式による。追加学習は必須でない目的に合わせ性能・安全性を評価する
学習から再利用へ進み、目的に合わせて利用方法を選ぶ関係です。事前学習は言語モデルやラベルなし学習に限らず、全方式に同じ課題・規模・費用を当てはめません。
ひよこ ひよこ
AIが教科書を丸暗記すること?
ペンギン先生 ペンギン先生
文章のパターンなどを学ぶ訓練で、単にすべての文章を保存して読み返す仕組みではないよ。ただし訓練データを記憶してしまう問題もあるので、丸暗記とは違うから漏えいしない、とも言えないんだ。
ひよこ ひよこ
正解を人が付けなくても学習できる?
ペンギン先生 ペンギン先生
言語モデルでは文章の続きを予測させるなど、データ自体から予測対象を作れる。自己教師あり学習と呼ぶよ。人手で正解を付けた画像などで先に学習する方法もあり、事前学習がいつもラベルなしとは限らない。
ひよこ ひよこ
GPTとBERTは同じ学習なの?
ペンギン先生 ペンギン先生
GPT系は前のトークンから次を予測する自己回帰の方式が代表的。原論文のBERTは、一部のトークンを予測するMasked LMと、2文が続いているかを判定する課題を使う。すべてのモデルに同じ課題を当てはめないようにしよう。
ひよこ ひよこ
ペンギン先生 ペンギン先生
目的によるよ。BERTの論文は事前学習のパラメーターをタスク別の追加学習に使う一方、GPT-3の論文は重みを更新せず、入力に例を示す方法も評価している。再利用は追加学習だけではないんだ。
ひよこ ひよこ
事前学習済みなら、安心して使える?
ペンギン先生 ペンギン先生
正確な回答や安全な動作が必ず得られるわけではないよ。使う目的に合わせてモデルを評価しよう。費用もモデルの大きさ、データ量、計算設備で変わるので、すべてが数千万ドルと一律には言えないんだ。
もっと詳しく知りたい人へ

BERTは全トークンを15%隠す?

原論文では15%のトークン位置を予測対象に選びます。その選ばれた位置の80%を[MASK]へ、10%をランダムなトークンへ置き換え、残り10%は変えません。これは原論文の設定で、全事前学習に共通する割合ではありません。

ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「プレトレーニング」って出てきたら「後の利用の土台として先に行う学習」と思えばだいたいOK!
📖 おまけ:英語の意味
「Pre-training」 = 事前学習・事前訓練
💬 Preは前もって、Trainingは訓練という意味です。事前学習もモデルの学習そのもので、追加学習だけを「本番の学習」と呼ぶと役割を誤解しやすくなります。

参考資料

← 用語集にもどる