【ろばーた】

RoBERTa(ロバータ) とは?

最終更新:
💡 BERTを土台に、学習の条件を組み合わせて見直す

BERTの事前学習の条件を見直した、2019年の自然言語処理モデル。動的マスキング、NSPなしの学習、データや学習量の増加、トークナイザーの違いと、文章分類などでの利用を解説します。

📌 このページのポイント
RoBERTa:事前学習の条件を見直すBERTのTransformerエンコーダーが土台動的マスキングA?C入力時にマスクのパターンを選ぶ入力と学習の目的文を詰めて入力NSPなしで学習量と学習条件データ・バッチ学習量等トークンの分け方byte-level BPE2019年の検討条件。組合せの結果と区別する
マスク付き小箱は仕組みのイメージで実際のトークン列ではありません。主な条件を並列に示し、単独の変更で同じ改善が起きることや現在の全用途で最良とは保証しません。
ひよこ ひよこ
RoBERTaは、BERTと別の構造なの?
ペンギン先生 ペンギン先生
BERTのTransformerエンコーダーを土台に、学習の条件を見直したモデルだよ。文章中の隠したトークンを予測する学習を使う。単にデータを増やしただけではなく、いくつかの条件を組み合わせて調べたんだ。
ひよこ ひよこ
動的マスキングは何?
ペンギン先生 ペンギン先生
文章をモデルへ入力する際に、隠す位置を選ぶ方法だよ。元のBERT実装は事前に複数のマスク付きデータを作って使い回していた。BERTが同じ文章で必ず1つの位置しか隠さなかった、という説明ではないんだ。
ひよこ ひよこ
NSPは不要だと証明したの?
ペンギン先生 ペンギン先生
RoBERTaは、文のつながりを判定するNSPの学習を外している。ただし入力の作り方なども関係するので、あらゆるモデルや用途でNSPが無意味だと証明したわけではないよ。論文の条件と結果を分けて読もう。
ひよこ ひよこ
ほかには何を変えた?
ペンギン先生 ペンギン先生
学習するデータ、バッチの大きさ、学習量などを見直した。文章をトークンへ分ける方法も、byte-level BPEを使っている。BERTと同じトークナイザーをそのまま使えるとは考えず、モデルに合うものを選ぼう。
ひよこ ひよこ
文章を作るチャットAIなの?
ペンギン先生 ペンギン先生
代表的には、文章分類や文中から答えを取り出す質問応答、隠したトークンの予測などに使えるモデルだよ。用途ごとに追加学習や評価が必要になる場合がある。2019年に報告されたベンチマーク結果が、今のすべての言語や仕事での優位を保証するわけではないんだ。
もっと詳しく知りたい人へ

学習データが10倍なら、精度も10倍になる?

そのような比例関係ではありません。原論文では、16GBから160GBのテキストへの追加と、学習量の増加などを段階的に比較しています。データの量と多様性の影響も一緒に変わるため、単に容量だけで精度を予測しません。

マスク位置は、同じ文章なら毎回必ず異なる?

入力時にマスクするパターンを生成するという意味です。ランダムに選ぶため、同じ位置になる場合もあります。動的マスキングだけで、すべての評価が大きく向上したと読むのも避け、ほかの学習条件と合わせて見ます。

ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「RoBERTa」って出てきたら「BERTの事前学習を見直したモデル」と思えばだいたいOK!
📖 おまけ:英語の意味
「Robustly Optimized BERT Pretraining Approach」 = 頑健に最適化したBERTの事前学習アプローチ
💬 2019年にFacebook AIとワシントン大学の研究者が発表した論文の名称です。本文ではRobustly optimized BERT approachの文字からRoBERTaと呼んでいます。

参考資料

← 用語集にもどる