【ろばーた】
RoBERTa(ロバータ) とは?
最終更新:
💡 BERTを土台に、学習の条件を組み合わせて見直す
BERTの事前学習の条件を見直した、2019年の自然言語処理モデル。動的マスキング、NSPなしの学習、データや学習量の増加、トークナイザーの違いと、文章分類などでの利用を解説します。
📌 このページのポイント
RoBERTaは、BERTと別の構造なの?
BERTのTransformerエンコーダーを土台に、学習の条件を見直したモデルだよ。文章中の隠したトークンを予測する学習を使う。単にデータを増やしただけではなく、いくつかの条件を組み合わせて調べたんだ。
動的マスキングは何?
NSPは不要だと証明したの?
ほかには何を変えた?
もっと詳しく知りたい人へ
学習データが10倍なら、精度も10倍になる?
そのような比例関係ではありません。原論文では、16GBから160GBのテキストへの追加と、学習量の増加などを段階的に比較しています。データの量と多様性の影響も一緒に変わるため、単に容量だけで精度を予測しません。
マスク位置は、同じ文章なら毎回必ず異なる?
入力時にマスクするパターンを生成するという意味です。ランダムに選ぶため、同じ位置になる場合もあります。動的マスキングだけで、すべての評価が大きく向上したと読むのも避け、ほかの学習条件と合わせて見ます。
📖 おまけ:英語の意味
「Robustly Optimized BERT Pretraining Approach」 = 頑健に最適化したBERTの事前学習アプローチ
💬 2019年にFacebook AIとワシントン大学の研究者が発表した論文の名称です。本文ではRobustly optimized BERT approachの文字からRoBERTaと呼んでいます。