【えむえるえむ】
MLM(マスク言語モデル) とは?
最終更新:
💡 前後の文脈を使い、隠した部分を予測する
入力の一部を隠すなどして、元のトークンを予測するマスク言語モデルの学習方法。前後の文脈、BERTの15%と80・10・10の違い、文章生成との関係を解説します。
📌 このページのポイント
MLMは、文章の穴埋めをすること?
イメージは近いよ。入力の一部を隠すなどして、元のトークンを予測する学習方法なんだ。トークンはモデルが扱う単位で、必ず一つの単語と同じではない。単語の一部分に分かれることもあるよ。
前後の言葉を、両方見られる?
BERTなどのマスク言語モデルでは、対象位置の前と後の文脈を使えるよ。隠していない周囲の情報から予測する。学習で当てられたことだけで、人間と同じ意味理解ができたと保証するわけではないんだ。
BERTでは、15%を隠すんだよね?
元のBERTの論文では、トークンの位置の15%を予測対象として選ぶ。そのうち80%を[MASK]へ、10%をランダムなトークンへ置き換え、残り10%はそのままにする。選んだ15%すべてを[MASK]にする、という説明ではないよ。
そのままの位置も、答えを当てる?
そうだよ。元のBERTでは、選んだ位置について元のトークンを予測する。実際の課題に使う段階では[MASK]を入れないため、学習との違いを小さくする工夫なんだ。この割合が、すべてのマスク言語モデルで固定とは限らないよ。
次の言葉を作るモデルとは、何が違う?
左から右の自己回帰型モデルは、前までのトークンから次を予測する。MLMは、選んだ位置を周囲の文脈から予測するという違いがあるよ。MLMだけで、会話文をそのまま順番に作る仕組みになるわけではなく、用途と学習方法を分けて考えるんだ。
もっと詳しく知りたい人へ
マスク言語モデルは、BERTだけ?
BERTは代表例です。ほかにもこの学習方法を使うモデルがあります。マスク率や置き換えの方法は、対象モデルの論文や実装設定を確認します。
学習した後は、どう使う?
BERTでは、分類や質問応答など、目的の課題に合う入出力と追加学習を使えます。マスク言語モデルとしての穴埋め推論もできます。学習方法と、最終的なアプリの使い方は同じとは限りません。
まとめ:ざっくりこれだけ覚えればOK!
「MLM」って出てきたら「文の一部を隠すなどして、前後の文脈から元のトークンを予測する学習方法」と思えばだいたいOK!
📖 おまけ:英語の意味
「Masked Language Modeling / Masked Language Model」 = マスクを使った言語の学習・モデル
💬 maskは覆い隠すことです。MLMは、学習の課題を指す場合と、その方式を使うモデルを指す場合があります。BERTだけに限る名前ではありません。