【にゅーらるげんごもでる】

ニューラル言語モデル とは?

最終更新:
💡 文脈から、次の言葉の出やすさを学ぶ

ニューラルネットワークを使って、文脈に応じた語やトークン、語列の確率を学習する言語モデル。次のトークンを予測する方式では、その予測を繰り返して文章を生成できる。

📌 このページのポイント
文脈から次のトークンを予測今日 は文脈(例)ニューラルネットワーク次の候補晴れ雨休み選んだトークンを文脈に加え、次を予測構造の例:フィードフォワード / RNNTransformer などword2vecの単語ベクトルとは役割が違う
次のトークンを予測する方式の模式例です。候補や棒の長さは説明用で実測値ではありません。選んだトークンを文脈に加え、次の予測を続けます。
ひよこ ひよこ
ニューラル言語モデルって、AIが言葉を覚える仕組み?
ペンギン先生 ペンギン先生
文章に現れる語の並びや、文脈に応じた次の言葉の出やすさを学ぶモデルだよ。単語などを数値のベクトルで表し、ニューラルネットワークで予測する。人間と同じ仕方で意味を理解するということまでは、この名前に含まれないんだ。
ひよこ ひよこ
word2vecからRNN、Transformerへ進化したの?
ペンギン先生 ペンギン先生
単純な一本道ではないよ。2003年のBengioらの論文には、単語の表現と語列の確率を一緒に学ぶモデルがある。2013年のword2vecは、主に単語ベクトルを効率よく学ぶ手法。そのベクトルだけで文章を生成する言語モデルになるわけではないんだ。
ひよこ ひよこ
RNNとTransformerは何が違うの?
ペンギン先生 ペンギン先生
RNN型は前の状態を次の位置へ渡して処理するよ。Transformer型はアテンションで位置同士を関連付け、学習時の並列計算をしやすくした。ただし、次のトークンを順に出す方式では、未来の答えを先に見ているわけではないんだ。
ひよこ ひよこ
文章はどうやって作るの?
ペンギン先生 ペンギン先生
次のトークンの確率を予測し、その中から選んだトークンを文脈へ加えて、次を予測するんだ。トークンは単語全体とは限らない。図は短い例だけれど、実際にどの位置を区切るかは使う方式によって違うよ。
ひよこ ひよこ
モデルを大きくすれば、全部正しくなる?
ペンギン先生 ペンギン先生
大きさだけで正しさは保証できないよ。言語モデルが学ぶのは言葉の出やすさで、予測確率が高いことと事実が正しいことは別なんだ。全てのニューラル言語モデルがTransformer型というわけでもないよ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「ニューラル言語モデル」って出てきたら「ニューラルネットワークで言葉の出やすさを学ぶモデル」と思えばだいたいOK!
📖 おまけ:英語の意味
「Neural Language Model」 = ニューラルネットワークを用いた言語モデル
💬 Neuralはニューラルネットワークを使うという意味。n-gramなどとの違いはモデル化の方法で、ニューラル型も確率を学ぶ統計的なモデルだよ。

参考資料

← 用語集にもどる