【にゅーらるげんごもでる】
ニューラル言語モデル とは?
最終更新:
💡 文脈から、次の言葉の出やすさを学ぶ
ニューラルネットワークを使って、文脈に応じた語やトークン、語列の確率を学習する言語モデル。次のトークンを予測する方式では、その予測を繰り返して文章を生成できる。
📌 このページのポイント
- 語やトークンをベクトルで表し、語列の確率をニューラルネットワークで学習する
- フィードフォワード型、RNN型、Transformer型などがある
- word2vecは単語ベクトルを学ぶ手法で、文章生成モデルそのものとは区別する
- Transformer型でも、自己回帰の文章生成は次のトークンを順に出す
ニューラル言語モデルって、AIが言葉を覚える仕組み?
文章に現れる語の並びや、文脈に応じた次の言葉の出やすさを学ぶモデルだよ。単語などを数値のベクトルで表し、ニューラルネットワークで予測する。人間と同じ仕方で意味を理解するということまでは、この名前に含まれないんだ。
word2vecからRNN、Transformerへ進化したの?
RNNとTransformerは何が違うの?
RNN型は前の状態を次の位置へ渡して処理するよ。Transformer型はアテンションで位置同士を関連付け、学習時の並列計算をしやすくした。ただし、次のトークンを順に出す方式では、未来の答えを先に見ているわけではないんだ。
文章はどうやって作るの?
次のトークンの確率を予測し、その中から選んだトークンを文脈へ加えて、次を予測するんだ。トークンは単語全体とは限らない。図は短い例だけれど、実際にどの位置を区切るかは使う方式によって違うよ。
モデルを大きくすれば、全部正しくなる?
大きさだけで正しさは保証できないよ。言語モデルが学ぶのは言葉の出やすさで、予測確率が高いことと事実が正しいことは別なんだ。全てのニューラル言語モデルがTransformer型というわけでもないよ。
まとめ:ざっくりこれだけ覚えればOK!
「ニューラル言語モデル」って出てきたら「ニューラルネットワークで言葉の出やすさを学ぶモデル」と思えばだいたいOK!
📖 おまけ:英語の意味
「Neural Language Model」 = ニューラルネットワークを用いた言語モデル
💬 Neuralはニューラルネットワークを使うという意味。n-gramなどとの違いはモデル化の方法で、ニューラル型も確率を学ぶ統計的なモデルだよ。