【バート】

BERT とは?

最終更新:
💡 前後の手掛かりで、言葉を読み解くモデル

Googleの研究者らが発表した自然言語処理モデル。Transformerのエンコーダーを使い、入力中の前後の文脈を合わせて扱う。事前学習したモデルを文書分類や質問応答などへ調整して利用できる。

📌 このページのポイント
BERT:前後の文脈で穴埋め事前学習のイメージ今日は[MASK]が良い前の手掛かり後ろの手掛かり「天気」を予測覚えた表現を、分類や質問応答へ前も後ろも、手掛かりになるね
マスク言語モデルの学習を簡略化した例。実際のトークン分割や置き換え方法は、例文の表示とは異なります。
ひよこ ひよこ
双方向って、文章を2回読むの?
ペンギン先生 ペンギン先生
左から右、右から左と2回読むという意味ではないよ。入力中のある言葉を扱うとき、前にある言葉も後ろにある言葉も手掛かりにするんだ。例えば空欄を埋めるなら、後ろの言葉から分かることもあるね。
ひよこ ひよこ
穴埋め問題で勉強するの?
ペンギン先生 ペンギン先生
そう。入力の一部を隠し、元のトークンを予測するマスク言語モデルの学習を使うよ。トークンは文章を分けた単位で、必ず1単語とは限らない。元のBERTでは、2つの文が実際に続くかを判断する学習も組み合わせたんだ。
ひよこ ひよこ
全部の言葉を隠してしまう?
ペンギン先生 ペンギン先生
一部を予測対象にするよ。元論文では位置の15%を選び、その中の80%を[MASK]に置き換える。残りは別のトークンにするか、そのまま残すんだ。「全文の15%が必ず[MASK]になる」とは違うね。
ひよこ ひよこ
学習したら、そのまま何でも答えられる?
ペンギン先生 ペンギン先生
事前学習で得た表現を、目的に合わせて使うよ。例えば分類や質問応答の出力を付け、正解付きデータで調整するファインチューニングがある。BERTだけで、会話サービスや長文生成の仕組みが全部そろうわけではないんだ。
ひよこ ひよこ
次の言葉を生成するAIより、理解力が上?
ペンギン先生 ペンギン先生
一律には言えないよ。BERTの双方向の扱いと、次のトークンを順に予測する学習では、使える文脈や目的が違う。実際の性能はモデルやデータ、課題で変わるので、用途に合わせて評価しよう。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「BERT」って出てきたら「前後の文脈を使って文章を読み解くAIモデル」と思えばだいたいOK!
📖 おまけ:英語の意味
「Bidirectional Encoder Representations from Transformers」 = Transformerによる双方向エンコーダー表現
💬 前後の文脈を合わせて表現を作ることが、Bidirectional(双方向)の意味。左右へ順番に2回読む、という意味ではないよ。

参考資料

← 用語集にもどる