【ブイエルエム】
VLM(Vision-Language Model) とは?
最終更新:
💡 画像と言葉を結び付けるAIモデル
画像と言語を関連付けて処理するAIモデルの総称。画像と文章の対応を比べるモデルや、画像を基に説明や質問への回答を生成するモデルがある。対応する入力・出力や得意な作業はモデルによって異なる。
📌 このページのポイント
- Vision-Language Model(視覚と言語のモデル)の略
- 画像と文章の照合、説明生成、視覚的な質問応答などに使われる
- CLIPとLLaVAのように、目的や構成が異なるモデルがある
- 誤認識や画像にない内容の生成もあり、出力を元画像と照合する
VLMって何の略?
VLMならみんな会話できるの?
目的はモデルによるよ。CLIPは画像とテキストの特徴を作り、対応の近さを比べるモデル。LLaVAは画像のエンコーダーと言語モデルをつなぎ、画像について指示に応じるモデルだよ。VLMという名前だけで、自由な文章を生成できるとは決まらないんだ。
画像をどう言葉につなげるの?
たとえばLLaVAでは、画像の特徴を取り出すエンコーダーを言語モデルにつなぐよ。一方CLIPでは画像と文章それぞれの特徴を作って対応を比べる。画像の分割方法や結合方法はモデルごとに異なり、すべてが同じVision Transformerの構成ではないんだ。
どんな使い方があるの?
生成型のモデルなら、写真の説明や画像に基づく質問応答に使えるよ。照合型なら画像に合う文章の候補を選ぶなどの使い方がある。読み取りたい文字や細部を扱えるか、使うモデルと実際の画像で確認しよう。図は画像と質問から説明を生成するタイプの例だよ。
画像についての回答は正しいの?
画像にない物体を、あるように答えるハルシネーションも報告されているよ。もっともらしい文章でも、元画像の内容と一致するとは限らない。必要な作業で精度を評価し、重要な判断に使う情報は元画像と照合することが大切なんだ。
まとめ:ざっくりこれだけ覚えればOK!
「VLM」って出てきたら「画像と言葉を関連付けて扱うAIモデル」と思えばだいたいOK!
📖 おまけ:英語の意味
「Vision-Language Model」 = 視覚・言語モデル
💬 Vision(視覚)とLanguage(言語)を関連付けて扱うModel(モデル)という名前だよ