【ブイエルエム】

VLM(Vision-Language Model) とは?

最終更新:
💡 画像と言葉を結び付けるAIモデル

画像と言語を関連付けて処理するAIモデルの総称。画像と文章の対応を比べるモデルや、画像を基に説明や質問への回答を生成するモデルがある。対応する入力・出力や得意な作業はモデルによって異なる。

📌 このページのポイント
画像と言葉を結び付けるVLM 画像入力 テキスト入力 何が写る? VLM 生成型の例 説明 猫が います モデルにより出力形式・精度は異なる
画像と質問から説明を生成するタイプの例。照合型など、異なる目的・構成のVLMもある。
ひよこ ひよこ
VLMって何の略?
ペンギン先生 ペンギン先生
Vision-Language Modelの略で、画像と言葉を関連付けて扱うモデルだよ。画像と文章が合っているかを比べたり、写真について質問に答えたりする用途がある。視覚と言語を扱う点で、マルチモーダルAIの一分野なんだ。
ひよこ ひよこ
VLMならみんな会話できるの?
ペンギン先生 ペンギン先生
目的はモデルによるよ。CLIPは画像とテキストの特徴を作り、対応の近さを比べるモデル。LLaVAは画像のエンコーダーと言語モデルをつなぎ、画像について指示に応じるモデルだよ。VLMという名前だけで、自由な文章を生成できるとは決まらないんだ。
ひよこ ひよこ
画像をどう言葉につなげるの?
ペンギン先生 ペンギン先生
たとえばLLaVAでは、画像の特徴を取り出すエンコーダーを言語モデルにつなぐよ。一方CLIPでは画像と文章それぞれの特徴を作って対応を比べる。画像の分割方法や結合方法はモデルごとに異なり、すべてが同じVision Transformerの構成ではないんだ。
ひよこ ひよこ
どんな使い方があるの?
ペンギン先生 ペンギン先生
生成型のモデルなら、写真の説明や画像に基づく質問応答に使えるよ。照合型なら画像に合う文章の候補を選ぶなどの使い方がある。読み取りたい文字や細部を扱えるか、使うモデルと実際の画像で確認しよう。図は画像と質問から説明を生成するタイプの例だよ。
ひよこ ひよこ
画像についての回答は正しいの?
ペンギン先生 ペンギン先生
画像にない物体を、あるように答えるハルシネーションも報告されているよ。もっともらしい文章でも、元画像の内容と一致するとは限らない。必要な作業で精度を評価し、重要な判断に使う情報は元画像と照合することが大切なんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「VLM」って出てきたら「画像と言葉を関連付けて扱うAIモデル」と思えばだいたいOK!
📖 おまけ:英語の意味
「Vision-Language Model」 = 視覚・言語モデル
💬 Vision(視覚)とLanguage(言語)を関連付けて扱うModel(モデル)という名前だよ

参考資料

← 用語集にもどる