【まるちもーだるえるえるえむ】

マルチモーダルLLM とは?

最終更新:
💡 言葉と画像などを組み合わせて答えるAI

言語を扱う大規模モデルに、画像など別の種類の情報も扱う能力を組み合わせたモデル。対応する画像・音声・動画の種類や、入力と出力の範囲はモデルごとに異なる。

📌 このページのポイント
画像+言葉 → 言葉で回答画像特徴を取り出す質問文章言語モデル特徴と質問回答文章入力できる種類と、出力できる種類は別全てのモダリティに対応するとは限らない
画像と言語を扱うLLaVA型の構成を簡略化した例です。音声・動画への対応や画像生成の可否は、モデルごとに異なります。
ひよこ ひよこ
マルチモーダルって「たくさんのモード」ってこと?
ペンギン先生 ペンギン先生
モダリティは情報の種類だと思えばいいよ。たとえば画像と「何が写っている?」という文章を受け取り、文章で答えるモデルもマルチモーダルなんだ。
ひよこ ひよこ
画像・音声・動画を全部扱えるの?
ペンギン先生 ペンギン先生
対応範囲はモデルごとに違うよ。LLaVAの原著は画像と言語を扱い、Qwen2-VLの論文は画像・動画と言語を扱う構成を説明している。マルチモーダルという名前だけで、音声も使えるとは判断できないんだ。
ひよこ ひよこ
画像を見られるなら、画像も描ける?
ペンギン先生 ペンギン先生
それも別だよ。画像を入力して文章で答えるモデルに、画像生成機能があるとは限らない。受け取れる種類と出せる種類を、分けて確認するんだ。
ひよこ ひよこ
技術的にはどう組み合わせるの?
ペンギン先生 ペンギン先生
LLaVAの例では、画像エンコーダが取り出した特徴を変換して言語モデルへ渡すよ。画像と質問を関連付けて答えを生成するんだ。接続方法や学習方法は一つではなく、全てを同じ構造で説明はできないよ。
ひよこ ひよこ
写真を渡せば、説明は必ず正しい?
ペンギン先生 ペンギン先生
画像に写っていない内容を答えてしまうこともあるよ。LLaVAの論文も、入力や事実に根拠のない出力を問題として挙げている。複数の情報を使えることと、正確に読み取れることは別なんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「マルチモーダルLLM」って出てきたら「言葉と画像など、複数の種類の情報を扱う大規模モデル」と思えばだいたいOK!
📖 おまけ:英語の意味
「Multimodal Large Language Model」 = 複数の情報様式を扱う大規模言語モデル
💬 Multiは複数、modalityは情報の様式。人間の五感を全て持つという意味ではないよ。

参考資料

← 用語集にもどる