【まるちもーだるえるえるえむ】
マルチモーダルLLM とは?
最終更新:
💡 言葉と画像などを組み合わせて答えるAI
言語を扱う大規模モデルに、画像など別の種類の情報も扱う能力を組み合わせたモデル。対応する画像・音声・動画の種類や、入力と出力の範囲はモデルごとに異なる。
📌 このページのポイント
- モダリティはテキスト・画像・音声など情報の種類を指す
- 複数の種類を扱えても、全ての種類に対応するとは限らない
- 画像を入力できることと、画像を生成できることは別
- 画像の特徴をエンコーダで取り出し、言語モデルにつなぐ構成がある
マルチモーダルって「たくさんのモード」ってこと?
モダリティは情報の種類だと思えばいいよ。たとえば画像と「何が写っている?」という文章を受け取り、文章で答えるモデルもマルチモーダルなんだ。
画像・音声・動画を全部扱えるの?
対応範囲はモデルごとに違うよ。LLaVAの原著は画像と言語を扱い、Qwen2-VLの論文は画像・動画と言語を扱う構成を説明している。マルチモーダルという名前だけで、音声も使えるとは判断できないんだ。
画像を見られるなら、画像も描ける?
それも別だよ。画像を入力して文章で答えるモデルに、画像生成機能があるとは限らない。受け取れる種類と出せる種類を、分けて確認するんだ。
技術的にはどう組み合わせるの?
LLaVAの例では、画像エンコーダが取り出した特徴を変換して言語モデルへ渡すよ。画像と質問を関連付けて答えを生成するんだ。接続方法や学習方法は一つではなく、全てを同じ構造で説明はできないよ。
写真を渡せば、説明は必ず正しい?
画像に写っていない内容を答えてしまうこともあるよ。LLaVAの論文も、入力や事実に根拠のない出力を問題として挙げている。複数の情報を使えることと、正確に読み取れることは別なんだ。
📖 おまけ:英語の意味
「Multimodal Large Language Model」 = 複数の情報様式を扱う大規模言語モデル
💬 Multiは複数、modalityは情報の様式。人間の五感を全て持つという意味ではないよ。