【まるちもーだる】

マルチモーダル とは?

最終更新:
💡 複数の種類の情報を、組み合わせて扱う

AI分野では、文章・画像・音声・動画など、複数の種類の情報を扱うモデルや処理を指す。画像と質問文を組み合わせるなどの使い方があり、対応する入力・出力や組み合わせはモデルによって異なる。

📌 このページのポイント
画像と文章を組み合わせる 画像 質問文 対応するモデル 文章の回答
画像と質問文を入力し、文章の回答を得る例です。入力に対応していても、同じ形式を出力できるとは限りません。対応する形式はモデルの仕様で確認します。
ひよこ ひよこ
画像だけを扱うAIもマルチモーダル?
ペンギン先生 ペンギン先生
一つの種類だけを扱うことと、複数を扱うことは分けよう。画像と文章など異なるモダリティを扱うのがマルチモーダルだよ。「文章以外を扱える」だけでは、複数の種類に対応しているとは限らないんだ。
ひよこ ひよこ
どう使うの?
ペンギン先生 ペンギン先生
例えば画像と「何が写っている?」という質問文を渡して、文章の回答を受け取る使い方があるよ。Geminiの画像理解ガイドには、画像の説明や視覚的な質問への回答などが示されている。使える組み合わせは個別のモデルで確認するんだ。
ひよこ ひよこ
画像を入力できれば、画像も生成できる?
ペンギン先生 ペンギン先生
入力と出力の対応は別だよ。例えばGemini 3.1 Pro Previewの仕様は文章・画像・音声・動画・PDFを入力できる一方、出力は文章だ。マルチモーダルという名前だけで、あらゆる形式を生成できるとは考えないようにしよう。
ひよこ ひよこ
どのモデルも同じ仕組みで処理するの?
ペンギン先生 ペンギン先生
同じとは限らないよ。例えばCLIPの論文は、画像と対応する説明文を使って画像の表現を学ぶ方法を示している。画像への回答を生成するモデルと、画像と文章の対応を扱うモデルでは目的も違う。一つの構造をすべてのモデルの仕組みとして説明できないんだ。
ひよこ ひよこ
マルチモーダルなら、何でも正しく読み取れる?
ペンギン先生 ペンギン先生
複数の種類に対応することは、回答が正しいという保証ではないよ。対応形式や上限を確かめ、画像の読み取りや回答を目的に合わせて確認する。毎回すべての形式を同時に入力する必要がある、という意味でもないんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「マルチモーダル」って出てきたら「文章や画像など、複数の種類の情報を扱うこと」と思えばだいたいOK!
📖 おまけ:英語の意味
「multimodal」 = 複数の様式を扱う
💬 multiは複数、modalは様式に関する語だよ。AIでは文章・画像などのモダリティを扱うという意味で使われるんだ。

参考資料

← 用語集にもどる