【まるちもーだる】
マルチモーダル とは?
最終更新:
💡 複数の種類の情報を、組み合わせて扱う
AI分野では、文章・画像・音声・動画など、複数の種類の情報を扱うモデルや処理を指す。画像と質問文を組み合わせるなどの使い方があり、対応する入力・出力や組み合わせはモデルによって異なる。
📌 このページのポイント
- モダリティは文章・画像・音声などの情報の種類を指す
- 画像と質問文など、異なる種類を組み合わせて扱える
- 入力できる形式と、生成できる出力形式は別に確認する
- 対応範囲・処理の仕組み・回答の精度はモデルによる
画像だけを扱うAIもマルチモーダル?
一つの種類だけを扱うことと、複数を扱うことは分けよう。画像と文章など異なるモダリティを扱うのがマルチモーダルだよ。「文章以外を扱える」だけでは、複数の種類に対応しているとは限らないんだ。
どう使うの?
例えば画像と「何が写っている?」という質問文を渡して、文章の回答を受け取る使い方があるよ。Geminiの画像理解ガイドには、画像の説明や視覚的な質問への回答などが示されている。使える組み合わせは個別のモデルで確認するんだ。
画像を入力できれば、画像も生成できる?
どのモデルも同じ仕組みで処理するの?
同じとは限らないよ。例えばCLIPの論文は、画像と対応する説明文を使って画像の表現を学ぶ方法を示している。画像への回答を生成するモデルと、画像と文章の対応を扱うモデルでは目的も違う。一つの構造をすべてのモデルの仕組みとして説明できないんだ。
マルチモーダルなら、何でも正しく読み取れる?
複数の種類に対応することは、回答が正しいという保証ではないよ。対応形式や上限を確かめ、画像の読み取りや回答を目的に合わせて確認する。毎回すべての形式を同時に入力する必要がある、という意味でもないんだ。
まとめ:ざっくりこれだけ覚えればOK!
「マルチモーダル」って出てきたら「文章や画像など、複数の種類の情報を扱うこと」と思えばだいたいOK!
📖 おまけ:英語の意味
「multimodal」 = 複数の様式を扱う
💬 multiは複数、modalは様式に関する語だよ。AIでは文章・画像などのモダリティを扱うという意味で使われるんだ。