【まるちもーだるうめこみ】

マルチモーダル埋め込み とは?

最終更新:
💡 見た目も言葉も同じ地図に載せる翻訳者

テキストや画像など、異なる種類のデータを比較できる共通のベクトル空間へ表現する技術。対応する内容の類似度を使い、文章から画像を探すなどの検索に活用できる。

📌 このページのポイント
マルチモーダル埋め込み画像と言葉を比較できる数字へテキスト「猫の写真」テキスト用の変換画像🐱 写真画像用の変換共通のベクトル空間文章の特徴画像の特徴類似度を使い、文章に対応する画像を検索配置はイメージ。必ず一致するとは限らない
CLIPの画像とテキストを例にした図。ImageBindは音声などにも対象を広げています。
ひよこ ひよこ
文章を使って画像を探せるのはなぜ?
ペンギン先生 ペンギン先生
画像とテキストを、互いに比較できるベクトルに変換するんだ。ベクトルは数字の並びだよ。「猫の写真」という文章に対応する画像が高い類似度になるよう学習したモデルなら、その類似度を検索に使えるね
ひよこ ひよこ
文章と画像を、同じ方法で変換するの?
ペンギン先生 ペンギン先生
CLIPでは画像用とテキスト用のエンコーダーが、それぞれ数値の表現を作るよ。入力の処理方法が違っても、出力を共通の空間で比較できるように学習する。「同じ地図に載せる」と考えると分かりやすいね
ひよこ ひよこ
猫なら必ず近くて、犬なら遠くなる?
ペンギン先生 ペンギン先生
必ずではないよ。モデルが学習した関係や、文章の書き方、画像の特徴によって変わる。CLIPでは画像と文章の特徴のコサイン類似度を使えるけれど、意味を完全に理解した証拠でも、正しい回答の保証でもないんだ
ひよこ ひよこ
CLIPとImageBindは、何が違うの?
ペンギン先生 ペンギン先生
CLIPは画像とテキストを扱う代表例だよ。ImageBindは画像・テキスト・音声・深度・熱画像・IMUデータの6種類を共通空間に結び付ける研究。IMUは加速度などの動きを測るセンサーのデータだね。すべてのモデルが全種類を扱うわけではないよ
ひよこ ひよこ
埋め込みを作るだけで、画像も生成できる?
ペンギン先生 ペンギン先生
埋め込み自体は比較に使う数値の表現で、画像を描く処理とは別だよ。検索したいデータを同じ対応モデルで埋め込み、類似度の高いものを探す使い方から考えよう。生成モデルと組み合わせる応用もあるけれど、変換だけで写真が完成するわけではないんだ
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「マルチモーダル埋め込み」って出てきたら「画像や言葉を同じ数字の地図で比べる技術」と思えばだいたいOK!
📖 おまけ:英語の意味
「Multimodal Embedding」 = マルチモーダル埋め込み
💬 複数(multi)のモード(modal)を同一空間に埋め込む(embed)技術から来てるよ

参考資料

← 用語集にもどる