【まるちもーだるうめこみ】
マルチモーダル埋め込み とは?
最終更新:
💡 見た目も言葉も同じ地図に載せる翻訳者
テキストや画像など、異なる種類のデータを比較できる共通のベクトル空間へ表現する技術。対応する内容の類似度を使い、文章から画像を探すなどの検索に活用できる。
📌 このページのポイント
- 対応するテキストや画像を、比較できる数値の表現に変換する
- 異なる種類の入力でも、共通空間の類似度で検索できる
- CLIPは画像とテキスト、ImageBindは6種類の入力が代表例
- 近い表現になることは、内容の正しさや検索の成功を保証しない
文章を使って画像を探せるのはなぜ?
文章と画像を、同じ方法で変換するの?
CLIPでは画像用とテキスト用のエンコーダーが、それぞれ数値の表現を作るよ。入力の処理方法が違っても、出力を共通の空間で比較できるように学習する。「同じ地図に載せる」と考えると分かりやすいね
猫なら必ず近くて、犬なら遠くなる?
必ずではないよ。モデルが学習した関係や、文章の書き方、画像の特徴によって変わる。CLIPでは画像と文章の特徴のコサイン類似度を使えるけれど、意味を完全に理解した証拠でも、正しい回答の保証でもないんだ
CLIPとImageBindは、何が違うの?
CLIPは画像とテキストを扱う代表例だよ。ImageBindは画像・テキスト・音声・深度・熱画像・IMUデータの6種類を共通空間に結び付ける研究。IMUは加速度などの動きを測るセンサーのデータだね。すべてのモデルが全種類を扱うわけではないよ
埋め込みを作るだけで、画像も生成できる?
埋め込み自体は比較に使う数値の表現で、画像を描く処理とは別だよ。検索したいデータを同じ対応モデルで埋め込み、類似度の高いものを探す使い方から考えよう。生成モデルと組み合わせる応用もあるけれど、変換だけで写真が完成するわけではないんだ
まとめ:ざっくりこれだけ覚えればOK!
「マルチモーダル埋め込み」って出てきたら「画像や言葉を同じ数字の地図で比べる技術」と思えばだいたいOK!
📖 おまけ:英語の意味
「Multimodal Embedding」 = マルチモーダル埋め込み
💬 複数(multi)のモード(modal)を同一空間に埋め込む(embed)技術から来てるよ