【まるちもーだるうめこみ】

マルチモーダル埋め込み とは?

公開:
💡 見た目も言葉も同じ地図に載せる翻訳者
📌 このページのポイント
マルチモーダル埋め込み テキスト "猫の写真" 画像 🐱 写真データ 音声 🔊 音声データ テキスト エンコーダ 画像 エンコーダ 音声 エンコーダ 共有ベクトル空間 テキスト 画像 音声 近い = 意味が似てる 入力データ モダリティ別 エンコーダ 同一空間に変換 代表例: CLIP(OpenAI)、ImageBind(Meta)
マルチモーダル埋め込みのイメージ
ひよこ ひよこ
ペンギン先生、画像をテキストで検索できるってどういう仕組みなの?
ペンギン先生 ペンギン先生
それがマルチモーダル埋め込みの仕組みだよ。テキストも画像も、同じ「数字の地図」に変換してしまうんだ。
ひよこ ひよこ
テキストと画像が同じ地図に…?全然違うものなのに変換できるの?
ペンギン先生 ペンギン先生
うん。例えば「猫の写真」と「猫」というテキストを、それぞれ数百次元のベクトルに変換すると、地図上の近い場所に配置されるように学習するんだよ。
ひよこ ひよこ
じゃあ「犬の写真」は「猫」のテキストから遠い場所になるんだね!
ペンギン先生 ペンギン先生
まさにその通りだよ。この仕組みを使うと、テキストで画像を検索したり、画像に似た別の画像を見つけたりできるんだ。
ひよこ ひよこ
CLIPっていう名前をよく聞くんだけど、それがそういう技術なの?
ペンギン先生 ペンギン先生
そうだよ。OpenAIが作ったCLIPはテキストと画像を同じ空間に埋め込む代表例だよ。画像検索エンジンやAI画像生成でも使われてるんだ。
ひよこ ひよこ
音声も同じようにできるの?
ペンギン先生 ペンギン先生
できるよ。Metaが開発したImageBindは画像・テキスト・音声・深度マップなど6種類のデータを同一空間に埋め込んでいて、音声から似た画像を探すことまでできるんだよ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
マルチモーダル埋め込み」って出てきたら「テキストも画像も同じ地図に変換する技術」と思えればだいたいOK!
📖 おまけ:英語の意味
「Multimodal Embedding」 = マルチモーダル埋め込み
💬 複数(multi)のモード(modal)を同一空間に埋め込む(embed)技術から来てるよ
← 用語集にもどる