【くりっぷもでる】
CLIPモデル とは?
最終更新:
💡 画像と言葉を数値にして、どれが近いかを比べる
画像とテキストをそれぞれ数値の表現に変換し、対応の強さを比べるモデル。OpenAIの研究で提案され、候補の説明文を使った画像分類や、画像と言葉の検索などに利用できる。
📌 このページのポイント
- 画像とテキストを共通の埋め込み空間に変換
- 正しい画像・文のペアを、別の組より近づけるように学習
- 候補の説明文と比べて、追加学習なしの分類に使える
- 説明文や画像を自分で生成するモデルとは別
画像の説明文を作るの?
CLIP自体が自由な説明文を書き出すわけではないよ。たとえば猫の写真と「猫の写真」「犬の写真」という候補の文を数値に変換し、どの候補が対応しそうかを比べるんだ。分類や検索のために、画像と言葉をつなぐ役割だよ。
どうやって結びつけるの?
ゼロショット分類って?
画像生成とは、どう関係するの?
CLIPなどのテキストエンコーダを、画像生成モデルへの条件を作る部品として利用する場合があるよ。ただし画像そのものを作るのは別の生成モデル。画像生成AIがすべてCLIPを必要とするわけではなく、使う部品はモデルによって違うんだ。
結果は信用してよいの?
細かい種類の区別や個数を数えるような課題は苦手な場合があるよ。学習データ由来の偏りも考える必要がある。類似度は、内容が正しいという保証や万人に共通の確率ではないので、用途に合った画像や候補で確かめよう。
まとめ:ざっくりこれだけ覚えればOK!
「CLIP」って出てきたら「画像と言葉を数値にして、対応の強さを比べるモデル」と思えばだいたいOK!
📖 おまけ:英語の意味
「Contrastive Language-Image Pre-training」 = 言語と画像を対比させる事前学習
💬 対応する画像と文の組、対応しない組を比べながら学習する考え方が名前に含まれているよ。