【くりっぷもでる】

CLIPモデル とは?

最終更新:
💡 画像と言葉を数値にして、どれが近いかを比べる

画像とテキストをそれぞれ数値の表現に変換し、対応の強さを比べるモデル。OpenAIの研究で提案され、候補の説明文を使った画像分類や、画像と言葉の検索などに利用できる。

📌 このページのポイント
CLIP:画像と言葉を比べる猫の画像画像エンコーダ→ 数値の表現候補「猫」「犬」テキストエンコーダ→ 数値の表現画像と候補文の類似度を比較分類や検索の手がかりにする説明文を書き出す処理とは別だよ
画像と候補の文を比較する分類の例。候補の書き方や対象によって結果は変わります。
ひよこ ひよこ
画像の説明文を作るの?
ペンギン先生 ペンギン先生
CLIP自体が自由な説明文を書き出すわけではないよ。たとえば猫の写真と「猫の写真」「犬の写真」という候補の文を数値に変換し、どの候補が対応しそうかを比べるんだ。分類や検索のために、画像と言葉をつなぐ役割だよ。
ひよこ ひよこ
どうやって結びつけるの?
ペンギン先生 ペンギン先生
画像エンコーダとテキストエンコーダで、それぞれをベクトルにするよ。学習では対応する画像と文のベクトルを近づけ、違う組との類似度を下げるようにする。似た内容を比較できる数値の表現を学ぶんだ。
ひよこ ひよこ
ゼロショット分類って?
ペンギン先生 ペンギン先生
分類したい候補を「猫の写真」「犬の写真」のような文で表し、画像との類似度を比較する使い方だよ。その分類専用の追加学習をせずに試せる、という意味であって、CLIPが学習を全くしていない意味ではないんだ。候補の選び方や文の書き方でも結果は変わるよ。
ひよこ ひよこ
画像生成とは、どう関係するの?
ペンギン先生 ペンギン先生
CLIPなどのテキストエンコーダを、画像生成モデルへの条件を作る部品として利用する場合があるよ。ただし画像そのものを作るのは別の生成モデル。画像生成AIがすべてCLIPを必要とするわけではなく、使う部品はモデルによって違うんだ。
ひよこ ひよこ
結果は信用してよいの?
ペンギン先生 ペンギン先生
細かい種類の区別や個数を数えるような課題は苦手な場合があるよ。学習データ由来の偏りも考える必要がある。類似度は、内容が正しいという保証や万人に共通の確率ではないので、用途に合った画像や候補で確かめよう。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「CLIP」って出てきたら「画像と言葉を数値にして、対応の強さを比べるモデル」と思えばだいたいOK!
📖 おまけ:英語の意味
「Contrastive Language-Image Pre-training」 = 言語と画像を対比させる事前学習
💬 対応する画像と文の組、対応しない組を比べながら学習する考え方が名前に含まれているよ。

参考資料

← 用語集にもどる