【せんざいべくとる】

潜在ベクトル とは?

最終更新:
💡 モデルが学んだ表現を、数値の座標で扱う

モデル内部の潜在表現を数値の列として表したもの。オートエンコーダーでは入力を潜在表現へ変換し、デコーダーで再構成する。画像生成でも、潜在空間で処理するモデルがある。

📌 このページのポイント
内部の数値表現を経由して、再構成する 入力画像 再構成画像 潜在ベクトル z [0.3, −1.2, …] ⚙ エンコーダー ⚙ デコーダー 画像そのものとは別の内部表現 数値・画像は説明用の模式例 再構成は、元画像と完全一致するとは限らない
オートエンコーダーの模式図。左の矢印はエンコード、右はデコードの処理を示す。成分の意味や次元数はモデルによる。この図は潜在拡散モデル全体の処理図ではない。
ひよこ ひよこ
潜在ベクトルって、何が潜在してるの?
ペンギン先生 ペンギン先生
画像のピクセルそのものなどとは別の、モデル内部で扱う表現だよ。オートエンコーダーなら、エンコーダーが入力を数値の表現に変換する。その表現をベクトルとして扱うんだ。
ひよこ ひよこ
「笑顔の度合い」みたいな数値が並ぶの?
ペンギン先生 ペンギン先生
各数値がそのまま人に分かる特徴の名前に対応するとは限らないよ。どういう表現が学ばれるかはモデルや学習方法による。潜在ベクトルなら必ず「本質的な特徴」が取り出せる、という保証でもないんだ。
ひよこ ひよこ
必ず少ない数値に圧縮するの?
ペンギン先生 ペンギン先生
入力より次元を小さくするオートエンコーダーもあるけれど、同じか大きい次元の表現を使うものもあるよ。数百個などの固定した数とは限らない。小さくする場合も、元の情報を完全に保つとは限らないんだ。
ひよこ ひよこ
元の画像には戻せるの?
ペンギン先生 ペンギン先生
デコーダーで再構成するよ。図はその流れで、数字は架空の例。再構成した画像は元と完全に一致するとは限らない。VAEでは、潜在空間から値をサンプリングしてデコーダーで画像を生成することもできるんだ。
ひよこ ひよこ
Stable Diffusionでも使われているの?
ペンギン先生 ペンギン先生
Stable Diffusion v1は潜在拡散モデルの例だよ。画像を表す潜在空間でノイズ除去を行い、デコーダーで画像にする。拡散モデルすべてがこの構成ではなく、画像のピクセル空間で処理するものもあるんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「潜在ベクトル」って出てきたら「モデル内部の表現を表す数値の列」と思えばだいたいOK!
📖 おまけ:英語の意味
「Latent Vector」 = 潜在的な数値のベクトル
💬 Latentは「隠れた・潜在的な」、Vectorは数値を並べたベクトル。観測するデータそのものとは区別して、モデル内部の表現を扱う言葉だよ

参考資料

← 用語集にもどる