【せんざいくうかん】

潜在空間(Latent Space) とは?

最終更新:
💡 データを内部の数値で表した「特徴の地図」

データを直接観測できない内部の変数やベクトルで表す空間。機械学習では、モデルが学習した表現を使ってデータの構造を扱い、再構成や生成などに利用する。

📌 このページのポイント
潜在空間:内部の数値表現 画像を表す例(配置は説明用) 入力画像 潜在空間の図示 変換 各点が内部の表現 エンコーダーで 数値へ変換 2次元の配置は、理解用の単純化 実際の次元数や近さの意味はモデルによる 再構成・生成などで利用する 全てが低次元になるわけではない
2次元の位置や記号は説明用で、実測結果ではありません。次元数、距離や軸の意味は、モデルの設計や学習によって異なります。
ひよこ ひよこ
潜在空間ってなに?なんだか難しそう。
ペンギン先生 ペンギン先生
データを内部の数値で表す「特徴の地図」と考えてみよう。例えばオートエンコーダーは、画像などの入力をエンコーダーで内部の表現へ変換する。地図の点はその表現だけれど、人間が分かる意味の名前が全てに付くわけではないよ。
ひよこ ひよこ
必ず小さな数字の組に圧縮するの?
ペンギン先生 ペンギン先生
入力より少ない次元へ圧縮するモデルはあるけれど、それだけではないよ。入力と同じ次元や、それより大きな内部表現を使うオートエンコーダーもある。何を学ばせるか、どう制約するかも大切なんだ。
ひよこ ひよこ
似た画像なら、必ず近くに並ぶ?
ペンギン先生 ペンギン先生
モデルが学んだ特徴に沿って近くなることはあるけれど、必ず猫は猫、犬は犬ときれいに分かれる保証はないよ。学習データや目的によって、背景など別の特徴が表現されることもある。「近いから人間にも同じ意味」と決めつけないでね。
ひよこ ひよこ
画像を作ることにも使える?
ペンギン先生 ペンギン先生
VAEなどでは、潜在変数を選び、デコーダーで画像へ変換できるよ。VAEのエンコーダーは分布のパラメーターを求め、そこから潜在変数をサンプリングする。元の画像を完全に戻す保証や、任意の点から望みどおりの画像が出る保証ではないんだ。
ひよこ ひよこ
図に描いた地図は、そのままモデルの中にあるの?
ペンギン先生 ペンギン先生
図は理解用に2次元へ単純化した例だよ。実際にはもっと多くの次元を持つことがあるし、各軸が「猫らしさ」など一つの意味に対応するとは限らない。図の距離や分類だけから、実際のモデルの性能を判断しないでね。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「潜在空間」って出てきたら「データを内部の数値で表す空間」と思えばだいたいOK!
📖 おまけ:英語の意味
「Latent Space」 = 潜在的な・隠れた空間
💬 Latentは「潜在的な」、Spaceは「空間」。元の観測データとは別の、内部の変数や表現を扱う空間を指すよ

参考資料

← 用語集にもどる