【ステーブルディフュージョン】

Stable Diffusion とは?

最終更新:
💡 言葉を手がかりに、ノイズから画像を作るAI

文章などを手がかりに画像を生成する、拡散モデルの系列。画像の圧縮表現を扱う潜在拡散の技術を使い、公開された重みを自分の環境で動かせるモデルもある。利用条件、必要な計算資源、機能はモデルの版と実行方法による。

📌 このページのポイント
言葉を手がかりに、潜在表現から画像へテキスト「星空の風景」条件の数値表現へノイズ潜在空間で開始画像の圧縮表現生成モデル条件に沿って段階的にノイズから生成デコーダ画像へ戻す生成画像内容を確認利用条件と必要な計算資源は、版や実行方法による
文章の数値表現を条件に、潜在空間のノイズから生成し、画像へ戻す流れです。矢印は処理の向きを示します。初期モデルの潜在拡散を簡略化しており、全ての版の内部構造が同一という意味ではありません。
ひよこ ひよこ
どうやって文章から絵を描くの?
ペンギン先生 ペンギン先生
文章を数値の表現へ変え、それを手がかりにノイズから生成するよ。潜在拡散では、画像を圧縮した表現に相当する空間で処理し、最後に画像へ戻す。学習した関係を使う仕組みで、人と同じ理解をしているという意味ではないんだ
ひよこ ひよこ
Stable Diffusionは、一つのモデルなの?
ペンギン先生 ペンギン先生
複数の版や構成がある系列だよ。初期の公開モデルはCompVis、Stability AI、Runwayなどの協力で作られた。モデルの版が違うと機能や必要なメモリも変わる。記事や設定を見るときは、どのモデルの説明か確認しよう
ひよこ ひよこ
誰でも、無料で自由に使える?
ペンギン先生 ペンギン先生
公開された重みを使えることと、無条件の利用許可は別だよ。モデルごとにライセンスがあり、用途や収益などによって条件が変わる場合がある。自分で動かすにも機器や電力が必要で、外部サービスの料金も別なんだ
ひよこ ひよこ
LoRAで、好きな画風にできる?
ペンギン先生 ペンギン先生
追加する少数の重みを学習して、モデルを調整する方法だよ。全体を学習し直すより、学習するパラメーターを減らせる。ただし、学習データや設定で結果は変わり、数十枚あれば必ず再現できるという保証ではない。元モデルと追加データの利用条件も確認しよう
ひよこ ひよこ
PCのスペックや、生成画像の使い方は?
ペンギン先生 ペンギン先生
選んだモデルと実行ツールの要件を確認しよう。必要なGPUメモリや速度は、解像度、設定、最適化などで変わる。生成後も意図した内容かを確認し、公開や商用利用ではライセンスと適用される権利・規則を確認するんだ
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「Stable Diffusion」って出てきたら「言葉などを手がかりに画像を作る拡散モデルの系列」と思えばだいたいOK!
📖 おまけ:英語の意味
「Stable Diffusion」 = Stable Diffusionというモデル名
💬 stableは安定した、diffusionは拡散という意味だよ。名称だけで、出力が必ず安定する、高品質になるという保証ではないんだ

参考資料

← 用語集にもどる