Stable Diffusion の仕組み

Stable Diffusionは拡散モデルを効率化した画像生成モデルです。潜在空間での処理やCLIPの活用を解説します。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針
香月 リサ 先生(笑顔) 香月 リサ 先生

最近のAI業界で、2022年8月にStable Diffusionがオープンソースで公開されたことは大事件だったわ。
今日はその仕組みを解剖していきましょう。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

あたしもこれで絵描いてるよ!
オープンソースってのがすごいんだよね?

香月 リサ 先生(普段) 香月 リサ 先生

そう、無料で誰でも使えて、改造もできるから、一気に生成AIの民主化が進んだの。
技術的にはLatent Diffusion Model(LDM)が核心よ。

深見 つむぎ(普段) 深見 つむぎ

補足ですが、元の拡散モデルは画像のピクセル空間で直接処理するため、計算量が膨大でした。
LDM では画像をまず潜在空間(Latent Space)に圧縮してから拡散処理するため、はるかに効率的なんですよね。

香月 リサ 先生(普段) 香月 リサ 先生

つむぎさん、完璧な補足。
具体的には、512×512 画素の画像を 64×64 の潜在表現に圧縮してから処理するから、計算量は約64分の1になるの。
数字で見ると驚きの圧縮率よね。

雪村 ましろ(普段) 雪村 ましろ

でも、どうしてテキストから猫とか犬とか作れるの?
「猫」って言葉、画像には直接関係ないよね?

香月 リサ 先生(普段) 香月 リサ 先生

ましろちゃん、核心を突く質問。
そこで活躍するのがCLIPというモデルよ。
OpenAI が2021年に発表したもので、テキストと画像を共通のベクトル空間にマッピングする技術なの。

深見 つむぎ(普段) 深見 つむぎ

CLIP は「猫の画像」と「cat」という文字列を、ベクトル空間で近くに配置するように学習されているんですよね。
そしてこの CLIP のテキストベクトルを拡散モデルの「生成をガイドする信号」として使う、と。

雪村 ましろ(笑顔) 雪村 ましろ

じゃあ、「夕焼けの海辺を走る犬」って書くと、その意味ベクトルが拡散モデルに渡されて、画像がそれに寄せて生成されるんだね。

戸倉 ジャスミン(びっくり) 戸倉 ジャスミン

うわっ先生、ましろの理解力やばっ…。
ましろ、もしかして隠れ天才?

香月 リサ 先生(笑顔) 香月 リサ 先生

あらあら、ジャスミンちゃん、よく気づいたわね、ましろちゃんの才能。
ふふ。
ちなみに Stable Diffusion って、オープンソースだから派生モデルも山ほどあって、SDXL、SD3、ControlNet、LoRA マージモデル、アニメ特化モデル(Anything、Counterfeit など)、多種多様よ。

深見 つむぎ(普段) 深見 つむぎ

補足すると、2024年には Stability AI が SD3 を発表、Black Forest Labs が FLUX をリリース、さらに各社の高速版(1ステップ生成)など、進化が加速しています。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

コミュニティがデカいから、どんどん新しいモデル出るんだよね。
個人クリエイターが世界を変える時代、ほんとにめっちゃすごいじゃん!

香月 リサ 先生(普段) 香月 リサ 先生

試験では「Latent Diffusion=潜在空間で拡散」「CLIP で意味ガイド」「オープンソースで普及」の3点を押さえておいて。
AI 民主化の歴史的転換点でもあるわ。

確認クイズ

Stable Diffusion が従来の拡散モデルより効率的な理由として最も適切なものはどれか。

  1. パラメータ数が少ない
  2. 潜在空間で拡散処理を行うため計算コストが低い
  3. 学習データが少なくて済む
  4. ルールベースで画像を生成する
こたえを見る

正解: 2. 潜在空間で拡散処理を行うため計算コストが低い

Stable Diffusion は画像を潜在空間に圧縮してから拡散処理を行うため、計算コストが大幅に削減されます。パラメータ数は多く、学習データも大量、ルールベースではありません。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。