拡散モデルの基本 - ノイズから画像へ

画像生成AIの中核技術「拡散モデル」は、ノイズを少しずつ除去して画像を生成します。その仕組みを会話で学びましょう。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針
香月 リサ 先生(笑顔) 香月 リサ 先生

今日から画像生成の章。
中核技術の拡散モデルよ。
実はジャスミンちゃん、妹さんの誕生日プレゼントで生成 AI 使ってるらしいじゃない?
実体験から解説できそうね。

戸倉 ジャスミン(あせる) 戸倉 ジャスミン

え、なんで知ってるんですか…まぁ、そう、Stable Diffusion で推しキャラの絵作ってたんだけど、最初はぜんぜん上手くいかなかったね。
プロンプトが悪いのかと思ったら、そもそも生成の「仕組み」知らなかったから、パラメータいじっても何が効いてるかわかんない状態だったんだよね。

香月 リサ 先生(普段) 香月 リサ 先生

そこで今日のテーマに繋がるわけね。
Diffusion Model(拡散モデル)は、ノイズが徐々に拡散していく物理現象の逆再生、が基本アイデアよ。
学習時、きれいな画像に少しずつノイズを加えていって、最終的には完全なランダム画像にする。
この変化の過程をモデルに覚えさせるのよ。

雪村 ましろ(普段) 雪村 ましろ

きれいな写真に砂嵐が段々かかって、最後は真っ白い雪景色になる感じ?

深見 つむぎ(普段) 深見 つむぎ

ましろちゃん、その比喩は分かりやすいね。
砂嵐の映像を想像するとイメージしやすい。

香月 リサ 先生(普段) 香月 リサ 先生

そう。
で、生成時は逆向きに走らせるの。
完全ランダムノイズから出発して、「このノイズの塊は、何を目指していたんだろう?」と1ステップずつ復元していくと、最終的にきれいな画像が現れるのよ。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

それで納得!
あたしが絵を出してる時、「ノイズ→ちょい像→キャラ化」って段階的にプレビュー出てたの、あれそういうことか!

香月 リサ 先生(普段) 香月 リサ 先生

ジャスミンちゃん、実体験から気づけるなんて素晴らしい。
学習したものを活用してる証拠ね。

深見 つむぎ(普段) 深見 つむぎ

補足すると、このプロセスを何十〜何百ステップの反復で行います。
最近の手法では10ステップ程度でも高品質に生成できる高速化が進んでいますね。

雪村 ましろ(笑顔) 雪村 ましろ

何回も少しずつ磨くって、お菓子作りで何度も漉す工程に似てる。
和菓子の餡子って、何回も裏ごしして滑らかにするんだよ。

香月 リサ 先生(普段) 香月 リサ 先生

ましろちゃん、今日も比喩が冴えるわね。
まさにそのイメージ。
ぼやけた画像を徐々に具体的な形へ磨き上げる——これが拡散モデルの本質よ。
「わからない」なんて言ってる場合じゃないくらい、すごい技術が裏で動いているのよ。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

ほんとにめっちゃすごい技術じゃん!
画像生成って、魔法じゃなくてこの繊細な積み重ねの結果なんだね。

深見 つむぎ(普段) 深見 つむぎ

補足: 拡散モデルには色々な派生があって、DDPM、DDIM、Score-based SDE、Latent Diffusionなどが知られています。
次回扱う Stable Diffusion は最後のタイプで、効率化のためのイノベーションが詰まっています。

香月 リサ 先生(普段) 香月 リサ 先生

試験的には「拡散モデル=ノイズから逆向きに復元して画像を生成する手法」「代表例 Stable Diffusion」の2点を押さえればOKよ。

確認クイズ

拡散モデルの画像生成プロセスとして正しいものはどれか。

  1. 画像をピクセル単位で描画する
  2. ランダムノイズから段階的にノイズを除去する
  3. テンプレート画像を合成する
  4. 既存画像を検索して返す
こたえを見る

正解: 2. ランダムノイズから段階的にノイズを除去する

拡散モデルはランダムノイズから出発し、学習したノイズ除去プロセスを段階的に適用して画像を生成します。ピクセル単位描画やテンプレート合成、画像検索はいずれも拡散モデルの動作ではありません。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。