テキストから画像を生成する技術を総称してText-to-Imageと呼ぶわ。
今日は代表サービスとプロンプトのコツを見ましょう。
DALL-E、Midjourney、Stable Diffusion、他にも色々あるんだよね?
代表的なのは OpenAI のDALL-Eシリーズ(2/3)、Midjourney、Stability AI のStable Diffusion、Google のImagen、Adobe Firefly、Black Forest Labs の FLUX など。
それぞれ得意分野が違って、Midjourney は芸術的な表現、DALL-E 3 は指示の解釈力、Stable Diffusion はカスタマイズ自由度、という印象ね。
プロンプトの書き方で結果って変わるのぉ?
ましろも描かせてみたいなぁ…
書き方で劇的に変わるわ。
コツは主に4つ。
①具体的に描写する: 「犬」より「ゴールデンレトリバーの子犬」がベター。
②スタイルを指定する: 「水彩画風」「写真風」「浮世絵風」など。
③品質指定を加える: 「高解像度」「8K」「masterpiece」など。
④構図指定:「上からの視点」「クローズアップ」など。
うーん、あたしまだピンとこない…具体的ってどのくらい?
『走ってるゴールデンレトリバー』くらいでいいの?
さらに足すと「黄色いゴールデンレトリバーが、夕焼けの海辺を勢いよく走っている、毛並みのディテールが細かい、写真風」とかになります。
形容と場面描写をレイヤーで重ねる感覚です。
わぁ、お店の紹介文みたい…ふふっ。
なんだか楽しそうっ!
そしてもう一つ強力な道具がネガティブプロンプト。
「含めたくない要素」を指定するの。
よくあるのは「blurry(ぼやけ)」「low quality(低品質)」「deformed(歪み)」「extra fingers(指が多い)」など。
これだけで結果の質が大幅向上するのよ。
ポジだけじゃなくてネガでも指定できるんだ?!
へぇ〜、そっちも大事そうだね!
補足: モデルごとにネガティブプロンプトの効き方は異なります。
Midjourney は `--no` オプション、Stable Diffusion は独立した入力欄、DALL-E 3 ではあまり使えない、など仕様差があります。
プロンプトって、言葉の絵の具と筆、みたいな役目なんだね。
言葉の選び方がそのまま絵の出来に直結するんだね!
まさにプロンプトエンジニアリングって感じ!
Phase 5 も楽しみになってきた!
試験では「Text-to-Image=テキストから画像生成」「代表サービス3〜4つ」「ネガティブプロンプトの概念」を押さえて。
日常の生成ツール体験が、そのまま試験対策にもなる、という実用的な章でもあるのよ。
確認クイズ
Text-to-Image のプロンプトで画像品質を向上させる方法として最も適切なものはどれか。
- プロンプトを短くする
- ネガティブプロンプトで不要な要素を除外する
- 同じプロンプトを繰り返す
- 英語ではなく日本語で入力する
こたえを見る
正解: 2. ネガティブプロンプトで不要な要素を除外する
ネガティブプロンプトで「blurry, low quality, deformed」など不要な要素を指定することで、画像品質を向上させられます。長さや言語、繰り返しは一般的な品質向上策ではありません。