stable diffusion プロンプト ガイド:モデル別に効くもの

要約

stable diffusion プロンプト ガイドの要点:SD1.5は短いトークンリスト、SD3.5は自然言語で書く。ネガティブプロンプトは汎用リストより問題に特化させる。重みの上限は1.4、LoRAはトリガーワードでプロンプトを短縮できる。

AIが生成した画像をピン留めしたムードボードの前に立つアートディレクターのワークスペース

stable diffusion プロンプト ガイド:モデル別に効くもの

stable diffusion プロンプト ガイドで最もよく見落とされているのは、SD1.5、SDXL、SD3.5がそれぞれ別のプロンプト言語を使うという事実だ。このガイドはその構文の違いをモデルごとに整理した実践的なリファレンス。テスト済みのネガティブプロンプト、重みの仕組み、LoRAの使い方、そのままコピーして使えるプロダクション例を収録している。汎用プロンプトをコピペして結果がバラバラになっているなら、問題は構造にある、ランダム性ではない。

SD1.5、SDXL、SD3.5:それぞれ別のプロンプト言語を使う

初心者向けガイドが犯す最大のミスは、Stable Diffusionをひとつのツールとして扱うこと。実際には三つの異なるプロンプト言語がある。

SD 1.5 は短く密度の高いトークンリストを好む。モデルはプロンプトを位置で重みづけされた概念の集合として読む。前にある概念ほど注意を引く。つまり、最も重要なものを最初に書くこと。portrait of a woman, cinematic lighting, shallow depth of field, film grain, 35mm, kodachrome, highly detailed はこの構造が機能している例だ。長い説明文はSD1.5を混乱させる、文法を解析するようには作られていないから。

SDXL は長いプロンプトを扱えるし、クオリティプリアンブルとの相性もいい。(masterpiece, best quality:1.2), [subject], [style tags], [lighting], [camera] という構造は安定して機能する。SDXLはSD1.5よりトークンの順序に寛容だが、それでもプロンプトを文として読むのではなくリストとして読む。重要な違い:SDXLはネガティブプロンプトをより精確に処理するので、SD1.5よりも具体的なネガティブ指定が効果的だ。

SD 3.5 はルールを変えた。MMDiT-Xアーキテクチャとトリプルテキストエンコーダーにより、旧バージョンでは不可能なレベルで自然言語を理解する。A woman standing in front of a neon-lit bookshop in rain, photographed with a 50mm lens, warm interior light spilling out, film photography aesthetic と書けば、SD3.5はその文章に従う。同じプロンプトをSD1.5で実行すると、それなりの出力は得られるが構図が異なる、たいていは意図した方向ではない。

実践テスト:SDXLで最もうまくいったプロンプトをそのままSD3.5で実行してみる。それなりの出力が得られる。今度は自然な2文で書き直して再実行。2回目の出力は構図の意図をはっきりと反映するはずだ。

SD3.5はこれまでのどのStable Diffusionバージョンよりも画像内のテキストを上手く扱う。出力に読み取れるテキストが必要なユースケースでは、SD3.5が唯一の選択肢になる。

Hands typing prompt into Stable Diffusion interface on dark screen

すべてのバージョンで機能する5つのプロンプト構成要素

どのモデルを使っていても、この構造が確実なスタート地点になる:

  1. 被写体 :誰が、何が、最初の数語で明確に

  2. スタイル参照 :シネマティック、エディトリアル、ヴィンテージフォト、ブルータリストイラスト、アナログ

  3. ライティング :最も軽視されがちな変数(ソフト拡散光、ゴールデンアワー、ハード指向光、ネオンリムライト、曇り空フラット)

  4. テクニカル・カメラ :焦点距離、フィルムストック、媒体、想定アスペクト比

  5. クオリティシグナル :SD1.5とSDXLには best quality, highly detailed, 8k。SD3.5には不要、何も加えない

全バージョンで被写体を最初に置く。それ以外は変えても構わない。出力がおかしいときは、トークンを増やす前に被写体の行を修正すること。

SD1.5とSDXLのベースはこれをコピーして使う:

[subject], [style], [lighting], 35mm photography, film grain, highly detailed, best quality

SD3.5のベースはこれ:

[1〜2文で場面を描写する。] 35mmフィルムで撮影、[ライティング条件]、[具体的な美的参照]。

どちらも出発点。モデルの挙動を十分に理解したら、そこから押し広げていく。

ネガティブプロンプトは汎用リストを捨てる

ガイドの90%に載っているネガティブプロンプトはこれだ:

ugly, blurry, bad anatomy, extra limbs, deformed, low quality, worst quality, jpeg artifacts

間違いではない。でも実際にはほとんど機能していない。ネガティブプロンプトは望まないものを潜在空間でエンコードすることで機能する。実際に出力で起きている問題に特化するほど効果が上がる。

背景がごちゃごちゃになる場合は busy background, cluttered, noisy background, absent depth of field を追加。

ポートレートの解剖学的なずれには asymmetrical eyes, deformed hands, fused fingers, extra fingers, elongated neck を追加。

ストック写真っぽい出力になるなら stock photo, overexposed, corporate photography, glossy, overly bright を追加。

学習データからウォーターマークが滲み出る場合は watermark, signature, logo, text overlay を追加。

SDXLでのエディトリアルポートレート用のプロダクションネガティブプロンプトはこれ:

blurry, out of focus, bad anatomy, deformed hands, extra limbs, asymmetrical eyes, stock photo, overexposed, watermark, signature, text, low quality, worst quality, jpeg artifacts, plastic skin, airbrushed, over-retouched

被写体に当てはまらない節は削除する。風景の生成にポートレート特化のネガティブを使うと、計算を無駄にするだけでなく、実際に欲しいものを抑制する可能性がある。

ひとつ知っておくべきこと:SD3.5はネガティブフィールドで自然言語に反応する。No watermarks. Do not include text. Avoid overexposed highlights. はトークンリストと並行して機能する。被写体に対して両形式をテストして、クリーンな出力が得られる方を選ぶ。

Two AI-generated prints side by side showing style contrast on studio desk

重みづけで出力を壊さないために

SD1.5とSDXLでは、括弧が重みを上げ、角括弧が下げる:

絶対ルール:どんな要素でも1.4以下に保つ。それを超えると、モデルは重みづけした概念を歪め、意図しない方向に構図を引っ張る。強調ではなく、生成を燃やすことになる。

よくあるミス:複数の要素に重みを積み重ねること。(golden hour:1.3), (film grain:1.3), (shallow depth of field:1.2) を実行すると重みの予算が3つに分散され、そのどれも明確には出てこないことが多い。重みを付けるのは1〜2要素だけにする。残りは自然な重みで。

SD3.5では重み構文の効果は薄い。モデルの自然言語理解により、強調は文の構造から得られる。an imposing Victorian mansion, with a small figure barely visible in the foreground と書けば、括弧構文なしで構図の関係性が伝わる。

SD3.5での推奨:重みトークンをゼロにしてプロンプトを組み立てる。3回以上の生成で重要な要素が一貫して軽視される場合のみ追加する。

LoRAを使うとプロンプトがどう変わるか

LoRAは特定のスタイル、キャラクター、被写体のためにStable Diffusionをチューニングする小さなアドオンモデルだ。ひとつ読み込むとベースプロンプトの戦略が変わる。

構文:ポジティブプロンプトの中に <lora:model_name:0.8> と書く、0.8が重み。0.7〜0.8の間から始めること。1.0を超えると効果が過剰になり、ポートレート被写体では解剖学的な崩壊が起きることがある。

LoRAが有効なときの変化:トリガーワードが大きな重みを持つので、ベースプロンプトはより短くできる。filmgrain35mm というトリガーワードを持つシネマティックフィルムグレインLoRAを読み込んだなら、ベースに 35mm, kodachrome, film grain, analog photography は不要だ。filmgrain35mm portrait of [subject], soft window light, editorial と書いて、テクスチャの仕事はLoRAに任せる。

変わらないこと:被写体の行、ライティングの方向、ネガティブプロンプトはLoRAなしのときと同じく重要。LoRAはスタイルと表面を扱う。構造の悪い被写体行や意図と噛み合わない構図は修正しない。

信頼できるLoRAの入手先:Civitaiが主なリポジトリ。プロダクション用途では、ダウンロード数が多くて自分が必要とする出力に近いサンプルがあるLoRAを選ぶ。ダウンロード数が少なくサンプル画像もないLoRAはブラックボックス、生成するよりデバッグに時間がかかることになる。

Translucent acetate layers stacked on light table representing LoRA adapters in Stable Diffusion

すぐ使えるプロンプト集:ここから始めて後で調整

SDXLでのエディトリアルポートレート:

ポジティブ:

portrait of a woman in her late 30s, looking past the camera, editorial photography, soft window light from the left, muted warm tones, film grain, medium format, (shallow depth of field:1.2), highly detailed, best quality

ネガティブ:

blurry, bad anatomy, deformed hands, plastic skin, overexposed, stock photo, watermark, text, low quality

SD1.5でのブルータリスト建築:

ポジティブ:

brutalist apartment building exterior, raw concrete texture, overcast sky, documentary photography, wide angle, desaturated palette, high contrast shadows, 28mm lens, kodak tri-x grain, highly detailed

ネガティブ:

people, cars, colorful, oversaturated, blurry, digital art, illustration, painting

SD3.5での自然言語シーン:

ポジティブ:

A young woman reading in a small independent bookshop late afternoon, warm light from a window beside her, shot on 35mm film, editorial photography style, slightly underexposed, visible grain, candid feel

ネガティブ:

blurry, deformed hands, asymmetrical eyes, watermark, stock photo, overlit

これをコピーして使う。リミックスしたければどうぞ、でも機能するものから始めること。

触る前にひとつ確認する

ほとんどのプロンプトの問題は、実はプロンプトの問題ではない。シードの問題だ。

何かを変える前に、まともなプロンプトを最低3回実行する。Stable Diffusionは確率的、バリエーションは生成プロセスに組み込まれている。いいプロンプトから1回悪い出力が出てもノイズ。同じ方向で3回連続して悪い出力が出たら、対処する価値のあるシグナルだ。

実際に機能するワークフロー:プロンプトの構造を固め、強い出力を生むシードを見つけて、そのベースラインから絞り込む。毎回の生成ごとにプロンプトを変え続けると、比較の基準点がない微細な変更の無限ループにはまる。

試してみる。上のプロンプトをひとつ選んで、ComfyUI、AUTOMATIC1111、または使っているSDプラットフォームに投入する。1語も変えずに10回実行する。その10回の中で、どんなプロンプトガイドよりもモデルが何に反応するかを学べる。

構造を見て、どう組み立てられているかを確認する。

よくある質問

SD1.5とSDXLのプロンプトの違いは何ですか?
SD1.5は短く密度の高いトークンリストが最も効果的で、語順が出力に影響します。SDXLは長いプロンプトを扱えて、(masterpiece, best quality:1.2)のようなクオリティプリアンブルとの相性がいいです。両バージョンともプロンプトを文ではなくトークンリストとして読みます。
SD3.5はSDXLと異なるプロンプト形式が必要ですか?
はい。SD3.5は自然言語を理解するので、カンマ区切りのトークンリストよりも説明的な文章が効果的です。「best quality」や「highly detailed」のようなクオリティシグナルはSD3.5ではほぼ効果がなく、省略できます。
Stable Diffusionで効果的なネガティブプロンプトをどう書けばいいですか?
解剖学的な問題やクオリティのアーティファクト、スタイルのずれに対応する基本リストから始めて、実際の出力で起きている問題に特化したワードを追加します。背景がごちゃごちゃになる、ストック写真っぽくなる、ウォーターマークが滲み出るなど、実際の問題を狙うのが汎用の長いリストよりも効果的です。
SDプロンプトの括弧内の重みはどの値を使えばいいですか?
どんな要素でも1.4以下に保つこと。1.4を超えると重みづけした概念が歪み、構図が意図しない方向に引っ張られます。強調したい要素は1.2から始めて調整します。同じプロンプトで2つ以上の要素に重みをかけるのは避けること。
LoRAを使うとプロンプトはどう変わりますか?
LoRAが有効なとき、そのトリガーワードが大きな重みを持つので、LoRAがカバーするスタイルトークンはベースプロンプトから省略できます。被写体の行、ライティング、ネガティブプロンプトはLoRAなしのときと同じく重要です。LoRAはスタイルと表面を扱いますが、構図の問題は修正しません。
Stable DiffusionのプロンプトをFluxやMidjourneyで使えますか?
各モデルはプロンプト言語が異なります。Midjourneyはネガティブプロンプトフィールドや重み構文をSD同様には使いません。Flux 1.1 ProはSD3.5に近い自然言語に反応します。プロンプトをそのままコピーするのではなく、各モデルに合わせて調整することが重要です。
Stable Diffusionの出力が生成ごとにバラバラなのはなぜですか?
Stable Diffusionは各生成にランダムなシードを使うので、出力が大きく変わるのは仕様です。プロンプトに問題があると判断する前に、同じプロンプトを最低3回実行します。同じ方向で3回連続して悪い出力が出たら、プロンプトの構造を調整する価値があります。
★ steely dan × liminal hotel room × 35mm film ★ brutalist architecture sunset vaporwave ★ 1970s rock album × medium format ★ renaissance cyberpunk samurai ★ macro honey gold leaf ★ tokyo aerial rain cinematic ★ surrealist collage editorial ★ analog grain portrait studio ★ neon botanical illustration ★   ★ steely dan × liminal hotel room × 35mm film ★ brutalist architecture sunset vaporwave ★ 1970s rock album × medium format ★ renaissance cyberpunk samurai ★ macro honey gold leaf ★ tokyo aerial rain cinematic ★ surrealist collage editorial ★ analog grain portrait studio ★ neon botanical illustration ★   
✦ copy the prompt ✦ remix this ✦ drop into flux ✦ steal this look ✦ open the moodboard ✦ crack it open ✦ send to nano banana ✦ go wild ✦ copy the prompt ✦ remix this ✦ drop into flux ✦ steal this look ✦ open the moodboard ✦ crack it open ✦ send to nano banana ✦ go wild ✦