AI画像プロンプト作り方: 長いより構造的に
要約
AI画像 プロンプト 作り方で「運頼み」を卒業する方法。プロンプトは長さじゃなく構造。被写体・スタイル・ライティング・構図・ムード・技術の6つのスロットを満たせば、Midjourney、Flux、Stable Diffusionすべてで再現可能な出力が得られます。
AI画像 プロンプト 作り方の基本は、長さじゃなくて構造で決まるということ。被写体、スタイル、ライティング、構図、ムード、技術パラメータ。6つのスロット。1つ欠けると、MidjournyやFluxは最も一般的なオプションで埋める。それがお前のレンダリングが他人のPinterestボードと同じに見える理由だ。これは形容詞を積み重ねる話ではない。実の写真家やアートディレクターがシャッターを押す前に決める、あらゆる判断に名前をつけることだ。運のいい出力と、何度でも再現できる出力の違いはそこにある。
「女性が公園にいて、シネマティック、8k、最高品質」と打ち込んで、同じ言葉を打ち込む全員が受け取るのと同じ過度に明るく過度に平滑化されたデフォルトが返ってくる。それは運じゃない。3つのスロットが空っぽなプロンプトが、モデルの最も一般的な推測で埋められるだけだ。
実は全モデルが従う「6つのスロット」構造
カンマ区切りのキーワードスープは忘れろ。「キツネ、森、秋、霧、日光、8k、最高品質」はモデルに何も伝わらない。だからストック写真のペースト状の出力が返ってくる。全モデルは同じタグが付いた1万枚の画像を見たことがあって、それらすべてを最も安全な平均に平滑化してしまう。それが「AI感」だ。
全モデルで通用する構造: 被写体、スタイル、ライティング、構図、ムード、技術。6つのスロット。スロットに何を入れるか言えなければ、モデルが選ぶ。そしてそのタグが付いた全画像の平均を選ぶ。
被写体は常に最初。「女性」じゃなくて、何をしているのか、何を着ているのか、何を持っているのか、どこにいるのか。スタイルは次: ムードではなく、媒体か運動を名付けろ。「シネマティック」はモデルには何も意味しない。マーケティング用語だ。「1978年のコダクロームフィルム」はモデルが実際にシミュレートできることだ。
構図は大多数の人がスキップするスロット。レンズの選択、角度、フレーミング距離。35mmの三角ローアングルと85mmのタイトクローズアップは全く違う読みをされる。モデルに「いい写真」と推測させるのではなく、自分で選ぶ。
実際に機能しているプロンプトを分解してみろ: 何か具体的なことをしている被写体、命名されたスタイル、方向がある光源、レンズとフレーミングの選択、感情的な基調、モデルが必要とするパラメータフラグ。そのうち2つ欠けば、今週みんなが生成してるのと同じベージュ色のポートレートの40番目のバリエーションが出てくる。
ムードは大多数の人がスキップするか、矛盾した3つの形容詞を一度に詰め込むスロット。1つのトーンを選べ: 穏やか、緊張、祝祭的、臨床的。「壮大でしかも穏やかでしかもドラマティック」じゃなくて、それはモデルに3つのムードを平均化して平坦で優柔不断な中間を告げるだけだ。技術は最後。最初ではなく: アスペクト比、シード、モデル固有のフラグ。他の5つが実際に何を言うかをロックするのがこのスロットだ。
Midjourney v7、Flux 1.1 Pro、SD3.5: 同じ構造、違う操作
同じ6スロット構造を3つのモデルで実行した。被写体も同じ、ライティングも同じ、フレーミングも同じ。出力は期待以上に異なった。
Midjourney v7は短く、高信号の句を欲しがる。全文ではなく。--srefでスタイルの一貫性に報い、--stylizeをより積極的に読む。段落全体を打ち込むと、ノイズを平均化して、より安全でより平坦な何かに戻り始める。3つ中で最も強い気分と大気ライティングの感覚を持つが、求める方について経済的である必要がある。
Flux 1.1 Proは逆だ。自然言語に密接に従い、特に詳細に報う。カメラとフィルムストック固有の指定で。「85mm, f/1.8, Kodak Portra 400」と言えば、Fluxはそのグレインと色反応を保つ。プラスチック感に平滑化しない。これは写真が求められて、イラストではなく、それでプロの標準になった。
Stable Diffusion 3.5は構造化された、重み付けされたキーワードを報う。括弧は強調を上へ、括弧は下へ。(rim light:1.4)は文で「強い照明」と打つのとは異なる動作をする。その数値制御が全体的な魅力だ。カスタムLoRAsとControlNetでパイプラインを構築していれば、SD3.5は依然としてお前が全体で所有する。自己ホストまたはフロントエンド経由で。
これらのどれも客観的に「より良い」わけではない。異なる仕事のために構築された異なる制御面だ。お前のプロンプトの制御面に合致するものを選べ。X上で誰もが推す理由ではなく。
明言する価値がある: プロジェクトの中盤でモデルを切り替える(1つの出力が期待外れだったから)は、スタイルが揃わず、スルーのないフォルダに終わる最速の方法だ。プロンプトに基づいてモデルを決定し、判断する前に3〜4つのシードで同じプロンプトを実行し、モデルが制御面として実際に要求を叶えられない時だけ切り替えろ。
ライティング用語が「AI感」を消す
レンダリングが「生成感」に見えるのを直す最速の方法: 光源とその方向に名前をつけろ。「いいライティング」ではなく、それは情報ゼロの文だ。ソース、品質、方向。
「竹を通してろ過される低い太陽、左へ激しい影」はモデルに物理的なセットアップをシミュレートするように伝える。ガッファーがセットを照らすやり方で。「いいライティング」は何も伝わらず、デフォルトは平坦、影なし、過度に明るい。それが30秒で書かれたプロンプトの指標だ。

自分で発明するのではなく、実ライティング用語を借りろ。レンブラント照明は頬の影に三角形の光。リムライト は背景からの分離。ボリュメトリックフォグは実際の深さを持つ大気。これらは派手に聞こえるように選ばれた装飾語ではない。それぞれが、モデルに具体的な物理的セットアップをシミュレートするように告げる。
技術スロットに「RAW photo」または「unprocessed」を加えろ。プラスチック肌の過度に平滑化した見た目が繰り返されるなら。それは小さなフレーズだが、全モデルがデフォルトの過度にレンダリングされた見た目に対して不均衡な量の仕事をする。

すぐに使える5つのプロンプト
上記3つのモデルで実際にテストした。完成した作品ではなく、6スロット構造で構築された開始点。被写体は変えろ。骨は同じ。
編集ポートレート: 「三角ローアングル、35mmレンズ、カメラ左からのレンブラント照明、ミュートされた秋のパレット、穏やかで確実な表現、フィルムグレーン、RAW photo。"
製品スタイル静物: 「生コンクリート上のオーバーヘッド平面図、窓光からの硬い端の影1つ、1つのオブジェクトはわずかにオフセント、彼らはデザート化、未処理。"
ブルータリスト建築: 「広いショット、対称的なコンクリート正面、曇った拡散光、フレーム内に人がいない、冷たい色グレード、24mmレンズ、ドキュメンタリーフレーミング。"
リソプリント質感研究: 「2色のリソプリント美学、目に見える登録オフセット、平坦な色ブロック、ハーフトーンドットパターン、目に見えるペーパーグレーン。"
ムーディーな風景: 「広いショット、低い太陽が霧を通してろ過、冷たい色温度、長い影、最小限の色パレット、シネマティック構成。"
Fluxにドロップしてフォトリアリズムを、またはMidjournyにドロップしてムードを。どのスロットが次に壊れるか見ろ。それは通常、盲目的にリロールする理由ではなく、次のラウンドで詰め込む必要があるスロットだ。
プロンプトライブラリの作り方
ほとんどの人のプロンプト「コレクション」は、Notesアプリに埋まった40個のスクリーンショット、ラベルなし、6週間後に掘り起こせない。それはライブラリではなく、掘り返す気力がない墓地だ。
作動するライブラリはvibeではなく、スロットでタグ付けしろ。「照明: 硬い側面光」と「スタイル: リソプリント」の下にプロンプトを置く。「クールな1」や「キツネのやつ」ではなく。1ヶ月後に特定の照明セットアップが必要な時、10秒で見つかる。カメラロールをスクロールして、サムネイルを認識するのではなく。

ここがAre.naをワークフローに入れるべき場所。nice-to-haveではなく、手順。シングルプロンプトを書く前に参照をAre.na-iseしろ。視覚DNA(光、質感、パレット)をチャンネルに最初にブロックアウトしろ。その後そのチャネルを6つのスロットに翻訳しろ。モデルに直接打ち込むより遅いが、出力は誰もが他人のショーケースから引き出すのと違う。
何度も試しすぎるのは逆効果
シードをロックしろ。ラウンドごとに1つのスロットだけ変えろ。それが全部だ。ほぼ誰もそれをしない。
出力が期待外れの時、10回リロールして運を祈る本能がある。実際に機能するのは: シードを固定にしておく、1度に正確に1つの変数を変える、照明から始める、次に構図、次にムード、最初に書いたプロンプトに対して結果を評価しろ。個人的に好むかどうかではなく。「これは要求に合致するか」が「今日のvibe として好きか」を毎回破る。後者に終点はなく、100回のリロールで感情を追い、仕様に追わない。
4つを同時に変えてリロールしても改善しないなら、最初からプロンプトが不完全だ。6つのスロットに戻れ。何か欠けてる。そしてリロール回数では空のスロットは埋まらない。
フォトリアリズムの深い技術制御のため、Black Forest Labs の Flux プロンプト解釈と guidance scale の動作のドキュメントが参考になる。大多数のサードパーティガイドより詳しい。カジュアル使用を超えるなら15分の価値がある。
どのモデルから試すべきか
Flux 1.1 Pro: プロンプトが写真に読める場合。Midjourney v7: プロンプトが気分に読める場合。SD3.5: パイプラインを全部所有したい場合、カスタムLoRAsをベースモデルに重ねたい場合。
ここに普遍的な答えはない。そうした答えを売ってる者は、お前にメソッドではなくテンプレートパックを売ってる。6スロットプロンプトを最初に書け。それが実際に何を描写しているか決めろ。その後、合致するモデルを選べ。上記の5つを盗め。壊せ。お前の被写体とお前の参照スタックのために再構築しろ。それが実際の仕事だ。それは誰か他人のショーケースを100回スクロールするより午後の過ごし方がいい。