Prompt per immagini IA: struttura a sei slot che funziona

Riassunto

I prompt IA non devono essere più lunghi, devono essere strutturati. La struttura a sei slot (subject, style, illuminazione, composizione, mood, parametri) trasforma i render generici in output coerenti e controllabili. Scopri come scrivere prompt che funzionano su Midjourney v7, Flux 1.1 Pro e Stable Diffusion 3.5.

Flat lay di foto stampate, contatti e un laptop chiuso su un tavolo studio in cemento, stile zine moodboard

Prompt per immagini IA: la struttura a sei slot che funziona davvero

I prompt IA migliori non sono più lunghi, sono strutturati. Sei slot: subject, style, illuminazione, composizione, mood, parametri tecnici. Salta uno e Midjourney o Flux lo riempie con l'opzione più generica che ha, e quella è esattamente la ragione per cui i tuoi render assomigliano alla Pinterest board di tutti gli altri. Non è una questione di accumulare aggettivi fino a quando qualcosa attecchisce. È nominare ogni decisione che un fotografo o un art director vero farebbe prima ancora di aprire l'otturatore. Questa è l'intera differenza tra un output fortunato e uno che puoi ripetere.

L'hai già fatto: tipo "una donna in un parco, cinematico, 8k, migliore qualità" e ricevi lo stesso render sovraesposto, sovra-levigato che il modello regala a chiunque digiti esattamente quella frase. Non è sfortuna. È un prompt con tre slot vuoti, riempiti dall'indovinellone più generico del modello.

La struttura a sei slot che ogni prompt funzionante segue davvero

Dimenticati le keyword separate da virgole. "Volpe, foresta, autunno, nebbia, luce solare, 8k, migliore qualità" non dice niente al modello su quello che vuoi davvero, quindi di default sceglie l'insipidezza da stock photo. Ogni modello ha visto diecimila immagini taggate con esattamente queste parole, e le media tutte nell'output più sicuro possibile.

La brief che tiene in piedi su tutti i modelli: subject, style, illuminazione, composizione, mood, parametri tecnici. Sei slot. Se non riesci a dire cosa va in uno slot, il modello sceglie per te, e sceglie la media di ogni immagine che ha mai visto tagata così. Quello è il "look IA" che stai cercando di eliminare.

Subject primo, sempre. Non "una donna", ma cosa sta facendo, cosa indossa, cosa tiene, dove. Style subito dopo: nomina un medium o un movimento, non un vibe. "Cinematico" non significa niente di specifico per un modello, è parola marketing, non istruzione visiva. "Pellicola slide Kodachrome, 1978" significa qualcosa che un modello può davvero simulare.

La composizione è lo slot che la gente salta più spesso. Lunghezza focale, angolo, inquadratura: un'angolazione bassa a tre quarti da 35mm legge completamente diverso da un close-up stretto da 85mm, e il modello ha bisogno che tu ne scelga una invece di indovinare "una bella foto".

Apri un prompt che funziona e guarda cosa c'è dentro: un subject che fa qualcosa di concreto, uno style nominato, una sorgente di luce con direzione, una scelta di focale e inquadratura, un registro emotivo, e whatever flag il modello tiene. Manca due di queste e ottieni la quarantesima variazione dello stesso ritratto beige che tutti gli altri stanno generando questa settimana.

Il mood è lo slot che la gente più spesso salta completamente o sovraccarica con tre aggettivi contraddittori in una volta. Scegli un registro: quieto, teso, celebrativo, clinico. Non "epico e sereno e drammatico" impilati insieme, che dice solo al modello di fare la media di tre mood in un mezzo piatto e indeciso. E parametri tecnici ultimo, non primo: aspect ratio, seed, flag specifici del modello. È lo slot che blocca gli altri cinque al loro posto una volta che hai davvero deciso cosa dicono.

Midjourney v7, Flux 1.1 Pro, SD3.5: stessa brief, regole diverse

Abbiamo lanciato la stessa brief a sei slot attraverso tre modelli, stesso subject, stesso cue di illuminazione, stessa inquadratura. Gli output sono diverged più di quanto ci aspettassimo, che è esattamente il punto di testare invece di assumere.

Midjourney v7 vuole frasi corte ad alto segnale, non frasi complete. Ricompensa --sref per la coerenza stilistica e legge --stylize più aggressivamente di come faceva prima. Spingi un paragrafo intero e comincia a fare la media del rumore di nuovo verso qualcosa di più sicuro e più blando. È ancora il modello con il miglior senso di mood e illuminazione atmosferica dei tre, ma ha bisogno che tu sia economico su come chiedi.

Flux 1.1 Pro va esattamente dall'altro lato. Segue i brief in linguaggio naturale strettamente e ricompensa il dettaglio, in particolare specifiche di camera e stock fotografico. Di' "85mm, f/1.8, Kodak Portra 400" e Flux davvero mantiene quella grana e risposta di colore invece di levigarla in plastica. È il modello per quando la brief è una fotografia, non un'illustrazione, e è diventato lo standard professionale esattamente per quella ragione.

Stable Diffusion 3.5 ricompensa le keyword strutturate e pesate: parentesi per spingere l'enfasi su, bracket per tirarla giù. (rim light:1.4) si comporta diversamente dal dire "strong rim light" in una frase, e questo controllo numerico è tutto l'appeal. Se stai costruendo una pipeline con LoRAs custom e ControlNet, SD3.5 è ancora quello che possiedi da capo a piedi, self-hosted o attraverso un front end.

Nessuno di questi è oggettivamente "migliore". Sono superfici di controllo diverse costruite per lavori diversi. Scegli quello la cui superficie di controllo matcha la brief che hai scritto, non quello che tutti stanno screenshottando su X questa settimana perché ha beccato un output fortunato.

Vale la pena dirlo piano: cambiare modello a metà progetto perché un output ti ha deluso è il modo più veloce di finire con una cartella di stili disaccoppiati e nessun fil rouge. Decidi il modello basato sulla brief, lancia la stessa brief attraverso tre o quattro seed prima di giudicare il modello stesso, e cambia strumento solo se la superficie di controllo davvero non può fare quello che la brief chiede.

Il vocabolario di illuminazione che uccide il look IA

Ecco il fix più veloce per i render che gridano "generato": nomina la sorgente di luce e la sua direzione. Non "buona illuminazione", che è una frase con zero informazioni dentro. Una sorgente, una qualità, una direzione.

"Sole basso che filtra attraverso il bambù, ombre dure che ragliano a sinistra" dà al modello una configurazione fisica da simulare, come farebbe un gaffer su un set. "Illuminazione carina" non gli dà niente, quindi di default usa il look piatto, senza ombre, sovraesposto che è diventato il tell inconfondibile di un prompt scritto frettoloso in trenta secondi.

Macro shot di una softbox piccola che proietta un'ombra dai bordi netti su un busto di gesso, illustrante la configurazione di illuminazione a fonte singola

Ruba dal vocabolario di illuminazione vero invece di inventartene uno: Rembrandt lighting per un triangolo piccolo di luce sulla guancia in ombra, rim light per separazione dallo sfondo, volumetric fog per atmosfera con profondità reale. Queste non sono parole decorative scelte per suonare fancy. Ognuna dice al modello di simulare una configurazione fisica specifica invece di indovinare cosa intendevi.

Aggiungi "RAW photo" o "unprocessed" allo slot tecnico se la pelle di plastica sovra-levigata è il tuo problema ricorrente. È una piccola frase che fa un'enorme quantità di lavoro contro il look sovra-renderizzato che ogni modello di default quando il prompt gli lascia spazio per indovinare.

Busto di terracotta illuminato con luce Rembrandt drammatica da un lato contro uno sfondo scuro

Cinque prompt che puoi rubare adesso

Abbiamo testato questi attraverso i tre modelli sopra. Non sono arte finita, sono punti di partenza costruiti sulla struttura a sei slot. Cambia il subject, mantieni le ossa intatte.

Butta uno di questi in Flux per fotorealismo o Midjourney per atmosfera, e guarda quale slot si rompe per primo quando l'output ti delude. Quello è di solito lo slot esatto che devi stringere il prossimo round, non una ragione per fare reroll alla cieca.

Costruire una libreria di prompt invece di un cimitero di screenshot

La "collezione prompt" di la maggior parte della gente è quaranta screenshot sepolti in un'app Note, nessuno etichettato, nessuno riutilizzabile sei settimane dopo quando davvero hai bisogno di quella configurazione di illuminazione esatta di nuovo. Quello non è una libreria, è un cimitero che non riscaverai mai.

Una libreria che funziona taglia per slot, non per vibe. Archivia un prompt sotto "illuminazione: hard side light" e "style: riso print," non sotto "quello figo" o "la cosa della volpe." Quando hai bisogno di una configurazione di illuminazione specifica un mese da ora, la trovi in dieci secondi invece di scrollare una camera roll sperando di riconoscere una miniatura.

Vista overhead di una cork moodboard appuntata con foto Kodachrome-style vintage e campioni di colore riso

È anche qui che Are.na guadagna il suo posto nel workflow, non come nice-to-have ma come il step prima dello step. Are.na-izza le tue referenze prima di scrivere un singolo prompt: blocca il DNA visivo (luce, texture, palette) in un canale prima, poi traduci quel canale nei sei slot. È più lento che digitare dritto in un modello, ma gli output smettono di assomigliare a quelli di tutti gli altri.

Quando iterare di più peggior le cose

Blocka il seed. Cambia uno slot per round. Questo è tutta la disciplina, e quasi nessuno lo fa.

L'istinto quando un output delude è fare reroll dieci volte e sperare che il seed random ti salvi. Quello che davvero funziona: mantieni il seed fisso, cambia esattamente una variabile alla volta, illuminazione primo, poi composizione, poi mood, e valuta il risultato rispetto alla brief che hai originariamente scritto, non rispetto a se ti piace il vibe oggi. "Corrisponde questo a quello che ho chiesto" batte "mi piace" ogni volta, perché la seconda domanda non ha endpoint e brucerai cento generazioni inseguendo una sensazione invece di una spec.

Se hai cambiato quattro cose alla volta e ancora stai facendo reroll senza miglioramento, la brief era incompleta dall'inizio. Torna ai sei slot. Qualcosa è vuoto, e nessuna quantità di reroll lo fix.

Per controllo tecnico più profondo sul lato fotorealismo, Black Forest Labs documenta il comportamento di aderenza prompt e guidance-scale di Flux in più dettaglio di quanto la maggior parte delle guide di terze parti si preoccupi di fare, vale i quindici minuti se stai spingendo oltre l'uso casuale.

Allora quale modello lanci questa brief prima?

Flux 1.1 Pro se la brief legge come una fotografia. Midjourney v7 se legge come un mood. SD3.5 se devi possedere la pipeline da capo a piedi e impilare LoRAs custom su un modello base.

Non c'è risposta universale qui, e chiunque te la vendi sta vendendo un template pack, non un metodo. Scrivi la brief a sei slot primo, decidi che tipo di immagine davvero descrive una volta che è sulla pagina, e solo allora scegli il modello che matcha. Ruba i cinque prompt sopra, rompili, ricostruiscili per il tuo subject e il tuo stack di referenze. Questo è il lavoro vero, ed è un uso migliore di un pomeriggio che scrollare il feed di showcase di qualcun altro per la centesima volta.

Domande frequenti

Qual è la differenza principale tra una brief a sei slot e un prompt con keyword separate da virgole?
Una brief strutturata nomina ogni decisione visiva (subject, style, illuminazione, composizione, mood, parametri) che un vero fotografo farebbe. Le keyword separate dicono al modello di fare la media di migliaia di immagini con le stesse tag, producendo output generico. La struttura produce controllo.
Quale modello dovrei usare prima: Midjourney, Flux o Stable Diffusion?
Dipende dalla brief. Flux 1.1 Pro se è una fotografia. Midjourney v7 se è un mood. SD3.5 se devi possedere la pipeline end-to-end con custom LoRAs. Decidi basato sulla brief, non sulla moda di questa settimana.
Perché "RAW photo" e "unprocessed" sono così importanti nei parametri tecnici?
Questi termini contrappesano il default di tutti i modelli di sovra-levigare e sovra-renderizzare. Dicono al modello di produrre grana di film, texture grezza, risposta di colore reale — tutto quello che combatte il look IA plasticato.
Cosa succede se cambio quattro variabili alla volta durante l'iterazione?
Se cambi più variabili insieme e l'output non migliora, non sai quale slot era il problema. La disciplina giusta: cambia uno slot per round, valuta contro la brief originale, non contro quello che ti piace oggi.
Come dovrei organizzare la mia libreria di prompt?
Taglia per slot, non per vibe. Archivia sotto "illuminazione: hard side light" e "style: riso print" invece di "quello figo". Usa Are.na prima di scrivere il prompt: prepara il DNA visivo (luce, texture, palette) in un canale, poi trasforma in sei slot.
Cosa significa "Are.na-izzare" le tue referenze?
Creare un canale Are.na, collezionare immagini di riferimento che condividono DNA visivo (stessa illuminazione, texture, palette), poi tradurre quel canale nei sei slot del prompt. È più lento che digitare subito nel modello, ma gli output smettono di assomigliare a quelli di tutti gli altri.
★ steely dan × liminal hotel room × 35mm film ★ brutalist architecture sunset vaporwave ★ 1970s rock album × medium format ★ renaissance cyberpunk samurai ★ macro honey gold leaf ★ tokyo aerial rain cinematic ★ surrealist collage editorial ★ analog grain portrait studio ★ neon botanical illustration ★   ★ steely dan × liminal hotel room × 35mm film ★ brutalist architecture sunset vaporwave ★ 1970s rock album × medium format ★ renaissance cyberpunk samurai ★ macro honey gold leaf ★ tokyo aerial rain cinematic ★ surrealist collage editorial ★ analog grain portrait studio ★ neon botanical illustration ★   
✦ copy the prompt ✦ remix this ✦ drop into flux ✦ steal this look ✦ open the moodboard ✦ crack it open ✦ send to nano banana ✦ go wild ✦ copy the prompt ✦ remix this ✦ drop into flux ✦ steal this look ✦ open the moodboard ✦ crack it open ✦ send to nano banana ✦ go wild ✦