Guida ai prompt di Stable Diffusion: cosa funziona per ogni modello
Riassunto
I prompt di Stable Diffusion funzionano diversamente secondo la versione del modello. SD1.5 e SDXL preferiscono liste di token separate da virgole; SD3.5 comprende il linguaggio naturale. Questa guida copre la struttura in cinque parti che funziona su tutte le versioni, negative prompt testati, come usare le parentesi senza rovinare i risultati, e come integrare i LoRA. Include esempi pronti per ritratti editoriali, architetture e scene cinematiche.
Il tuo prompt di Stable Diffusion non funziona allo stesso modo su SD1.5, SDXL e SD3.5. Questa guida ai prompt di Stable Diffusion copre la sintassi esatta per ogni versione del modello -- negative prompt testati, meccanica dei pesi, integrazione LoRA ed esempi pronti da produzione. Se finora hai copiato prompt generici ottenendo risultati incoerenti, il problema non è casuale: è strutturale.
SD1.5, SDXL, SD3.5: ogni modello ha il suo linguaggio
L'errore più grande in tutte le guide per principianti è trattare Stable Diffusion come uno strumento unico. Sono tre linguaggi diversi.
SD 1.5 vuole liste di token brevi e dense. Il modello legge il tuo prompt come una borsa di concetti pesati per posizione. I concetti all'inizio ricevono più attenzione. Questo significa: inizia con quello che conta davvero. ritratto di una donna, illuminazione cinematografica, profondità di campo ridotta, film grain, 35mm, kodachrome, altamente dettagliato funziona perché il soggetto e l'illuminazione vengono per primi. Una lunga frase descrittiva confonde SD 1.5 -- non è costruito per leggere la grammatica.
SDXL gestisce prompt più lunghi e risponde bene ai preamboli di qualità. La struttura (capolavoro, migliore qualità:1.2), [soggetto], [tag di stile], [illuminazione], [fotocamera] rimane affidabile. SDXL è più tollerante rispetto all'ordine dei token rispetto a SD 1.5 ma legge ancora i prompt come una lista, non una frase. Una differenza chiave: SDXL gestisce i negative prompt più precisamente, quindi la specificità nei tuoi negativi paga di più qui che su SD 1.5.
SD 3.5 ha cambiato completamente le regole. Con la sua architettura MMDiT-X e il triple text encoder, comprende il linguaggio naturale a un livello che le versioni precedenti non possono. Scrivi Una donna che sta davanti a una libreria illuminata da neon sotto la pioggia, fotografata con un obiettivo 50mm, luce calda che esce dall'interno, estetica della fotografia analogica e SD 3.5 segue la frase. Lo stesso prompt su SD 1.5 produrrà qualcosa di accettabile ma compositivamente diverso -- e non sempre nella direzione che volevi.
Test pratico: prendi il tuo miglior prompt SDXL e lancialo tal quale su SD 3.5. Otterrai un output decente. Adesso riscrivilo come due frasi naturali. Esegui di nuovo. Il secondo output seguirà notevolmente meglio la tua intenzione compositiva.
SD 3.5 gestisce anche il testo nelle immagini meglio di qualsiasi versione precedente di Stable Diffusion. Se il testo leggibile nell'output è importante per il tuo caso d'uso, SD 3.5 è l'unica versione SD che vale la pena usare per questo compito.

La struttura in cinque parti che funziona su tutte le versioni
Qualunque modello tu stia usando, questa struttura ti dà un punto di partenza affidabile:
Soggetto -- chi o cosa, dichiarato chiaramente nelle prime parole
Riferimento di stile -- il linguaggio visivo: cinematografico, editoriale, fotografia vintage, illustrazione brutalista, analogico
Illuminazione -- la variabile più sottovalutata (luce diffusa morbida, ora d'oro, luce direzionale dura, rim light al neon, cielo coperto piatto)
Tecnica e fotocamera -- lunghezza focale, pellicola, medium, rapporto d'aspetto implicito
Segnale di qualità -- per SD 1.5 e SDXL:
migliore qualità, altamente dettagliato, 8k. Per SD 3.5: saltalo, non aggiunge nulla
Metti il soggetto per primo in ogni versione. Tutto il resto può variare. Quando un output sembra sbagliato, correggi prima la linea del soggetto prima di aggiungere altri token.
Ruba questa base per SD 1.5 e SDXL:
[soggetto], [stile], [illuminazione], fotografia 35mm, film grain, altamente dettagliato, migliore qualitàRuba questa base per SD 3.5:
[Scena descritta in una o due frasi.] Fotografato su pellicola 35mm, [condizione di illuminazione], [riferimento estetico specifico].Entrambe sono punti di partenza. Adatta quando conosci il comportamento del modello abbastanza bene da sapere cosa spingere.
Negative prompt: smetti di usare liste generiche
Ecco il negative prompt che trovi nel 90% delle guide:
brutto, sfocato, anatomia sbagliata, arti extra, deformato, bassa qualità, peggiore qualità, artefatti jpegNon sbagliato. Ma che fa molto poco lavoro reale nella maggior parte dei contesti. I negative prompt funzionano codificando quello che non vuoi nello spazio latente. Più specifico sei al problema effettivo che appare nei tuoi output, più efficaci diventano.
Se stai ottenendo sfondi fangosi: aggiungi sfondo occupato, disordinato, sfondo rumoroso, assenza di profondità di campo.
Se i ritratti derivano anatomicamente: aggiungi occhi asimmetrici, mani deformi, dita fuse, dita extra, collo allungato.
Se l'output scivola verso fotografia stock nonostante il tuo prompt: aggiungi foto stock, sovraesposta, fotografia aziendale, lucida, troppo luminosa.
Se stai vedendo emorragia di filigrana dai dati di addestramento: aggiungi filigrana, firma, logo, testo sovrapposto.
Il mio negative prompt di produzione per ritratti editoriali su SDXL:
sfocato, fuori fuoco, anatomia sbagliata, mani deformi, arti extra, occhi asimmetrici, foto stock, sovraesposta, filigrana, firma, testo, bassa qualità, peggiore qualità, artefatti jpeg, pelle di plastica, ritoccata con aerografo, sovra-ritoccataRimuovi le clausole che non si applicano al tuo soggetto. Lanciare negative specifici per ritratti su una generazione di paesaggio spreca computazione e può sopprimere cose che effettivamente vuoi.
Una cosa da sapere: SD 3.5 risponde al linguaggio naturale nel campo negativo. Niente filigrane. Non includere testo. Evita i riflessi sovraesposti. funziona insieme alle liste di token. Prova entrambi i formati sul tuo soggetto e scegli quello che ti dà output più puliti.

Pesi e enfasi senza rovinare l'output
In SD 1.5 e SDXL, le parentesi aumentano il peso e le parentesi quadre lo diminuiscono.
(illuminazione cinematografica:1.3)-- 30% più peso su questo concetto[sfondo disordinato]-- sopprime leggermente questo elemento((dettaglio molto importante))-- ogni coppia di parentesi moltiplica per circa 1.1
La regola dura: stai sotto 1.4 per qualsiasi elemento singolo. Oltre quello, il modello distorce il concetto pesato e può tirare la composizione verso di esso in modi che non vuoi. Non stai aggiungendo enfasi, stai bruciando la generazione.
Un errore comune: impilare più elementi pesati. Lanciare (ora d'oro:1.3), (film grain:1.3), (profondità di campo ridotta:1.2) distribuisce il budget del peso su tre cose e spesso non ne rende nessuna pulita. Scegli uno o due elementi da pesare. Lascia il resto al peso naturale.
Per SD 3.5, la sintassi del peso ha meno effetto. La comprensione del linguaggio naturale del modello significa che ottieni enfasi dalla struttura della frase. Scrivi un maestoso palazzo vittoriano, con una piccola figura a malapena visibile in primo piano e la relazione compositiva viene attraverso senza alcuna sintassi di parentesi.
Prova questo su SD 3.5: costruisci il tuo prompt senza zero token di peso. Aggiungili solo se il modello sottopesa coerentemente qualcosa di critico in tre o più generazioni.
LoRA: come cambiano quello che devi scrivere
I LoRA sono piccoli modelli aggiuntivi che sintonizzano Stable Diffusion per uno stile, personaggio o soggetto specifico. Caricarne uno cambia la tua strategia di prompt di base.
La sintassi: <lora:nome_modello:0.8> nel prompt positivo, dove 0.8 è il peso. Inizia tra 0.7 e 0.8. Andare sopra 1.0 spesso sovrasatura l'effetto e può rompere l'anatomia sui soggetti dei ritratti.
Cosa cambia quando un LoRA è attivo: la parola trigger porta molto peso, quindi il tuo prompt di base può essere più snello. Se carichi un LoRA con film grain cinematografico con parola trigger filmgrain35mm, non hai bisogno di 35mm, kodachrome, film grain, fotografia analogica nella tua base. Scrivi filmgrain35mm ritratto di [soggetto], luce morbida dalla finestra, editoriale e lascia che il LoRA faccia il lavoro di trama.
Cosa non cambia: la tua linea di soggetto, direzione dell'illuminazione e negative prompt contano ancora tanto quanto senza il LoRA. I LoRA gestiscono stile e superficie. Non riparano una linea di soggetto mal strutturata o una composizione che non corrisponde alla tua intenzione di output.
Dove trovare LoRA affidabili: Civitai è il repository principale. Per l'uso in produzione, rimani con LoRA che hanno un buon numero di download e output di esempio vicini a quello che hai bisogno. Un LoRA con download minimi e nessuna immagine di esempio è una scatola nera -- spenderai più tempo a fare debug che a generare.

Prompt pronti da copiare: inizia qui, adatta dopo
Ritratto editoriale su SDXL:
Positivo:
ritratto di una donna in tarda trentina, che guarda oltre la fotocamera, fotografia editoriale, luce morbida dalla finestra a sinistra, toni caldi attenuati, film grain, medio formato, (profondità di campo ridotta:1.2), altamente dettagliato, migliore qualitàNegativo:
sfocato, anatomia sbagliata, mani deformi, pelle di plastica, sovraesposta, foto stock, filigrana, testo, bassa qualitàArchitettura brutalista su SD 1.5:
Positivo:
essterno di edificio residenziale brutalista, trama di calcestruzzo grezzo, cielo coperto, fotografia documentaristica, grandangolo, tavolozza desaturata, alte ombre con contrasto, obiettivo 28mm, film grain kodak tri-x, altamente dettagliatoNegativo:
persone, auto, colorato, sovrasatura, sfocato, arte digitale, illustrazione, pitturaScena in linguaggio naturale su SD 3.5:
Positivo:
Una giovane donna che legge in una piccola libreria indipendente nel tardo pomeriggio, luce calda da una finestra accanto a lei, fotografata su pellicola 35mm, stile della fotografia editoriale, leggermente sottoesposta, grana visibile, feeling candidoNegativo:
sfocato, mani deformi, occhi asimmetrici, filigrana, foto stock, troppo illuminatoRubalo. Rimescola se vuoi, ma inizia da qualcosa che funziona prima di divergere.
Piattaforme per lanciare questi prompt
Non hai bisogno di una configurazione GPU locale per testare questi. Diverse piattaforme ti permettono di eseguire modelli basati su SD nel browser o tramite API.
Una cosa prima di continuare a modificare
La maggior parte dei problemi di prompt non sono effettivamente problemi di prompt. Sono problemi di seed.
Lancia un prompt solido almeno tre volte prima di toccare qualsiasi cosa. Stable Diffusion è stocastico -- la variazione è integrata nel processo di generazione. Un output negativo da un buon prompt è rumore. Tre output negativi di seguito, tutti sbagliati allo stesso modo, è un segnale che vale la pena affrontare.
Il flusso di lavoro che effettivamente funziona: correggi la tua struttura di prompt, trova un seed che produce un output forte, quindi affina da quella linea di base. Modificare il prompt dopo ogni singola generazione ti manterrà in un ciclo infinito di cambiamenti marginali senza un punto di riferimento per confrontare.
Vai a provarlo. Scegli uno dei prompt sopra. Lancialo in ComfyUI, AUTOMATIC1111 o la tua piattaforma SD preferita. Lancialo dieci volte prima di cambiare una parola. Imparerai più su cosa il modello risponde in quelle dieci esecuzioni che in qualsiasi guida di prompt.
Aprilo e guarda come è costruito.