Stable Diffusion-guide: vad som faktiskt fungerar per modell

Summary

Din SD-prompt fungerar inte likadant på SD1.5, SDXL och SD3.5. SD1.5 vill ha korta tokenlistor, SDXL hanterar längre prompts med kvalitetspreambler och SD3.5 förstår naturligt språk på en nivå de äldre versionerna inte klarar. Den här guiden täcker exakt syntax per modellversion, testade negativa prompts, viktmekanik, LoRA-integration och copy-ready exempel från produktion. Om du kopierat generiska prompts och fått inkonsistenta resultat, är problemet strukturellt.

Art director-arbetsplats med AI-genererade prints fästa på moodboard-vägg

Din Stable Diffusion-prompt fungerar inte likadant på SD1.5, SDXL och SD3.5. Den här stable diffusion prompts guide täcker exakt syntax per modellversion, testade negativa prompts, viktmekanik och LoRA-integration med copy-ready exempel från produktion. Om du kopierat generiska prompts och fått inkonsistenta resultat, är problemet strukturellt, inte slumpmässigt.

SD1.5, SDXL, SD3.5: tre olika prompt-språk

Det största misstaget i alla nybörjarguider är att behandla Stable Diffusion som ett enda verktyg. Det är tre olika prompt-språk.

SD 1.5 vill ha korta, täta tokenlistor. Modellen läser din prompt som ett knippe begrepp viktade efter position. Tidigare begrepp drar mer uppmärksamhet. Det betyder: sätt det viktigaste först. portrait of a woman, cinematic lighting, shallow depth of field, film grain, 35mm, kodachrome, highly detailed fungerar för att subjektet och belysningen kommer först. En lång beskrivande mening förvirrar SD 1.5, den är inte byggd för att tolka grammatik.

SDXL hanterar längre prompts och svarar bra på kvalitetspreambler. Strukturen (masterpiece, best quality:1.2), [subjekt], [stiltaggar], [belysning], [kamera] är fortfarande pålitlig. SDXL är mer förlåtande med tokenordning än SD 1.5, men läser ändå prompts som en lista, inte en mening. En viktig skillnad: SDXL hanterar negativa prompts mer precist, så specificitet i dina negationer ger mer utdelning här än på SD 1.5.

SD 3.5 ändrade reglerna helt. Med sin MMDiT-X-arkitektur och trippel textkodare förstår den naturligt språk på en nivå de äldre versionerna inte klarar. Skriv A woman standing in front of a neon-lit bookshop in rain, photographed with a 50mm lens, warm interior light spilling out, film photography aesthetic och SD 3.5 följer meningen. Samma prompt på SD 1.5 ger ett hyggligt resultat, men kompositionellt annorlunda, och inte alltid i den riktning du ville.

Det praktiska testet: ta din bästa SDXL-prompt, kör den ordagrant på SD 3.5. Du får ett okej resultat. Skriv nu om den som två naturliga meningar och kör igen. Det andra resultatet följer din kompositionsintention märkbart bättre.

SD 3.5 hanterar också text i bilder bättre än någon tidigare Stable Diffusion-version. Om läsbar text i outputen spelar roll för ditt projekt, är SD 3.5 den enda SD-version som är värd att använda för den uppgiften.

Händer som skriver prompt i Stable Diffusion-gränssnitt på mörk skärm

Fem delar som håller i alla versioner

Oavsett vilken modell du kör ger den här strukturen en pålitlig startpunkt:

  1. Subjekt, vem eller vad, tydligt formulerat i de första orden

  2. Stilreferens, det visuella språket: cinematic, editorial, vintage photograph, brutalist illustration, analog

  3. Belysning, den mest undertestade variabeln (soft diffused light, golden hour, hard directional light, neon rim light, overcast flat)

  4. Teknik och kamera, brännvidd, filmstock, medium, implicit bildformat

  5. Kvalitetssignal, för SD 1.5 och SDXL: best quality, highly detailed, 8k. För SD 3.5: hoppa över det, det tillför ingenting

Sätt subjektet först i varje version. Allt annat kan skifta. När en output ser fel ut, fixa subjektraden innan du lägger till fler tokens.

Stjäl den här SD 1.5- och SDXL-basen:

[subjekt], [stil], [belysning], 35mm photography, film grain, highly detailed, best quality

Stjäl den här SD 3.5-basen:

[Scen beskriven i en eller två meningar.] Shot on 35mm film, [ljusförhållande], [specifik estetisk referens].

Båda är startpunkter. Anpassa när du kan modellens beteende tillräckligt bra för att veta vad du kan pusha.

Negativa prompts: sluta använda den generiska listan

Här är den negativa prompt du hittar i 90% av alla guider:

ugly, blurry, bad anatomy, extra limbs, deformed, low quality, worst quality, jpeg artifacts

Inte fel. Men gör knappt något riktigt arbete i de flesta sammanhang. Negativa prompts fungerar genom att koda det du inte vill ha i det latenta rummet. Ju mer specifik du är mot det faktiska problemet som dyker upp i dina outputs, desto mer effektiva blir de.

Om du får grumliga bakgrunder: lägg till busy background, cluttered, noisy background, absent depth of field.

Om porträtt driftar anatomiskt: lägg till asymmetrical eyes, deformed hands, fused fingers, extra fingers, elongated neck.

Om outputen glider mot stockfoto trots din prompt: lägg till stock photo, overexposed, corporate photography, glossy, overly bright.

Om du ser vattenstämpelgenomblödning från träningsdata: lägg till watermark, signature, logo, text overlay.

Min produktionsprompt för redaktionella porträtt på SDXL:

blurry, out of focus, bad anatomy, deformed hands, extra limbs, asymmetrical eyes, stock photo, overexposed, watermark, signature, text, low quality, worst quality, jpeg artifacts, plastic skin, airbrushed, over-retouched

Ta bort meningarna som inte gäller ditt subjekt. Att köra porträttspecifika negationer på en landskapsgenerering slösar beräkningskraft och kan undertrycka saker du faktiskt vill ha.

En sak värd att veta: SD 3.5 svarar på naturligt språk i negationsfältet. No watermarks. Do not include text. Avoid overexposed highlights. fungerar tillsammans med tokenlistor. Testa båda formaten och välj det som ger renare outputs för ditt subjekt.

Två AI-genererade prints sida vid sida som visar stilkontrast på studiobord

Vikter och betoning utan att förstöra outputen

I SD 1.5 och SDXL ökar parenteser vikten och hakparenteser minskar den.

Den hårda regeln: håll dig under 1.4 för vilket enskilt element som helst. Över det förvränger modellen det viktade begreppet och kan dra kompositionen mot det på ett sätt du inte vill. Du lägger inte till betoning, du bränner genereringen.

Ett vanligt misstag: stapla flera viktade element. Att köra (golden hour:1.3), (film grain:1.3), (shallow depth of field:1.2) sprider viktbudgeten över tre saker och levererar ofta ingen av dem rent. Välj ett eller två element att vikta. Låt resten ligga på naturlig vikt.

För SD 3.5 har viktsyntax mindre effekt. Modellens naturliga språkförståelse innebär att du får betoning från meningsstruktur. Skriv an imposing Victorian mansion, with a small figure barely visible in the foreground och det kompositionella förhållandet kommer igenom utan parentessyntax.

Prova det här på SD 3.5: bygg din prompt helt utan vikttokens. Lägg till dem bara om modellen konsekvent underviktar något kritiskt i tre eller fler genereringar.

LoRAs: hur de förändrar vad du behöver skriva

LoRAs är små tilläggsmodeller som finjusterar Stable Diffusion för en specifik stil, karaktär eller ett ämne. Att ladda en förändrar din grundläggande promptstrategi.

Syntaxen: <lora:modellnamn:0.8> i den positiva prompten, där 0.8 är vikten. Börja mellan 0.7 och 0.8. Att gå över 1.0 övermättar ofta effekten och kan bryta anatomin på porträttsubjekt.

Vad som förändras när en LoRA är aktiv: triggervärdet bär mycket vikt, så din grundläggande prompt kan vara smalare. Om du laddar en cinematic film grain LoRA med triggerord filmgrain35mm, behöver du inte 35mm, kodachrome, film grain, analog photography i din bas. Skriv filmgrain35mm portrait of [subjekt], soft window light, editorial och låt LoRA:n göra texturarbetet.

Vad som inte förändras: din subjektrad, belysningsriktning och negativ prompt spelar fortfarande lika stor roll som utan LoRA:n. LoRAs hanterar stil och yta. De fixar inte en dåligt strukturerad subjektrad eller en komposition som inte stämmer med din outputintention.

Vad du hittar pålitliga LoRAs: Civitai är det viktigaste arkivet. För produktionsbruk, håll dig till LoRAs med solida nedladdningsantal och exempeloutputs nära det du behöver. En LoRA med minimala nedladdningar och inga exempelbilder är en svart låda, du spenderar mer tid på felsökning än på att generera.

Transparenta acetatskikt staplade på ljusbord som representerar LoRA-adaptrar i Stable Diffusion

Färdiga prompts att kopiera: börja här, anpassa sen

Redaktionellt porträtt på SDXL:

Positivt:

portrait of a woman in her late 30s, looking past the camera, editorial photography, soft window light from the left, muted warm tones, film grain, medium format, (shallow depth of field:1.2), highly detailed, best quality

Negativt:

blurry, bad anatomy, deformed hands, plastic skin, overexposed, stock photo, watermark, text, low quality

Brutalistisk arkitektur på SD 1.5:

Positivt:

brutalist apartment building exterior, raw concrete texture, overcast sky, documentary photography, wide angle, desaturated palette, high contrast shadows, 28mm lens, kodak tri-x grain, highly detailed

Negativt:

people, cars, colorful, oversaturated, blurry, digital art, illustration, painting

Naturlig språkscen på SD 3.5:

Positivt:

A young woman reading in a small independent bookshop late afternoon, warm light from a window beside her, shot on 35mm film, editorial photography style, slightly underexposed, visible grain, candid feel

Negativt:

blurry, deformed hands, asymmetrical eyes, watermark, stock photo, overlit

Stjäl det här. Mixa om du vill, men börja med något som fungerar innan du avviker.

Plattformar att testa dessa prompts på

Du behöver ingen lokal GPU-setup för att testa det här. Flera plattformar låter dig köra SD-baserade och relaterade modeller direkt i webbläsaren eller via API.

En sak innan du fortsätter tweaka

De flesta prompt-problem är egentligen inte prompt-problem. De är seed-problem.

Kör en solid prompt minst tre gånger innan du rör något. Stable Diffusion är stokastisk, variation är inbyggt i genereringsprocessen. En dålig output från en bra prompt är brus. Tre dåliga outputs i rad, alla fel på samma sätt, är en signal värd att agera på.

Det arbetsflöde som faktiskt fungerar: fixa din promptstruktur, hitta ett seed som producerar en stark output, förfina sedan från den baslinjen. Att tweaka prompten efter varje enskild generering håller dig i en ändlös loop av marginella förändringar utan någon referenspunkt att jämföra mot.

Testa det nu. Ta en av prompterna ovan. Kör den i ComfyUI, AUTOMATIC1111 eller din SD-plattform. Kör den tio gånger innan du ändrar ett ord. Du lär dig mer om vad modellen svarar på under de tio körningarna än i någon prompt-guide.

Crack it open, kolla hur det är byggt.

Frequently asked questions

Vad är skillnaden mellan SD1.5- och SDXL-prompts?
SD1.5 fungerar bäst med korta, täta tokenlistor där ordordningen påverkar outputen. Tidigare ord i prompten drar mer uppmärksamhet. SDXL hanterar längre prompts och drar nytta av kvalitetspreambler som (masterpiece, best quality:1.2). Båda läser prompts som listor, inte meningar, till skillnad från SD3.5.
Kräver SD3.5 ett annat promptformat än SDXL?
Ja. SD3.5 förstår naturligt språk, så att skriva beskrivande meningar fungerar bättre än kommaseparerade tokenlistor. Kvalitetssignaler som 'best quality' tillför ingenting på SD3.5 och kan hoppas över. Viktsyntax med parenteser har också mindre effekt.
Hur skriver jag effektiva negativa prompts för Stable Diffusion?
Börja med en baslista som riktar sig mot anatomiproblem, kvalitetsartefakter och stildrift, lägg sedan till meningar specifikt för vad som går fel i just dina outputs. En porträttspecifik negativ prompt på en landskapsgenerering slösar beräkningskraft och kan undertrycka saker du faktiskt vill ha.
Vilket viktvärde ska jag använda med parenteser i SD-prompts?
Håll dig under 1.4 för vilket enskilt element som helst. Värden över 1.4 förvränger det viktade begreppet och drar kompositionen i oönskade riktningar. Börja vid 1.1 eller 1.2 och justera. Stacka inte fler än två viktade element i samma prompt.
Hur förändrar LoRAs de prompts jag behöver skriva?
När en LoRA är aktiv bär dess triggerord betydande vikt, så din grundläggande prompt kan vara smalare. Ta bort stiltaggar som LoRA:n redan hanterar. Ditt subjekt, belysningsriktning och negativ prompt spelar fortfarande lika stor roll som utan LoRA:n.
Kan jag använda Stable Diffusion-prompts på Flux eller Midjourney?
Varje modell använder ett annat prompt-språk. Midjourney använder inte negativa promptfält eller viktsyntax på samma sätt. Flux 1.1 Pro svarar bättre på naturligt språk, liknande SD3.5. Kopiera inte prompts rakt av mellan modeller, anpassa strukturen för varje.
Varför varierar mina Stable Diffusion-outputs så mycket mellan genereringar?
Stable Diffusion använder ett slumpmässigt seed för varje generering, vilket påverkar outputen avsevärt. Det är förväntat beteende. Kör samma prompt minst tre gånger med olika seeds innan du ändrar något i prompten, annars riskerar du att felsöka brus snarare än ett verkligt problem.
★ steely dan × liminal hotel room × 35mm film ★ brutalist architecture sunset vaporwave ★ 1970s rock album × medium format ★ renaissance cyberpunk samurai ★ macro honey gold leaf ★ tokyo aerial rain cinematic ★ surrealist collage editorial ★ analog grain portrait studio ★ neon botanical illustration ★   ★ steely dan × liminal hotel room × 35mm film ★ brutalist architecture sunset vaporwave ★ 1970s rock album × medium format ★ renaissance cyberpunk samurai ★ macro honey gold leaf ★ tokyo aerial rain cinematic ★ surrealist collage editorial ★ analog grain portrait studio ★ neon botanical illustration ★   
✦ copy the prompt ✦ remix this ✦ drop into flux ✦ steal this look ✦ open the moodboard ✦ crack it open ✦ send to nano banana ✦ go wild ✦ copy the prompt ✦ remix this ✦ drop into flux ✦ steal this look ✦ open the moodboard ✦ crack it open ✦ send to nano banana ✦ go wild ✦