Stable Diffusion-guide: vad som faktiskt fungerar per modell
Summary
Din SD-prompt fungerar inte likadant på SD1.5, SDXL och SD3.5. SD1.5 vill ha korta tokenlistor, SDXL hanterar längre prompts med kvalitetspreambler och SD3.5 förstår naturligt språk på en nivå de äldre versionerna inte klarar. Den här guiden täcker exakt syntax per modellversion, testade negativa prompts, viktmekanik, LoRA-integration och copy-ready exempel från produktion. Om du kopierat generiska prompts och fått inkonsistenta resultat, är problemet strukturellt.
Din Stable Diffusion-prompt fungerar inte likadant på SD1.5, SDXL och SD3.5. Den här stable diffusion prompts guide täcker exakt syntax per modellversion, testade negativa prompts, viktmekanik och LoRA-integration med copy-ready exempel från produktion. Om du kopierat generiska prompts och fått inkonsistenta resultat, är problemet strukturellt, inte slumpmässigt.
SD1.5, SDXL, SD3.5: tre olika prompt-språk
Det största misstaget i alla nybörjarguider är att behandla Stable Diffusion som ett enda verktyg. Det är tre olika prompt-språk.
SD 1.5 vill ha korta, täta tokenlistor. Modellen läser din prompt som ett knippe begrepp viktade efter position. Tidigare begrepp drar mer uppmärksamhet. Det betyder: sätt det viktigaste först. portrait of a woman, cinematic lighting, shallow depth of field, film grain, 35mm, kodachrome, highly detailed fungerar för att subjektet och belysningen kommer först. En lång beskrivande mening förvirrar SD 1.5, den är inte byggd för att tolka grammatik.
SDXL hanterar längre prompts och svarar bra på kvalitetspreambler. Strukturen (masterpiece, best quality:1.2), [subjekt], [stiltaggar], [belysning], [kamera] är fortfarande pålitlig. SDXL är mer förlåtande med tokenordning än SD 1.5, men läser ändå prompts som en lista, inte en mening. En viktig skillnad: SDXL hanterar negativa prompts mer precist, så specificitet i dina negationer ger mer utdelning här än på SD 1.5.
SD 3.5 ändrade reglerna helt. Med sin MMDiT-X-arkitektur och trippel textkodare förstår den naturligt språk på en nivå de äldre versionerna inte klarar. Skriv A woman standing in front of a neon-lit bookshop in rain, photographed with a 50mm lens, warm interior light spilling out, film photography aesthetic och SD 3.5 följer meningen. Samma prompt på SD 1.5 ger ett hyggligt resultat, men kompositionellt annorlunda, och inte alltid i den riktning du ville.
Det praktiska testet: ta din bästa SDXL-prompt, kör den ordagrant på SD 3.5. Du får ett okej resultat. Skriv nu om den som två naturliga meningar och kör igen. Det andra resultatet följer din kompositionsintention märkbart bättre.
SD 3.5 hanterar också text i bilder bättre än någon tidigare Stable Diffusion-version. Om läsbar text i outputen spelar roll för ditt projekt, är SD 3.5 den enda SD-version som är värd att använda för den uppgiften.

Fem delar som håller i alla versioner
Oavsett vilken modell du kör ger den här strukturen en pålitlig startpunkt:
Subjekt, vem eller vad, tydligt formulerat i de första orden
Stilreferens, det visuella språket: cinematic, editorial, vintage photograph, brutalist illustration, analog
Belysning, den mest undertestade variabeln (soft diffused light, golden hour, hard directional light, neon rim light, overcast flat)
Teknik och kamera, brännvidd, filmstock, medium, implicit bildformat
Kvalitetssignal, för SD 1.5 och SDXL:
best quality, highly detailed, 8k. För SD 3.5: hoppa över det, det tillför ingenting
Sätt subjektet först i varje version. Allt annat kan skifta. När en output ser fel ut, fixa subjektraden innan du lägger till fler tokens.
Stjäl den här SD 1.5- och SDXL-basen:
[subjekt], [stil], [belysning], 35mm photography, film grain, highly detailed, best qualityStjäl den här SD 3.5-basen:
[Scen beskriven i en eller två meningar.] Shot on 35mm film, [ljusförhållande], [specifik estetisk referens].Båda är startpunkter. Anpassa när du kan modellens beteende tillräckligt bra för att veta vad du kan pusha.
Negativa prompts: sluta använda den generiska listan
Här är den negativa prompt du hittar i 90% av alla guider:
ugly, blurry, bad anatomy, extra limbs, deformed, low quality, worst quality, jpeg artifactsInte fel. Men gör knappt något riktigt arbete i de flesta sammanhang. Negativa prompts fungerar genom att koda det du inte vill ha i det latenta rummet. Ju mer specifik du är mot det faktiska problemet som dyker upp i dina outputs, desto mer effektiva blir de.
Om du får grumliga bakgrunder: lägg till busy background, cluttered, noisy background, absent depth of field.
Om porträtt driftar anatomiskt: lägg till asymmetrical eyes, deformed hands, fused fingers, extra fingers, elongated neck.
Om outputen glider mot stockfoto trots din prompt: lägg till stock photo, overexposed, corporate photography, glossy, overly bright.
Om du ser vattenstämpelgenomblödning från träningsdata: lägg till watermark, signature, logo, text overlay.
Min produktionsprompt för redaktionella porträtt på SDXL:
blurry, out of focus, bad anatomy, deformed hands, extra limbs, asymmetrical eyes, stock photo, overexposed, watermark, signature, text, low quality, worst quality, jpeg artifacts, plastic skin, airbrushed, over-retouchedTa bort meningarna som inte gäller ditt subjekt. Att köra porträttspecifika negationer på en landskapsgenerering slösar beräkningskraft och kan undertrycka saker du faktiskt vill ha.
En sak värd att veta: SD 3.5 svarar på naturligt språk i negationsfältet. No watermarks. Do not include text. Avoid overexposed highlights. fungerar tillsammans med tokenlistor. Testa båda formaten och välj det som ger renare outputs för ditt subjekt.

Vikter och betoning utan att förstöra outputen
I SD 1.5 och SDXL ökar parenteser vikten och hakparenteser minskar den.
(cinematic lighting:1.3), 30% mer vikt på det här begreppet[cluttered background], undertrycker det här elementet lite((very important detail)), varje parentespar multiplicerar med ungefär 1.1
Den hårda regeln: håll dig under 1.4 för vilket enskilt element som helst. Över det förvränger modellen det viktade begreppet och kan dra kompositionen mot det på ett sätt du inte vill. Du lägger inte till betoning, du bränner genereringen.
Ett vanligt misstag: stapla flera viktade element. Att köra (golden hour:1.3), (film grain:1.3), (shallow depth of field:1.2) sprider viktbudgeten över tre saker och levererar ofta ingen av dem rent. Välj ett eller två element att vikta. Låt resten ligga på naturlig vikt.
För SD 3.5 har viktsyntax mindre effekt. Modellens naturliga språkförståelse innebär att du får betoning från meningsstruktur. Skriv an imposing Victorian mansion, with a small figure barely visible in the foreground och det kompositionella förhållandet kommer igenom utan parentessyntax.
Prova det här på SD 3.5: bygg din prompt helt utan vikttokens. Lägg till dem bara om modellen konsekvent underviktar något kritiskt i tre eller fler genereringar.
LoRAs: hur de förändrar vad du behöver skriva
LoRAs är små tilläggsmodeller som finjusterar Stable Diffusion för en specifik stil, karaktär eller ett ämne. Att ladda en förändrar din grundläggande promptstrategi.
Syntaxen: <lora:modellnamn:0.8> i den positiva prompten, där 0.8 är vikten. Börja mellan 0.7 och 0.8. Att gå över 1.0 övermättar ofta effekten och kan bryta anatomin på porträttsubjekt.
Vad som förändras när en LoRA är aktiv: triggervärdet bär mycket vikt, så din grundläggande prompt kan vara smalare. Om du laddar en cinematic film grain LoRA med triggerord filmgrain35mm, behöver du inte 35mm, kodachrome, film grain, analog photography i din bas. Skriv filmgrain35mm portrait of [subjekt], soft window light, editorial och låt LoRA:n göra texturarbetet.
Vad som inte förändras: din subjektrad, belysningsriktning och negativ prompt spelar fortfarande lika stor roll som utan LoRA:n. LoRAs hanterar stil och yta. De fixar inte en dåligt strukturerad subjektrad eller en komposition som inte stämmer med din outputintention.
Vad du hittar pålitliga LoRAs: Civitai är det viktigaste arkivet. För produktionsbruk, håll dig till LoRAs med solida nedladdningsantal och exempeloutputs nära det du behöver. En LoRA med minimala nedladdningar och inga exempelbilder är en svart låda, du spenderar mer tid på felsökning än på att generera.

Färdiga prompts att kopiera: börja här, anpassa sen
Redaktionellt porträtt på SDXL:
Positivt:
portrait of a woman in her late 30s, looking past the camera, editorial photography, soft window light from the left, muted warm tones, film grain, medium format, (shallow depth of field:1.2), highly detailed, best qualityNegativt:
blurry, bad anatomy, deformed hands, plastic skin, overexposed, stock photo, watermark, text, low qualityBrutalistisk arkitektur på SD 1.5:
Positivt:
brutalist apartment building exterior, raw concrete texture, overcast sky, documentary photography, wide angle, desaturated palette, high contrast shadows, 28mm lens, kodak tri-x grain, highly detailedNegativt:
people, cars, colorful, oversaturated, blurry, digital art, illustration, paintingNaturlig språkscen på SD 3.5:
Positivt:
A young woman reading in a small independent bookshop late afternoon, warm light from a window beside her, shot on 35mm film, editorial photography style, slightly underexposed, visible grain, candid feelNegativt:
blurry, deformed hands, asymmetrical eyes, watermark, stock photo, overlitStjäl det här. Mixa om du vill, men börja med något som fungerar innan du avviker.
Plattformar att testa dessa prompts på
Du behöver ingen lokal GPU-setup för att testa det här. Flera plattformar låter dig köra SD-baserade och relaterade modeller direkt i webbläsaren eller via API.
En sak innan du fortsätter tweaka
De flesta prompt-problem är egentligen inte prompt-problem. De är seed-problem.
Kör en solid prompt minst tre gånger innan du rör något. Stable Diffusion är stokastisk, variation är inbyggt i genereringsprocessen. En dålig output från en bra prompt är brus. Tre dåliga outputs i rad, alla fel på samma sätt, är en signal värd att agera på.
Det arbetsflöde som faktiskt fungerar: fixa din promptstruktur, hitta ett seed som producerar en stark output, förfina sedan från den baslinjen. Att tweaka prompten efter varje enskild generering håller dig i en ändlös loop av marginella förändringar utan någon referenspunkt att jämföra mot.
Testa det nu. Ta en av prompterna ovan. Kör den i ComfyUI, AUTOMATIC1111 eller din SD-plattform. Kör den tio gånger innan du ändrar ett ord. Du lär dig mer om vad modellen svarar på under de tio körningarna än i någon prompt-guide.
Crack it open, kolla hur det är byggt.