Przewodnik po promptach Stable Diffusion: co działa na każdym modelu

Summary

Prompty Stable Diffusion działają inaczej w zależności od wersji modelu. SD1.5 i SDXL preferują listy tokenów rozdzielone przecinkami; SD3.5 rozumie język naturalny. Przewodnik obejmuje pięcioczęściową strukturę promptu, która sprawdza się we wszystkich wersjach, przetestowane negatywne prompty dostosowane do przypadku użycia, jak działa ważenie w nawiasach bez zniekształcania rezultatów i integrację słów kluczowych LoRA. Zawiera gotowe do skopiowania przykłady dla portretów redakcyjnych, zdjęć architektury i scen kinematycznych.

Workspace kierownika artystycznego z AI-wygenerowanymi wydrukami przypinnymi do ściany moodboard

Twój prompt Stable Diffusion nie działa w ten sam sposób na SD1.5, SDXL i SD3.5. Ten przewodnik po promptach Stable Diffusion omawia dokładną składnię dla każdej wersji modelu -- przetestowane negatywne prompty, mechanikę ważenia, integrację LoRA i gotowe do skopiowania przykłady z produkcji. Jeśli dotychczas kopiowałeś ogólne prompty i otrzymywałeś niespójne rezultaty, problem ma charakter strukturalny, a nie losowy.

SD1.5, SDXL, SD3.5: Każdy model ma swój własny język promptów

Najbigszy błąd w każdym poradniku dla początkujących to traktowanie Stable Diffusion jako jednego narzędzia. To są trzy różne języki promptów.

SD 1.5 chce krótkich, gęstych list tokenów. Model czyta twój prompt jako zbiór koncepcji ważonych pozycją. Wcześniejsze koncepcje przyciągają więcej uwagi. To oznacza: zacznij od tego, co ważne. portret kobiety, kinematyczne oświetlenie, słaba głębia ostrości, ziarnistość filmu, 35mm, kodachrome, wysoko szczegółowe działa, ponieważ temat i oświetlenie pojawiają się najpierw. Długie opisowe zdanie myli SD 1.5 -- nie został zbudowany do parsowania gramatyki.

SDXL obsługuje dłuższe prompty i dobrze reaguje na wstępy poświęcone jakości. Struktura (arcydzieło, najlepsza jakość:1.2), [temat], [tagi stylu], [oświetlenie], [kamera] pozostaje niezawodna. SDXL jest bardziej wyrozumiały w stosunku do porządku tokenów niż SD 1.5, ale nadal czyta prompty jako listę, a nie zdanie. Jedna kluczowa różnica: SDXL obsługuje negatywne prompty bardziej precyzyjnie, więc specyfika w twoich negatywach przynosi tu więcej korzyści niż na SD 1.5.

SD 3.5 całkowicie zmienił zasady. Dzięki architekturze MMDiT-X i potrójnemu kodownikowi tekstu, rozumie język naturalny na poziomie, którego starsze wersje nie mogą osiągnąć. Napisz Kobieta stojąca przed neonową księgarnią w deszczu, sfotografowana obiektywem 50mm, ciepłe światło wnętrza wylewające się na ulicę, estetyka fotografii filmowej a SD 3.5 podąża za zdaniem. Taki sam prompt na SD 1.5 wytworzy coś do zaakceptowania, ale kompozycyjnie innego -- i niekoniecznie w kierunku, jaki chciałeś.

Praktyczna próba: weź swój najlepszy prompt SDXL, uruchom go dosłownie na SD 3.5. Otrzymasz przyzwoity wynik. Teraz przepisz go na dwa naturalne zdania. Uruchom ponownie. Drugi rezultat zauważalnie lepiej będzie podążać za twoją intencją kompozycji.

SD 3.5 też lepiej obsługuje tekst w obrazach niż jakakolwiek poprzednia wersja Stable Diffusion. Jeśli czytelny tekst na wyjściu ma znaczenie dla twojego przypadku użycia, SD 3.5 jest jedyną wersją SD wartą używania do tego zadania.

Dłonie pisujące prompt w interfejsie Stable Diffusion na ciemnym ekranie

Pięcioczęściowa struktura promptu, która działa we wszystkich wersjach

Niezależnie od tego, który model uruchamiasz, ta struktura daje ci niezawodny punkt wyjścia:

  1. Temat -- kto lub co, jasno określone w pierwszych kilku słowach

  2. Odniesienie stylu -- język wizualny: kinematyczny, redakcyjny, fotografia vintage, ilustracja brutalistyczna, analog

  3. Oświetlenie -- najrzadziej testowana zmienna (miękkie rozproszone światło, złota godzina, ostre światło skierowane, neontowe światło obrzeżowe, pochmurne i płaskie)

  4. Techniczne i kamera -- ogniskowa, emulsja filmowa, medium, sugerowany stosunek wymiarów

  5. Sygnał jakości -- dla SD 1.5 i SDXL: najlepsza jakość, wysoko szczegółowe, 8k. Dla SD 3.5: pomiń to, nic nie dodaje

Umieść temat najpierw w każdej wersji. Wszystko inne może się zmienić. Kiedy wyjście wygląda źle, popraw linię tematu zanim dodasz więcej tokenów.

Ukradnij tę bazę SD 1.5 i SDXL:

[temat], [styl], [oświetlenie], fotografia 35mm, ziarnistość filmu, wysoko szczegółowe, najlepsza jakość

Ukradnij tę bazę SD 3.5:

[Scena opisana w jednym lub dwóch zdaniach.] Sfilmowana na filmie 35mm, [warunek oświetlenia], [konkretne odniesienie estetyczne].

Obydwie to punkty wyjścia. Dostosuj, gdy znasz dobrze zachowanie modelu, aż wiedz, co popychać.

Negatywne prompty: Przestań używać generycznej listy

Oto negatywny prompt, który znajdujesz w 90% przewodników:

brydki, rozmyty, zła anatomia, dodatkowe kończyny, zniekształcony, niska jakość, najgorsza jakość, artefakty jpeg

Nie zły. Ale prawie nie wykonuje żadnej rzeczywistej pracy w większości kontekstów. Negatywne prompty działają poprzez kodowanie tego, czego nie chcesz w przestrzeni latentnej. Im bardziej jesteś konkretny do rzeczywistego problemu, który pojawia się w twoich rezultatach, tym bardziej efektywne się stają.

Jeśli otrzymujesz mgliste tła: dodaj zajęte tło, bałagan, szumowe tło, brak głębi ostrości.

Jeśli portrety dryfują anatomicznie: dodaj asymetryczne oczy, zniekształcone ręce, zrosłe palce, dodatkowe palce, wydłużona szyja.

Jeśli wyjście zmienia się w kierunku fotografii stockowej pomimo twojego promptu: dodaj zdjęcie stockowe, przesłonięte, fotografia korporacyjna, błyszczący, zbyt jasny.

Jeśli widzisz przeciekające znaki wodne z danych treningowych: dodaj znak wodny, podpis, logo, nakładka tekstowa.

Mój promptu negatywny w produkcji dla portretów redakcyjnych na SDXL:

rozmyty, nie w ostrości, zła anatomia, zniekształcone ręce, dodatkowe kończyny, asymetryczne oczy, zdjęcie stockowe, przesłonięte, znak wodny, podpis, tekst, niska jakość, najgorsza jakość, artefakty jpeg, sztuczna skóra, pędzlem retuszowana, nadmiernie opracowana

Usuń klauzule, które nie dotyczą twojego tematu. Uruchomienie specyficznych dla portretów negatywów na generacji krajobrazu marnotrawnie obliczeniami i może stłumić rzeczy, które faktycznie chcesz.

Jedna rzecz warta wiedzenia: SD 3.5 reaguje na język naturalny w polu negatywnym. Brak znaków wodnych. Nie dołączaj tekstu. Unikaj przesłonionych świateł. działa obok list tokenów. Testuj oba formaty na swoim temacie i wybierz ten, który daje czystsze rezultaty.

Dwa wydruki AI wygenerowane obok siebie pokazujące kontrast stylu na biurku studio

Wagi i nacisk bez wkłócania wyjścia

W SD 1.5 i SDXL nawiasy okrągłe zwiększają wagę, a nawiasy kwadratowe zmniejszają ją.

Twarda zasada: pozostań poniżej 1.4 dla dowolnego pojedynczego elementu. Powyżej tego model zniekształca ważoną koncepcję i może pociągnąć kompozycję w kierunku nią niezamierzonym. Nie dodajesz nacisk, palujesz generację.

Częsty błąd: układanie wielu ważonych elementów w stos. Uruchomienie (złota godzina:1.3), (ziarnistość filmu:1.3), (słaba głębia ostrości:1.2) rozprzestrzenia budżet wagowy na trzy rzeczy i często nie dostarcza żadną z nich czysto. Wybierz jeden lub dwa elementy do ważenia. Pozostaw resztę przy naturalnej wadze.

Dla SD 3.5 składnia ważenia ma mniejszy efekt. Naturalne rozumienie języka modelu oznacza, że otrzymujesz nacisk ze struktury zdania. Napisz okazała wiktoriańska rezydencja, z małą postacią ledwie widoczną na pierwszym planie i relacja kompozycyjna przychodzi bez żadnej składni nawiasów.

Spróbuj tego na SD 3.5: zbuduj swój prompt z zerowymi tokenami wagi. Dodawaj je tylko, jeśli model konsekwentnie niedoważa coś krytycznego w trzech lub więcej generacjach.

LoRAs: Jak zmieniają to, co musisz napisać

LoRAs to małe modele dodatkowe, które dostrajają Stable Diffusion do konkretnego stylu, postaci lub tematu. Załadowanie jednego zmienia twoją bazową strategię promptu.

Sk ładnia: <lora:nazwa_modelu:0.8> w pozytywnym promptie, gdzie 0.8 to waga. Zacznij między 0.7 a 0.8. Wychodzenie powyżej 1.0 często przesyca efekt i może złamać anatomię na tematach portretowych.

Co się zmienia, gdy LoRA jest aktywna: słowo klucza nosi dużą wagę, więc twoja baza promptu może być szczuplejsza. Jeśli zaladowujesz kinematyczną LoRA ziarnistości filmu ze słowem kluczowym filmgrain35mm, nie potrzebujesz 35mm, kodachrome, ziarnistość filmu, fotografia analogowa w swojej bazie. Napisz filmgrain35mm portret [tematu], miękkie światło okienne, redakcyjne i pozwól LoRA, aby wykonać pracę tekstury.

Co się nie zmienia: twoja linia tematu, kierunek oświetlenia i negatywny prompt mają znaczenie tyle samo, co bez LoRA. LoRAs obsługują styl i powierzchnię. Nie naprawiają źle ustrukturyzowanej linii tematu lub kompozycji, która nie pasuje do twojej intencji wyjścia.

Gdzie znaleźć niezawodne LoRAs: Civitai to główne repozytorium. Do produkcji trzymaj się LoRAs, które mają solidne liczby pobrań i przykładowe wyjścia bliskie temu, czego potrzebujesz. LoRA z minimalnymi pobranymi i bez obrazów przykładowych to czarna skrzynka -- spędzisz więcej czasu na debugowaniu niż generowaniu.

Przezroczyste warstwy acetatu ułożone na stole świetlnym reprezentujące adaptery LoRA w Stable Diffusion

Gotowe do skopiowania prompty: Zacznij tutaj, dostosuj później

Portret redakcyjny na SDXL:

Pozytywny:

portret kobiety po trzydziestce, patrzący poza kamerę, fotografia redakcyjna, miękkie światło okienne z lewej, stonowane ciepłe tony, ziarnistość filmu, format średni, (słaba głębia ostrości:1.2), wysoko szczegółowe, najlepsza jakość

Negatywny:

rozmyty, zła anatomia, zniekształcone ręce, sztuczna skóra, przesłonięte, zdjęcie stockowe, znak wodny, tekst, niska jakość

Architektura brutalistyczna na SD 1.5:

Pozytywny:

zewnątrz budynku mieszkalnego brutalistycznego, tekstura surowego betonu, pochmurne niebo, fotografia dokumentalna, szeroki kąt, odszatnięta paleta, wysokie kontrast cieni, obiektyw 28mm, kodak tri-x ziarnistość, wysoko szczegółowe

Negatywny:

osoby, samochody, kolorowe, przesycone, rozmyty, cyfrowa sztuka, ilustracja, malarstwo

Scena w języku naturalnym na SD 3.5:

Pozytywny:

Młoda kobieta czyta w małej niezależnej księgarni late afternoon, ciepłe światło z okna obok niej, sfilmowana na filmie 35mm, styl fotografii redakcyjnej, lekko niedoświetlona, widoczna ziarnistość, spontaniczny, naturalistyczny czar

Negatywny:

rozmyty, zniekształcone ręce, asymetryczne oczy, znak wodny, zdjęcie stockowe, przesłonięte

Ukradnij to. Remiks jeśli chcesz, ale zacznij od czegoś, co działa zanim się odbiegniesz.

Platformy do uruchamiania tych promptów

Nie potrzebujesz lokalnego GPU setup, aby testować te. Kilka platform pozwala na uruchomienie modeli opartych na SD i powiązanych w przeglądarce lub poprzez API.

Jedna rzecz zanim będziesz dalej grać

Większość problemów z promptami to nie problemy z promptami. To problemy z seedem.

Uruchom solidny prompt co najmniej trzy razy zanim cokolwiek dotkniesz. Stable Diffusion jest stochastyczne -- zmienność jest wbudowana w proces generacji. Jedno złe wyjście z dobrego promptu to szum. Trzy złe wyjścia z rzędu, wszystkie złe w taki sam sposób, to sygnał wart działania.

Workflow, który faktycznie działa: napraw strukturę swojego promptu, znajdź seed, który wytwarza silny wynik, potem udoskonalaj z tego baseline. Granie promptu po każdej pojedynczej generacji będzie cię utrzymywać w nieskończonej pętli marginalnych zmian bez punktu odniesienia do porównania.

Idź to spróbuj. Wybierz jeden z promptów wyżej. Upuść go w ComfyUI, AUTOMATIC1111 lub na wybraną platformę SD. Uruchom to dziesięć razy zanim zmienisz słowo. Nauczysz się więcej o tym, na co model reaguje w tych dziesięciu biegach, niż w jakimkolwiek przewodniku promptów.

Przebiegnij go i zobacz, jak jest zbudowany.

Frequently asked questions

Jaka jest różnica między promptami SD1.5 a SDXL?
SD1.5 działa najlepiej z krótkimi, gęstymi listami tokenów, gdzie porządek słów wpływa na wyjście. SDXL obsługuje dłuższe prompty i korzysta z wstępów dotyczących jakości, takich jak (arcydzieło, najlepsza jakość:1.2). Obie wersje czytają prompty jako zbiory tokenów, a nie naturalne zdania językowe.
Czy SD3.5 wymaga innego formatu promptu niż SDXL?
Tak. SD3.5 rozumie język naturalny, więc pisanie opisowych zdań działa lepiej niż listy tokenów rozdzielone przecinkami. Sygnały jakości, takie jak 'najlepsza jakość' lub 'wysoko szczegółowe', mają mały mierzalny efekt na SD3.5 i mogą być pominięte.
Jak napisać efektywne negatywne prompty dla Stable Diffusion?
Zacznij od listy bazowej kierowanej na problemy anatomiczne, artefakty jakości i dryfowanie stylu, potem dodaj klauzule specyficzne do tego, co się psuje w twoich wynikach. Kierowanie na rzeczywisty problem -- mgliste tła, dryfowanie fotografii stockowej, przeciekanie znaków wodnych -- jest bardziej efektywne niż generyczna długa lista.
Jaką wartość wagi powinienem używać z nawiasami w promptach SD?
Pozostań poniżej 1.4 dla dowolnego pojedynczego elementu. Wartości powyżej 1.4 zwykle zniekształcają ważoną koncepcję i pociągają kompozycję w niezamierzone kierunki. Zacznij od 1.2 dla elementów, które chcesz wyróżnić i dostosuj stąd. Unikaj ważenia więcej niż dwóch elementów w tym samym promptie.
Jak LoRAs zmieniają prompty, które piszę?
Gdy LoRA jest aktywna, jej słowo klucz nosi znaczną wagę, więc twoja baza promptu może być szczuplejsza. Usuń tokeny stylu, które LoRA już obsługuje. Twoja linia tematu, kierunek oświetlenia i negatywny prompt mają znaczenie tyle samo bez LoRA -- LoRAs obsługują styl, a nie kompozycję.
Czy mogę używać promptów Stable Diffusion na Flux lub Midjourney?
Każdy model używa innego języka promptu. Midjourney nie używa pól negatywnych promptów lub składni ważenia w ten sam sposób. Flux 1.1 Pro lepiej reaguje na język naturalny podobny do SD3.5. Dostosuj prompty do każdego modelu zamiast kopiowania ich bez zmian.
Dlaczego moje wyjścia Stable Diffusion tak się różnią między generacjami?
Stable Diffusion używa losowego seeda dla każdej generacji, co znacząco wpływa na wyjście. To normalne zachowanie. Uruchom ten sam prompt trzy lub więcej razy, zanim zdecydujesz, że prompt jest zły. Jeśli wiele wyników jest złych w taki sam sposób, potem dostosuj strukturę promptu.
★ steely dan × liminal hotel room × 35mm film ★ brutalist architecture sunset vaporwave ★ 1970s rock album × medium format ★ renaissance cyberpunk samurai ★ macro honey gold leaf ★ tokyo aerial rain cinematic ★ surrealist collage editorial ★ analog grain portrait studio ★ neon botanical illustration ★   ★ steely dan × liminal hotel room × 35mm film ★ brutalist architecture sunset vaporwave ★ 1970s rock album × medium format ★ renaissance cyberpunk samurai ★ macro honey gold leaf ★ tokyo aerial rain cinematic ★ surrealist collage editorial ★ analog grain portrait studio ★ neon botanical illustration ★   
✦ copy the prompt ✦ remix this ✦ drop into flux ✦ steal this look ✦ open the moodboard ✦ crack it open ✦ send to nano banana ✦ go wild ✦ copy the prompt ✦ remix this ✦ drop into flux ✦ steal this look ✦ open the moodboard ✦ crack it open ✦ send to nano banana ✦ go wild ✦