Przewodnik po promptach Stable Diffusion: co działa na każdym modelu
Summary
Prompty Stable Diffusion działają inaczej w zależności od wersji modelu. SD1.5 i SDXL preferują listy tokenów rozdzielone przecinkami; SD3.5 rozumie język naturalny. Przewodnik obejmuje pięcioczęściową strukturę promptu, która sprawdza się we wszystkich wersjach, przetestowane negatywne prompty dostosowane do przypadku użycia, jak działa ważenie w nawiasach bez zniekształcania rezultatów i integrację słów kluczowych LoRA. Zawiera gotowe do skopiowania przykłady dla portretów redakcyjnych, zdjęć architektury i scen kinematycznych.
Twój prompt Stable Diffusion nie działa w ten sam sposób na SD1.5, SDXL i SD3.5. Ten przewodnik po promptach Stable Diffusion omawia dokładną składnię dla każdej wersji modelu -- przetestowane negatywne prompty, mechanikę ważenia, integrację LoRA i gotowe do skopiowania przykłady z produkcji. Jeśli dotychczas kopiowałeś ogólne prompty i otrzymywałeś niespójne rezultaty, problem ma charakter strukturalny, a nie losowy.
SD1.5, SDXL, SD3.5: Każdy model ma swój własny język promptów
Najbigszy błąd w każdym poradniku dla początkujących to traktowanie Stable Diffusion jako jednego narzędzia. To są trzy różne języki promptów.
SD 1.5 chce krótkich, gęstych list tokenów. Model czyta twój prompt jako zbiór koncepcji ważonych pozycją. Wcześniejsze koncepcje przyciągają więcej uwagi. To oznacza: zacznij od tego, co ważne. portret kobiety, kinematyczne oświetlenie, słaba głębia ostrości, ziarnistość filmu, 35mm, kodachrome, wysoko szczegółowe działa, ponieważ temat i oświetlenie pojawiają się najpierw. Długie opisowe zdanie myli SD 1.5 -- nie został zbudowany do parsowania gramatyki.
SDXL obsługuje dłuższe prompty i dobrze reaguje na wstępy poświęcone jakości. Struktura (arcydzieło, najlepsza jakość:1.2), [temat], [tagi stylu], [oświetlenie], [kamera] pozostaje niezawodna. SDXL jest bardziej wyrozumiały w stosunku do porządku tokenów niż SD 1.5, ale nadal czyta prompty jako listę, a nie zdanie. Jedna kluczowa różnica: SDXL obsługuje negatywne prompty bardziej precyzyjnie, więc specyfika w twoich negatywach przynosi tu więcej korzyści niż na SD 1.5.
SD 3.5 całkowicie zmienił zasady. Dzięki architekturze MMDiT-X i potrójnemu kodownikowi tekstu, rozumie język naturalny na poziomie, którego starsze wersje nie mogą osiągnąć. Napisz Kobieta stojąca przed neonową księgarnią w deszczu, sfotografowana obiektywem 50mm, ciepłe światło wnętrza wylewające się na ulicę, estetyka fotografii filmowej a SD 3.5 podąża za zdaniem. Taki sam prompt na SD 1.5 wytworzy coś do zaakceptowania, ale kompozycyjnie innego -- i niekoniecznie w kierunku, jaki chciałeś.
Praktyczna próba: weź swój najlepszy prompt SDXL, uruchom go dosłownie na SD 3.5. Otrzymasz przyzwoity wynik. Teraz przepisz go na dwa naturalne zdania. Uruchom ponownie. Drugi rezultat zauważalnie lepiej będzie podążać za twoją intencją kompozycji.
SD 3.5 też lepiej obsługuje tekst w obrazach niż jakakolwiek poprzednia wersja Stable Diffusion. Jeśli czytelny tekst na wyjściu ma znaczenie dla twojego przypadku użycia, SD 3.5 jest jedyną wersją SD wartą używania do tego zadania.

Pięcioczęściowa struktura promptu, która działa we wszystkich wersjach
Niezależnie od tego, który model uruchamiasz, ta struktura daje ci niezawodny punkt wyjścia:
Temat -- kto lub co, jasno określone w pierwszych kilku słowach
Odniesienie stylu -- język wizualny: kinematyczny, redakcyjny, fotografia vintage, ilustracja brutalistyczna, analog
Oświetlenie -- najrzadziej testowana zmienna (miękkie rozproszone światło, złota godzina, ostre światło skierowane, neontowe światło obrzeżowe, pochmurne i płaskie)
Techniczne i kamera -- ogniskowa, emulsja filmowa, medium, sugerowany stosunek wymiarów
Sygnał jakości -- dla SD 1.5 i SDXL:
najlepsza jakość, wysoko szczegółowe, 8k. Dla SD 3.5: pomiń to, nic nie dodaje
Umieść temat najpierw w każdej wersji. Wszystko inne może się zmienić. Kiedy wyjście wygląda źle, popraw linię tematu zanim dodasz więcej tokenów.
Ukradnij tę bazę SD 1.5 i SDXL:
[temat], [styl], [oświetlenie], fotografia 35mm, ziarnistość filmu, wysoko szczegółowe, najlepsza jakośćUkradnij tę bazę SD 3.5:
[Scena opisana w jednym lub dwóch zdaniach.] Sfilmowana na filmie 35mm, [warunek oświetlenia], [konkretne odniesienie estetyczne].Obydwie to punkty wyjścia. Dostosuj, gdy znasz dobrze zachowanie modelu, aż wiedz, co popychać.
Negatywne prompty: Przestań używać generycznej listy
Oto negatywny prompt, który znajdujesz w 90% przewodników:
brydki, rozmyty, zła anatomia, dodatkowe kończyny, zniekształcony, niska jakość, najgorsza jakość, artefakty jpegNie zły. Ale prawie nie wykonuje żadnej rzeczywistej pracy w większości kontekstów. Negatywne prompty działają poprzez kodowanie tego, czego nie chcesz w przestrzeni latentnej. Im bardziej jesteś konkretny do rzeczywistego problemu, który pojawia się w twoich rezultatach, tym bardziej efektywne się stają.
Jeśli otrzymujesz mgliste tła: dodaj zajęte tło, bałagan, szumowe tło, brak głębi ostrości.
Jeśli portrety dryfują anatomicznie: dodaj asymetryczne oczy, zniekształcone ręce, zrosłe palce, dodatkowe palce, wydłużona szyja.
Jeśli wyjście zmienia się w kierunku fotografii stockowej pomimo twojego promptu: dodaj zdjęcie stockowe, przesłonięte, fotografia korporacyjna, błyszczący, zbyt jasny.
Jeśli widzisz przeciekające znaki wodne z danych treningowych: dodaj znak wodny, podpis, logo, nakładka tekstowa.
Mój promptu negatywny w produkcji dla portretów redakcyjnych na SDXL:
rozmyty, nie w ostrości, zła anatomia, zniekształcone ręce, dodatkowe kończyny, asymetryczne oczy, zdjęcie stockowe, przesłonięte, znak wodny, podpis, tekst, niska jakość, najgorsza jakość, artefakty jpeg, sztuczna skóra, pędzlem retuszowana, nadmiernie opracowanaUsuń klauzule, które nie dotyczą twojego tematu. Uruchomienie specyficznych dla portretów negatywów na generacji krajobrazu marnotrawnie obliczeniami i może stłumić rzeczy, które faktycznie chcesz.
Jedna rzecz warta wiedzenia: SD 3.5 reaguje na język naturalny w polu negatywnym. Brak znaków wodnych. Nie dołączaj tekstu. Unikaj przesłonionych świateł. działa obok list tokenów. Testuj oba formaty na swoim temacie i wybierz ten, który daje czystsze rezultaty.

Wagi i nacisk bez wkłócania wyjścia
W SD 1.5 i SDXL nawiasy okrągłe zwiększają wagę, a nawiasy kwadratowe zmniejszają ją.
(kinematyczne oświetlenie:1.3)-- 30% więcej wagi na tę koncepcję[zajęte tło]-- lekko tłumi ten element((bardzo ważny szczegół))-- każda para nawiasów mnoży się w przybliżeniu o 1.1
Twarda zasada: pozostań poniżej 1.4 dla dowolnego pojedynczego elementu. Powyżej tego model zniekształca ważoną koncepcję i może pociągnąć kompozycję w kierunku nią niezamierzonym. Nie dodajesz nacisk, palujesz generację.
Częsty błąd: układanie wielu ważonych elementów w stos. Uruchomienie (złota godzina:1.3), (ziarnistość filmu:1.3), (słaba głębia ostrości:1.2) rozprzestrzenia budżet wagowy na trzy rzeczy i często nie dostarcza żadną z nich czysto. Wybierz jeden lub dwa elementy do ważenia. Pozostaw resztę przy naturalnej wadze.
Dla SD 3.5 składnia ważenia ma mniejszy efekt. Naturalne rozumienie języka modelu oznacza, że otrzymujesz nacisk ze struktury zdania. Napisz okazała wiktoriańska rezydencja, z małą postacią ledwie widoczną na pierwszym planie i relacja kompozycyjna przychodzi bez żadnej składni nawiasów.
Spróbuj tego na SD 3.5: zbuduj swój prompt z zerowymi tokenami wagi. Dodawaj je tylko, jeśli model konsekwentnie niedoważa coś krytycznego w trzech lub więcej generacjach.
LoRAs: Jak zmieniają to, co musisz napisać
LoRAs to małe modele dodatkowe, które dostrajają Stable Diffusion do konkretnego stylu, postaci lub tematu. Załadowanie jednego zmienia twoją bazową strategię promptu.
Sk ładnia: <lora:nazwa_modelu:0.8> w pozytywnym promptie, gdzie 0.8 to waga. Zacznij między 0.7 a 0.8. Wychodzenie powyżej 1.0 często przesyca efekt i może złamać anatomię na tematach portretowych.
Co się zmienia, gdy LoRA jest aktywna: słowo klucza nosi dużą wagę, więc twoja baza promptu może być szczuplejsza. Jeśli zaladowujesz kinematyczną LoRA ziarnistości filmu ze słowem kluczowym filmgrain35mm, nie potrzebujesz 35mm, kodachrome, ziarnistość filmu, fotografia analogowa w swojej bazie. Napisz filmgrain35mm portret [tematu], miękkie światło okienne, redakcyjne i pozwól LoRA, aby wykonać pracę tekstury.
Co się nie zmienia: twoja linia tematu, kierunek oświetlenia i negatywny prompt mają znaczenie tyle samo, co bez LoRA. LoRAs obsługują styl i powierzchnię. Nie naprawiają źle ustrukturyzowanej linii tematu lub kompozycji, która nie pasuje do twojej intencji wyjścia.
Gdzie znaleźć niezawodne LoRAs: Civitai to główne repozytorium. Do produkcji trzymaj się LoRAs, które mają solidne liczby pobrań i przykładowe wyjścia bliskie temu, czego potrzebujesz. LoRA z minimalnymi pobranymi i bez obrazów przykładowych to czarna skrzynka -- spędzisz więcej czasu na debugowaniu niż generowaniu.

Gotowe do skopiowania prompty: Zacznij tutaj, dostosuj później
Portret redakcyjny na SDXL:
Pozytywny:
portret kobiety po trzydziestce, patrzący poza kamerę, fotografia redakcyjna, miękkie światło okienne z lewej, stonowane ciepłe tony, ziarnistość filmu, format średni, (słaba głębia ostrości:1.2), wysoko szczegółowe, najlepsza jakośćNegatywny:
rozmyty, zła anatomia, zniekształcone ręce, sztuczna skóra, przesłonięte, zdjęcie stockowe, znak wodny, tekst, niska jakośćArchitektura brutalistyczna na SD 1.5:
Pozytywny:
zewnątrz budynku mieszkalnego brutalistycznego, tekstura surowego betonu, pochmurne niebo, fotografia dokumentalna, szeroki kąt, odszatnięta paleta, wysokie kontrast cieni, obiektyw 28mm, kodak tri-x ziarnistość, wysoko szczegółoweNegatywny:
osoby, samochody, kolorowe, przesycone, rozmyty, cyfrowa sztuka, ilustracja, malarstwoScena w języku naturalnym na SD 3.5:
Pozytywny:
Młoda kobieta czyta w małej niezależnej księgarni late afternoon, ciepłe światło z okna obok niej, sfilmowana na filmie 35mm, styl fotografii redakcyjnej, lekko niedoświetlona, widoczna ziarnistość, spontaniczny, naturalistyczny czarNegatywny:
rozmyty, zniekształcone ręce, asymetryczne oczy, znak wodny, zdjęcie stockowe, przesłonięteUkradnij to. Remiks jeśli chcesz, ale zacznij od czegoś, co działa zanim się odbiegniesz.
Platformy do uruchamiania tych promptów
Nie potrzebujesz lokalnego GPU setup, aby testować te. Kilka platform pozwala na uruchomienie modeli opartych na SD i powiązanych w przeglądarce lub poprzez API.
Jedna rzecz zanim będziesz dalej grać
Większość problemów z promptami to nie problemy z promptami. To problemy z seedem.
Uruchom solidny prompt co najmniej trzy razy zanim cokolwiek dotkniesz. Stable Diffusion jest stochastyczne -- zmienność jest wbudowana w proces generacji. Jedno złe wyjście z dobrego promptu to szum. Trzy złe wyjścia z rzędu, wszystkie złe w taki sam sposób, to sygnał wart działania.
Workflow, który faktycznie działa: napraw strukturę swojego promptu, znajdź seed, który wytwarza silny wynik, potem udoskonalaj z tego baseline. Granie promptu po każdej pojedynczej generacji będzie cię utrzymywać w nieskończonej pętli marginalnych zmian bez punktu odniesienia do porównania.
Idź to spróbuj. Wybierz jeden z promptów wyżej. Upuść go w ComfyUI, AUTOMATIC1111 lub na wybraną platformę SD. Uruchom to dziesięć razy zanim zmienisz słowo. Nauczysz się więcej o tym, na co model reaguje w tych dziesięciu biegach, niż w jakimkolwiek przewodniku promptów.
Przebiegnij go i zobacz, jak jest zbudowany.