Guide prompts Stable Diffusion - ce qui marche par modèle
Résumé
Les prompts Stable Diffusion ne marchent pas pareil selon le modèle. Ce guide des prompts couvre la syntaxe exacte pour SD1.5, SDXL et SD3.5, avec prompts négatifs testés et précis, mécaniques de poids sans cassure, intégration LoRA avec mots-clés triggers, et exemples copiables directement exploitables en production. Chaque modèle est sa propre langue.
Ce guide prompts Stable Diffusion couvre la vraie mécanique : les prompts ne marchent pas pareil sur SD1.5, SDXL et SD3.5. Chaque modèle est sa propre langue. Tu vas avoir la syntaxe exacte pour chaque version — prompts négatifs testés, mécaniques de poids, intégration LoRA, exemples copiables. Si tu copies-colles des prompts génériques et tu te tapes des résultats incohérents, c'est pas du hasard, c'est structurel.
SD1.5, SDXL, SD3.5 : chaque modèle est sa propre langue
La grosse boulette dans chaque guide pour débutants, c'est de traiter Stable Diffusion comme un seul outil. C'est trois langages de prompts complètement différents.
SD 1.5 veut des listes de tokens courtes et denses. Le modèle lit ton prompt comme un sac de concepts pondérés par leur position. Les mots en début tirent beaucoup plus l'attention. Donc : mets ce qui compte en premier. portrait d'une femme, cinematic lighting, shallow depth of field, film grain, 35mm, kodachrome, highly detailed marche parce que le sujet et l'éclairage sont en tête. Une longue phrase descriptive fout le bazar à SD 1.5 - il n'est pas conçu pour parser la grammaire.
SDXL avale les prompts plus longs et répond bien aux preambles qualitatifs. La structure (masterpiece, best quality:1.2), [sujet], [tags de style], [lumière], [caméra] reste valide. SDXL est plus indulgent sur l'ordre des tokens que SD 1.5, mais il lit quand même les prompts comme une liste, pas une phrase. Une différence clé : SDXL gère les prompts négatifs plus précisément que SD 1.5, donc être spécifique sur tes négatifs paye vraiment mieux ici.
SD 3.5 a changé les règles du jeu. Avec son archi MMDiT-X et triple text encoder, il saisit la langue naturelle à un niveau que les vieux modèles ne peuvent pas atteindre. Écris Une femme devant une librairie indie éclairée au néon sous la pluie, photographiée au 50mm, lumière chaude qui s'échappe du magasin, esthétique film photography et SD 3.5 suit la phrase. Le même prompt sur SD 1.5 donne quelque chose de passable mais compositionnellement différent - pas toujours dans le sens que tu voulais.
Le test pratique : prends ton meilleur prompt SDXL, balance-le tel quel sur SD 3.5. Tu vas avoir un truc correct. Réécris-le maintenant en deux phrases naturelles. Lance la génération de nouveau. Le deuxième output va clairement mieux suivre ce que tu as décrit.
SD 3.5 gère aussi le texte dans les images mieux que n'importe quelle version de Stable Diffusion. Si tu as besoin d'un texte lisible en sortie, SD 3.5 est le seul à utiliser pour ce boulot.

La structure en cinq parties qui marche partout
Quel que soit le modèle que tu tournes, cette structure te donne un point de départ valide :
Sujet - qui ou quoi, énoncé clairement dans les premières secondes
Référence stylistique - le langage visuel : cinematic, editorial, vintage photograph, brutalist illustration, analog
Lumière - la variable la plus sous-testée (soft diffused light, golden hour, hard directional light, neon rim light, overcast flat)
Technique et caméra - longueur focale, film, médium, ratio implicite
Signal de qualité - pour SD 1.5 et SDXL :
best quality, highly detailed, 8k. Pour SD 3.5 : oublie, ça ajoute que dalle
Mets le sujet en premier dans toutes les versions. Le reste peut glisser. Quand une sortie ne donne pas, c'est sur la ligne du sujet qu'il faut bosser avant d'ajouter d'autres tokens.
Prends ce base pour SD 1.5 et SDXL :
[sujet], [style], [lumière], 35mm photography, film grain, highly detailed, best qualityPrends ce base pour SD 3.5 :
[Scène décrite en une ou deux phrases.] Shot on 35mm film, [condition lumière], [référence esthétique spécifique].Les deux, c'est des points de départ. Affine-toi une fois que tu sais bien comment le modèle répond.
Prompts négatifs : arrête avec la liste générique
Voilà le prompt négatif que tu trouves dans 90% des guides :
ugly, blurry, bad anatomy, extra limbs, deformed, low quality, worst quality, jpeg artifactsPas mauvais. Mais il fait quasi rien dans la plupart des cas. Les prompts négatifs marchent en encodant ce que tu ne veux PAS dans l'espace latent. Plus tu es spécifique sur ce qui merde vraiment dans tes sorties, plus c'est efficace.
T'as des arrière-plans boueux : ajoute busy background, cluttered, noisy background, absent depth of field.
Les portraits déraillent anatomiquement : ajoute asymmetrical eyes, deformed hands, fused fingers, extra fingers, elongated neck.
La sortie glisse vers du stock photo malgré ton prompt : ajoute stock photo, overexposed, corporate photography, glossy, overly bright.
Tu vois du watermark qui traîne des données d'entraînement : ajoute watermark, signature, logo, text overlay.
Mon prompt négatif de production pour les portraits éditoriaux en SDXL :
blurry, out of focus, bad anatomy, deformed hands, extra limbs, asymmetrical eyes, stock photo, overexposed, watermark, signature, text, low quality, worst quality, jpeg artifacts, plastic skin, airbrushed, over-retouchedRogne les clauses qui ne s'appliquent pas à ce que tu genères. Balancer un prompt négatif spécifique-aux-portraits sur du paysage, c'est du calcul gaspillé et ça peut écraser des trucs que tu veux garder.
Un truc à sait sur SD 3.5 : la langue naturelle marche dans le négatif aussi. Pas de watermarks. Pas de texte. Évite les hautes lumières surexposées. fonctionne à côté des listes de tokens. Teste les deux sur ce que tu genères et garde celle qui te donne les résultats les plus nets.

Poids et accentuation sans tout casser
Sur SD 1.5 et SDXL, les parenthèses augmentent le poids et les crochets le baissent.
(cinematic lighting:1.3)- 30% plus de poids sur ce concept[cluttered background]- supprime un peu cet élément((very important detail))- chaque paire de parenthèses multiplie par environ 1.1
La règle dure : reste en-dessous de 1.4 pour n'importe quel élément seul. Au-delà, le modèle distord le concept pondéré et peut tirer la composition vers lui d'une façon que tu ne veux pas. Tu n'ajoutes pas d'accentuation, tu la brûles.
Une grosse erreur : empiler les éléments pondérés. Balancer (golden hour:1.3), (film grain:1.3), (shallow depth of field:1.2) et tu éparpilles le budget de poids sur trois trucs et livres aucun d'eux clairement. Choisis un ou deux éléments à pondérer. Laisse le reste au poids naturel.
Pour SD 3.5, la syntaxe des poids a moins d'effet. La compréhension de langue naturelle du modèle veut dire que tu obtiens l'accentuation par la structure de la phrase. Écris a mansion imposing Victorian building, a tiny figure barely visible in the foreground et la relation compositionnelle passe sans aucune syntaxe de parenthèse.
Essaie ça sur SD 3.5 : construis ton prompt avec zéro token de poids. Ajoute-les juste si le modèle sous-pèse régulièrement quelque chose de critique sur trois générations d'affilée minimum.
LoRAs : comment ça change ce que tu écris
Les LoRAs, c'est des petits modèles add-on qui règlent Stable Diffusion sur un style, un personnage ou un sujet spécifique. En charger un bascule ta stratégie de prompt de base.
La syntaxe : <lora:model_name:0.8> dans le prompt positif, où 0.8 c'est le poids. Commence entre 0.7 et 0.8. Aller au-delà de 1.0, ça sature souvent l'effet et peut cramer l'anatomie sur les portraits.
Ce qui change quand une LoRA est active : le mot clé trigger porte beaucoup de poids, donc ton prompt de base peut être plus fluet. Si tu charges une LoRA de film grain cinéma avec mot trigger filmgrain35mm, tu n'as pas besoin de 35mm, kodachrome, film grain, analog photography dans ton base. Écris filmgrain35mm portrait of [sujet], soft window light, editorial et laisse la LoRA faire le taff texture.
Ce qui ne change PAS : ta ligne de sujet, la direction de lumière et ton prompt négatif comptent autant avec ou sans LoRA. Les LoRAs manient le style et la surface. Elles ne réparent pas une ligne de sujet mal construite ou une composition qui n'aligne pas ton intent.
Où trouver des LoRAs fiables : Civitai est le dépôt principal. Pour le boulot de production, reste avec les LoRAs qui ont des download counts solides et des exemples de sortie proches de ce que tu cherches. Une LoRA avec min de downloads et pas d'images exemple, c'est une boîte noire - tu vas y passer plus de temps à déboguer qu'à générer.

Prompts copiables : commence là, affine après
Portrait éditorial sur SDXL :
Positif :
portrait of a woman in her late 30s, looking past the camera, editorial photography, soft window light from the left, muted warm tones, film grain, medium format, (shallow depth of field:1.2), highly detailed, best qualityNégatif :
blurry, bad anatomy, deformed hands, plastic skin, overexposed, stock photo, watermark, text, low qualityArchitecture brutalist sur SD 1.5 :
Positif :
brutalist apartment building exterior, raw concrete texture, overcast sky, documentary photography, wide angle, desaturated palette, high contrast shadows, 28mm lens, kodak tri-x grain, highly detailedNégatif :
people, cars, colorful, oversaturated, blurry, digital art, illustration, paintingScène en langue naturelle sur SD 3.5 :
Positif :
A young woman reading in a small independent bookshop late afternoon, warm light from a window beside her, shot on 35mm film, editorial photography style, slightly underexposed, visible grain, candid feelNégatif :
blurry, deformed hands, asymmetrical eyes, watermark, stock photo, overlitVoilà : copie ça. Remix si tu veux, mais commence par quelque chose qui marche avant de te tirer vers le chaos.
Plateforme pour lancer ces prompts
Tu n'as pas besoin de GPU local pour tester. Plusieurs plateformes te laissent tourner des modèles basés SD dans le navigateur ou par API.
Un truc avant de continuer à affiner
La plupart des problèmes de prompt ne sont pas des problèmes de prompt. C'est des problèmes de seed.
Tourne un bon prompt au moins trois fois avant de toucher à quoi que ce soit. Stable Diffusion est stochastique - la variation est baked in le processus de génération. Une mauvaise sortie d'un bon prompt, c'est du bruit. Trois mauvaises sorties d'affilée, toutes fausses de la même manière, c'est du signal qu'il faut traiter.
Le workflow qui marche : répare la structure du prompt, trouve un seed qui produit une forte sortie, puis affine à partir de ce socle. Tweaker le prompt après chaque génération solo te laisse dans une boucle infinie de petites variations sans point de référence pour comparer.
Allez, teste. Choisis un des prompts d'en haut. Jette-le dans ComfyUI, AUTOMATIC1111 ou ta plateforme SD préférée. Tourne-le dix fois avant de changer un mot. Tu vas apprendre plus sur comment le modèle répond en dix runs que dans n'importe quel guide de prompt.
Crack it open et regarde comment c'est construit.