Guia prompts Stable Diffusion: o que funciona por modelo

Resumo

O Stable Diffusion tem três linguagens de prompt distintas: o SD1.5 quer listas de tokens curtas; o SDXL aceita prompts mais longos com preâmbulos de qualidade; o SD3.5 entende linguagem natural. Este guia cobre a estrutura de cinco partes válida para todos os modelos, como criar prompts negativos por caso de uso, mecânica de pesos sem distorcer o output, e integração de LoRAs com exemplos prontos para copiar.

Espaço de trabalho de art director com prints gerados por IA fixados em mural de moodboard

O teu prompt no Stable Diffusion não funciona da mesma forma no SD1.5, no SDXL e no SD3.5. Este guia prompts Stable Diffusion cobre a sintaxe exata de cada versão: prompts negativos testados, mecânica de pesos, integração de LoRAs e exemplos prontos para produção. Se tens copiado prompts genéricos e obtido resultados inconsistentes, o problema é estrutural, não aleatório.

SD1.5, SDXL e SD3.5: cada modelo tem a sua própria linguagem

O maior erro em qualquer guia para iniciantes é tratar o Stable Diffusion como uma única ferramenta. São três linguagens de prompt distintas.

O SD 1.5 quer listas de tokens curtas e densas. O modelo lê o teu prompt como um conjunto de conceitos ponderados pela posição. Os conceitos que aparecem primeiro recebem mais atenção. Isso significa: começa com o que importa. portrait of a woman, cinematic lighting, shallow depth of field, film grain, 35mm, kodachrome, highly detailed funciona porque o sujeito e a iluminação vêm primeiro. Uma frase descritiva longa confunde o SD 1.5, que não foi feito para interpretar gramática.

O SDXL aceita prompts mais longos e responde bem a preâmbulos de qualidade. A estrutura (masterpiece, best quality:1.2), [sujeito], [tags de estilo], [iluminação], [câmera] continua sendo confiável. O SDXL é mais tolerante com a ordem dos tokens do que o SD 1.5, mas ainda lê prompts como uma lista, não como uma frase. Uma diferença importante: o SDXL lida com prompts negativos de forma mais precisa, então a especificidade nos negativos compensa mais aqui do que no SD 1.5.

O SD 3.5 mudou as regras completamente. Com a sua arquitetura MMDiT-X e triple text encoder, ele entende linguagem natural a um nível que as versões anteriores não conseguem. Escreve A woman standing in front of a neon-lit bookshop in rain, photographed with a 50mm lens, warm interior light spilling out, film photography aesthetic e o SD 3.5 segue a frase. O mesmo prompt no SD 1.5 vai produzir algo aceitável, mas compositivamente diferente, e nem sempre na direção que querias.

O teste prático: pega o teu melhor prompt SDXL e roda no SD 3.5 sem alterar nada. Vais obter um output razoável. Agora reescreve como duas frases naturais. Roda de novo. O segundo output vai seguir melhor a tua intenção de composição.

O SD 3.5 também lida com texto em imagens melhor do que qualquer versão anterior do Stable Diffusion. Se texto legível no output é importante para o teu caso de uso, o SD 3.5 é a única versão do SD que vale a pena para isso.

Mãos digitando prompt na interface do Stable Diffusion em tela escura

A estrutura de prompt em cinco partes que funciona em todos os modelos

Seja qual for o modelo que estás a usar, esta estrutura dá-te um ponto de partida confiável:

  1. Sujeito - quem ou o quê, descrito claramente nas primeiras palavras

  2. Referência de estilo - a linguagem visual: cinematic, editorial, vintage photograph, brutalist illustration, analog

  3. Iluminação - a variável menos testada (soft diffused light, golden hour, hard directional light, neon rim light, overcast flat)

  4. Técnico e câmera - distância focal, película, médio, proporção implícita

  5. Sinal de qualidade - para SD 1.5 e SDXL: best quality, highly detailed, 8k. Para SD 3.5: podes omitir, não acrescenta nada

Põe o sujeito em primeiro em todas as versões. O resto pode mudar. Quando um output parece errado, corrige a linha do sujeito antes de adicionar mais tokens.

Copia este base para SD 1.5 e SDXL:

[sujeito], [estilo], [iluminação], 35mm photography, film grain, highly detailed, best quality

Copia este base para SD 3.5:

[Cena descrita em uma ou duas frases.] Shot on 35mm film, [condição de iluminação], [referência estética específica].

São pontos de partida. Adapta quando conheceres bem o comportamento do modelo para saber o que puxar.

Prompts negativos: chega de usar a lista genérica

Aqui está o prompt negativo que encontras em 90% dos guias:

ugly, blurry, bad anatomy, extra limbs, deformed, low quality, worst quality, jpeg artifacts

Não está errado. Mas na maioria dos contextos faz pouco trabalho real. Os prompts negativos funcionam codificando o que não queres no espaço latente. Quanto mais específico fores ao problema real que aparece nos teus outputs, mais eficazes se tornam.

Se estás a obter fundos bagunçados: adiciona busy background, cluttered, noisy background, absent depth of field.

Se os retratos desviam anatomicamente: adiciona asymmetrical eyes, deformed hands, fused fingers, extra fingers, elongated neck.

Se o output escorrega para fotografia de stock apesar do teu prompt: adiciona stock photo, overexposed, corporate photography, glossy, overly bright.

Se estás a ver marcas d'água infiltradas dos dados de treino: adiciona watermark, signature, logo, text overlay.

O prompt negativo de produção para retratos editoriais no SDXL:

blurry, out of focus, bad anatomy, deformed hands, extra limbs, asymmetrical eyes, stock photo, overexposed, watermark, signature, text, low quality, worst quality, jpeg artifacts, plastic skin, airbrushed, over-retouched

Remove as cláusulas que não se aplicam ao teu sujeito. Usar negativos específicos para retrato numa geração de paisagem desperdiça computação e pode suprimir o que realmente queres.

Uma coisa que vale saber: o SD 3.5 responde a linguagem natural no campo negativo. No watermarks. Do not include text. Avoid overexposed highlights. funciona ao lado de listas de tokens. Testa os dois formatos no teu sujeito e escolhe o que te dá outputs mais limpos.

Dois prints gerados por IA lado a lado mostrando contraste de estilo em mesa de estúdio

Pesos e ênfase sem destruir o output

No SD 1.5 e SDXL, os parênteses aumentam o peso e os colchetes diminuem.

A regra: fica abaixo de 1.4 para qualquer elemento único. Acima disso, o modelo distorce o conceito ponderado e pode puxar a composição de formas que não queres. Não estás a adicionar ênfase, estás a queimar a geração.

Um erro comum: empilhar múltiplos elementos ponderados. Rodar (golden hour:1.3), (film grain:1.3), (shallow depth of field:1.2) distribui o orçamento de peso entre três coisas e frequentemente não entrega nenhuma delas de forma limpa. Escolhe um ou dois elementos para ponderar. Deixa o resto com peso natural.

Para o SD 3.5, a sintaxe de pesos tem menos efeito. O entendimento de linguagem natural do modelo significa que obténs ênfase a partir da estrutura da frase. Escreve an imposing Victorian mansion, with a small figure barely visible in the foreground e a relação composicional transparece sem nenhuma sintaxe de parênteses.

Experimenta isto no SD 3.5: constrói o teu prompt com zero tokens de peso. Adiciona-os apenas se o modelo subestimar consistentemente algo crítico em três ou mais gerações.

LoRAs: como mudam o que precisas de escrever

LoRAs são pequenos modelos add-on que afinam o Stable Diffusion para um estilo, personagem ou sujeito específico. Carregar um muda a tua estratégia de prompt base.

A sintaxe: <lora:nome_do_modelo:0.8> no prompt positivo, onde 0.8 é o peso. Começa entre 0.7 e 0.8. Ir acima de 1.0 frequentemente satura o efeito e pode quebrar a anatomia em sujeitos de retrato.

O que muda quando uma LoRA está ativa: a palavra de ativação carrega muito peso, então o teu prompt base pode ser mais enxuto. Se carregares uma LoRA de film grain cinematic com palavra de ativação filmgrain35mm, não precisas de 35mm, kodachrome, film grain, analog photography na tua base. Escreve filmgrain35mm portrait of [sujeito], soft window light, editorial e deixa a LoRA fazer o trabalho de textura.

O que não muda: a linha do sujeito, a direção da iluminação e o prompt negativo ainda importam tanto quanto sem a LoRA. As LoRAs lidam com estilo e superfície. Não corrigem uma linha de sujeito mal estruturada ou uma composição que não corresponde à tua intenção.

Onde encontrar LoRAs confiáveis: o Civitai é o repositório principal. Para uso em produção, fica com LoRAs que tenham contagens de download sólidas e outputs de exemplo próximos do que precisas. Uma LoRA com poucos downloads e sem imagens de exemplo é uma caixa preta: vais gastar mais tempo a depurar do que a gerar.

Camadas de acetato translúcido empilhadas em mesa de luz representando adaptadores LoRA no Stable Diffusion

Prompts prontos para copiar: começa aqui, adapta depois

Retrato editorial no SDXL:

Positivo:

portrait of a woman in her late 30s, looking past the camera, editorial photography, soft window light from the left, muted warm tones, film grain, medium format, (shallow depth of field:1.2), highly detailed, best quality

Negativo:

blurry, bad anatomy, deformed hands, plastic skin, overexposed, stock photo, watermark, text, low quality

Arquitetura brutalista no SD 1.5:

Positivo:

brutalist apartment building exterior, raw concrete texture, overcast sky, documentary photography, wide angle, desaturated palette, high contrast shadows, 28mm lens, kodak tri-x grain, highly detailed

Negativo:

people, cars, colorful, oversaturated, blurry, digital art, illustration, painting

Cena em linguagem natural no SD 3.5:

Positivo:

A young woman reading in a small independent bookshop late afternoon, warm light from a window beside her, shot on 35mm film, editorial photography style, slightly underexposed, visible grain, candid feel

Negativo:

blurry, deformed hands, asymmetrical eyes, watermark, stock photo, overlit

Copia. Remistura se quiseres, mas começa a partir de algo que funciona antes de divergires.

Uma coisa antes de continuar ajustando

A maioria dos problemas de prompt não são realmente problemas de prompt. São problemas de seed.

Roda um prompt sólido pelo menos três vezes antes de mexer em qualquer coisa. O Stable Diffusion é estocástico: a variação está incorporada no processo de geração. Um output mau a partir de um bom prompt é ruído. Três outputs maus seguidos, todos errados da mesma forma, é um sinal que vale a pena tratar.

O fluxo de trabalho que funciona mesmo: corrige a estrutura do teu prompt, encontra uma seed que produz um output forte, depois refina a partir dessa base. Ajustar o prompt depois de cada geração individual vai manterte num ciclo interminável de mudanças marginais sem um ponto de referência para comparar.

Experimenta agora. Escolhe um dos prompts acima. Coloca-o no ComfyUI, no AUTOMATIC1111 ou na tua plataforma SD preferida. Roda-o dez vezes antes de mudar uma palavra. Vais aprender mais sobre o que o modelo responde nessas dez tentativas do que em qualquer guia de prompts.

Abre e vê como está construído.

Perguntas frequentes

Qual a diferença entre os prompts do SD1.5 e do SDXL?
O SD1.5 funciona melhor com listas de tokens curtas e densas, onde a ordem das palavras afeta o output. O SDXL aceita prompts mais longos e beneficia de preâmbulos de qualidade como (masterpiece, best quality:1.2). Ambas as versões leem prompts como listas de tokens, não como frases em linguagem natural.
O SD3.5 requer um formato de prompt diferente do SDXL?
Sim. O SD3.5 entende linguagem natural, por isso escrever frases descritivas funciona melhor do que listas de tokens separados por vírgulas. Sinais de qualidade como 'best quality' ou 'highly detailed' têm pouco efeito no SD3.5 e podem ser omitidos.
Como criar prompts negativos eficazes para o Stable Diffusion?
Começa com uma lista base para problemas de anatomia, artefatos de qualidade e desvio de estilo, depois adiciona cláusulas específicas ao que está a correr mal nos teus outputs. Targetar o problema real, como fundos bagunçados, desvio para stock photo ou marcas d'água, é mais eficaz do que uma lista genérica longa.
Qual valor de peso devo usar com parênteses em prompts SD?
Fica abaixo de 1.4 para qualquer elemento único. Valores acima de 1.4 tendem a distorcer o conceito ponderado e puxar a composição em direções indesejadas. Começa em 1.2 para elementos que queres enfatizar e ajusta a partir daí. Evita ponderar mais do que dois elementos no mesmo prompt.
Como as LoRAs mudam os prompts que escrevo?
Quando uma LoRA está ativa, a sua palavra de ativação carrega muito peso, então o teu prompt base pode ser mais enxuto. Remove os tokens de estilo que a LoRA já trata. A linha do sujeito, a direção da iluminação e o prompt negativo continuam a importar tanto quanto sem a LoRA: as LoRAs lidam com estilo, não com composição.
Posso usar prompts do Stable Diffusion no Flux ou no Midjourney?
Cada modelo usa uma linguagem de prompt diferente. O Midjourney não usa campos de prompt negativo nem sintaxe de pesos da mesma forma. O Flux 1.1 Pro responde melhor a linguagem natural, de forma semelhante ao SD3.5. Adapta os prompts a cada modelo em vez de os copiar sem alterações.
Por que os meus outputs do Stable Diffusion variam tanto entre gerações?
O Stable Diffusion usa uma seed aleatória para cada geração, o que afeta significativamente o output. Isso é comportamento esperado. Roda o mesmo prompt pelo menos três vezes antes de decidir que o prompt está errado. Se múltiplos outputs estiverem errados da mesma forma, aí sim ajusta a estrutura do prompt.
★ steely dan × liminal hotel room × 35mm film ★ brutalist architecture sunset vaporwave ★ 1970s rock album × medium format ★ renaissance cyberpunk samurai ★ macro honey gold leaf ★ tokyo aerial rain cinematic ★ surrealist collage editorial ★ analog grain portrait studio ★ neon botanical illustration ★   ★ steely dan × liminal hotel room × 35mm film ★ brutalist architecture sunset vaporwave ★ 1970s rock album × medium format ★ renaissance cyberpunk samurai ★ macro honey gold leaf ★ tokyo aerial rain cinematic ★ surrealist collage editorial ★ analog grain portrait studio ★ neon botanical illustration ★   
✦ copy the prompt ✦ remix this ✦ drop into flux ✦ steal this look ✦ open the moodboard ✦ crack it open ✦ send to nano banana ✦ go wild ✦ copy the prompt ✦ remix this ✦ drop into flux ✦ steal this look ✦ open the moodboard ✦ crack it open ✦ send to nano banana ✦ go wild ✦