# Prompts para vídeo com IA que aguentam após terceiro segundo

URL: https://prexi.art/pt/journal/prompts-video-ia
Type: blog
Locale: pt
Published: 2026-10-05
Updated: 2026-10-05

---

> Para de descrever imagens e dirige o plano: cinco slots, linguagem real de câmera e uma trava, mais três prompts prontos para copiar em Veo, Kling ou Runway.

Tu digitaste "um plano cinematográfico legal de uma cidade à noite" e recebeste oito segundos de sopa de néon derretida. Bem-vindo ao clube. Bons **prompts para vídeo com IA** não descrevem uma imagem. Eles dirigem um plano: quem faz o quê, para onde vai a câmera, quanto tempo dura, o que fica congelado. Abaixo está a estrutura de cinco partes que roubamos de cada prompt que funciona, mais exemplos prontos para copiar e colar em Veo, Kling ou Runway hoje mesmo.

## Por que teu prompt derrete após dois segundos

Um prompt de imagem estática descreve um fotograma. Um prompt de vídeo tem que descrever tempo. Pronto; a diferença inteira está aí, e é por isso que um hábito de Midjourney cai aos pedaços assim que tu bates no botão de vídeo.

Quando tu só descreves uma aparência, o modelo tem que inventar o movimento. Escolhe a opção mais preguiçosa: um zoom lento, um rosto à deriva, fundo que se reorganiza quietinho. Tu pediste um clima e ganhaste um protetor de tela.

A solução é chata e funciona. Nomeia o **sujeito**, uma **ação**, o **movimento de câmera**, a **luz** e uma coisa que tem que **ficar igual**. Cinco slots. Erra um e o modelo preenche por ti, de forma feita.

O próprio guia de prompts [Veo do Google](https://cloud.google.com/vertex-ai/generative-ai/docs/video/video-gen-prompt-guide) termina no mesmo esqueleto: sujeito, ação, estilo, posição e movimento de câmera, composição, ambiente. A gente só compacta para tu conseguir manter na cabeça enquanto digita.

## A fórmula de cinco slots, com um prompt para roubar

Eis o enquadramento. Escreve nesta ordem, em uma ou duas frases simples, e fica em torno de 60 palavras para a primeira passada.

- 
**Sujeito**: uma frase nominal com dois detalhes. "Um mensageiro numa jaqueta amarela de chuva", não "uma pessoa".

- 
**Ação**: um verbo, um tempo. "Cruza a rua e para sob um sinal piscante."

- 
**Câmera**: tamanho de plano mais movimento. "Ângulo baixo, push-in lento."

- 
**Luz e grau**: "luz de sódio, asfalto molhado, grão de filme 35mm."

- 
**Trava**: o que fica parado. "Placas de sinalização e prédios ficam estáticos, sem personagens extras."

Rouba isto:

> Um mensageiro numa jaqueta amarela de chuva cruza uma rua vazia à noite e para sob um sinal piscante. Ângulo baixo, push-in lento, grão de filme 35mm, luz de sódio refletindo no asfalto molhado. Placas e prédios ficam estáticos, sem personagens extras, sem texto.

Vê o que falta. Nenhum "épico", nenhum "obra-prima", nenhum "8K ultra detalhado". Essas palavras são sobras da era dos modelos de imagem e trazem ruído, não direção. Gasta esses tokens na câmera em vez disso.

![Vintage camera on a tripod slider track in a dim studio, ready for a slow dolly move](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/prexi/2026-10/d651e0-img1.webp)

## Linguagem de câmera é a melhoria mais barata que tu tens

Se tu consertas um slot, conserta este. Modelos viram milhões de clipes rotulados com vocabulário de cinema, então termos reais de câmera puxam comportamento real. Vaguezas puxam a média.

Uma folha de consulta breve que muda saídas de verdade:

- 
**Push-in / pull-back**: os movimentos mais seguros. Começa aqui.

- 
**Tracking shot**: câmera segue o sujeito para um lado ou por trás. Ótimo para cenas de caminhada.

- 
**Orbit / arc**: poderoso, também o movimento mais provável de deformar rostos. Fica com o clipe curto.

- 
**Câmera fixa travada**: subestimado. Um plano de tripé com só o sujeito se movendo é a coisa mais estável que tu podes pedir.

- 
**Mão na câmera**: adiciona vida, adiciona tremor. Diz "sutil" ou tu vai ganhar cam de terremoto.

Um movimento por clipe. Dois movimentos simultâneos, "orbit enquanto faz zoom e se inclina para cima", é aonde a física vai morrer. Se tu queres uma revelação complexa, constrói como shots separados e corta junto.

## Prompts de imagem-para-vídeo: descreve o movimento, não a imagem

Começar de um fotograma estático é o código de trapaça quietinho de todo este ofício. Tu tranca o look com um modelo de imagem primeiro, aí tu anima. O prompt de vídeo deixa de ser descrição e vira uma instrução de palco.

A imagem já contém o sujeito, a luz e a paleta. Repetir gasta palavras e às vezes bate contra o fotograma. Escreve só o que **se move**:

> A mulher vira a cabeça lentamente em direção à janela. Cortinas se levantam numa brisa leve. Câmera fica parada. Tudo mais no fotograma fica exatamente como está.

Essa última frase importa mais do que parece. "Tudo o mais fica como está" é uma trava barata contra fundos à deriva que entregam a IA.

Se tu tá montando referências em Midjourney ou Flux primeiro, fica com composição simples: um sujeito bem claro, espaço ao redor para a câmera se mover. Um fotograma apertado, bagunçado, não deixa nada seguro para o modelo de vídeo empurrar.

![Blurred video editing timeline on a monitor above a notebook of camera angle sketches](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/prexi/2026-10/f643a9-img2.webp)

## Prompts que valem a pena copiar: três cenas, três trabalhos

Bibliotecas de prompts adoram volume. A gente prefere dar três que cada um ensina um reflexo diferente. Remixeia à vontade, mas começa destes.

**O tempo de produto.** Curto, controlado, sem humanos para deformar.

> Plano macro de uma xícara de cerâmica fosca em um balcão de pedra ao amanhecer. Vapor sobe lentamente. Pull-back lento revela uma cozinha iluminada pelo sol. Luz morna de janela, profundidade de campo rasa. A forma da xícara e o balcão ficam iguais. Sem mãos, sem texto.

**A peça de clima.** Um personagem, um gesto, muito clima.

> Uma figura solitária com um guarda-chuva caminha para longe por uma viela molhada de néon à noite. Plano largo bem defini, aberração cromática, chuva forte, reflexos molhados, grão de filme 35mm. A figura segue caminhando em ritmo constante. Sem cortes.

**O loop.** Para fundos, seções destaque, posts em redes que precisam retocar sem emenda.

> Nuvens se deslocando lentamente sobre um cume de montanha na hora dourada, câmera estática, paralaxe suave na grama do primeiro plano. Grau de filme suave. O movimento é sutil e contínuo, quadros de início e fim parecem iguais.

Cada um segue os cinco slots. Cada um termina com uma trava. Esse é o padrão, e é por isso que eles seguram além do terceiro segundo.

![Lone figure with an umbrella walking away down a rainy neon alley at night, cinematic frame](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/prexi/2026-10/bfc6da-img3.webp)

## Som, duração e aspecto: os detalhes que as pessoas esquecem

Três coisas ficam de fora dos cinco slots e ainda destroem clipes quando ignoradas.

**Duração.** Clipes curtos se aguentam, clipes longos à deriva. Se um modelo oferece cinco a oito segundos, pede um tempo e para. Precisa de trinta segundos? Planeja seis shots, não uma geração heroica. Montadores têm cortado em ação por um século por um motivo.

**Proporção.** Decide antes de escrever, porque composição depende disso. Um push-in lento por um corredor se lê lindamente em 16:9 e se sente apertado em 9:16. Para vertical, coloca o sujeito no terço central e deixa espaço para chrome de interface. Diz a proporção no prompt se a ferramenta deixa.

**Som.** Alguns modelos agora geram áudio com a imagem. Se o teu faz, escreve o som como escreves o plano: "zumbido de tráfego distante, chuva em um dossel de metal, uma sirene abafada". Pula pedidos de música a menos que tu realmente precisa. Tu vai querer fazer a trilha sonora tu mesmo de qualquer forma.

Eis uma versão do prompt do mensageiro com som adicionado:

> Um mensageiro numa jaqueta amarela de chuva cruza uma rua vazia e para sob um sinal piscante. Ângulo baixo, push-in lento, grão de filme 35mm, 16:9. Som ambiente: chuva constante, tráfego distante, buzz elétrico fraco do sinal. Sem diálogos, sem texto.

Mesmos cinco slots, uma linha extra. Pronto; o upgrade inteiro.

## Qual modelo ganha qual prompt?

Mesmo prompt, modelo diferente, resultado diferente. Não espera um prompt mestre viajando. Poucas generalizações honestas, sem benchmarks fingidos:

Veo aguenta frases descritivas, cinematográficas, longas bem e pode carregar diálogos e pistas de som quando tu escreves. Kling tende a recompensar ações físicas bem claras e instruções de câmera, e é uma casa confortável para imagem-para-vídeo. Runway gosta de prompts apertados, comedidos, e te dá mais controle manual assim que tá iterando.

Se tu prefere não malabarismo três abas, Higgsfield coloca vários modelos de vídeo atrás de um espaço de trabalho. É prático quando tu quer rodar o mesmo prompt por dois mecanismos e comparar, que é a forma mais rápida de aprender o que cada um realmente escuta.

Nossa abordagem: pega um modelo, aprende seus truques por uma semana, aí ramifica. Pular mecanismos toda vez que um clipe desaponta não ensina nada.

## Pula estes hábitos (custam teus créditos)

Algum conselho circula porque soa esperto. Não é. Pula:

- 
**Pilhas de palavras de qualidade.** "Ultra realista, 8K, obra-prima, premiado" não faz um vídeo melhor. Dilui a instrução.

- 
**Prompts longos estilo romance.** Além de cerca de 100 palavras, modelos soltam detalhes iniciais. Curto e específico bate longo e poético.

- 
**Pedir texto no fotograma.** Sinais, legendas e logos normalmente se deformam no meio do clipe. Adiciona títulos no teu editor.

- 
**Cinco ações num clipe.** Cinco segundos cabem um tempo. Divide o resto em gerações separadas.

- 
**Reescrever do zero toda vez.** Fica com um prompt funcional, muda um slot, compara. Esse é um experimento real.

## Como iterar sem queimar seus créditos

Trata cada geração como um teste, não um bilhete de loteria. Muda um slot por vez. Se o movimento tá errado, mexe na linha de ação. Se o look à deriva, aperta a trava. Se a câmera flutua, troca "orbit" por "push-in lento".

Fica com uma nota corrente do que funcionou, em qualquer formato que tu realmente vai abrir de novo. Placas Are.na funcionam bem para isto, assim como um arquivo de texto simples. O ponto é que teu terceiro prompt deve começar do vencedor do teu segundo prompt, não do zero.

E revisa clipes em silêncio primeiro. Julga o movimento por conta própria antes de deixar uma trilha sonora legal desculpar.

## O que tentar esta noite

Pega uma cena dos três acima, roda num modelo único, e muda só a linha de câmera. Roda três vezes: fixa, push-in, tracking. Coloca os clipes lado a lado. Tu vai aprender mais daquele experimento de dez minutos do que de qualquer lista de cem prompts.

Copia o prompt, coloca lá dentro, e vê o que quebra. Aí nos diz qual slot tu consertaria primeiro.

## FAQ

### O que faz um bom prompt para vídeo com IA?

Um bom prompt para vídeo com IA nomeia um sujeito, uma ação, um movimento de câmera, a luz e uma trava para o que deve ficar igual. Descreve tempo e movimento, não apenas um fotograma único.

### Quanto tempo deve ter um prompt para vídeo com IA?

Apunta para 40 a 80 palavras na primeira passada. Além de cerca de 100 palavras, a maioria dos modelos começam a deixar cair os detalhes iniciais, então curto e específico bate longo e poético.

### Preciso de prompts diferentes para Veo, Kling e Runway?

Sim, espera ajustar. Veo aguenta frases longas e cinematográficas e pistas de som, Kling recompensa ações físicas bem claras, e Runway gosta de prompts apertados. Guarda os cinco slots e reescreve o resto.

### Como escrevo prompts de imagem-para-vídeo?

Pula descrever a imagem, já que ela já tem sujeito, luz e paleta. Escreve só o que se move, nomeia o comportamento da câmera, e adiciona que tudo o mais fica exatamente como está.

### Prompts para vídeo com IA podem incluir som e diálogo?

Se teu modelo gera áudio, sim. Escreve som como um plano: textura ambiente, um ou dois efeitos, e diálogo entre aspas se precisa. Modelos sem áudio ignoram essas linhas.

### Por que vídeos IA distorcem rostos e fundos?

Normalmente o prompt pede muito: vários movimentos de câmera, muitas ações ou cenas lotadas. Usa um movimento, um tempo, uma câmera travada ou lenta, e uma trava para o fundo.