AI-videoprompter som håller ihop längre än tre sekunder

Summary

Bra AI-videoprompter regisserar ett skott i stället för att beskriva en bild. Namnge ett objekt, en handling, en kamerarörelse, ljuset och en sak som måste stanna kvar. Håll videor korta, använd verkliga kameraord och lägg till en låsrad för att stoppa drivande bakgrunder. För bild-till-video, beskriv bara rörelsen.

Uppifrån flygfoto av en indie-filmares storyboard-ark, filmremsa, riso-tryck och filmmarkeringsboard på ett träbord

Du skrev "en cool filmisk bild av en stad på natten" och fick åtta sekunder av smält neonsoppa. Välkommen till klubben. Bra ai videoprompter beskriver inte en bild. De regisserar ett skott: vem som gör vad, vart kameran går, hur länge det varar, vad som stannar på plats. Här är den femdelad struktur vi stjäl från varje prompt som fungerar, plus färdiga exempel du kan kasta in i Veo, Kling eller Runway redan i dag.

Varför din prompt smälter efter två sekunder

En stillbild-prompt beskriver en ram. En videoprompt måste beskriva tid. Det är hela skillnaden, och det är anledningen till att en Midjourney-vana faller ihop så snart du trycker på videoknappen.

När du bara beskriver en känsla måste modellen hitta på rörelsen. Den väljer det lataste alternativet: en långsam zoom, ett drivande ansikte, en bakgrund som tyst omorganiserar sig själv. Du bad om en känsla och fick en skärmsnålare.

Fixet är tråkigt och det fungerar. Namnge objektet, en handling, kamerarörelsen, ljuset och en sak som måste stanna på plats. Fem slots. Missa en och modellen fyller den åt dig, oftast dåligt.

Googles egen Veo-guide för prompts landar på samma skelett: objekt, handling, stil, kameraposition och rörelse, komposition, stämning. Vi kollapsar det bara så du kan hålla det i huvudet medan du skriver.

Femslots-formeln som du kan stjäla

Här är ramen. Skriv den i den här ordningen, i en eller två enkla meningar, och håll den under ungefär 60 ord för första gången.

  1. Objekt: en substantivfras med två specifikationer. "En kurir i en gul regnkappa", inte "en person".

  2. Handling: ett verb, ett tempo. "Korsar gatan och stannar under ett blinkande skylt."

  3. Kamera: skottets storlek plus rörelse. "Låg vinkel, långsam push in."

  4. Ljus och färgtone: "natriumgatlampor, våt asfalt, 35mm-kornighet."

  5. Låsrad: vad som stannar på plats. "Bakgrundsskyltning stannar statisk, ingen extra karaktärer."

Stjäl det här:

En kurir i en gul regnkappa korsar en tom gata på natten och stannar under ett blinkande skylt. Låg vinkel, långsam push in, 35mm filmkornighet, natriumgatlampor som reflekteras på våt asfalt. Skyltar och byggnader stannar statiska, ingen extra karaktärer, ingen text.

Lägg märke till vad som saknas. Inget "episk", inget "mästerverk", inget "8K ultradetaljer". De orden är kvarlevor från bildmodellsepoken och de tillför brus, inte riktning. Lägg de toknen på kameran i stället.

Vintage-kamera på ett stativglidspår i en mörk studio, redo för en långsam dolly-rörelse

Kameraväxlingen är din billigaste uppgradering

Om du bara fixar en slot, fixa den här. Modeller har sett miljoner videor märkta med filmvokabulär, så verkliga kameraord drar fram verkligt beteende. Vaga ord drar genomsnittet.

En kort fusklista som faktiskt ändrar outputs:

En rörelse per klipp. Två samtidiga rörelser ("orbita medan du zoomar och tittar upp") är där fysiken går för att dö. Om du vill ha en komplex avslöjning, bygga den som separata skott och skär dem tillsammans.

Bild-till-video-prompts: beskriv rörelsen, inte bilden

Att börja från en stillbild är den tysta fuskkoden för hela detta hantverk. Du låser utseendet med en bildmodell först, sedan animerar du. Videoprompt slutar vara en beskrivning och blir en scenanvisning.

Bilden innehåller redan objektet, ljuset och paletterna. Att upprepa dem slösar ord och ibland strider mot ramen. Skriv bara vad som rör sig:

Kvinnan vänder långsamt huvudet mot fönstret. Gardiner lyfts i en lätt bris. Kameran stannar på plats. Allt annat i ramen stannar exakt som det är.

Den sista meningen betyder mer än den ser ut. "Allt annat stannar som det är" är en billig lås mot drivande bakgrunder som ger bort AI-material.

Om du bygger referenser i Midjourney eller Flux först, håll kompositionen enkel: ett tydligt objekt, utrymme omkring för kameran att röra sig in i. En trång, stökig stillbild ger videonmodellen inget säkert att trycka in i.

Suddigt videoredigensprår på en skärm ovanför en anteckningsbok med kameravinkelsketser

Prompts värdiga att kopiera: tre scener, tre jobb

Promptbibliotek älskar volym. Vi vill hellre ge dig tre som varje lär en annan reflex. Remixa fritt, men börja från dessa.

Produktslaget. Kort, kontrollerad, ingen människor att förvränga.

Makroskott av en matt keramikkrus på en stenräknare vid gryning. Ånga stiger långsamt. Långsam pull-back avslöjar ett solbelyst kök. Mjukt fönsterljus, grunt fokusavstånd. Krusformen och räknaren stannar oförändrad. Ingen händer, ingen text.

Stämningsbitén. En karaktär, en gest, mycket atmosfär.

En ensamstående figur med ett paraply går bort ner en regning neon-gränd på natten. Låst bred bild, anamorf lens flare, kraftig regn, våta reflektioner, 35mm-kornighet. Figuren fortsätter gå i ett stadigt tempo. Inga snitt.

Loopen. För bakgrunder, hjältesektion, sociala inlägg som behöver spelas upp utan söm.

Långsamt glidande moln över en bergsås vid gyllene timmen, statisk kamera, subtil parallax i förgrundsgräs. Mjuk filmfärg. Rörelsen är subtil och kontinuerlig, start- och slutramar ser likadana ut.

Varje följer de fem slots. Varje slutar med en låsrad. Det är mönstret, och det är varför de håller ihop längre än tre sekunder.

Ensamstående figur med ett paraply som går bort ner en regn neon-gränd på natten, filmisk ram

Ljud, längd och bildformat: de inställningarna som glöms bort

Tre detaljer sitter utanför de fem slots och förstör fortfarande klipp när de ignoreras.

Längd. Korta klipp håller ihop, långa försvagar. Om en modell erbjuder fem till åtta sekunder, be om ett tempo och stanna. Behöv trettio sekunder? Planera sex skott, inte en heroisk generation. Redigerare har snidit på handling i ett sekel av anledning.

Bildformat. Bestäm innan du skriver, för komposition beror på det. En långsam push in ner i en korridor läses vackert i 16:9 och känns trång i 9:16. För vertikal, lägg objektet i mitten tredje och lämna huvudutrymme för gränssnittkrom. Säg förhållandet i prompten om verktyget låter dig.

Ljud. Vissa modeller genererar nu ljud tillsammans med bilden. Om din gör det, skriv ljudet som du skriver skottet: "avlägsen trafikbrummande, regn på ett metallöverdrag, en dämpad siren". Hoppa över musikförfrågningar om du inte verkligen behöver dem. Du vill sätta betyg på det själv ändå.

Här är en version av kurir-prompten med ljud tillagt:

En kurir i en gul regnkappa korsar en tom gata och stannar under ett blinkande skylt. Låg vinkel, långsam push in, 35mm-kornighet, 16:9. Omgivningsljud: stadigt regn, avlägsen trafik, svag elektrisk brum från skylten. Ingen dialog, ingen text.

Samma fem slots, en extra rad. Det är hela uppgraderingen.

Vilken modell får vilken prompt?

Samma prompt, annan modell, annat resultat. Förvänta dig inte att en mastersignatur reser. Ett par ärliga generaliseringar, inga riktmärken låtsas:

Veo hanterar långa, beskrivande, filmiska meningar väl och kan bära dialog och ljudcues när du skriver dem in. Kling tenderar att belöna tydlig fysisk handling och kamerainstruktioner, och det är ett bekvämt hem för bild-till-video. Runway gillar snäva, återhållsamma prompter och ger dig mer hands-on kontroll när du itererar.

Om du hellre inte jonglerar tre flikar, Higgsfield sätter flera videomodeller bakom ett arbetsområde. Det är praktiskt när du vill köra samma prompt genom två motorer och jämföra, vilket är det snabbaste sättet att lära sig vad varje faktiskt lyssnar på.

Vår take: plocka en modell, lär dig dess tvister på en vecka, då grenen ut. Att hoppa motorer varje gång ett klipp besviker lär dig inget.

Hoppa över dessa vanor (de kostar dig krediter)

Någon rådgivning cirkulerar för att den låter smart. Det är det inte. Hoppa över:

Hur man itererar utan att bränna dina krediter

Behandla varje generation som ett test, inte en lotteriett. Ändra en slot i taget. Om rörelsen är fel, rör vid handlingsraden. Om utseendet försvagar, dra åt låsraden. Om kameran flyter, byt "orbit" för "långsam push in".

Behåll en löpande anteckning på vad som fungerade, i vilket format du faktiskt öppnar igen. Are.na tavlor fungerar väl för detta, liksom en vanlig textfil. Poängen är att din tredje prompt bör börja från din andra prompts vinnare, inte från noll.

Och granska klipp på mute först. Bedöm rörelsen på egen hand innan du låter ett trevligt soundtrack förlåta den.

Vad du ska prova i kväll

Plocka en scen från de tre ovan, kör den i en enda modell, och ändra bara kameralinjen. Kör den tre gånger: statisk, push in, tracking. Lägg klippet sida vid sida. Du kommer att lära dig mer från det tio-minuters experimentet än från någon lista på hundra prompts.

Kopiera prompten, kasta in den, och se vad som bryter. Sedan berättar du för oss vilken slot du skulle fixa först.

Frequently asked questions

Vad gör en bra AI-videoprompt?
En bra AI-videoprompt namnger ett objekt, en handling, en kamerarörelse, ljuset och en låsrad för vad som måste stanna oförändrat. Det beskriver tid och rörelse, inte bara en enda ram.
Hur lång ska en AI-videoprompt vara?
Sikta på 40 till 80 ord på första försöket. Förbi ungefär 100 ord börjar de flesta modeller släppa tidiga detaljer, så kort och specifikt slår långt och poetiskt.
Behöver jag olika prompts för Veo, Kling och Runway?
Ja, förvänta dig att justera. Veo hanterar långt filmiska meningar och ljudcues väl, Kling belönar tydlig fysisk handling, och Runway gillar snäva prompts. Behåll de fem slots och omformulera resten.
Hur skriver jag bild-till-video-prompts?
Hoppa över att beskriva bilden, eftersom den redan innehåller objekt, ljus och palett. Skriv bara vad som rör sig, namnge kamerauppförande, och lägg till att allt annat stannar exakt som det är.
Kan AI-videoprompter innehålla ljud och dialog?
Om din modell genererar ljud, ja. Skriv ljud som ett skott: omgivningstextur, ett eller två effekter, och dialog i citattecken vid behov. Modeller utan ljud ignorerar dessa linjer.
Varför förvrider AI-videor ansikten och bakgrunder?
Vanligtvis ber prompten om för mycket: flera kamerarörelsen, många handlingar eller folkfulla scener. Använd en rörelse, ett tempo, en låst eller långsam kamera, och en låsrad för bakgrunden.
★ steely dan × liminal hotel room × 35mm film ★ brutalist architecture sunset vaporwave ★ 1970s rock album × medium format ★ renaissance cyberpunk samurai ★ macro honey gold leaf ★ tokyo aerial rain cinematic ★ surrealist collage editorial ★ analog grain portrait studio ★ neon botanical illustration ★   ★ steely dan × liminal hotel room × 35mm film ★ brutalist architecture sunset vaporwave ★ 1970s rock album × medium format ★ renaissance cyberpunk samurai ★ macro honey gold leaf ★ tokyo aerial rain cinematic ★ surrealist collage editorial ★ analog grain portrait studio ★ neon botanical illustration ★   
✦ copy the prompt ✦ remix this ✦ drop into flux ✦ steal this look ✦ open the moodboard ✦ crack it open ✦ send to nano banana ✦ go wild ✦ copy the prompt ✦ remix this ✦ drop into flux ✦ steal this look ✦ open the moodboard ✦ crack it open ✦ send to nano banana ✦ go wild ✦