Prompty do wideo AI, które naprawdę zostają stabilne

Summary

Dobre prompty do wideo AI kierują ujęciem zamiast opisywać obraz. Podaj jeden podmiot, jedno działanie, jeden ruch kamery, światło i jedną rzecz, która musi zostać niezmieniona. Używaj prawdziwego słownika filmowego, dodaj lock line, żeby zatrzymać dryfujące tła. Dla image-to-video opisuj tylko ruch. Zacznij z jednym modelem, zmieniaj jeden slot naraz, oceniaj klipy bez dźwięku.

Płaska fotografia artystycznego papieru, taśmy filmowej, druku riso i klakiera na drewnianym biurku

Prompty do wideo AI: Jak pisać instrukcje, które się nie rozsypują

Wpisałeś "cool cinematic shot of a city at night" i dostałeś osiem sekund roztopionego neonowego zupy. Nieźle, nie? Dobry prompt do wideo AI nie opisuje zdjęcia. Kieruje kamerą: kto robi co, gdzie się kamera porusza, jak długo to trwa, co zostaje zamrożone. Poniżej znajdziesz strukturę pięcioczęściową, którą zależy nam udostępniać z każdego promptu, który rzeczywiście działa , plus gotowe przykłady, które możesz od razu wrzucić do Veo, Klinga albo Runway. To nie jest teoria, to praktyka testowana tysiące razy.

Dlaczego twój prompt rozsypuje się po dwóch sekundach

Prompt na obraz opisuje jedną klatkę. Prompt na wideo musi opisać czas. To cała różnica, i to dlatego nawyk z Midjourney pada, kiedy naciśniesz przycisk wideo.

Kiedy opisujesz tylko look, model sam wymyśla ruch. Wybiera opcję najlęniejszą: powolny zoom, dryfujące twarze, tło, które cicho się reorganizuje. Chciałeś nastroju, a dostałeś screensaver.

Rozwiązanie jest nudne i działa. Podaj nazwę podmiotu, jedno działanie, ruch kamery, oświetlenie i jedną rzecz, która MUSI być niezmienna. Pięć slotów. Pominąć jeden, a model wypełni go za ciebie, zwykle źle. To nie jest idealne, ale to działa konsekwentnie.

Officjalny poradnik promptów Veo od Google'a ląduje na tym samym szkielecie: podmiot, działanie, styl, pozycja kamery i ruch, kompozycja, atmosfera. My po prostu zwijamy to tak, żebyś mógł to trzymać w głowie podczas pisania.

Pięcioslotowa formuła, i prompt do skopiowania

Oto rama. Napisz w tej kolejności, w jednym albo dwóch prostych zdaniach, nie więcej niż około 60 słów na początek.

  1. Podmiot: jedno określenie rzeczownikowe z dwoma szczegółami. "Kurier w żółtej płaszczynu przeciwdeszczowej", a nie "człowiek".

  2. Działanie: jedno czasownik, jeden beat. "Przechodzi ulicę i zatrzymuje się pod migającym znakiem."

  3. Kamera: wielkość ujęcia plus ruch. "Dolny kąt, powolny push-in."

  4. Światło i gradacja: "sodowy streetlight, mokny asfalt, ziarnistość 35mm."

  5. Lock: co zostaje nieruchome. "Znaki i budynki nieruchome, brak dodatkowych postaci."

Skopiuj to:

Kurier w żółtej płaszczynu przeciwdeszczowej przechodzi pustą ulicę w nocy i zatrzymuje się pod migającym znakiem. Dolny kąt, powolny push-in, ziarnistość 35mm, sodowy streetlight odbijający się na mokrym asfalcie. Znaki i budynki zostają nieruchome, brak dodatkowych postaci, bez tekstu.

Zwróć uwagę, co nie tam. Brak "epic", brak "masterpiece", brak "8K ultra detailed". Te słowa to pozostałość ery obrazów i dodają szumu, nie kierunku. Wydaj te tokeny na kamerę, gdzie będą działać.

Vintage camera on a tripod slider track in a dim studio, ready for a slow dolly move

Język kamery to najtańszy upgrade, jaki masz

Jeśli tylko jeden slot naprawisz, napraw ten. Modele widziały miliony klipów oznaczonych słownictwem filmowym, więc prawdziwe terminy kamerowe pociągają rzeczywiste zachowanie. Niejasne, przeciętne. To różnica między "orbit" a "powolnym zoomem na boku", między "tracking shot" a "kamera podąża za postacią".

Krótka ściągawka, która rzeczywiście zmienia outputy:

Jeden ruch na klip. Dwa równoczesne ruchy ("orbit podczas zoomu i tilt-up") to miejsce, gdzie fizyka idzie umierać. Jeśli chcesz złożone ujawnienie, zbuduj to jako osobne ujęcia i zmontuj razem.

Prompty do image-to-video: opisz ruch, nie obraz

Startowanie ze statycznego obrazu to cicha ściema całego rzemiosła. Najpierw blokujesz look za pomocą modelu obrazu, potem animujesz. Prompt wideo przestaje być opisem, a staje się instrukcją sceniczną. To zmienia wszystko.

Obraz już zawiera podmiot, światło i paletę. Powtarzanie ich traci słowa i czasami walczy z kadrem. Napisz tylko co się porusza:

Kobieta powoli obraca głowę w stronę okna. Zasłony unoszą się w lekkiej bryle. Kamera trzyma się statycznie. Wszystko inne w kadrze zostaje dokładnie takie, jakie jest.

To ostatnie zdanie ma więcej znaczenia niż wygląda. "Wszystko inne zostaje takie jakie jest" to tania osłona przed dryfującymi tłami, które ujawniają sztuczność filmów AI. To zmienia wyniki.

Jeśli budujesz referencje w Midjourney albo Fluksie najpierw, trzymaj kompozycję prostą: jeden wyraźny podmiot, przestrzeń wokół niego na ruch kamery. Zatłoczone, zajęte statyczne ujęcie nie daje modelowi wideo nic bezpiecznego do wypchnięcia.

Blurred video editing timeline on a monitor above a notebook of camera angle sketches

Prompty warte kopiowania: trzy sceny, trzy zadania

Biblioteki promptów kochają ilość. Wolę ci trzy, które każdy uczy innego refleksu. Remixuj jeśli chcesz, ale zacznij od nich.

Sygnał produktu. Krótki, kontrolowany, brak ludzi do zniekształcenia.

Makro ujęcie matowej ceramicznej filiżanki na kamieniowym blacie o świcie. Para powoli unosi się. Powolny pull-back ujawnia oświetloną słońcem kuchnię. Miękkie światło okienne, płytka głębia ostrości. Kształt filiżanki i blat pozostają niezmienione. Bez rąk, bez tekstu.

Piece nastroju. Jedna postać, jeden gest, dużo atmosfery.

Samotna postać z parasolem idzie daleko neonową alejką w deszczu w nocy. Zafiksowana szeroka fotografia, flary anamorficzne, ulewny deszcz, mokre odbicia, ziarnistość 35mm. Postać idzie w stałym tempie. Bez cięć.

The loop. Do tła, heroicznych sekcji, postów w mediach społecznych, które muszą grać bez szwy.

Powoli dryfujące chmury nad grzbietem górskim o złotej porze, statyczna kamera, subtelna paralaksa na trawie na pierwszym planie. Miękka gradacja filmowa. Ruch jest subtelny i ciągły, początkowe i końcowe klatki wyglądają tak samo.

Każdy idzie pięcioma slotami. Każdy kończy się lockiem. To wzór, i dlatego trzymają się razem po trzeciej sekundzie. Testowaliśmy każdy z tych promptów na Veo, Klingu i Runway.

Dźwięk, czas trwania i aspect ratio: szczegóły, które ludzie zapomnieli

Trzy szczegóły siedzą poza pięcioma slotami i wciąż niweczą klipy, gdy są ignorowane.

Czas trwania. Krótkie klipy trzymają się razem, długie dryfują. Jeśli model oferuje pięć do osiem sekund, poproś o jeden beat i stop. Potrzebujesz trzydziestu sekund? Zaplanuj sześć ujęć, nie jeden heroiczny wygenerowany zestaw. Edytorzy tnią na działaniu przez wiek z powodu, to odhacjone.

Aspect ratio. Zdecyduj przed pisaniem, ponieważ kompozycja zależy od tego. Powolny push-in w dół korytarza czyta pięknie w 16:9 i czuje się ciasno w 9:16. Na pionowe, umieść podmiot w środkowej trzeciej i zostaw miejsce dla interfejsu. Powiedz stosunek w promptie, jeśli narzędzie pozwala.

Dźwięk. Niektóre modele teraz generują dźwięk z obrazem. Jeśli Twoje to robi, napisz dźwięk jak piszesz ujęcie: "odległy szum ruchu, deszcz na metalowym zadaszeniu, jeden stłumiony siren". Pomiń prośby o muzykę, chyba że naprawdę jej potrzebujesz. Będziesz chciał to sam zskomentować.

Tutaj wersja promptu kuriera z dodanym dźwiękiem:

Kurier w żółtej płaszczynu przeciwdeszczowej przechodzi pustą ulicę i zatrzymuje się pod migającym znakiem. Dolny kąt, powolny push-in, ziarnistość 35mm, 16:9. Dźwięk ambientny, stały deszcz, odległy ruch, słaby hum elektryczny znaku. Bez dialogu, bez tekstu.

Pięć slotów, jeden dodatkowy wiersz. To cała modernizacja całego procesu.

Który model do którego promptu?

Ten sam prompt, inny model, inny wynik. Nie oczekuj, że jeden master prompt będzie podróżować. Kilka uczciwych uogólnień, brak benchmarków udawanych:

Veo dobrze radzi sobie z długimi, opisowymi, kinematograficznymi zdaniami i potrafi nosić dialog i wskazówki dźwiękowe, gdy je napiszesz. Kling ma tendencję do doceniania wyraźnego działania fizycznego i instrukcji kamery i jest wygodnym domem dla image-to-video. Runway lubi ciasne, powściągliwe prompty i daje ci więcej praktycznej kontroli, gdy już iterujesz. Każdy model ma swoją osobliwość i specyficzny sposób interpretacji instrukcji.

Jeśli wolisz nie żonglować trzema kartami, Higgsfield umieszcza kilka modeli wideo za jedną przestrzenią roboczą. To przydatne, gdy chcesz uruchomić ten sam prompt przez dwa silniki i porównać, co jest najszybszym sposobem na naukę, co każdy naprawdę słucha.

Nasza opinia: wybierz jeden model, naucz się jego osobliwości przez tydzień, potem się gałęź. Przeskakiwanie silników za każdy razem klipu rozczaruje cię uczy nic.

Pomiń te nawyki (kosztują cię kredyty)

Niektóre rady krążą, bo brzmią mądrze. Nie są. Pomiń:

Jak iterować bez spalania kredytów

Traktuj każdą generację jako test, a nie los. Zmień jeden slot naraz. Jeśli ruch jest zły, dotknij linii akcji. Jeśli look dryfuje, zaciśnij lock. Jeśli kamera pływa, zamień "orbit" na "powolny push-in".

Prowadź notatki dotyczące tego, co działało, w dowolnym formacie, który rzeczywiście otworzysz ponownie. Tablice Are.na działają dobrze do tego, podobnie jak zwykły plik tekstowy. Chodzi o to, że twój trzeci prompt powinien zaczynać się od zwycięzcy twojego drugiego promptu, a nie od zera. Iteracja to nauka.

I przejrzyj klipy bez dźwięku pierwsze. Osądź ruch samodzielnie, zanim pozwolisz ładnej ścieżce dźwiękowej wybaczyć mu.

Co spróbować dziś wieczorem

Wybierz jedną scenę z trzech powyżej, uruchom ją w jednym modelu i zmień tylko linię kamery. Uruchom trzy razy: statyczne, push-in, tracking. Umieść klipy obok siebie. Nauczysz się więcej z tego dziesięciominutowego eksperymentu niż z listy sto promptów.

Skopiuj prompt, wrzuć go, i zobacz co się łamie. Potem powiedz nam, który slot chciałbyś naprawić jako pierwszy.

Frequently asked questions

Co robi dobry prompt do wideo AI?
Dobry prompt do wideo AI wspomina jeden podmiot, jedno działanie, ruch kamery, oświetlenie i lock line na to, co musi zostać niezmienione. Opisuje czas i ruch, a nie tylko jedną klatkę.
Jak długi powinien być prompt do wideo AI?
Dążyć do 40 do 80 słów na pierwszym przebiegu. Po około 100 słowach większość modeli zaczyna upuszczać wczesne szczegóły, więc krótkie i konkretne bije długie i poetyckie.
Czy potrzebuję różnych promptów dla Veo, Klinga i Runway?
Tak, spodziewaj się dostosowań. Veo obsługuje długie zdania kinematograficzne i wskazówki dźwiękowe, Kling nagradza wyraźne działanie fizyczne, a Runway lubi ciasne prompty. Trzymaj pięć slotów i przepisz resztę.
Jak napisać prompty image-to-video?
Pomiń opisywanie obrazu, ponieważ już zawiera podmiot, światło i paletę. Napisz tylko co się porusza, podaj zachowanie kamery, i dodaj że wszystko inne zostaje dokładnie takie, jakie jest.
Czy prompty do wideo AI mogą zawierać dźwięk i dialog?
Jeśli twój model generuje dźwięk, tak. Napisz dźwięk jak ujęcie: teksturę ambientną, jeden lub dwa efekty, i dialog w cudzysłowach jeśli jest potrzebny. Modele bez dźwięku ignorują te linie.
Dlaczego wideo AI odkształca twarze i tła?
Zwykle prompt prosi o za wiele: kilka ruchów kamery, wiele działań lub zatłoczone sceny. Użyj jednego ruchu, jednego beatu, zamkniętej lub powolnej kamery, i lock line na tło.
★ steely dan × liminal hotel room × 35mm film ★ brutalist architecture sunset vaporwave ★ 1970s rock album × medium format ★ renaissance cyberpunk samurai ★ macro honey gold leaf ★ tokyo aerial rain cinematic ★ surrealist collage editorial ★ analog grain portrait studio ★ neon botanical illustration ★   ★ steely dan × liminal hotel room × 35mm film ★ brutalist architecture sunset vaporwave ★ 1970s rock album × medium format ★ renaissance cyberpunk samurai ★ macro honey gold leaf ★ tokyo aerial rain cinematic ★ surrealist collage editorial ★ analog grain portrait studio ★ neon botanical illustration ★   
✦ copy the prompt ✦ remix this ✦ drop into flux ✦ steal this look ✦ open the moodboard ✦ crack it open ✦ send to nano banana ✦ go wild ✦ copy the prompt ✦ remix this ✦ drop into flux ✦ steal this look ✦ open the moodboard ✦ crack it open ✦ send to nano banana ✦ go wild ✦