Prompt Video AI yang Benar Tahan Melampaui Detik Ketiga
Summary
Prompt video AI yang baik mengarahkan shot bukan menggambarkan gambar. Namai satu subjek, satu aksi, satu gerakan kamera, cahayanya, dan satu hal yang harus tetap tidak berubah. Pertahankan clip ke satu beat, gunakan kosakata kamera nyata, dan tambahkan garis kunci untuk menghentikan latar belakang melayang. Untuk image-to-video, gambarkan hanya gerakannya. Mulai dengan satu model, ubah satu slot pada satu waktu, dan nilai clip dibisu sebelum menambahkan suara.
Kamu mengetik "cinematic shot kota malam" dan dapatkan delapan detik sup neon yang meleleh. Selamat datang. Prompt video ai yang bagus tidak menggambarkan gambar. Mereka mengarahkan sebuah shot: siapa yang berbuat apa, kemana kamera bergerak, berapa lama, apa yang tetap diam. Di bawah adalah struktur lima bagian yang kami ambil dari setiap prompt yang berhasil, ditambah contoh siap-salin yang bisa kamu masukkan ke Veo, Kling atau Runway hari ini.
Mengapa prompt-mu meleleh setelah dua detik
Prompt gambar diam menggambarkan satu frame. Prompt video harus menggambarkan waktu. Itulah seluruh perbedaannya, dan itulah sebabnya kebiasaan Midjourney rusak saat kamu tekan tombol video.
Ketika kamu hanya menggambarkan tampilan, model harus menemukan gerakan. Model memilih opsi paling malas: zoom lambat, wajah melayang, latar belakang yang perlahan mengatur ulang dirinya sendiri. Kamu meminta mood dan mendapat screensaver.
Perbaikannya membosankan dan berhasil. Namai subjek, satu aksi, gerakan kamera, pencahayaan, dan satu hal yang harus tetap tidak berubah. Lima slot. Lewatkan satu dan model mengisinya untuk kamu, biasanya dengan buruk.
Panduan prompting Veo Google sendiri mendarat di kerangka yang sama: subjek, aksi, gaya, posisi dan gerakan kamera, komposisi, ambiens. Kami hanya merangkumnya agar bisa kamu pegang di kepala saat mengetik.
Formula lima-slot, dengan prompt yang bisa kamu curi
Ini framenya. Tulislah dalam urutan ini, dalam satu atau dua kalimat polos, dan pertahankan di bawah sekitar 60 kata untuk pass pertama.
Subjek: satu frasa nominal dengan dua spesifik. "Pengantar dalam jaket hujan kuning", bukan "seorang".
Aksi: satu kata kerja, satu beat. "Menyeberangi jalan dan berhenti di bawah tanda berkedip."
Kamera: ukuran shot plus gerakan. "Sudut rendah, push-in lambat."
Cahaya dan grade: "Cahaya lampu natrium, aspal basah, butir film 35mm."
Kunci: apa yang tetap diam. "Signage latar belakang tetap statis, tidak ada karakter ekstra."
Curi ini:
Pengantar dalam jaket hujan kuning menyeberangi jalan kosong di malam hari dan berhenti di bawah tanda berkedip. Sudut rendah, push-in lambat, butir film 35mm, cahaya lampu natrium mencerminkan aspal basah. Signage dan bangunan tetap statis, tidak ada karakter ekstra, tidak ada teks.
Perhatikan apa yang hilang. Tidak ada "epik", tidak ada "masterpiece", tidak ada "8K ultra detail". Kata-kata itu adalah sisa dari era model gambar dan menambah noise, bukan arah. Gunakan token itu untuk kamera sebaliknya.

Bahasa kamera adalah upgrade termurah yang kamu miliki
Jika kamu hanya perbaiki satu slot, perbaiki ini. Model telah melihat jutaan clip berlabel dengan kosakata film, jadi istilah kamera nyata menarik perilaku nyata. Yang samar-samar menarik rata-rata.
Lembar contekan singkat yang benar-benar mengubah output:
Push-in / pull-back: gerakan paling aman. Mulai dari sini.
Tracking shot: kamera mengikuti subjek ke samping atau dari belakang. Sempurna untuk scene berjalan.
Orbit / arc: kuat, juga gerakan paling mungkin merusak wajah. Pertahankan clip singkat.
Static locked-off: kurang dihargai. Shot tripod dengan hanya subjek bergerak adalah hal paling stabil yang bisa kamu minta.
Handheld: menambah kehidupan, menambah gemetar. Katakan "subtle" atau kamu akan mendapat earthquake cam.
Satu gerakan per clip. Dua gerakan simultan ("orbit sambil zoom dan tilt naik") adalah tempat fisika pergi mati. Jika ingin reveal kompleks, bangun sebagai shot terpisah dan potong bersama.
Prompt image-to-video: gambarkan gerakan, bukan gambarnya
Mulai dari still adalah kode curang diam dari seluruh kerajinan ini. Kunci tampilan dengan model gambar pertama, kemudian buat animasi. Prompt video berhenti menjadi deskripsi dan menjadi stage direction.
Gambar sudah berisi subjek, cahaya dan palet. Mengulangnya membuang kata dan kadang melawan frame. Tulis hanya apa yang bergerak:
Wanita itu membalikkan kepalanya perlahan ke arah jendela. Gorden terangkat dalam angin ringan. Kamera tetap diam. Segala sesuatu di frame lain tetap persis seperti apa adanya.
Kalimat terakhir itu penting lebih dari yang terlihat. "Segala sesuatu tetap seperti apa adanya" adalah kunci murah melawan latar belakang melayang yang membuat footage AI terungkap.
Jika membangun referensi di Midjourney atau Flux pertama, simpan komposisi sederhana: satu subjek jelas, ruang di sekelilingnya untuk kamera bergerak. Still ramai dan sesak memberikan model video tidak ada yang aman untuk push.

Prompt yang layak disalin: tiga scene, tiga pekerjaan
Library prompt suka volume. Kami lebih suka memberi kamu tiga yang masing-masing mengajarkan reflex berbeda. Remix sesuka hati, tapi mulai dari ini.
Beat produk. Singkat, terkontrol, tanpa manusia untuk rusakkan.
Makro shot mug keramik matte di counter batu di pagi hari. Uap naik perlahan. Pull-back lambat mengungkap dapur berterang matahari. Cahaya jendela lembut, shallow depth of field. Bentuk mug dan counter tetap tidak berubah. Tidak ada tangan, tidak ada teks.
Piece mood. Satu karakter, satu gesture, banyak atmosfer.
Sosok sendiri dengan payung berjalan pergi turun jalan alley neon hujan di malam hari. Shot wide locked-off, anamorphic flare, hujan lebat, refleksi basah, butir 35mm. Sosok terus berjalan dengan kecepatan mantap. Tidak ada potongan.
Loop. Untuk latar belakang, hero sections, postingan sosial yang perlu diputar tanpa jahitan.
Awan melayang perlahan di atas ridge gunung di golden hour, kamera statis, parallax lembut dalam rumput foreground. Soft film grade. Gerakan halus dan berkelanjutan, frame awal dan akhir terlihat sama.
Masing-masing mengikuti lima slot. Masing-masing berakhir dengan kunci. Itulah polanya, dan itulah mengapa mereka tahan melampaui detik ketiga.

Suara, durasi dan rasio aspek: setelan yang orang lupakan
Tiga detail duduk di luar lima slot dan masih menghancurkan clip saat diabaikan.
Durasi. Clip singkat tahan, yang panjang melayang. Jika model menawarkan lima hingga delapan detik, minta satu beat dan berhenti. Butuh tiga puluh detik? Rencanakan enam shot, bukan satu generasi heroik. Editor telah memotong di action selama satu abad karena alasan.
Rasio aspek. Putuskan sebelum menulis, karena komposisi bergantung padanya. Push-in lambat turun koridor dibaca indah di 16:9 dan terasa sempit di 9:16. Untuk vertikal, letakkan subjek di third tengah dan tinggalkan ruang kepala untuk chrome interface. Katakan rasio dalam prompt jika alat membiarkanmu.
Suara. Beberapa model sekarang menghasilkan audio dengan gambarnya. Jika punyamu, tulis suaranya seperti kamu menulis shot: "dengingan lalu lintas jauh, hujan di awning logam, satu sirene terteredam". Lewati permintaan musik kecuali kamu benar-benar membutuhkannya. Kamu akan ingin score sendiri bagaimanapun.
Ini versi prompt pengantar dengan suara ditambahkan:
Pengantar dalam jaket hujan kuning menyeberangi jalan kosong dan berhenti di bawah tanda berkedip. Sudut rendah, push-in lambat, butir 35mm, 16:9. Suara ambiens: hujan mantap, lalu lintas jauh, buzz listrik dari tanda. Tidak ada dialog, tidak ada teks.
Lima slot yang sama, satu baris ekstra. Itulah seluruh upgrade.
Model mana yang mendapat prompt mana?
Prompt yang sama, model berbeda, hasil berbeda. Jangan berharap satu master prompt untuk traveling. Beberapa generalisasi jujur, tidak ada benchmark yang berpura-pura:
Veo menangani kalimat panjang, deskriptif, sinematik dengan baik dan bisa membawa dialog dan cues suara ketika kamu menuliskannya. Kling cenderung menghargai aksi fisik jelas dan instruksi kamera, dan itu rumah nyaman untuk image-to-video. Runway suka prompt ketat, teredam dan memberimu lebih banyak kontrol hands-on saat iterating.
Jika lebih suka tidak juggling tiga tab, Higgsfield menempatkan beberapa model video di belakang satu workspace. Itu praktis ketika kamu ingin jalankan prompt yang sama melalui dua engine dan bandingkan, yang adalah cara tercepat belajar apa yang benar-benar didengarkan masing-masing.
Opini kami: pilih satu model, pelajari quirk-nya selama satu minggu, kemudian cabang keluar. Hopping engine setiap kali clip mengecewakan mengajarkanmu tidak ada.
Lewati kebiasaan ini (mereka menghabiskan kredit-mu)
Beberapa saran beredar karena terdengar cerdas. Tidak. Lewati:
Tumpukan kata kualitas. "Ultra realistic, 8K, masterpiece, award-winning" tidak membuat video lebih baik. Ini mengenceringkan instruksi.
Prompt novel panjang. Melampaui kurang lebih 100 kata, model menjatuhkan detail awal. Pendek dan spesifik mengalahkan panjang dan puitis.
Meminta teks dalam frame. Tanda, keterangan dan logo biasanya melengkung mid-clip. Tambahkan judul di editor-mu.
Lima aksi dalam satu clip. Lima detik pas untuk satu beat. Pisahkan sisa ke generasi terpisah.
Menulis ulang dari awal setiap kali. Simpan satu prompt kerja, ubah satu slot, bandingkan. Itulah eksperimen nyata.
Cara iterasi tanpa membakar kredit-mu
Perlakukan setiap generasi sebagai tes, bukan tiket lotre. Ubah satu slot pada satu waktu. Jika gerakan salah, sentuh baris aksi. Jika tampilan melayang, ketat kunci. Jika kamera mengapung, tukar "orbit" untuk "push-in lambat".
Simpan catatan berjalan tentang apa yang berhasil, dalam format apapun kamu benar-benar akan buka lagi. Board Are.na bekerja baik untuk ini, begitu juga file teks biasa. Poinnya adalah bahwa prompt ketiga kamu harus mulai dari pemenang prompt kedua kamu, bukan dari nol.
Dan tinjau clip dalam mode diam pertama. Menilai gerakan dengan sendirinya sebelum kamu biarkan soundtrack bagus maafkan.
Apa yang harus dicoba malam ini
Pilih satu scene dari tiga di atas, jalankan dalam model tunggal, dan ubah hanya baris kamera. Jalankan tiga kali: statis, push-in, tracking. Letakkan clip berdampingan. Kamu akan belajar lebih banyak dari eksperimen sepuluh menit itu daripada dari daftar seratus prompt.
Salin prompt, masukkan, dan lihat apa yang rusak. Kemudian katakan kepada kami slot mana yang akan kamu perbaiki pertama.
Praktik terbaik untuk iterasi cepat
Ketika kamu mulai dengan lima-slot framework, iterasi menjadi sistematis bukan intuitif. Jangan mencoba mengubah semuanya sekaligus. Sebaliknya, buat spreadsheet kecil atau dokumen teks dengan tiga kolom: slot apa, apa yang berubah, hasil apa. Satu perubahan per baris. Ini terdengar membosankan tapi menghemat energi mental dan kredit model.
Banyak kreator berpikir merge tool seperti ComfyUI atau menambahkan ControlNet adalah langkah berikutnya. Mungkin. Tapi pertama-tama kuasai prompt murni. Tools ada untuk mempercepat workflow yang sudah bekerja, bukan menyelamatkan workflow yang rusak.
Mengapa model berbeda mendengarkan berbeda
Setiap model video memiliki arsitektur training yang sedikit berbeda dan dataset training yang berbeda. Veo dilatih dengan klip yang lebih sinematik dan film-heavy, makanya menerima deskripsi naratif. Kling dilatih dengan lebih banyak konten user-generated dan short-form, makanya menghargai instruksi langsung. Runway berada di tengah dan lebih toleran terhadap eksperimen.
Ini bukan alasan untuk tidak coba semuanya. Ini alasan untuk mengerti bahwa satu prompt tidak universal. Bawa keyword dan structure ke setiap engine, tapi siap untuk reword action line atau camera instruction bergantung pada model.
Kesalahan umum pemula
Banyak orang datang ke video prompting dengan kebiasaan yang bekerja untuk image generation. Beberapa kesalahan paling umum:
Memasukkan detail konseptual ("cyber-punk"), bukan instruksi teknis ("overhead tracking shot")
Menulis prompt di gaya kalimat panjang daripada frasa pendek yang jelas
Mendeskripsikan emosi bukan aksi ("heartfelt", "tender") tanpa tindakan konkret
Lupa bahwa durasi default lebih pendek dari yang kamu kira : clip 6 detik itu cepat
Perbaikan: tulis seperti director breakdown sheet, bukan script novel. Lebih konkrit, lebih singkat, lebih action-oriented.
Setelah kamu memahami pola lima-slot, banyak masalah pemula lenyap. Kamu tahu apa yang dicari model karena kamu menjelaskannya dengan eksplisit. Tidak ada ruang untuk interpretasi buruk.