- Blog
- Filmische KI-Video-Prompts: Fünf Shot-Rezepte, die Sie in acht Sekunden inszenieren können
Filmische KI-Video-Prompts: Fünf Shot-Rezepte, die Sie in acht Sekunden inszenieren können
Fünf Shot-Rezepte für filmische KI-Video-Prompts: Produktenthüllung, Dialogmoment, Dokumentarmoment, Verwandlung und vertikaler Hook — plus das Sechs-Felder-Briefing, das jedes davon braucht.

Die meisten kurzen KI-Clips scheitern nicht daran, dass die Idee zu klein war. Sie scheitern daran, dass der Prompt der Kamera nie gesagt hat, was sie tun soll. Bitten Sie um "eine epische filmische Aufnahme eines Musikers", und Sie erhalten eine Standard-Weitwinkelaufnahme mit einer langsamen Bewegung, weil jedes Wort in diesem Satz — episch, filmisch, erstaunlich — ein Gefühl benennt statt eine Entscheidung, die das Modell ausführen kann.
Veo 3 hat die Messlatte für diese Art von Arbeit höher gelegt. Das Modell erzeugt Bild und Ton gemeinsam und produziert Dialoge, Soundeffekte und Umgebungsgeräusche direkt, statt sie im Nachhinein darüberzulegen (Google DeepMinds Veo-Seite beschreibt es als Video, das auf Audio trifft). Ein einzelner Prompt kann nun eine Dialogzeile mit passender Lippenbewegung, Schritte auf nassem Stein und den darunterliegenden Raumton liefern. Das macht aus dem Prompten etwas, das eher einem Shot-Briefing als einer Suchanfrage ähnelt, und es bedeutet, dass filmische KI-Video-Prompts dieselbe Disziplin verdienen, die Sie einem echten Drehbuch geben würden.
Dieser Leitfaden handelt vom Inszenieren, nicht vom Beschreiben. Er behandelt die Struktur, die einen Prompt für das Modell lesbar hält, die physischen Grenzen, um die Sie herum planen müssen, und fünf kreative Richtungen — eine Produktenthüllung, einen Dialogmoment, einen beobachteten Moment, eine Verwandlung und einen vertikalen Hook —, die Sie heute auf einem prompt-zentrierten Tool wie dem Veo-3-Generator auf KOOX AI umsetzen können.
Warum filmische Adjektive nichts bewirken
Googles eigene Anleitung für Veo ist deutlich, was die Reihenfolge betrifft: Die Kameraführung kommt zuerst, weil die Kameraarbeit "das kraftvollste Werkzeug ist, um Ton und Emotion zu vermitteln" (Prompt Architects' Aufschlüsselung von Googles fünfteiliger Formel). Die fünf Felder lauten Kameraführung, Motiv, Handlung, Kontext und dann Stil und Atmosphäre. Wenn ein Feld leer bleibt, füllt das Modell es mit einem Standardwert, und der Standardwert ist immer nichtssagender als Ihre Idee.
Benannte Kamerabewegungen tragen eine dichte Bedeutung. Ein "langsamer Dolly-Push-in" vermittelt dem Modell in drei Wörtern das Tempo, das Objektivgefühl und die emotionale Richtung der Aufnahme; "coole Kamerabewegung" sagt ihm nichts. Dieselbe Logik gilt für das Licht. "Filmische Beleuchtung" ist ein Moodboard; "hartes Key-Light von Neon links der Kamera, weiches Fill aus einem Schaufenster rechts, kontrastarme Low-Key-Ausleuchtung" ist eine Anweisung, die ein Prüfer tatsächlich überprüfen kann.
Google DeepMinds Prompt-Leitfaden wendet dasselbe Prinzip aus der anderen Richtung an: Beginnen Sie damit, die Art von Video zu definieren, die Sie machen wollen — realistisch, animiert, Stop-Motion —, und nutzen Sie Charakterdialoge, um den Ton festzulegen. Zuerst der Stil, dann das spezifische Detail.
Das Sechs-Felder-Shot-Briefing
Alles unten passt in eine wiederverwendbare Vorlage. Füllen Sie jedes Feld aus, das wichtig ist, und lassen Sie den Rest weg; eine stille Produktaufnahme braucht keinen Dialog, und eine durch ein Referenzbild geführte Aufnahme braucht keinen Absatz über das Aussehen.
- Motiv — eine Person oder ein Objekt mit einem identifizierenden Detail. "Eine Frau in ihren 40ern, dunkles Haar, trägt einen Leinenblazer."
- Handlung — ein sichtbares Ereignis mit einer Richtung. "Geht langsam auf die Kamera zu, blickt einmal nach unten."
- Szene — Ort, Tageszeit, Wetter. "Eine schmale Buchhandlung in der Dämmerung, Regen am Fenster."
- Kamera — eine Einstellungsgröße, ein Objektiv, eine Bewegung. "Halbnahaufnahme, 35 mm, langsamer Dolly-Push-in."
- Licht — Quelle, Richtung, Qualität. "Warmes Fensterlicht von links im Bild, weiches Fill, kein Dunst."
- Audio — Dialog in Anführungszeichen, Effekte und Atmosphäre getrennt benannt. "SFX: Regen auf Glas, ein Türgong. Sie sagt: 'Wir haben geschlossen.'"

Zwei Gewohnheiten halten die Vorlage ehrlich. Erstens: Budgetieren Sie die Modifikatoren — zwei oder drei pro Aufnahme sind der ideale Wert, und fünf widersprüchliche Bewegungen zu stapeln ist der schnellste Weg zu einem verwaschenen Ergebnis. Zweitens: Benennen Sie die Bewegung, die Sie wollen, auch wenn Sie keine wollen — wenn Sie nicht "statisch" oder "fixiert" schreiben, steht es dem Modell frei, eine eigene Bewegung hinzuzufügen.
Ein ausgearbeitetes Beispiel, zusammengesetzt:
Halbnahaufnahme einer müden Bäckerin, die nach Ladenschluss auf eine Edelstahltheke gelehnt ist, 50 mm, Kamera auf Augenhöhe fixiert. Warmes Leuchtstofflicht von oben, kühles blaues Straßenlicht durch das Fenster, Mehlstaub auf der Schürze. Sie atmet aus und sagt leise: "Morgen fangen wir früher an." Audio: Brummen eines Kühlschranks, ein sich setzendes Blech, leiser Regen. Keine Musik.
Für acht Sekunden entwerfen
Veo 3.1 erzeugt acht Sekunden lange Videos mit nativ generiertem Audio in 720p, 1080p oder 4K (Gemini-API-Veo-Dokumentation). Acht Sekunden sind keine Einschränkung, gegen die man ankämpfen muss; sie sind die Arbeitseinheit. Eine Aufnahme, ein lesbares Ereignis, eine Kamerabewegung. Ein Beat-Sheet aus drei Momenten — etablieren, verändern, landen — passt bequem hinein, und ein Prompt, der einen einminütigen Oner verlangt, wird einfach abgeschnitten.
Die Länge entsteht durch Montage statt durch eine einzelne Generierung. Extend setzt einen Clip ab seiner letzten Sekunde fort, sodass eine Sequenz auf eine Minute oder mehr anwachsen kann, während die visuelle und akustische Kontinuität erhalten bleibt (Googles Veo-3.1-Ankündigung). Die Generierung mit erstem und letztem Frame überbrückt zwei Bilder zu einem Übergang, und bis zu drei Referenzbilder können einen Charakter, ein Produkt oder einen Stil verankern, wenn Konsistenz wichtig ist. Wenn Sie von einem Standbild statt von einem Satz ausgehen, gilt dasselbe Shot-Briefing für Image-to-Video — beschreiben Sie, was sich gegenüber dem Ausgangsbild ändert, statt neu zu beschreiben, was bereits sichtbar ist, wie in diesen Foto-zu-Video-Workflows.
Fünf Richtungen, die Sie heute inszenieren können
1. Die Produktenthüllung mit einer materiellen Veränderung. Wählen Sie ein einzelnes Produkt und eine physische Veränderung: Kondenswasser, das auf einer kalten Dose entsteht, Dampf, der von einem Teller aufsteigt, Flüssigkeit, die sich in einem Glas setzt. Halten Sie die Kamera statisch oder geben Sie ihr einen kurzen Push-in, der stoppt, bevor das Etikett das Bild füllt. Verlangen Sie einen gestalteten Klanghinweis und Raumton, sonst nichts. Der Prüftest ist einfach: Ist das Etikett im letzten Frame noch lesbar?
2. Der Dialogmoment. Ein Sprecher, eine kurze Zeile, eine fixierte mittlere oder nahe Aufnahme. Setzen Sie den gesprochenen Satz in Anführungszeichen, damit das Modell ihn als Sprache behandelt, benennen Sie die Vortragsart, und halten Sie die Zeile kurz genug, dass sie in den Clip passt. Prüfen Sie das Lippen-Timing, die Aussprache und ob sich unerwünschte Untertitel eingeschlichen haben, bevor Sie das Bild beurteilen.
3. Der beobachtete Dokumentarmoment. Eine Handkamera-Verfolgung oder eine langsame Verfolgungsfahrt, ein Motiv, das etwas Gewöhnliches und Spezifisches tut — ein Radfahrer, der an einer roten Ampel wartet, ein Händler, der einen Stand schließt. Halten Sie die Atmosphäre geschichtet, aber leise: Straßenbrummen, eine Glocke, ein Kontaktgeräusch. Das ist die Richtung, die Zurückhaltung am meisten belohnt, denn natürliche Bewegung und räumliche Logik lassen einen Clip echt wirken.
4. Die surreale Verwandlung. Ein Objekt ändert seinen Zustand innerhalb eines fixierten Bildausschnitts: ein Papierkranich, der sich zu einem Vogel entfaltet, Sand, der sich zu einem Gesicht umordnet. Ein fixierter Bildausschnitt ist wesentlich, denn der ganze Clip ist die Veränderung selbst. Geben Sie dem Moment materielle Geräusche statt einer Musikuntermalung, und stellen Sie sicher, dass die Verwandlung sichtbar und nicht nur angedeutet ist.
5. Der vertikale Hook. Sofortige Handlung in einem vertikalen Bildausschnitt, ein knackiger Effekt im ersten Beat, das Motiv innerhalb des sicheren Bereichs gehalten. Hoch- und Querformat sind beide verfügbar, also entscheiden Sie sich für den Bildausschnitt, bevor Sie schreiben, nicht danach. Sagen Sie "statisch" oder verlangen Sie einen einzigen kurzen Push; ein Hook, der driftet, ist ein Hook, der sein Motiv verliert.

Jede dieser Richtungen bleibt innerhalb eines achtsekündigen Ereignisses, und genau deshalb funktionieren sie.
Den Ton wie eine zweite Spur inszenieren
Nativer Ton ist die Funktion, die die meisten Menschen verschwenden. Veo 3 erzeugt Dialoge, Soundeffekte und Umgebungsgeräusche aus dem Prompt selbst, und Veo 3.1 hat diese Tonunterstützung auf die darauf aufbauenden Tools ausgeweitet. Drei Konventionen halten die Ergebnisse sauber:
- Dialog steht in Anführungszeichen und wird einem benannten Sprecher zugeordnet.
- Effekte werden als Effekte benannt — "SFX: ein einzelnes Aluminiumgleiten, ein Tropfen, der auf Stein trifft."
- Die Atmosphäre bekommt ihren eigenen Satz: "Raumton, entfernter Verkehr, keine Musik."
Stille ist eine Entscheidung, die es wert ist, aufgeschrieben zu werden. "Kein Dialog, keine Musik" ist eine legitime Anweisung, und es ist der ehrliche Weg, eine Produkt- oder Naturaufnahme sauber zu halten.
Eine Bibliothek aufbauen, jede Aufnahme überprüfen
Behandeln Sie die Iteration als Ändern-einer-Variable. Wenn die Komposition falsch ist, schreiben Sie das Kamera-Feld neu; wenn die Stimmung daneben liegt, schreiben Sie das Licht-Feld neu; wenn die Bewegung falsch ist, behalten Sie alles andere und tauschen Sie die eine Bewegung aus. Zwei Generierungen zu vergleichen, die sich in einem Feld unterscheiden, sagt Ihnen, welches Feld den Unterschied verursacht hat — und wo Sie drei Dinge auf einmal geändert haben, lernen Sie nichts.
Mit dieser Vergleichsgewohnheit können Sie eine kleine Aufnahmebibliothek führen, die nach Absicht geordnet ist — Enthüllung, Spannung, Übergang, Beweis —, wobei jeder Eintrag eine feste Aufnahmespezifikation mit variablem Inhalt enthält. Nutzen Sie die Spezifikation wieder und tauschen Sie das Motiv aus, um eine Kampagne visuell kohärent zu halten.
Zwei Regeln halten die Praxis sauber. Generierte Clips tragen ein SynthID-Wasserzeichen (Veo-3-Modellkarte), also entfernen oder verfälschen Sie die Herkunft nicht, und legen Sie die KI-Generierung offen, wo Ihr Publikum, ein Kunde oder eine Plattform es erwartet. Und fordern Sie keine echten, identifizierbaren Personen, geschützten Charaktere oder Markenprodukte an, für die Sie kein Nutzungsrecht haben. Ein Prompt-Briefing ist ein Plan, kein Freibrief.
Mit einer Zeile beginnen
Die Lücke zwischen einem Clip, der generiert aussieht, und einem, der inszeniert aussieht, beträgt meist zwei oder drei konkrete Wörter: den Namen einer Kamerabewegung, die Richtung eines Lichts, die Textur eines Klangs. Schreiben Sie das Motiv, geben Sie der Kamera eine Aufgabe, benennen Sie Ihr Licht, spezifizieren Sie den Ton, und entwerfen Sie für acht Sekunden. Dann generieren Sie, ändern Sie eine Sache und generieren Sie erneut.
Öffnen Sie den Veo-3-Videogenerator, schreiben Sie Ihr erstes Shot-Briefing, und lassen Sie die Kamera das Schauspiel übernehmen.