Prompts de vidéo cinématographique par IA : cinq recettes de plans à réaliser en huit secondes

Cinq recettes de plans pour des prompts de vidéo cinématographique par IA : révélation de produit, réplique de dialogue, moment documentaire, transformation et accroche verticale, plus le brief en six blocs dont chacune a besoin.

Prompts de vidéo cinématographique par IA : cinq recettes de plans à réaliser en huit secondes

La plupart des courts clips générés par IA n'échouent pas parce que l'idée était trop petite. Ils échouent parce que le prompt n'a jamais dit à la caméra quoi faire. Demandez « un plan cinématographique épique d'un musicien » et vous obtenez un cadre large par défaut avec une lente dérive, parce que chaque mot de cette phrase — épique, cinématographique, incroyable — nomme un ressenti plutôt qu'une décision que le modèle peut exécuter.

Veo 3 a relevé les enjeux pour ce type de travail. Le modèle génère l'image et le son ensemble, produisant nativement le dialogue, les effets sonores et le bruit ambiant plutôt que de les superposer après coup (la page Veo de Google DeepMind décrit cela comme la vidéo qui rencontre l'audio). Un seul prompt peut désormais renvoyer une réplique avec un mouvement des lèvres correspondant, des pas sur la pierre mouillée et le fond sonore de la pièce en dessous. Cela transforme le prompting en quelque chose de plus proche d'un brief de plan que d'une requête de recherche, et cela signifie que les prompts de vidéo cinématographique par IA méritent la même discipline que celle que vous accorderiez à un vrai scénario de tournage.

Ce guide porte sur la réalisation, pas sur la description. Il couvre la structure qui garde un prompt lisible pour le modèle, les limites physiques autour desquelles il faut concevoir, et cinq directions créatives — une révélation de produit, une réplique de dialogue, un moment observé, une transformation et une accroche verticale — que vous pouvez construire dès aujourd'hui sur un outil pensé pour le prompt comme le générateur Veo 3 sur KOOX AI.

Pourquoi les adjectifs cinématographiques ne font rien

Les propres recommandations de Google pour Veo sont sans détour sur l'ordre : la cinématographie vient en premier, parce que le travail de caméra est « l'outil le plus puissant pour transmettre le ton et l'émotion » (l'analyse par Prompt Architects de la formule en cinq parties de Google). Les cinq blocs s'enchaînent ainsi : cinématographie, sujet, action, contexte, puis style et ambiance. Quand un bloc est laissé vide, le modèle le remplit par un défaut, et le défaut est toujours plus fade que votre idée.

Les mouvements de caméra nommés portent un sens dense. Un « lent dolly push-in » dit au modèle le rythme, le rendu de l'objectif et la direction émotionnelle du plan en trois mots ; un « mouvement de caméra cool » ne lui dit rien. La même logique s'applique à la lumière. Un « éclairage cinématographique » est une planche d'ambiance ; une « key light dure depuis un néon à gauche de la caméra, fill doux depuis une vitrine à droite, contraste low-key » est une instruction qu'un relecteur peut réellement vérifier.

Le guide de prompts de Google DeepMind applique le même principe dans l'autre sens : commencez par définir le type de vidéo que vous voulez faire — réaliste, animée, en stop-motion — et utilisez le dialogue des personnages pour donner le ton. Le style d'abord, le détail précis ensuite.

Le brief de plan en six blocs

Tout ce qui suit tient dans un seul modèle réutilisable. Remplissez chaque bloc qui compte et laissez le reste de côté ; un plan de produit muet n'a pas besoin de dialogue, et un plan guidé par une image de référence n'a pas besoin d'un paragraphe sur l'apparence.

  • Sujet — une personne ou un objet avec un détail identifiant. « Une femme d'une quarantaine d'années, cheveux foncés, portant un blazer en lin. »
  • Action — un événement visible avec une direction. « Marche lentement vers la caméra, baissant une fois les yeux. »
  • Scène — lieu, heure de la journée, météo. « Une librairie étroite au crépuscule, de la pluie sur la vitrine. »
  • Caméra — une taille de plan, un objectif, un mouvement. « Plan mi-rapproché, 35 mm, lent dolly push-in. »
  • Lumière — source, direction, qualité. « Lumière chaude de fenêtre venant de la gauche de l'écran, fill doux, pas de brume. »
  • Audio — le dialogue entre guillemets, les effets et l'ambiance nommés séparément. « SFX : pluie sur la vitre, un carillon de porte. Elle dit : “Nous sommes fermés.” »

Trois fiches de storyboard en papier vierge alignées en rangée sur une surface de studio neutre, prêtes à être remplies

Deux habitudes gardent le modèle honnête. D'abord, dosez les modificateurs : deux ou trois par plan, c'est l'idéal, et empiler cinq mouvements contradictoires est le moyen le plus rapide d'obtenir un résultat confus. Ensuite, énoncez le mouvement que vous voulez même quand vous n'en voulez aucun — si vous n'écrivez pas « statique » ou « caméra verrouillée », le modèle est libre d'ajouter une dérive qui lui est propre.

Un exemple concret, assemblé :

Plan mi-rapproché d'une boulangère fatiguée appuyée sur un comptoir en inox après la fermeture, 50 mm, caméra verrouillée à hauteur des yeux. Lumière fluorescente chaude au-dessus, lumière bleue froide de la rue à travers la fenêtre, poussière de farine sur le tablier. Elle expire et dit doucement : « Demain, on commence plus tôt. » Audio : bourdonnement du réfrigérateur, une plaque qui se pose, une pluie légère. Pas de musique.

Concevoir pour huit secondes

Veo 3.1 génère des vidéos de huit secondes avec un audio généré nativement, en 720p, 1080p ou 4K (documentation Veo de l'API Gemini). Huit secondes n'est pas une limite contre laquelle lutter ; c'est l'unité de travail. Un plan, un événement lisible, un mouvement de caméra. Un découpage de trois moments — établir, changer, conclure — tient confortablement, et un prompt qui demande un plan-séquence d'une minute sera tout simplement coupé.

La longueur vient de l'assemblage plutôt que d'une seule génération. Extend prolonge un clip à partir de sa dernière seconde, si bien qu'une séquence peut atteindre une minute ou plus tout en conservant la continuité visuelle et sonore (l'annonce de Veo 3.1 par Google). La génération premier-et-dernier plan fait le pont entre deux images pour créer une transition, et jusqu'à trois images de référence peuvent ancrer un personnage, un produit ou un style quand la cohérence compte. Si vous partez d'une image fixe plutôt que d'une phrase, le même brief de plan s'applique à l'image-vers-vidéo — décrivez ce qui change par rapport à l'image source plutôt que de redécrire ce qui est déjà visible, comme dans ces flux de travail photo-vers-vidéo.

Cinq directions à réaliser dès aujourd'hui

1. La révélation de produit avec un seul changement de matière. Choisissez un seul produit et un seul changement physique : de la condensation qui apparaît sur une canette froide, de la vapeur qui s'échappe d'une assiette, un liquide qui se stabilise dans un verre. Gardez la caméra statique, ou donnez-lui un seul court push-in qui s'arrête avant que l'étiquette ne remplisse le cadre. Demandez un seul signal sonore conçu et le fond sonore de la pièce, et rien d'autre. Le test de relecture est simple : l'étiquette est-elle encore lisible sur la dernière image ?

2. La réplique de dialogue. Un seul locuteur, une seule réplique courte, un plan moyen ou serré verrouillé. Mettez la phrase prononcée entre guillemets pour que le modèle la traite comme de la parole, nommez le jeu, et gardez la réplique assez courte pour tenir dans le clip. Vérifiez le synchronisme labial, la prononciation et si des sous-titres indésirables se sont glissés avant de juger l'image.

3. Le moment documentaire observé. Une poursuite à l'épaule ou un lent travelling, un seul sujet faisant quelque chose d'ordinaire et de précis — un cycliste qui attend à un feu rouge, un commerçant qui ferme son étal. Gardez l'ambiance superposée mais discrète : rumeur de la rue, une cloche, un seul son de contact. C'est la direction qui récompense le plus la retenue, parce que le mouvement naturel et la logique spatiale sont ce qui fait qu'un clip paraît réel.

4. La transformation surréaliste. Un objet change d'état à l'intérieur d'un cadre verrouillé : une grue en papier qui se déplie en oiseau, du sable qui se réorganise en visage. Le cadre verrouillé est essentiel, parce que tout le clip est le changement lui-même. Donnez au moment des sons de matière plutôt qu'une musique, et assurez-vous que la transformation est visible plutôt que suggérée.

5. L'accroche verticale. Une action immédiate dans un cadre vertical, un seul effet net dès le premier temps, le sujet maintenu dans la zone sûre. Le portrait et le paysage sont tous deux disponibles, alors décidez du cadrage avant d'écrire, pas après. Dites « statique » ou demandez un seul court push ; une accroche qui dérive est une accroche qui perd son sujet.

Une flèche en papier découpée posée à plat sur une surface ocre sourde, pointant résolument vers la droite

Chacune de ces directions tient dans un seul événement de huit secondes, et c'est précisément pourquoi elles fonctionnent.

Réaliser l'audio comme une seconde piste

L'audio natif est la fonctionnalité que la plupart des gens gaspillent. Veo 3 génère le dialogue, les effets sonores et le bruit ambiant à partir du prompt lui-même, et Veo 3.1 a étendu ce support audio à tous les outils construits par-dessus. Trois conventions gardent les résultats propres :

  • Le dialogue va entre guillemets et est attribué à un locuteur nommé.
  • Les effets sont nommés comme des effets — « SFX : un seul glissement d'aluminium, une goutte qui frappe la pierre. »
  • L'ambiance a sa propre phrase : « fond sonore de pièce, circulation lointaine, pas de musique. »

Le silence est un choix qui mérite d'être écrit. « Pas de dialogue, pas de musique » est une instruction légitime, et c'est la façon honnête de garder un plan de produit ou de nature propre.

Construire une bibliothèque, revoir chaque prise

Traitez l'itération comme un changement d'une seule variable. Si la composition est mauvaise, réécrivez le bloc caméra ; si l'ambiance est à côté, réécrivez le bloc lumière ; si le mouvement est mauvais, gardez tout le reste et échangez le seul mouvement. Comparer deux générations qui diffèrent sur un seul champ vous dit quel champ a causé la différence — et là où vous avez changé trois choses à la fois, vous n'apprenez rien.

Avec cette habitude de comparaison, vous pouvez tenir une petite bibliothèque de plans indexée par intention — révélation, tension, transition, preuve — chaque entrée contenant une spécification de plan fixe avec un contenu variable. Réutilisez la spécification et échangez le sujet pour garder une campagne visuellement cohérente.

Deux règles gardent la pratique propre. Les clips générés portent un filigrane SynthID (fiche modèle de Veo 3), alors ne supprimez pas et ne dénaturez pas la provenance, et divulguez la génération par IA là où votre audience, un client ou une plateforme s'y attend. Et ne demandez pas de personnes réelles et identifiables, de personnages protégés ou de produits de marque que vous n'avez pas le droit d'utiliser. Un brief de prompt est un plan, pas un laissez-passer.

Commencer par une seule ligne

L'écart entre un clip qui a l'air généré et un clip qui a l'air réalisé tient généralement à deux ou trois mots précis : le nom d'un mouvement de caméra, la direction d'une lumière, la texture d'un son. Écrivez le sujet, donnez à la caméra une seule tâche, nommez votre lumière, précisez le son, et concevez pour huit secondes. Puis générez, changez une chose, et générez de nouveau.

Ouvrez le générateur de vidéo Veo 3, écrivez votre premier brief de plan, et laissez la caméra jouer.

Informations sur l'article

Publié le
Prompts de vidéo cinématographique par IA : cinq recettes de plans à réaliser en huit secondes