Prompts de vídeo cinematográfico con IA: cinco recetas de plano que puedes dirigir en ocho segundos

Cinco recetas de plano para prompts de vídeo cinematográfico con IA: revelación de producto, beat de diálogo, momento documental, transformación y gancho vertical, además del brief de seis campos que necesita cada una.

Prompts de vídeo cinematográfico con IA: cinco recetas de plano que puedes dirigir en ocho segundos

La mayoría de los clips cortos de IA no fracasan porque la idea fuera demasiado pequeña. Fracasan porque el prompt nunca le dijo a la cámara qué hacer. Pide "un plano cinematográfico épico de un músico" y obtendrás un plano general por defecto con una deriva lenta, porque cada palabra de esa frase —épico, cinematográfico, asombroso— nombra una sensación en lugar de una decisión que el modelo pueda ejecutar.

Veo 3 subió la apuesta para este tipo de trabajo. El modelo genera imagen y sonido a la vez, produciendo diálogo, efectos de sonido y ruido ambiente de forma nativa en lugar de superponerlos después (la página de Veo de Google DeepMind lo describe como vídeo que se une al audio). Un solo prompt puede ahora devolver una línea de diálogo con el movimiento de labios correspondiente, pasos sobre piedra mojada y el tono de sala por debajo. Eso convierte la creación de prompts en algo más cercano a un brief de plano que a una consulta de búsqueda, y significa que los prompts de vídeo cinematográfico con IA merecen la misma disciplina que darías a un guion de rodaje real.

Esta guía trata sobre dirigir, no describir. Abarca la estructura que mantiene un prompt legible para el modelo, los límites físicos en torno a los que tienes que diseñar y cinco direcciones creativas —una revelación de producto, un beat de diálogo, un momento observado, una transformación y un gancho vertical— que puedes construir hoy con una herramienta basada en prompts como el generador de Veo 3 en KOOX AI.

Por qué los adjetivos cinematográficos no sirven de nada

La propia guía de Google para Veo es directa respecto al orden: la cinematografía va primero, porque el trabajo de cámara es "la herramienta más poderosa para transmitir tono y emoción" (el desglose de Prompt Architects de la fórmula de cinco partes de Google). Los cinco campos son cinematografía, sujeto, acción, contexto y, por último, estilo y ambiente. Cuando se deja un campo vacío, el modelo lo rellena con un valor por defecto, y ese valor por defecto siempre es más insulso que tu idea.

Los movimientos de cámara con nombre propio concentran mucho significado. Un "lento dolly push-in" le dice al modelo el ritmo, la sensación de objetivo y la dirección emocional del plano en tres palabras; "un movimiento de cámara chulo" no le dice nada. La misma lógica se aplica a la luz. "Iluminación cinematográfica" es un tablero de referencias; "luz principal dura procedente de un neón a la izquierda de la cámara, relleno suave desde el escaparate de una tienda a la derecha, contraste low-key" es una instrucción que un revisor puede comprobar de verdad.

La guía de prompts de Google DeepMind aplica el mismo principio desde el otro lado: empieza definiendo el tipo de vídeo que quieres hacer —realista, animado, stop-motion— y usa el diálogo de los personajes para marcar el tono. Primero el estilo, después el detalle concreto.

El brief de plano de seis campos

Todo lo que sigue cabe en una única plantilla reutilizable. Rellena cada campo que importe y deja fuera los demás; un plano de producto en silencio no necesita diálogo, y un plano guiado por una imagen de referencia no necesita un párrafo sobre el aspecto.

  • Sujeto — una persona u objeto con un detalle identificativo. "Una mujer de unos 40 años, pelo oscuro, con un blazer de lino."
  • Acción — un evento visible con una dirección. "Camina despacio hacia la cámara, mira hacia abajo una vez."
  • Escena — lugar, momento del día, tiempo atmosférico. "Una librería estrecha al atardecer, lluvia en la ventana."
  • Cámara — un tamaño de plano, un objetivo, un movimiento. "Plano medio corto, 35mm, lento dolly push-in."
  • Luz — fuente, dirección, calidad. "Luz cálida de ventana desde la izquierda de pantalla, relleno suave, sin neblina."
  • Audio — diálogo entre comillas, efectos y ambiente nombrados por separado. "SFX: lluvia sobre el cristal, un timbre de puerta. Ella dice: 'Estamos cerrados.'"

Tres tarjetas de storyboard de papel en blanco colocadas en fila sobre una superficie neutra de estudio, listas para rellenarse

Dos hábitos mantienen la plantilla honesta. Primero, controla los modificadores: dos o tres por plano es el punto ideal, y acumular cinco movimientos contradictorios es la forma más rápida de obtener un resultado confuso. Segundo, indica el movimiento que quieres incluso cuando no quieres ninguno: si no escribes "estático" o "fijo", el modelo es libre de añadir una deriva propia.

Un ejemplo desarrollado, montado:

Plano medio corto de una panadera cansada apoyada en un mostrador de acero inoxidable después del cierre, 50mm, cámara fija a la altura de los ojos. Luz fluorescente cálida arriba, luz azulada y fría de la calle por la ventana, polvo de harina en el delantal. Ella exhala y dice en voz baja: "Mañana empezamos antes." Audio: zumbido del frigorífico, una bandeja que se asienta, lluvia tenue. Sin música.

Diseña para ocho segundos

Veo 3.1 genera vídeos de ocho segundos con audio generado de forma nativa, a 720p, 1080p o 4K (documentación de Veo de la Gemini API). Ocho segundos no son una limitación contra la que luchar; son la unidad de trabajo. Un plano, un evento legible, un movimiento de cámara. Una hoja de beats de tres momentos —establecer, cambiar, cerrar— cabe con holgura, y un prompt que pida un plano secuencia de un minuto simplemente se cortará.

La duración viene del montaje, no de una sola generación. Extend continúa un clip desde su último segundo, así que una secuencia puede crecer hasta un minuto o más manteniendo la continuidad visual y sonora (el anuncio de Veo 3.1 de Google). La generación con primer y último fotograma conecta dos imágenes en una transición, y hasta tres imágenes de referencia pueden anclar un personaje, un producto o un estilo cuando la consistencia importa. Si partes de una imagen fija en lugar de una frase, el mismo brief de plano se aplica al image-to-video: describe qué cambia respecto al fotograma de origen en lugar de volver a describir lo que ya se ve, como en estos flujos de trabajo de foto a vídeo.

Cinco direcciones que puedes dirigir hoy

1. La revelación de producto con un solo cambio material. Elige un único producto y un solo cambio físico: condensación que aparece en una lata fría, vapor que asciende de un plato, líquido que se asienta en un vaso. Mantén la cámara estática, o dale un breve push-in que se detenga antes de que la etiqueta llene el encuadre. Pide una única señal sonora diseñada y tono de sala, y nada más. La prueba de revisión es sencilla: ¿sigue siendo legible la etiqueta en el fotograma final?

2. El beat de diálogo. Un hablante, una línea corta, un plano medio o corto fijo. Pon la frase hablada entre comillas para que el modelo la trate como habla, nombra la interpretación y mantén la línea lo bastante corta para que quepa en el clip. Comprueba la sincronía de labios, la pronunciación y si se han colado subtítulos no deseados antes de juzgar la imagen.

3. El momento documental observado. Un seguimiento a mano o un travelling lento, un sujeto haciendo algo cotidiano y concreto: un ciclista esperando en un semáforo en rojo, un comerciante cerrando un puesto. Mantén el ambiente con capas pero bajo: murmullo de la calle, una campana, un sonido de contacto. Esta es la dirección que más recompensa la contención, porque el movimiento natural y la lógica espacial son lo que hace que un clip se perciba como real.

4. La transformación surrealista. Un objeto cambia de estado dentro de un encuadre fijo: una grulla de papel que se despliega hasta convertirse en un pájaro, arena que se reordena formando una cara. El encuadre fijo es esencial, porque todo el clip es el propio cambio. Dale al momento sonidos materiales en lugar de una banda sonora, y asegúrate de que la transformación sea visible en lugar de implícita.

5. El gancho vertical. Acción inmediata en un encuadre vertical, un efecto nítido en el primer beat, el sujeto dentro del área segura. Tanto el formato vertical como el horizontal están disponibles, así que decide el encuadre antes de escribir, no después. Di "estático" o pide un único empuje corto; un gancho que se desplaza es un gancho que pierde a su sujeto.

Una flecha recortada de papel liso colocada plana sobre una superficie ocre apagada, apuntando con firmeza hacia la derecha

Cada una de estas direcciones se mantiene dentro de un único evento de ocho segundos, que es exactamente por lo que funcionan.

Dirige el audio como una segunda pista

El audio nativo es la función que más gente desaprovecha. Veo 3 genera diálogo, efectos de sonido y ruido ambiente a partir del propio prompt, y Veo 3.1 amplió ese soporte de audio a las herramientas construidas sobre él. Tres convenciones mantienen limpios los resultados:

  • El diálogo va entre comillas y se atribuye a un hablante con nombre.
  • Los efectos se nombran como efectos: "SFX: un único deslizamiento de aluminio, una gota que golpea la piedra."
  • El ambiente tiene su propia frase: "tono de sala, tráfico lejano, sin música."

El silencio es una elección que merece la pena dejar por escrito. "Sin diálogo, sin música" es una instrucción legítima, y es la forma honesta de mantener limpio un plano de producto o de naturaleza.

Crea una biblioteca, revisa cada toma

Trata la iteración como cambiar una sola variable. Si la composición es incorrecta, reescribe el campo de cámara; si el ambiente anímico no es el adecuado, reescribe el campo de luz; si el movimiento es incorrecto, conserva todo lo demás y cambia el único movimiento. Comparar dos generaciones que difieren en un solo campo te dice qué campo causó la diferencia; y donde cambiaste tres cosas a la vez, no aprendes nada.

Con ese hábito de comparación puedes mantener una pequeña biblioteca de planos organizada por intención —revelación, tensión, transición, prueba—, con cada entrada guardando una especificación de plano fija y un contenido variable. Reutiliza la especificación y cambia el sujeto para mantener una campaña visualmente coherente.

Dos reglas mantienen limpia la práctica. Los clips generados llevan una marca de agua SynthID (ficha del modelo Veo 3), así que no elimines ni tergiverses la procedencia, y divulga la generación con IA allí donde tu público, un cliente o una plataforma lo espere. Y no pidas en el prompt personas reales e identificables, personajes protegidos ni productos de marca que no tengas derecho a usar. Un brief de prompt es un plan, no un permiso.

Empieza con una sola línea

La diferencia entre un clip que parece generado y uno que parece dirigido suele estar en dos o tres palabras concretas: el nombre de un movimiento de cámara, la dirección de una luz, la textura de un sonido. Escribe el sujeto, dale a la cámara una sola tarea, nombra tu luz, especifica el sonido y diseña para ocho segundos. Después genera, cambia una cosa y vuelve a generar.

Abre el generador de vídeo Veo 3, escribe tu primer brief de plano y deja que la cámara haga la interpretación.

Beitragsinfo

Veröffentlicht am
Prompts de vídeo cinematográfico con IA: cinco recetas de plano que puedes dirigir en ocho segundos