- ブログ
- AIシネマティック動画プロンプト:8秒で演出できる5つのショットレシピ
AIシネマティック動画プロンプト:8秒で演出できる5つのショットレシピ
AIシネマティック動画プロンプトのための5つのショットレシピ:プロダクトリビール、会話のビート、ドキュメンタリーの瞬間、変容、縦型フック、そしてそれぞれに必要な6スロットのブリーフ。

ほとんどの短いAIクリップは、アイデアが小さすぎたから失敗するわけではない。失敗するのは、プロンプトがカメラに何をすべきかを一度も伝えなかったからだ。「音楽家の壮大でシネマティックなショット」と頼めば、ゆっくりとドリフトする既定のワイドフレームが返ってくる。その一文のすべての言葉——壮大、シネマティック、驚くべき——が、モデルが実行できる決定ではなく、感覚を名指ししているだけだからだ。
Veo 3はこの種の作業の難易度を引き上げた。このモデルは映像と音を同時に生成し、セリフ、効果音、環境ノイズを後から重ねるのではなくネイティブに生み出す(Google DeepMindのVeoページはこれを「映像が音と出会う」と説明している)。単一のプロンプトで、リップムーブメントが一致したセリフ、濡れた石の上の足音、その下に流れるルームトーンまで返せるようになった。これによりプロンプティングは検索クエリというより撮影ブリーフに近いものになり、AIシネマティック動画プロンプトには本物の撮影台本に与えるのと同じ規律がふさわしいということになる。
このガイドは説明ではなく演出についてのものだ。モデルにとって読みやすいプロンプトを保つ構造、設計上考慮しなければならない物理的な制約、そして今日すぐにKOOX AIのVeo 3ジェネレーターのようなプロンプト優先ツールで作れる5つのクリエイティブな方向性——プロダクトリビール、会話のビート、観察された瞬間、変容、縦型フック——を扱う。
なぜシネマティックな形容詞は何もしないのか
Google自身のVeoのガイダンスは順序について率直だ。シネマトグラフィーが最初に来る。なぜならカメラワークは「トーンと感情を伝える最も強力なツール」だからだ(Prompt ArchitectsによるGoogleの5部構成フォーミュラの解説)。5つのスロットはシネマトグラフィー、被写体、アクション、コンテキスト、そしてスタイルと雰囲気の順に進む。スロットが空のままにされると、モデルは既定値でそれを埋めるが、その既定値は常にあなたのアイデアより味気ない。
名前のついたカメラムーブは濃密な意味を持つ。「スローダリープッシュイン」は、ペース、レンズの感触、ショットの感情的な方向性を3語でモデルに伝える。「クールなカメラムーブ」は何も伝えない。同じ論理が光にも当てはまる。「シネマティックな照明」はムードボードだ。「カメラ左からのネオンをキーにしたハードな光、右のショーウィンドウからのソフトなフィル、ローキーなコントラスト」は、レビュアーが実際に確認できる指示だ。
Google DeepMindのプロンプトガイドは同じ原則を逆方向から適用している。まず作りたい動画の種類——リアル、アニメーション、ストップモーション——を定義し、キャラクターのセリフでトーンを決める。まずスタイル、次に具体的なディテールだ。
6スロットのショットブリーフ
以下はすべて1つの再利用可能なテンプレートに収まる。重要なスロットをすべて埋め、残りは省く。無音のプロダクトショットにセリフは不要だし、参照画像で導かれるショットに外見についての段落は不要だ。
- 被写体 — 識別できるディテールを1つ持つ、1人の人物または1つの物体。「40代の女性、黒髪、リネンのブレザーを着ている。」
- アクション — 方向性を持つ1つの目に見える出来事。「カメラに向かってゆっくり歩き、一度だけ下をちらりと見る。」
- シーン — 場所、時間帯、天気。「夕暮れの狭い書店、窓に雨。」
- カメラ — 1つのショットサイズ、1つのレンズ、1つの動き。「ミディアムクローズアップ、35mm、スローダリープッシュイン。」
- 光 — 光源、方向、質。「スクリーン左からの暖かい窓明かり、ソフトなフィル、ヘイズなし。」
- オーディオ — 引用符内のセリフ、効果音と環境音は別々に名指しする。「SFX: ガラスに当たる雨、ドアチャイム。彼女が言う:『もう閉店です。』」

2つの習慣がテンプレートを誠実に保つ。第一に、修飾語を予算化すること。1ショットにつき2つか3つが最適で、矛盾する5つの動きを積み重ねるのが、濁った結果への最短ルートだ。第二に、動きを望まないときでも、望む動きを明記すること。「静的」または「ロックオフ」と書かなければ、モデルは自由に独自のドリフトを加えられる。
組み立てた実例:
閉店後、ステンレスのカウンターにもたれかかる疲れたパン職人のミディアムクローズアップ、50mm、カメラはアイレベルで固定。頭上の暖かい蛍光灯、窓から差し込む冷たい青い街灯、エプロンに舞う小麦粉の粉。彼女は息を吐き、静かに言う:「明日はもっと早く始めよう。」オーディオ:冷蔵庫のハム音、トレイが1つ落ち着く音、かすかな雨。音楽なし。
8秒のために設計する
Veo 3.1は、ネイティブ生成の音声を備えた8秒の動画を720p、1080p、または4Kで生成する(Gemini API Veoドキュメント)。8秒は戦うべき制約ではなく、作業の単位だ。1つのショット、1つの読み取れる出来事、1つのカメラムーブ。3つの瞬間——確立、変化、着地——からなるビートシートは余裕で収まり、1分間の長回しを求めるプロンプトは単に途中で切られてしまう。
長さは単一の生成ではなく、組み立てから生まれる。Extendはクリップをその最終秒から継続するので、映像と音声の連続性を保ちながらシーケンスを1分以上に伸ばせる(GoogleのVeo 3.1発表)。最初と最後のフレームからの生成は2つの画像をトランジションへと橋渡しし、最大3枚の参照画像が、一貫性が重要なときにキャラクター、製品、またはスタイルを固定できる。一文ではなく静止画から始めるなら、同じショットブリーフがimage-to-videoにも当てはまる——すでに見えているものを再説明するのではなく、ソースフレームから何が変わるかを説明する。これらの写真から動画へのワークフローのように。
今日演出できる5つの方向性
1. 1つの素材変化を伴うプロダクトリビール。 単一の製品と1つの物理的変化を選ぶ。冷えた缶に現れる結露、皿から立ち上る湯気、グラスの中で落ち着く液体。カメラは静止させ、またはラベルがフレームを埋める前に止まる短いプッシュインを1つ与える。設計された効果音を1つとルームトーンだけを求め、それ以外は求めない。レビューのテストは簡単だ。最終フレームでラベルはまだ読めるか?
2. 会話のビート。 1人の話者、1つの短いセリフ、1つの固定されたミディアムまたはクローズショット。話される文を引用符で囲み、モデルがそれを発話として扱うようにし、話し方を名指しし、クリップに収まるほど短くセリフを保つ。映像を評価する前に、リップのタイミング、発音、不要な字幕が紛れ込んでいないかを確認する。
3. 観察されたドキュメンタリーの瞬間。 ハンドヘルドのフォローまたはゆっくりしたトラック、普通でありながら具体的なことをしている1つの被写体——赤信号で待つ自転車乗り、屋台を片付ける商人。環境音は重ねつつも低く保つ。街のハム音、ベル、1つの接触音。これは自制が最も報われる方向性だ。自然な動きと空間の論理こそが、クリップを本物らしく読ませるからだ。
4. シュールな変容。 固定されたフレームの中で1つの物体が状態を変える。折り鶴が鳥へと開いていく、砂が顔へと並び変わる。固定されたフレーミングが不可欠だ。クリップ全体が変化そのものだからだ。その瞬間にはスコアではなく物の音を与え、変容がほのめかしではなく目に見えるようにする。
5. 縦型フック。 縦型フレームでの即座のアクション、最初のビートでの1つの鮮明な効果、セーフエリア内に保たれた被写体。ポートレートとランドスケープの両方が利用できるので、書いた後ではなく書く前にフレーミングを決める。「静的」と言うか、短いプッシュを1つだけ求める。ドリフトするフックは被写体を失うフックだ。

これらはそれぞれ1つの8秒の出来事の中に収まっており、まさにそれがうまく機能する理由だ。
オーディオを第2のトラックのように演出する
ネイティブオーディオは、ほとんどの人が無駄にしている機能だ。Veo 3はセリフ、効果音、環境ノイズをプロンプト自体から生成し、Veo 3.1はそのオーディオサポートをその上に構築されたツール群に広げた。3つの慣習が結果をクリーンに保つ:
- セリフは引用符で囲み、名指しされた話者に帰属させる。
- 効果音は効果音として名指しする——「SFX: アルミが1回滑る音、石に当たる1滴。」
- 環境音には独自の文を与える:「ルームトーン、遠くの交通、音楽なし。」
沈黙は書き留める価値のある選択だ。「セリフなし、音楽なし」は正当な指示であり、プロダクトや自然のショットをクリーンに保つ誠実な方法だ。
ライブラリを構築し、すべてのテイクをレビューする
反復は「1つの変数を変える」こととして扱う。構図が間違っていればカメラのスロットを書き直し、雰囲気がずれていれば光のスロットを書き直し、動きが間違っていれば他をすべて保ったまま単一のムーブを入れ替える。1つのフィールドだけが異なる2つの生成を比較すれば、どのフィールドが違いを生んだかがわかる——そして3つを一度に変えたところでは、何も学べない。
その比較の習慣があれば、意図——リビール、緊張、トランジション、証拠——で分類した小さなショットライブラリを保てる。各エントリは固定されたショット仕様と可変のコンテンツを持つ。仕様を再利用し被写体を入れ替えれば、キャンペーンを視覚的に一貫させられる。
2つのルールが実践をクリーンに保つ。生成されたクリップにはSynthIDウォーターマークが付く(Veo 3モデルカード)ので、出所を剥がしたり偽ったりせず、視聴者、クライアント、またはプラットフォームが期待する場所ではAI生成を開示する。そして、実在する識別可能な人物、保護されたキャラクター、使用する権利のないブランド製品をプロンプトで求めない。プロンプトブリーフは計画であり、許可証ではない。
1行から始める
生成されたように見えるクリップと演出されたように見えるクリップの差は、たいてい2、3の具体的な言葉だ。カメラムーブの名前、光の方向、音の質感。被写体を書き、カメラに1つの仕事を与え、光を名指しし、音を指定し、8秒のために設計する。そして生成し、1つを変え、もう一度生成する。
Veo 3動画ジェネレーターを開き、最初のショットブリーフを書き、カメラに演技をさせよう。