- المدونة
- أوامر الفيديو السينمائي بالذكاء الاصطناعي: خمس وصفات لقطات يمكنك إخراجها في ثمانِ ثوانٍ
أوامر الفيديو السينمائي بالذكاء الاصطناعي: خمس وصفات لقطات يمكنك إخراجها في ثمانِ ثوانٍ
خمس وصفات لقطات لأوامر الفيديو السينمائي بالذكاء الاصطناعي: كشف منتج، ووقفة حوار، ولحظة وثائقية، وتحوّل، وخطاف عمودي، إضافة إلى موجز الأجزاء الستة الذي يحتاجه كل منها.

معظم مقاطع الفيديو القصيرة بالذكاء الاصطناعي لا تفشل لأن الفكرة كانت أصغر من أن تنجح، بل لأن الأمر الموجَّه (prompt) لم يخبر الكاميرا قط بما ينبغي فعله. اطلب "لقطة سينمائية ملحمية لموسيقي" فتحصل على إطار واسع افتراضي مع انزلاق بطيء، لأن كل كلمة في تلك الجملة — ملحمية، سينمائية، مذهلة — تسمّي إحساسًا بدل أن تكون قرارًا يستطيع النموذج تنفيذه.
رفع Veo 3 سقف هذا النوع من العمل. يولّد النموذج الصورة والصوت معًا، فينتج الحوار والمؤثرات الصوتية والضجيج المحيط بشكل أصيل بدلًا من تركيبها لاحقًا (صفحة Veo من Google DeepMind تصفه بأنه فيديو يلتقي بالصوت). يمكن للأمر الواحد الآن أن يعيد جملة حوار مع حركة شفاه مطابقة، وخطوات على حجر مبلل، ونغمة الغرفة في الخلفية. وهذا يحوّل كتابة الأوامر إلى شيء أقرب إلى موجز لقطة (shot brief) منه إلى استعلام بحث، ويعني أن أوامر الفيديو السينمائي بالذكاء الاصطناعي تستحق نفس الانضباط الذي تمنحه لنص سيناريو حقيقي.
يتناول هذا الدليل الإخراج، لا الوصف. يغطي البنية التي تحافظ على بقاء الأمر مقروءًا للنموذج، والحدود الفيزيائية التي عليك التصميم حولها، وخمسة اتجاهات إبداعية — كشف منتج، ووقفة حوار، ولحظة مُراقَبة، وتحوّل، وخطاف عمودي — يمكنك بناؤها اليوم على أداة تُقدِّم الأمر أولًا مثل مولّد Veo 3 على KOOX AI.
لماذا لا تفعل الصفات السينمائية شيئًا
دليل Google نفسه الخاص بـ Veo صريح بشأن الترتيب: التصوير السينمائي يأتي أولًا، لأن عمل الكاميرا هو "أقوى أداة لنقل النبرة والانفعال" (تحليل Prompt Architects لصيغة Google ذات الأجزاء الخمسة). تتوالى الأجزاء الخمسة على النحو التالي: التصوير السينمائي، ثم الموضوع، ثم الحدث، ثم السياق، ثم الأسلوب والجو. وعندما يُترك جزء فارغًا، يملؤه النموذج بقيمة افتراضية، والقيمة الافتراضية دائمًا أفدّ من فكرتك.
تحمل حركات الكاميرا المُسمّاة معنى كثيفًا. "زيادة دفع بطيئة بالدوللي (slow dolly push-in)" تخبر النموذج بالوتيرة، وإحساس العدسة، والاتجاه الانفعالي للقطة في ثلاث كلمات؛ أما "حركة كاميرا رائعة" فلا تخبره بشيء. وينطبق المنطق ذاته على الإضاءة. "إضاءة سينمائية" هي لوحة مزاج؛ أما "مفتاح قوي من النيون على يسار الكاميرا، وضوء تعبئة ناعم من نافذة متجر على اليمين، وتباين منخفض المفتاح" فهي تعليمات يستطيع المراجع التحقق منها فعليًا.
دليل الأوامر من Google DeepMind يعمل بالمبدأ نفسه من الاتجاه المعاكس: ابدأ بتحديد نوع الفيديو الذي تريد صنعه — واقعي، أو متحرك، أو بتقنية إيقاف الحركة — واستخدم حوار الشخصيات لضبط النبرة. الأسلوب أولًا، والتفصيل المحدد ثانيًا.
موجز اللقطة ذو الأجزاء الستة
كل ما يلي يتناسب مع قالب واحد قابل لإعادة الاستخدام. املأ كل جزء يهم واترك الباقي؛ فلقطة منتج صامتة لا تحتاج حوارًا، ولقطة موجّهة بصورة مرجعية لا تحتاج فقرة عن المظهر.
- الموضوع — شخص واحد أو جسم واحد مع تفصيل مميّز واحد. "امرأة في الأربعينيات، شعر داكن، ترتدي سترة كتان."
- الحدث — حدث مرئي واحد باتجاه. "تمشي ببطء نحو الكاميرا، وتنظر إلى الأسفل مرة واحدة."
- المشهد — المكان، ووقت اليوم، والطقس. "مكتبة كتب ضيقة عند الغسق، ومطر على النافذة."
- الكاميرا — حجم لقطة واحد، وعدسة واحدة، وحركة واحدة. "لقطة متوسطة قريبة، 35 ملم، زيادة دفع بطيئة بالدوللي."
- الإضاءة — المصدر، والاتجاه، والجودة. "ضوء نافذة دافئ من يسار الشاشة، وتعبئة ناعمة، بلا ضباب."
- الصوت — الحوار بين علامتَي اقتباس، والمؤثرات والجو المحيط مُسمّاة بشكل منفصل. "مؤثرات صوتية: مطر على الزجاج، وقرع جرس باب. تقول: 'نحن مغلقون.'"

تُبقي عادتان القالب صادقًا. أولًا، ضع ميزانية للمُعدِّلات: اثنان أو ثلاثة لكل لقطة هي النقطة المثالية، وتكديس خمس حركات متنافية هو أسرع طريق إلى نتيجة موحلة. ثانيًا، اذكر الحركة التي تريدها حتى عندما لا تريد أية حركة — فإن لم تكتب "ثابتة" (static) أو "مقفلة" (locked off)، فالنموذج حر في إضافة انزلاق من عنده.
مثال محلول، مُجمَّع:
لقطة متوسطة قريبة لخبّاز متعب يستند إلى طاولة من الفولاذ المقاوم للصدأ بعد الإغلاق، 50 ملم، والكاميرا مقفلة عند مستوى العين. ضوء فلوري دافئ في الأعلى، وضوء شارع أزرق بارد عبر النافذة، وغبار طحين على المريلة. تتنفس الصعداء وتقول بهدوء: "غدًا نبدأ أبكر." الصوت: أزيز ثلاجة، وصينية واحدة تستقر، ومطر خفيف. بلا موسيقى.
صمّم لثمانِ ثوانٍ
يولّد Veo 3.1 مقاطع فيديو مدتها ثماني ثوانٍ مع صوت مُولَّد أصيلًا، بدقة 720p أو 1080p أو 4K (توثيق Veo في Gemini API). ثماني ثوانٍ ليست قيدًا يُصارَع، بل هي وحدة العمل. لقطة واحدة، وحدث واحد مقروء، وحركة كاميرا واحدة. ورقة إيقاع من ثلاث لحظات — تأسيس، وتغيير، وإرساء — تتسع بسهولة، والأمر الذي يطلب لقطة واحدة متواصلة مدتها دقيقة سوف يُقتطع ببساطة.
يأتي الطول من التجميع لا من توليد واحد. تُكمل خاصية التمديد (Extend) مقطعًا من ثانيته الأخيرة، فيمكن للتسلسل أن ينمو إلى دقيقة أو أكثر مع الحفاظ على الاستمرارية البصرية والصوتية (إعلان Google عن Veo 3.1). يدمج التوليد بالإطار الأول والأخير صورتين في انتقال واحد، ويمكن لما يصل إلى ثلاث صور مرجعية أن تُثبّت شخصية أو منتجًا أو أسلوبًا عندما تهم الاستمرارية. وإن كنت تبدأ من صورة ثابتة بدلًا من جملة، فإن موجز اللقطة ذاته ينطبق على تحويل الصورة إلى فيديو — صِف ما يتغيّر من الإطار المصدر بدل إعادة وصف ما هو ظاهر أصلًا، كما في مسارات العمل هذه لتحويل الصورة إلى فيديو.
خمسة اتجاهات يمكنك إخراجها اليوم
1. كشف المنتج بتغيّر مادي واحد. اختر منتجًا واحدًا وتغيّرًا فيزيائيًا واحدًا: تكوّن التكاثف على علبة باردة، أو تصاعد البخار من طبق، أو استقرار سائل في كأس. أبقِ الكاميرا ثابتة، أو امنحها دفعة قصيرة واحدة تتوقف قبل أن يملأ الملصق الإطار. اطلب إشارة صوتية مصمّمة واحدة ونغمة غرفة، ولا شيء غير ذلك. واختبار المراجعة بسيط: هل لا يزال الملصق مقروءًا في الإطار الأخير؟
2. وقفة الحوار. متحدث واحد، وسطر قصير واحد، ولقطة متوسطة أو قريبة مقفلة. ضع الجملة المنطوقة بين علامتَي اقتباس حتى يعاملها النموذج كحديث، وسمِّ الأداء، وأبقِ السطر قصيرًا بما يكفي ليناسب المقطع. تحقق من توقيت الشفاه، والنطق، وما إذا تسلّلت ترجمات غير مرغوبة، قبل أن تحكم على الصورة.
3. اللحظة الوثائقية المُراقَبة. متابعة بالكاميرا المحمولة أو تحرّك بطيء، وموضوع واحد يفعل شيئًا عاديًا ومحددًا — درّاج ينتظر عند إشارة حمراء، أو تاجر يغلق كشكًا. أبقِ الجو المحيط متعدد الطبقات لكن منخفضًا: أزيز الشارع، وجرس واحد، وصوت تلامس واحد. وهذا هو الاتجاه الذي يكافئ ضبط النفس أكثر من غيره، لأن الحركة الطبيعية والمنطق المكاني هما ما يجعل المقطع يُقرأ كأنه حقيقي.
4. التحوّل السريالي. يغيّر جسم واحد حالته داخل إطار مقفل: طائر ورقي يتفتّح إلى طير، أو رمل يُعيد ترتيب نفسه في وجه. والتأطير المقفل جوهري، لأن المقطع كله هو التغيّر نفسه. امنح اللحظة أصواتًا مادية بدل مقطوعة موسيقية، وتأكد من أن التحوّل مرئي لا مُضمَر.
5. الخطاف العمودي. حدث فوري في إطار عمودي، وتأثير حادّ واحد في الإيقاع الأول، والموضوع محتوى داخل المنطقة الآمنة. الطولي والأفقي كلاهما متاح، فقرّر التأطير قبل أن تكتب، لا بعده. قل "ثابتة" أو اطلب دفعة قصيرة واحدة؛ فالخطاف الذي ينزلق هو خطاف يفقد موضوعه.

كل واحد من هذه يبقى داخل حدث واحد مدته ثماني ثوانٍ، وهذا بالضبط سبب نجاحه.
أخرِج الصوت كمقطع ثانٍ
الصوت الأصيل هو الميزة التي يهدرها معظم الناس. يولّد Veo 3 الحوار والمؤثرات الصوتية والضجيج المحيط من الأمر نفسه، ووسّع Veo 3.1 دعم الصوت ليشمل الأدوات المبنية فوقه. وتحافظ ثلاث قواعد على نظافة النتائج:
- يوضع الحوار بين علامتَي اقتباس ويُنسب إلى متحدث مُسمّى.
- تُسمّى المؤثرات كمؤثرات — "مؤثرات صوتية: انزلاقة ألومنيوم واحدة، وقطرة واحدة تصيب الحجر."
- يحصل الجو المحيط على جملته الخاصة: "نغمة غرفة، وحركة مرور بعيدة، بلا موسيقى."
الصمت خيار يستحق أن يُكتب. "بلا حوار، بلا موسيقى" تعليمات مشروعة، وهي الطريقة الصادقة لإبقاء لقطة منتج أو طبيعة نظيفة.
بنِ مكتبة، وراجع كل تجربة
تعامل مع التكرار كتغيير متغيّر واحد. فإن كان التكوين خاطئًا، أعد كتابة جزء الكاميرا؛ وإن كانت النبرة بعيدة، أعد كتابة جزء الإضاءة؛ وإن كانت الحركة خاطئة، فأبقِ كل شيء آخر واستبدل الحركة الواحدة. مقارنة توليدين يختلفان في مجال واحد تخبرك أي مجال أحدث الفارق — أما حيث تغيّر ثلاثة أشياء دفعة واحدة، فلا تتعلم شيئًا.
بهذه العادة في المقارنة يمكنك الاحتفاظ بمكتبة لقطات صغيرة مُفهرسة حسب القصد — كشف، وتوتر، وانتقال، وإثبات — يحتفظ كل مُدخَل فيها بمواصفات لقطة ثابتة بمحتوى متغيّر. أعد استخدام المواصفات واستبدل الموضوع للحفاظ على تماسك حملة بصريًا.
قاعدتان تُبقِيان الممارسة نظيفة. فالمقاطع المُولَّدة تحمل علامة مائية من SynthID (بطاقة نموذج Veo 3)، فلا تُزِل المصدر ولا تحرّفه، وافصح عن التوليد بالذكاء الاصطناعي حيث يتوقع جمهورك أو عميلك أو منصة ذلك. ولا تكتب أوامر لأشخاص حقيقيين يمكن التعرف عليهم، أو شخصيات محمية، أو منتجات ذات علامات تجارية لا يحق لك استخدامها. فموجز الأمر خطة، لا تصريح إذن.
ابدأ من سطر واحد
الفجوة بين مقطع يبدو مُولَّدًا ومقطع يبدو مُخرَجًا غالبًا ما تكون كلمتين أو ثلاث كلمات محددة: اسم حركة كاميرا، واتجاه ضوء، وملمس صوت. اكتب الموضوع، وامنح الكاميرا مهمة واحدة، وسمِّ ضوءك، وحدّد الصوت، وصمّم لثمانِ ثوانٍ. ثم ولّد، وغيّر شيئًا واحدًا، وولّد مرة أخرى.
افتح مولّد فيديو Veo 3، واكتب موجز لقطتك الأول، ودع الكاميرا تقوم بالتمثيل.