كيف تصنع فيديو قصيرًا فيروسيًا بالذكاء الاصطناعي في 30 دقيقة (إصدار 2026)
مجموعة من أربع أدوات ونص برمجي قابل للتكرار يحول فكرة واحدة إلى فيديو عمودي مصقول وجذاب، بدون كاميرا أو وجه أو استوديو.
في عام 2026، يمكن لفيديو قصير بدون وجه مدته 45 ثانية أن يحقق مليون مشاهدة في أسبوع ويكلفك لا شيء سوى الوقت الذي تستغرقه لقراءة هذا الدليل. لقد أصبحت الأدوات جيدة بما يكفي بهدوء لدرجة أن عنق الزجاجة لم يعد جودة الذكاء الاصطناعي، بل النص البرمجي والإيقاع.
هذه هي المجموعة الدقيقة التي نستخدمها لتحويل فكرة من سطر واحد إلى فيديو عمودي مصقول في أقل من 30 دقيقة. لا كاميرا. لا استوديو. لا حاجة لوجه على الشاشة.
مجموعة الأدوات الأربع
تحتاج إلى أربع قطع بالضبط. لا تضف المزيد، فكل أداة إضافية تستهلك الوقت ولا تعوضه أبدًا في مقطع مدته 45 ثانية.
التكلفة الشهرية الإجمالية إذا نشرت 3 مقاطع قصيرة في الأسبوع: حوالي 30 دولارًا. نفس المجموعة قبل عام كانت تكلف أكثر من 100 دولار وأنتجت مخرجات أسوأ بشكل ملحوظ.
- صوت، ElevenLabs v3 للسرد.
- مظهر، Midjourney لصور B-roll بنسبة 9:16 (أو Flux 2 إذا كنت تريد تكلفة أقل).
- محرر، CapCut على سطح المكتب، مجاني، سريع، مزود بمزامنة الإيقاع مدمجة.
- منهي، Submagic للتعليقات التوضيحية والخطافات واقتراحات B-roll بالذكاء الاصطناعي.
الخطوة 1: كتابة النص البرمجي لمدة 45 ثانية (5 دقائق)
افتح مستندًا فارغًا واكتب ثلاثة أشياء:
اقرأه بصوت عالٍ وقم بتوقيت نفسك. إذا استغرق أكثر من 45 ثانية بوتيرة طبيعية، فقم بتقصير الكلمات. الفيديو العمودي يعيش أو يموت على الإيقاع.
- الخطاف (أول 1.5 ثانية من الصوت). جملة واحدة، مثيرة للجدل أو فضولية. "يخسر معظم الناس المال على البيتكوين لأنهم يشترون ما يشتريه أصدقاؤهم." وليس "في هذا الفيديو سنتحدث عن..."، فهذا يتم تجاهله في 0.4 ثانية.
- الوسط (حوالي 110-130 كلمة). ثلاث نقاط ملموسة، كل منها مرتبطة بصورة مرئية. إذا لم تتمكن من تخيل B-roll لجملة ما، فاحذف الجملة.
- الدعوة إلى اتخاذ إجراء (جملة واحدة). تابع للحصول على X. احفظ لوقت لاحق. علق برأيك. طلب واحد، لا تطلب اثنين أبدًا.
الخطوة 2: إنشاء التعليق الصوتي (3 دقائق)
افتح ElevenLabs واختر صوتًا من مكتبة v3. اختبر ثلاثة أصوات على الجملة الأولى قبل الالتزام، ملاءمة الصوت أهم من جودة الصوت. صوت "مميز" يشعر بالملل سيقضي على صوت "جيد" متحمس في كل مرة.
الإعدادات التي تعمل بشكل جيد للمقاطع القصيرة:
قم بالإنشاء، استمع مرة واحدة، وأعد الإنشاء فقط إذا تم نطق كلمة معينة بشكل خاطئ. لا تسعَ للكمال، فالمشاهدون لا يفعلون ذلك.
- الاستقرار: 35-45 (لمسة من التباين تبدو بشرية)
- التشابه: 75
- الأسلوب: 20-30 إذا كان النص البرمجي الخاص بك يحتوي على تأكيد، 0 إذا كان شرحًا هادئًا
الخطوة 3: إنشاء صور B-roll (10 دقائق)
هنا يضيع معظم المبدعين ساعة. الحل هو الالتزام بأسلوب بصري واحد مقدمًا وإعادة استخدام مرجع نمط Midjourney (--sref) في كل مطالبة.
سير العمل:
ستنتهي بصورة رأسية متماسكة بصريًا تبدو وكأنها من مخرج فني واحد. هذا ما يفصل فيديو الذكاء الاصطناعي الجيد عن الفيديو الذي يصرخ "قمامة الذكاء الاصطناعي".
إذا كان سعر Midjourney غير مبرر لحجم إنتاجك، فإن Flux 2 يقوم بـ 80٪ من نفس المهمة بتكلفة أقل بكثير، وأقل أناقة قليلاً ولكنه جيد بما يكفي للمقاطع القصيرة.
- أنشئ صورة "بطل" واحدة تعجبك. انسخ قيمة --sref الخاصة بها.
- لكل سطر من النص البرمجي الخاص بك، اكتب مطالبة واحدة. أضف --ar 9:16 --style raw --sref <your-code> إلى جميع المطالبات.
- قم بتشغيلها دفعة واحدة. اختر أفضل نسخة من كل منها. لا تقم بالترقية بعد.
- قم بترقية الـ 8-12 التي ستستخدمها فقط.
الخطوة 4: التحرير في CapCut (8 دقائق)
أسقط التعليق الصوتي على المخطط الزمني أولاً. دائمًا الصوت أولاً، ثم المرئيات، فالصوت يملي القطع، وليس العكس.
ثم:
قم بالتصدير بدقة 1080 × 1920، 60 إطارًا في الثانية. لا تصدر بدقة 30 إطارًا في الثانية في عام 2026.
هل تريد مخططًا زمنيًا تقليديًا لسطح المكتب بدلاً من ذلك؟ Wondershare Filmora يقوم بنفس القطع التلقائي المتزامن مع الإيقاع على محرر أكثر تقليدية، وهو أبطأ قليلاً لمقاطع الفيديو القصيرة لمدة 45 ثانية ولكنه أفضل إذا كنت تقوم أيضًا بتحرير مقاطع فيديو أطول على الجانب.
- ضع كل صورة B-roll على الإيقاع حيث يبدأ سطرها.
- استخدم القطع التلقائي إلى الإيقاع لأي موسيقى خلفية. اكتشاف الإيقاع في CapCut جيد بشكل مدهش في عام 2026.
- أضف حركة خفية إلى كل صورة: تكبير بطيء لمدة 5 ثوانٍ، مع تبديل الاتجاهات. الصور الثابتة على شاشة عمودية تبدو ميتة في غضون ثانيتين.
- بالنسبة للموسيقى الخلفية، استخدم مكتبة CapCut واختر شيئًا بسرعة 110-120 BPM مع حجم خافت منخفض بحيث يظل التعليق الصوتي في المقدمة.
الخطوة 5: إضافة التعليقات والخطافات في Submagic (3 دقائق)
أسقط تصدير CapCut الخاص بك في Submagic. ثلاثة أشياء للقيام بها:
قم بالتصدير. لقد انتهيت.
- اختر قالب تعليق يتناسب مع قناتك. الخط العريض، المتحرك، مع التركيز على كلمة واحدة يعمل بشكل أفضل للمحتوى التعليمي. الكشف كلمة بكلمة يعمل بشكل أفضل لسرد القصص.
- استخدم مولد الخطاف بالذكاء الاصطناعي على أول 1.5 ثانية لديك. يعيد كتابة خطافك إلى 3-5 بدائل، اختر الأكثر تأثيرًا. هذه الخطوة وحدها تستحق اشتراك Submagic بالكامل.
- اقبل اقتراحات B-roll بشكل متقطع. سيقترح الذكاء الاصطناعي أحيانًا مقطعًا مخزونًا يحسن الإيقاع حقًا، اقبل تلك، وتجاهل الباقي.
ما يبدو عليه هذا عمليًا
جلسة نموذجية، من البداية إلى النهاية:
سيستغرق أول مقطع قصير تقوم بإنشائه 90 دقيقة لأنك تتعلم الأدوات. الخامس يستغرق 25 دقيقة.
الأخطاء التي تقتل الوصول
بعض الأنماط التي نراها تقتل المقاطع القصيرة الجيدة بخلاف ذلك:
- أسلوب بصري غير متناسق. هذا هو سبب أهمية --sref. خلط الواقعية مع الرسوم التوضيحية في مقطع قصير واحد يبدو غير احترافي حتى عندما تكون اللقطات الفردية رائعة.
- تعليقات عامة. إذا كانت تعليقاتك مجرد نص منسوخ بخط افتراضي، فأنت تخسر 30٪ من معدل الإكمال مقارنة بقالب تعليق مصمم.
- دعوتان إلى اتخاذ إجراء. "تابع وعلّق واحفظ" يدرب الخوارزمية على التفكير في أن جمهورك لا يفعل شيئًا. طلب واحد فقط.
- موسيقى صاخبة. إذا لم يكن تعليقك الصوتي أعلى بـ 12-15 ديسيبل من الموسيقى الخلفية، فسيقوم المشاهدون بالتمرير.
- لا يوجد بديل للخطاف. يقوم Submagic بإنشاء 5 بدائل للخطاف في 10 ثوانٍ. الخطاف الافتراضي الذي يعتمد على النص البرمجي أولاً نادرًا ما يكون الأفضل.
إلى أين تذهب بعد ذلك
بمجرد أن تنتهي من 10 مقاطع قصيرة بهذه المجموعة، يتحول عنق الزجاجة من "هل يمكنني إنشاء فيديو" إلى "هل يمكنني العثور على أفكار تستحق الإنشاء". هذه هي المشكلة الأصعب، ولكنها المشكلة التي تستحق الحل.
في الوقت الحالي، فقط قم بإنشاء الأول. اليوم.