مدعوم من Alibaba Tongyi Wanxiang

Wan 3.0 · نموذج فيديو واحد وثلاث طرق للدخول

نموذج Tongyi Wanxiang Wan 3.0 من Alibaba، الآن على OVOV. ابدأ من موجّه نصي، أو من إطار أول وأخير، أو من موجّه تدعمه صورك وفيديوهاتك ومقاطعك الصوتية المرجعية — بدقة 480P أو 720P أو 1080P، ومدة من 5 إلى 30 ثانية، مع مسار صوتي أصلي.

المدة
النسبة
الدقة

أمثلة فيديو الذكاء الاصطناعي على OVOV

توليدات حقيقية من نماذج الفيديو لدينا — Veo 3.1 وKling وSeedance. مرر المؤشر فوق أي مقطع لتشغيله، وانقر أيقونة مكبر الصوت لسماع الصوت.

مرر للتشغيل · انقر مكبر الصوت لتفعيل الصوت

أمثلة فيديو الذكاء الاصطناعي على OVOV

توليدات حقيقية من نماذج الفيديو لدينا — Veo 3.1 وKling وSeedance. مرر المؤشر فوق أي مقطع لتشغيله، وانقر أيقونة مكبر الصوت لسماع الصوت.

سينمائي

عالم خيالي فضائي

عطور

إعلان عطر فاخر

منتج

إعلان إطلاق منتج

سفر

إعلان السفر إلى المالديف

أكشن

مبارزة ووشيا شرقية

فيلم

مشهد فيلم سباقات هوليوودي

خيال علمي

سفينة فضاء نحو النجوم

نمط حياة

كلب جولدن يطارد الفراشات

طعام

طاهي سوشي في العمل

موضة

فستان أحمر على الجرف

إعلان لعبة

مبارزة منتصف الليل

فلوق

فيديو Vlog سيلفي محمول

طعام

لقطة مقربة لأطعمة شهية

رقص

رقص شوارع حضري

مكياج

إعلان أحمر شفاه فاخر

لماذا يستحق Wan 3.0 نظرة

نموذج واحد يقبل النص أو الإطارات المفتاحية أو موادك الخاصة، ويعرض حتى 1080P، ويمتد إلى نصف دقيقة، ويكتب مساره الصوتي أثناء العمل.

مراجع متعددة الوسائط

في وضع النص إلى فيديو يمكنك إرفاق حتى 10 صور مرجعية، وحتى 5 فيديوهات مرجعية (15 ثانية إجمالاً)، وحتى 5 مقاطع صوتية مرجعية (15 ثانية إجمالاً). ويستخلص Wan 3.0 الشخصية والأسلوب والحركة والنبرة من موادك بدل أن يخمّنها.

التحكم في الإطار الأول والأخير

أعطه صورة بداية، وصورة نهاية اختيارياً، وسيعرض Wan 3.0 الحركة بينهما. أقصر طريق للقطات كشف المنتجات والتحولات ومشاهد قبل وبعد.

480P و720P و1080P

ثلاثة مستويات دقة، من بينها إخراج 1080P حقيقي. جرّب الفكرة بدقة 480P ببضع نقاط، ثم اعرض بدقة 1080P النسخة التي ستنشرها فعلاً.

من 5 إلى 30 ثانية

ست مدد ثابتة: 5 أو 10 أو 15 أو 20 أو 25 أو 30 ثانية. اختبار من خمس ثوانٍ يكلف نزراً يسيراً، وإعلان كامل من 30 ثانية يتسع داخل توليد واحد.

صوت أصلي مفعّل افتراضياً

يكتب Wan 3.0 الأجواء الصوتية والمؤثرات والصوت المطابق للحركة جنباً إلى جنب مع الصورة. المفتاح بيدك، وإيقاف الصوت لا يغيّر السعر.

خمس نسب عرض بتسعير لكل ثانية

16:9 و9:16 و1:1 و4:3 و3:4. تُحتسب النقاط لكل ثانية — 3 بدقة 480P، و6 بدقة 720P، و12 بدقة 1080P — والتوليد الفاشل تُستردّ نقاطه كاملة.

من الموجّه أو الإطارات المفتاحية أو موادك إلى مقطع جاهز

اختر المُدخل الذي يناسب ما لديك بالفعل. يتولى Wan 3.0 الصورة والصوت في التمريرة نفسها، فلا شيء يحتاج إلى تجميع بعد ذلك.

1

اختر طريقة دخولك

اكتب موجّهاً وحده، أو ارفع إطاراً أول (وإطاراً أخيراً اختيارياً)، أو أرفق صوراً وفيديوهات ومقاطع صوتية مرجعية إلى جانب موجّهك. ثم حدّد المدة ونسبة العرض والدقة.

2

يعرض Wan 3.0 الصورة والصوت

يخطط النموذج للحركة والإضاءة والإيقاع على امتداد المدة كلها، ثم يعرض الفيديو مع مساره الصوتي المطابق. معظم المهام تنتهي خلال دقيقة إلى خمس دقائق؛ والمقاطع الأطول تستغرق وقتاً أطول.

3

حمّله واستخدمه

خذ الفيديو الجاهز بالصوت المدمج فيه — بدون علامة مائية ومع حقوق تجارية. وإذا فشل التوليد، تعود نقاطك فوراً.

فيمَ يُجيد Wan 3.0

ثلاثة أوضاع إدخال ومستوى 1080P تغطي مساحة واسعة: إعلانات جاهزة، ومقاطع عمودية للتواصل الاجتماعي، وأعمال اتساق مبنية على موادك الخاصة، وأفلام أجواء طويلة.

إعلانات المنتجات والعلامات التجارية بدقة 1080P

إعلان من 30 ثانية بدقة Full HD، معروض في تمريرة واحدة. التمهيد والعرض والفائدة والخاتمة تتسع كلها في توليد واحد، مع الصوت.

  • إخراج 1080P لإعلانات ما قبل التشغيل وصفحات الهبوط والتسليم للعملاء
  • 16:9 للشاشة العريضة، و4:3 للتأطير التلفزيوني الكلاسيكي
  • صوت المنتج والأجواء يُولّدان مع الصورة

مقاطع سوشيال عمودية قصيرة

TikTok وReels وShorts بنسبة 9:16، من خطاف مدته 5 ثوانٍ إلى قصة من 30 ثانية. الصوت يأتي مرفقاً، فلا شيء يحتاج إلى تمريرة موسيقى لاحقة.

  • 9:16 عمودي، أو 1:1 لمنشورات الخلاصة المربعة
  • اعمل المسودة بدقة 480P بـ 3 نقاط لكل ثانية، وانشر بدقة 720P أو 1080P
  • صوت أصلي بدل مسار موسيقي مرخّص

الاتساق عبر سلسلة كاملة

أرفق الصور والفيديوهات والمقاطع الصوتية المرجعية نفسها بكل توليد، فتنتقل الشخصية والمنتج والنبرة من مقطع إلى آخر بدل أن تنحرف.

  • حتى 10 صور مرجعية لتثبيت الشخصية والأسلوب
  • حتى 5 فيديوهات مرجعية للحركة وسلوك الكاميرا
  • حتى 5 مقاطع صوتية مرجعية لإبقاء الصوت في العائلة نفسها

أفلام السفر والأجواء

تحليقات جوية ورحلات ساحلية وتجوال في الشوارع تحتاج وقتاً لتتنفس — إضافة إلى صوت الريح والماء والمدينة الذي يبيع المكان.

  • حركات كاميرا طويلة ومنسابة تحتاج 30 ثانية كاملة
  • صوت البيئة يُعرض جنباً إلى جنب مع الصورة
  • 1080P لفيديوهات الواجهة في أعلى الصفحة

دليل كتابة الموجّهات لـ Wan 3.0

يقبل Wan 3.0 موجّهات تصل إلى 20,000 حرف، وهي مساحة أكبر بكثير مما تحتاجه معظم المقاطع. وهذه العادات تُنفق تلك المساحة على ما يستجيب له النموذج فعلاً.

سمِّ موادك أولاً، ثم صف اللقطة النهائية

اختر وضع الإدخال قبل أن تكتب

الأوضاع الثلاثة تحتاج موجّهات مختلفة. النص إلى فيديو عليه أن يحمل المشهد كله بالكلمات. أما الإطار الأول والأخير فالتكوين فيه جاهز، فيصبح الموجّه عن الحركة. ووضع المراجع يدور حول ما تستعيره من المواد التي أرفقتها.

  • نص فقط: صف المكان والموضوع والكاميرا والصوت من الصفر
  • الإطار الأول والأخير: صف الحركة بينهما، لا الإطارين نفسيهما
  • المراجع (تُرفق في وضع النص إلى فيديو): قل ما يقدّمه كل ملف — الوجه، الملابس، حركة الكاميرا، النبرة

مثال

"First frame: a sealed cardboard box on a table. Last frame: the box open with a camera inside. Prompt: "hands lift the flaps in one smooth motion, soft window light"."

خاطب مراجعك بالأرقام

في وضع المراجع يمكنك الإشارة إلى المواد مباشرة — الصورة 1، الفيديو 1، الصوت 1 — ليعرف النموذج أي ملف يحكم أي جزء من اللقطة بدل أن يمزج كل شيء معاً.

  • حتى 10 صور مرجعية و5 فيديوهات مرجعية و5 مقاطع صوتية مرجعية
  • مجموع الفيديو المرجعي 15 ثانية، ومجموع الصوت المرجعي 15 ثانية
  • أعطِ كل ملف مهمة واحدة: الهوية من صورة، وحركة الكاميرا من فيديو

مثال

"Keep the woman from image 1 and the jacket from image 2, follow the slow dolly-in of video 1, and match the room tone of audio 1."

خطط للقوس السردي على امتداد المدة التي اخترتها

ثلاثون ثانية وقت شاشة كبير. اكتب التسلسل بالترتيب الذي يجب أن يحدث به، وإلا تمسّك النموذج بفكرة واحدة نصف دقيقة.

  • ابدأ بالمكان، ثم أدخل الموضوع، ثم الحركة
  • سمِّ ما يتغير مع الوقت: الضوء، الطقس، المسافة، السرعة
  • المدد الأقصر (5-10 ثوانٍ) تناسب فعلاً واحداً متصلاً

مثال

"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera slowly settles on a cup of coffee going cold."

اكتب الصوت، لا الصورة وحدها

الصوت يُولَّد افتراضياً، فكل ما تتركه دون ذكر سيُخترع نيابة عنك. وسطر أو سطران من التوجيه الصوتي يكفيان عادة لإبقائه في الأجواء الصحيحة.

  • سمِّ الأجواء: مطر على الزجاج، ضجيج مرور بعيد، صوت الغرفة
  • سمِّ الأصوات المطابقة للحركة: خطوات، محرك، رياح
  • طلب الهدوء توجيه مشروع — قله إذا أردت صوتاً خفيفاً
  • أرفق صوتاً مرجعياً إذا كانت النبرة واضحة في ذهنك

مثال

"Sound: steady rain on a tin roof, an occasional low roll of thunder in the distance, no music."

استبدل كلمات المديح بحقائق بصرية

«مذهل» و«ملحمي» و«سينمائي» لا تقول للنموذج شيئاً. أما الخامات والألوان واتجاه الضوء والأفعال القوية فتقول.

  • تجاوز: مذهل، ملحمي، خلاب، بديع، تحفة
  • استخدم أفعالاً قوية: يصطدم، ينساب، يشتعل، يلسع
  • سمِّ مصدر الضوء ووقت اليوم

مثال

"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."

اختر المدة والنسبة والدقة من البداية

يوفر Wan 3.0 مدداً من 5 و10 و15 و20 و25 و30 ثانية، وخمس نسب عرض، وثلاث دقات. الحسم قبل التوليد يوفر النقاط ويحافظ على التكوين الصحيح.

  • 16:9 و4:3 للأفقي، و9:16 و3:4 للعمودي، و1:1 للخلاصات
  • اعمل المسودة بدقة 480P (3 نقاط لكل ثانية)، وأنهِ بدقة 720P (6) أو 1080P (12)
  • اكتب للإطار الذي اخترته — العمودي يحتاج الموضوع قريباً وفي المنتصف
  • المدة ثابتة: 5 أو 10 أو 15 أو 20 أو 25 أو 30 ثانية — قرّب لوحتك القصصية إلى إحداها

مثال

"A 15-second 9:16 vertical clip: a barista pulling an espresso shot, steam rising into warm café light, shallow depth of field."

الأسئلة الشائعة









ابدأ رحلتك الإبداعية مع الذكاء الاصطناعي اليوم

انضم إلى OVOV لإنشاء الصور والفيديو والموسيقى والصوت بالذكاء الاصطناعي — أطلق العنان لإبداع بلا حدود.
سجّل الآن واحصل على 10 رصيد مجاني فورًا. بدون انتظار، ابدأ الإبداع على الفور.