نموذج Tongyi Wanxiang Wan 3.0 من Alibaba، الآن على OVOV. ابدأ من موجّه نصي، أو من إطار أول وأخير، أو من موجّه تدعمه صورك وفيديوهاتك ومقاطعك الصوتية المرجعية — بدقة 480P أو 720P أو 1080P، ومدة من 5 إلى 30 ثانية، مع مسار صوتي أصلي.
توليدات حقيقية من نماذج الفيديو لدينا — Veo 3.1 وKling وSeedance. مرر المؤشر فوق أي مقطع لتشغيله، وانقر أيقونة مكبر الصوت لسماع الصوت.
مرر للتشغيل · انقر مكبر الصوت لتفعيل الصوت
توليدات حقيقية من نماذج الفيديو لدينا — Veo 3.1 وKling وSeedance. مرر المؤشر فوق أي مقطع لتشغيله، وانقر أيقونة مكبر الصوت لسماع الصوت.
عالم خيالي فضائي
إعلان عطر فاخر
إعلان إطلاق منتج
إعلان السفر إلى المالديف
مبارزة ووشيا شرقية
مشهد فيلم سباقات هوليوودي
سفينة فضاء نحو النجوم
كلب جولدن يطارد الفراشات
طاهي سوشي في العمل
فستان أحمر على الجرف
مبارزة منتصف الليل
فيديو Vlog سيلفي محمول
لقطة مقربة لأطعمة شهية
رقص شوارع حضري
إعلان أحمر شفاه فاخر
نموذج واحد يقبل النص أو الإطارات المفتاحية أو موادك الخاصة، ويعرض حتى 1080P، ويمتد إلى نصف دقيقة، ويكتب مساره الصوتي أثناء العمل.
في وضع النص إلى فيديو يمكنك إرفاق حتى 10 صور مرجعية، وحتى 5 فيديوهات مرجعية (15 ثانية إجمالاً)، وحتى 5 مقاطع صوتية مرجعية (15 ثانية إجمالاً). ويستخلص Wan 3.0 الشخصية والأسلوب والحركة والنبرة من موادك بدل أن يخمّنها.
أعطه صورة بداية، وصورة نهاية اختيارياً، وسيعرض Wan 3.0 الحركة بينهما. أقصر طريق للقطات كشف المنتجات والتحولات ومشاهد قبل وبعد.
ثلاثة مستويات دقة، من بينها إخراج 1080P حقيقي. جرّب الفكرة بدقة 480P ببضع نقاط، ثم اعرض بدقة 1080P النسخة التي ستنشرها فعلاً.
ست مدد ثابتة: 5 أو 10 أو 15 أو 20 أو 25 أو 30 ثانية. اختبار من خمس ثوانٍ يكلف نزراً يسيراً، وإعلان كامل من 30 ثانية يتسع داخل توليد واحد.
يكتب Wan 3.0 الأجواء الصوتية والمؤثرات والصوت المطابق للحركة جنباً إلى جنب مع الصورة. المفتاح بيدك، وإيقاف الصوت لا يغيّر السعر.
16:9 و9:16 و1:1 و4:3 و3:4. تُحتسب النقاط لكل ثانية — 3 بدقة 480P، و6 بدقة 720P، و12 بدقة 1080P — والتوليد الفاشل تُستردّ نقاطه كاملة.
اختر المُدخل الذي يناسب ما لديك بالفعل. يتولى Wan 3.0 الصورة والصوت في التمريرة نفسها، فلا شيء يحتاج إلى تجميع بعد ذلك.
اكتب موجّهاً وحده، أو ارفع إطاراً أول (وإطاراً أخيراً اختيارياً)، أو أرفق صوراً وفيديوهات ومقاطع صوتية مرجعية إلى جانب موجّهك. ثم حدّد المدة ونسبة العرض والدقة.
يخطط النموذج للحركة والإضاءة والإيقاع على امتداد المدة كلها، ثم يعرض الفيديو مع مساره الصوتي المطابق. معظم المهام تنتهي خلال دقيقة إلى خمس دقائق؛ والمقاطع الأطول تستغرق وقتاً أطول.
خذ الفيديو الجاهز بالصوت المدمج فيه — بدون علامة مائية ومع حقوق تجارية. وإذا فشل التوليد، تعود نقاطك فوراً.
ثلاثة أوضاع إدخال ومستوى 1080P تغطي مساحة واسعة: إعلانات جاهزة، ومقاطع عمودية للتواصل الاجتماعي، وأعمال اتساق مبنية على موادك الخاصة، وأفلام أجواء طويلة.
إعلان من 30 ثانية بدقة Full HD، معروض في تمريرة واحدة. التمهيد والعرض والفائدة والخاتمة تتسع كلها في توليد واحد، مع الصوت.
TikTok وReels وShorts بنسبة 9:16، من خطاف مدته 5 ثوانٍ إلى قصة من 30 ثانية. الصوت يأتي مرفقاً، فلا شيء يحتاج إلى تمريرة موسيقى لاحقة.
أرفق الصور والفيديوهات والمقاطع الصوتية المرجعية نفسها بكل توليد، فتنتقل الشخصية والمنتج والنبرة من مقطع إلى آخر بدل أن تنحرف.
تحليقات جوية ورحلات ساحلية وتجوال في الشوارع تحتاج وقتاً لتتنفس — إضافة إلى صوت الريح والماء والمدينة الذي يبيع المكان.
يقبل Wan 3.0 موجّهات تصل إلى 20,000 حرف، وهي مساحة أكبر بكثير مما تحتاجه معظم المقاطع. وهذه العادات تُنفق تلك المساحة على ما يستجيب له النموذج فعلاً.
سمِّ موادك أولاً، ثم صف اللقطة النهائية
الأوضاع الثلاثة تحتاج موجّهات مختلفة. النص إلى فيديو عليه أن يحمل المشهد كله بالكلمات. أما الإطار الأول والأخير فالتكوين فيه جاهز، فيصبح الموجّه عن الحركة. ووضع المراجع يدور حول ما تستعيره من المواد التي أرفقتها.
مثال
"First frame: a sealed cardboard box on a table. Last frame: the box open with a camera inside. Prompt: "hands lift the flaps in one smooth motion, soft window light"."
في وضع المراجع يمكنك الإشارة إلى المواد مباشرة — الصورة 1، الفيديو 1، الصوت 1 — ليعرف النموذج أي ملف يحكم أي جزء من اللقطة بدل أن يمزج كل شيء معاً.
مثال
"Keep the woman from image 1 and the jacket from image 2, follow the slow dolly-in of video 1, and match the room tone of audio 1."
ثلاثون ثانية وقت شاشة كبير. اكتب التسلسل بالترتيب الذي يجب أن يحدث به، وإلا تمسّك النموذج بفكرة واحدة نصف دقيقة.
مثال
"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera slowly settles on a cup of coffee going cold."
الصوت يُولَّد افتراضياً، فكل ما تتركه دون ذكر سيُخترع نيابة عنك. وسطر أو سطران من التوجيه الصوتي يكفيان عادة لإبقائه في الأجواء الصحيحة.
مثال
"Sound: steady rain on a tin roof, an occasional low roll of thunder in the distance, no music."
«مذهل» و«ملحمي» و«سينمائي» لا تقول للنموذج شيئاً. أما الخامات والألوان واتجاه الضوء والأفعال القوية فتقول.
مثال
"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."
يوفر Wan 3.0 مدداً من 5 و10 و15 و20 و25 و30 ثانية، وخمس نسب عرض، وثلاث دقات. الحسم قبل التوليد يوفر النقاط ويحافظ على التكوين الصحيح.
مثال
"A 15-second 9:16 vertical clip: a barista pulling an espresso shot, steam rising into warm café light, shallow depth of field."