Le Tongyi Wanxiang Wan 3.0 d'Alibaba, sur OVOV. Partez d'un prompt, d'un premier et d'un dernier cadre, ou d'un prompt appuyé par vos propres images, vidéos et audio de référence — en 480P, 720P ou 1080P, de 5 à 30 secondes, avec une bande-son native.
De vraies générations de nos modèles vidéo — Veo 3.1, Kling et Seedance. Survolez un clip pour le lire, cliquez sur l'icône haut-parleur pour entendre le son.
Survolez pour lire · Cliquez sur le haut-parleur pour activer le son
De vraies générations de nos modèles vidéo — Veo 3.1, Kling et Seedance. Survolez un clip pour le lire, cliquez sur l'icône haut-parleur pour entendre le son.
Monde alien fantastique
Publicité parfum de luxe
Teaser de lancement
Publicité voyage Maldives
Duel wuxia oriental
Scène de film de courses
Vaisseau vers les étoiles
Golden Retriever et papillons
Chef de sushi à l'œuvre
Robe rouge sur la falaise
Duel de minuit
Vlog selfie à la main
Gros plan de cuisine alléchante
Danse urbaine de rue
Publicité rouge à lèvres de luxe
Un seul modèle qui accepte du texte, des cadres clés ou vos propres rushes, rend jusqu'en 1080P, tient une demi-minute et écrit sa bande-son au passage.
En texte-vers-vidéo, joignez jusqu'à 10 images de référence, jusqu'à 5 vidéos de référence (15 secondes au total) et jusqu'à 5 pistes audio de référence (15 secondes au total). Wan 3.0 tire le personnage, le style, le mouvement et le ton de votre propre matériel au lieu de deviner.
Donnez une image de départ, et éventuellement une image de fin, et Wan 3.0 rend le mouvement entre les deux. La voie la plus directe vers les reveals produit, les transformations et les arcs avant-après.
Trois paliers de résolution, dont une vraie sortie 1080P. Dégrossissez l'idée en 480P pour quelques crédits, puis rendez en 1080P la version que vous livrez vraiment.
Six durées fixes : 5, 10, 15, 20, 25 ou 30 secondes. Un test de cinq secondes coûte trois fois rien ; un spot complet de 30 secondes tient dans une seule génération.
Wan 3.0 écrit l'ambiance, les effets et les sons synchronisés au mouvement en même temps que l'image. L'interrupteur est à vous, et couper le son ne change pas le prix.
16:9, 9:16, 1:1, 4:3 et 3:4. Les crédits sont comptés à la seconde — 3 en 480P, 6 en 720P, 12 en 1080P — et une génération échouée est intégralement remboursée.
Choisissez l'entrée qui correspond à ce que vous avez déjà. Wan 3.0 traite l'image et le son dans la même passe : il n'y a rien à assembler ensuite.
Écrivez un prompt seul, téléversez un premier cadre (et éventuellement un dernier), ou joignez des images, des vidéos et de l'audio de référence à côté de votre prompt. Réglez ensuite la durée, le format d'image et la résolution.
Le modèle planifie le mouvement, la lumière et le rythme sur toute la durée, puis rend la vidéo avec sa piste audio assortie. La plupart des tâches aboutissent en une à cinq minutes ; les clips plus longs prennent plus de temps.
Récupérez la vidéo finie, audio intégré — sans filigrane, droits commerciaux inclus. Si une génération échoue, vos crédits reviennent immédiatement.
Trois modes d'entrée et un palier 1080P couvrent large : publicités finies, formats verticaux pour les réseaux, travail de continuité bâti sur vos propres rushes et longs films d'atmosphère.
Une publicité de 30 secondes en full HD, rendue en une passe. Mise en place, démonstration, bénéfice et signature tiennent dans une seule génération, son compris.
TikTok, Reels et Shorts en 9:16, du hook de 5 secondes à l'histoire de 30 secondes. L'audio arrive attaché : plus besoin d'une passe bande-son après coup.
Joignez les mêmes images, vidéos et audio de référence à chaque génération : le personnage, le produit et le ton se transmettent d'un clip à l'autre au lieu de dériver.
Survols aériens, routes côtières et déambulations au ras de la rue qui ont besoin de temps pour respirer — plus le vent, l'eau et le bruit de la ville qui vendent le lieu.
Wan 3.0 accepte des prompts jusqu'à 20 000 caractères, bien plus de place que la plupart des clips n'en demandent. Ces habitudes dépensent cette place sur ce à quoi le modèle réagit vraiment.
Nommez vos matériaux, puis décrivez le plan fini
Les trois modes n'appellent pas les mêmes prompts. Le texte-vers-vidéo doit porter toute la scène avec des mots. Le premier-et-dernier-cadre a déjà la composition : le prompt parle donc du mouvement. Le mode référence, lui, dit ce qu'il faut emprunter au matériel que vous avez joint.
Exemple
"First frame: a sealed cardboard box on a table. Last frame: the box open with a camera inside. Prompt: "hands lift the flaps in one smooth motion, soft window light"."
En mode référence, vous pouvez pointer le matériel directement — image 1, vidéo 1, audio 1 — pour que le modèle sache quel élément gouverne quelle partie du plan au lieu de tout mélanger.
Exemple
"Keep the woman from image 1 and the jacket from image 2, follow the slow dolly-in of video 1, and match the room tone of audio 1."
Trente secondes, c'est beaucoup de temps d'écran. Écrivez la progression dans l'ordre où elle doit se produire, sinon le modèle tiendra une seule idée pendant une demi-minute.
Exemple
"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera slowly settles on a cup of coffee going cold."
L'audio est généré par défaut : tout ce que vous laissez de côté sera inventé pour vous. Une ou deux lignes de direction sonore suffisent en général à garder le ton juste.
Exemple
"Sound: steady rain on a tin roof, an occasional low roll of thunder in the distance, no music."
Époustouflant, épique et cinématique ne disent rien au modèle. Les matières, les couleurs, la direction de la lumière et les verbes forts, si.
Exemple
"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."
Wan 3.0 propose 5, 10, 15, 20, 25 et 30 secondes, cinq formats d'image et trois résolutions. Décider avant de générer économise des crédits et garde la composition juste.
Exemple
"A 15-second 9:16 vertical clip: a barista pulling an espresso shot, steam rising into warm café light, shallow depth of field."