Propulsé par Alibaba Tongyi Wanxiang

Wan 3.0 · Un modèle vidéo, trois portes d'entrée

Le Tongyi Wanxiang Wan 3.0 d'Alibaba, sur OVOV. Partez d'un prompt, d'un premier et d'un dernier cadre, ou d'un prompt appuyé par vos propres images, vidéos et audio de référence — en 480P, 720P ou 1080P, de 5 à 30 secondes, avec une bande-son native.

Durée
Ratio
Résolution

Exemples de vidéos IA sur OVOV

De vraies générations de nos modèles vidéo — Veo 3.1, Kling et Seedance. Survolez un clip pour le lire, cliquez sur l'icône haut-parleur pour entendre le son.

Survolez pour lire · Cliquez sur le haut-parleur pour activer le son

Exemples de vidéos IA sur OVOV

De vraies générations de nos modèles vidéo — Veo 3.1, Kling et Seedance. Survolez un clip pour le lire, cliquez sur l'icône haut-parleur pour entendre le son.

Cinématique

Monde alien fantastique

Parfum

Publicité parfum de luxe

Produit

Teaser de lancement

Voyage

Publicité voyage Maldives

Action

Duel wuxia oriental

Film

Scène de film de courses

Sci-Fi

Vaisseau vers les étoiles

Lifestyle

Golden Retriever et papillons

Cuisine

Chef de sushi à l'œuvre

Mode

Robe rouge sur la falaise

Trailer

Duel de minuit

Vlog

Vlog selfie à la main

Cuisine

Gros plan de cuisine alléchante

Danse

Danse urbaine de rue

Maquillage

Publicité rouge à lèvres de luxe

Pourquoi Wan 3.0 mérite un coup d'œil

Un seul modèle qui accepte du texte, des cadres clés ou vos propres rushes, rend jusqu'en 1080P, tient une demi-minute et écrit sa bande-son au passage.

Références multimodales

En texte-vers-vidéo, joignez jusqu'à 10 images de référence, jusqu'à 5 vidéos de référence (15 secondes au total) et jusqu'à 5 pistes audio de référence (15 secondes au total). Wan 3.0 tire le personnage, le style, le mouvement et le ton de votre propre matériel au lieu de deviner.

Contrôle premier & dernier cadre

Donnez une image de départ, et éventuellement une image de fin, et Wan 3.0 rend le mouvement entre les deux. La voie la plus directe vers les reveals produit, les transformations et les arcs avant-après.

480P, 720P et 1080P

Trois paliers de résolution, dont une vraie sortie 1080P. Dégrossissez l'idée en 480P pour quelques crédits, puis rendez en 1080P la version que vous livrez vraiment.

De 5 à 30 secondes

Six durées fixes : 5, 10, 15, 20, 25 ou 30 secondes. Un test de cinq secondes coûte trois fois rien ; un spot complet de 30 secondes tient dans une seule génération.

Audio natif, activé par défaut

Wan 3.0 écrit l'ambiance, les effets et les sons synchronisés au mouvement en même temps que l'image. L'interrupteur est à vous, et couper le son ne change pas le prix.

Cinq formats d'image, facturés à la seconde

16:9, 9:16, 1:1, 4:3 et 3:4. Les crédits sont comptés à la seconde — 3 en 480P, 6 en 720P, 12 en 1080P — et une génération échouée est intégralement remboursée.

Du prompt, des cadres clés ou de vos rushes jusqu'au clip fini

Choisissez l'entrée qui correspond à ce que vous avez déjà. Wan 3.0 traite l'image et le son dans la même passe : il n'y a rien à assembler ensuite.

1

Choisissez votre porte d'entrée

Écrivez un prompt seul, téléversez un premier cadre (et éventuellement un dernier), ou joignez des images, des vidéos et de l'audio de référence à côté de votre prompt. Réglez ensuite la durée, le format d'image et la résolution.

2

Wan 3.0 rend l'image et le son

Le modèle planifie le mouvement, la lumière et le rythme sur toute la durée, puis rend la vidéo avec sa piste audio assortie. La plupart des tâches aboutissent en une à cinq minutes ; les clips plus longs prennent plus de temps.

3

Téléchargez et utilisez

Récupérez la vidéo finie, audio intégré — sans filigrane, droits commerciaux inclus. Si une génération échoue, vos crédits reviennent immédiatement.

Ce que Wan 3.0 fait bien

Trois modes d'entrée et un palier 1080P couvrent large : publicités finies, formats verticaux pour les réseaux, travail de continuité bâti sur vos propres rushes et longs films d'atmosphère.

Spots produit & marque en 1080P

Une publicité de 30 secondes en full HD, rendue en une passe. Mise en place, démonstration, bénéfice et signature tiennent dans une seule génération, son compris.

  • Sortie 1080P pour le pre-roll, les landing pages et la livraison client
  • 16:9 pour le grand écran, 4:3 pour le cadrage broadcast classique
  • Sons produit et ambiance générés avec l'image

Shorts verticaux pour les réseaux

TikTok, Reels et Shorts en 9:16, du hook de 5 secondes à l'histoire de 30 secondes. L'audio arrive attaché : plus besoin d'une passe bande-son après coup.

  • 9:16 vertical, ou 1:1 pour les posts carrés
  • Brouillonnez en 480P à 3 crédits la seconde, publiez en 720P ou 1080P
  • Audio natif plutôt qu'une piste musicale sous licence

Cohérence sur toute une série

Joignez les mêmes images, vidéos et audio de référence à chaque génération : le personnage, le produit et le ton se transmettent d'un clip à l'autre au lieu de dériver.

  • Jusqu'à 10 images de référence pour tenir le personnage et le style
  • Jusqu'à 5 vidéos de référence pour le mouvement et le jeu de caméra
  • Jusqu'à 5 pistes audio de référence pour garder le son dans la même famille

Films de voyage & d'atmosphère

Survols aériens, routes côtières et déambulations au ras de la rue qui ont besoin de temps pour respirer — plus le vent, l'eau et le bruit de la ville qui vendent le lieu.

  • Longs mouvements de caméra flottants qui exigent les 30 secondes entières
  • Audio d'ambiance rendu en même temps que l'image
  • 1080P pour les vidéos hero placées en haut de page

Guide d'écriture de prompts pour Wan 3.0

Wan 3.0 accepte des prompts jusqu'à 20 000 caractères, bien plus de place que la plupart des clips n'en demandent. Ces habitudes dépensent cette place sur ce à quoi le modèle réagit vraiment.

Nommez vos matériaux, puis décrivez le plan fini

Choisissez le mode d'entrée avant d'écrire

Les trois modes n'appellent pas les mêmes prompts. Le texte-vers-vidéo doit porter toute la scène avec des mots. Le premier-et-dernier-cadre a déjà la composition : le prompt parle donc du mouvement. Le mode référence, lui, dit ce qu'il faut emprunter au matériel que vous avez joint.

  • Texte seul : décrivez le décor, le sujet, la caméra et le son en partant de zéro
  • Premier et dernier cadre : décrivez le mouvement entre les deux, pas les cadres eux-mêmes
  • Références (jointes en texte-vers-vidéo) : dites ce qu'apporte chaque élément — visage, tenue, mouvement de caméra, ton

Exemple

"First frame: a sealed cardboard box on a table. Last frame: the box open with a camera inside. Prompt: "hands lift the flaps in one smooth motion, soft window light"."

Désignez vos références par leur numéro

En mode référence, vous pouvez pointer le matériel directement — image 1, vidéo 1, audio 1 — pour que le modèle sache quel élément gouverne quelle partie du plan au lieu de tout mélanger.

  • Jusqu'à 10 images de référence, 5 vidéos de référence et 5 pistes audio de référence
  • La vidéo de référence totalise 15 secondes ; l'audio de référence totalise 15 secondes
  • Donnez un seul rôle à chaque élément : l'identité par une image, le mouvement de caméra par une vidéo

Exemple

"Keep the woman from image 1 and the jacket from image 2, follow the slow dolly-in of video 1, and match the room tone of audio 1."

Planifiez l'arc sur la durée choisie

Trente secondes, c'est beaucoup de temps d'écran. Écrivez la progression dans l'ordre où elle doit se produire, sinon le modèle tiendra une seule idée pendant une demi-minute.

  • Ouvrez sur le décor, amenez le sujet, puis le mouvement
  • Nommez ce qui change dans le temps : lumière, météo, distance, vitesse
  • Les durées courtes (5-10s) conviennent à une action continue unique

Exemple

"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera slowly settles on a cup of coffee going cold."

Écrivez le son, pas seulement l'image

L'audio est généré par défaut : tout ce que vous laissez de côté sera inventé pour vous. Une ou deux lignes de direction sonore suffisent en général à garder le ton juste.

  • Nommez l'ambiance : pluie sur la vitre, circulation lointaine, son de pièce
  • Nommez les sons qui accompagnent le mouvement : pas, moteur, vent
  • Demander du silence est une vraie direction — dites-le si vous voulez du minimal
  • Joignez de l'audio de référence si vous avez déjà un ton en tête

Exemple

"Sound: steady rain on a tin roof, an occasional low roll of thunder in the distance, no music."

Échangez les mots d'éloge contre des faits visuels

Époustouflant, épique et cinématique ne disent rien au modèle. Les matières, les couleurs, la direction de la lumière et les verbes forts, si.

  • À oublier : époustouflant, épique, à couper le souffle, sublime, chef-d'œuvre
  • Utilisez des verbes qui ont de la force : claque, dérive, s'embrase, fouette
  • Nommez la source de lumière et l'heure du jour

Exemple

"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."

Choisissez durée, format et résolution dès le départ

Wan 3.0 propose 5, 10, 15, 20, 25 et 30 secondes, cinq formats d'image et trois résolutions. Décider avant de générer économise des crédits et garde la composition juste.

  • 16:9 et 4:3 pour le paysage, 9:16 et 3:4 pour le vertical, 1:1 pour les feeds
  • Brouillonnez en 480P (3 crédits par seconde), finalisez en 720P (6) ou 1080P (12)
  • Écrivez pour le cadre choisi — le vertical veut le sujet proche et centré
  • La durée est fixée à 5, 10, 15, 20, 25 ou 30 secondes — arrondissez votre storyboard à l'une d'elles

Exemple

"A 15-second 9:16 vertical clip: a barista pulling an espresso shot, steam rising into warm café light, shallow depth of field."

Questions fréquentes









Commencez dès aujourd'hui votre aventure créative avec l'IA

Rejoignez OVOV pour générer images, vidéos, musique et voix avec l'IA—libérez une créativité sans limites.
Inscrivez-vous maintenant et recevez 10 crédits gratuits immédiatement. Pas d'attente, créez tout de suite.