Il Tongyi Wanxiang Wan 3.0 di Alibaba, su OVOV. Parti da un prompt, da un primo e un ultimo frame o da un prompt sostenuto dalle tue immagini, video e audio di riferimento — in 480P, 720P o 1080P, da 5 a 30 secondi, con colonna sonora nativa.
Generazioni reali dei nostri modelli video — Veo 3.1, Kling e Seedance. Passa il mouse su un clip per riprodurlo, clicca sull'icona dell'altoparlante per sentire l'audio.
Passa il mouse per riprodurre · Clicca sull'altoparlante per attivare l'audio
Generazioni reali dei nostri modelli video — Veo 3.1, Kling e Seedance. Passa il mouse su un clip per riprodurlo, clicca sull'icona dell'altoparlante per sentire l'audio.
Mondo alieno fantastico
Pubblicità profumo di lusso
Teaser di lancio prodotto
Spot viaggio Maldive
Duello wuxia orientale
Scena di film di corse
Astronave verso le stelle
Golden Retriever e farfalle
Chef di sushi all'opera
Vestito rosso sulla scogliera
Duello di mezzanotte
Vlog selfie con telecamera a mano
Primo piano di cibo irresistibile
Street dance urbano
Pubblicità rossetto di lusso
Un solo modello che accetta testo, keyframe o il tuo materiale, renderizza fino a 1080P, arriva a mezzo minuto e scrive la propria colonna sonora mentre lavora.
Nel testo-in-video puoi allegare fino a 10 immagini di riferimento, fino a 5 video di riferimento (15 secondi in totale) e fino a 5 tracce audio di riferimento (15 secondi in totale). Wan 3.0 ricava personaggio, stile, movimento e tono dal tuo materiale invece di tirare a indovinare.
Dagli un'immagine di partenza e, se vuoi, una di arrivo: Wan 3.0 renderizza il movimento tra le due. La via più diretta a reveal di prodotto, trasformazioni e archi prima-dopo.
Tre livelli di risoluzione, incluso un vero output 1080P. Abbozza l'idea in 480P per pochi crediti, poi renderizza in 1080P la versione che consegni davvero.
Sei durate fisse: 5, 10, 15, 20, 25 o 30 secondi. Un test da cinque secondi costa spiccioli; uno spot completo da 30 secondi sta dentro una sola generazione.
Wan 3.0 scrive ambiente, effetti e suoni sincronizzati al movimento insieme all'immagine. L'interruttore è tuo, e spegnere l'audio non cambia il prezzo.
16:9, 9:16, 1:1, 4:3 e 3:4. I crediti si contano al secondo — 3 in 480P, 6 in 720P, 12 in 1080P — e una generazione fallita viene rimborsata per intero.
Scegli l'ingresso che corrisponde a ciò che hai già. Wan 3.0 gestisce immagine e suono nello stesso passaggio, quindi dopo non c'è nulla da montare.
Scrivi solo un prompt, carica un primo frame (e volendo un ultimo) oppure allega immagini, video e audio di riferimento accanto al tuo prompt. Poi imposta durata, rapporto d'aspetto e risoluzione.
Il modello pianifica movimento, luce e ritmo lungo tutta la durata, poi renderizza il video con la traccia audio corrispondente. La maggior parte dei lavori arriva in uno-cinque minuti; i clip più lunghi richiedono più tempo.
Prendi il video finito con l'audio già integrato — senza filigrana e con diritti commerciali inclusi. Se una generazione fallisce, i tuoi crediti tornano subito indietro.
Tre modalità di ingresso e un livello 1080P coprono molto terreno: pubblicità finite, tagli verticali per i social, lavoro di continuità costruito sul tuo materiale e lunghi film d'atmosfera.
Uno spot da 30 secondi in full HD, renderizzato in un solo passaggio. Impostazione, dimostrazione, beneficio e chiusura stanno dentro una sola generazione, suono compreso.
TikTok, Reels e Shorts in 9:16, dall'hook di 5 secondi alla storia da 30. L'audio arriva già attaccato, quindi non serve nessun passaggio successivo per la colonna sonora.
Allega le stesse immagini, gli stessi video e lo stesso audio di riferimento a ogni generazione: personaggio, prodotto e tono passano da un clip all'altro invece di andare alla deriva.
Carrellate aeree, strade costiere e passeggiate a livello strada che hanno bisogno di tempo per respirare — più il vento, l'acqua e il suono della città che vendono il luogo.
Wan 3.0 accetta prompt fino a 20.000 caratteri, molto più spazio di quanto serva alla maggior parte dei clip. Queste abitudini spendono quello spazio sulle cose su cui il modello agisce davvero.
Nomina il tuo materiale, poi descrivi l'inquadratura finita
Le tre modalità vogliono prompt diversi. Il testo-in-video deve reggere l'intera scena con le parole. Il primo-e-ultimo-frame ha già la composizione, quindi il prompt parla del movimento. La modalità riferimento riguarda cosa prendere in prestito dal materiale che hai allegato.
Esempio
"First frame: a sealed cardboard box on a table. Last frame: the box open with a camera inside. Prompt: "hands lift the flaps in one smooth motion, soft window light"."
In modalità riferimento puoi indicare il materiale in modo diretto — immagine 1, video 1, audio 1 — così il modello sa quale elemento governa quale parte dell'inquadratura invece di mescolare tutto insieme.
Esempio
"Keep the woman from image 1 and the jacket from image 2, follow the slow dolly-in of video 1, and match the room tone of audio 1."
Trenta secondi sono un sacco di tempo su schermo. Scrivi la progressione nell'ordine in cui deve accadere, altrimenti il modello terrà una sola idea per mezzo minuto.
Esempio
"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera slowly settles on a cup of coffee going cold."
L'audio viene generato di default, quindi tutto ciò che non dici viene inventato per te. Una o due righe di regia sonora bastano di solito a tenerlo in carattere.
Esempio
"Sound: steady rain on a tin roof, an occasional low roll of thunder in the distance, no music."
Stupendo, epico e cinematografico non dicono nulla al modello. Materiali, colori, direzione della luce e verbi forti sì.
Esempio
"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."
Wan 3.0 offre 5, 10, 15, 20, 25 e 30 secondi, cinque rapporti d'aspetto e tre risoluzioni. Decidere prima di generare fa risparmiare crediti e mantiene giusta la composizione.
Esempio
"A 15-second 9:16 vertical clip: a barista pulling an espresso shot, steam rising into warm café light, shallow depth of field."