Alimentato da Alibaba Tongyi Wanxiang

Wan 3.0 · Un modello video, tre modi per entrarci

Il Tongyi Wanxiang Wan 3.0 di Alibaba, su OVOV. Parti da un prompt, da un primo e un ultimo frame o da un prompt sostenuto dalle tue immagini, video e audio di riferimento — in 480P, 720P o 1080P, da 5 a 30 secondi, con colonna sonora nativa.

Durata
Proporzioni
Risoluzione

Esempi di video IA su OVOV

Generazioni reali dei nostri modelli video — Veo 3.1, Kling e Seedance. Passa il mouse su un clip per riprodurlo, clicca sull'icona dell'altoparlante per sentire l'audio.

Passa il mouse per riprodurre · Clicca sull'altoparlante per attivare l'audio

Esempi di video IA su OVOV

Generazioni reali dei nostri modelli video — Veo 3.1, Kling e Seedance. Passa il mouse su un clip per riprodurlo, clicca sull'icona dell'altoparlante per sentire l'audio.

Cinematografico

Mondo alieno fantastico

Fragranza

Pubblicità profumo di lusso

Prodotto

Teaser di lancio prodotto

Viaggi

Spot viaggio Maldive

Azione

Duello wuxia orientale

Film

Scena di film di corse

Sci-Fi

Astronave verso le stelle

Lifestyle

Golden Retriever e farfalle

Cibo

Chef di sushi all'opera

Moda

Vestito rosso sulla scogliera

Trailer

Duello di mezzanotte

Vlog

Vlog selfie con telecamera a mano

Cibo

Primo piano di cibo irresistibile

Danza

Street dance urbano

Makeup

Pubblicità rossetto di lusso

Perché vale la pena dare un'occhiata a Wan 3.0

Un solo modello che accetta testo, keyframe o il tuo materiale, renderizza fino a 1080P, arriva a mezzo minuto e scrive la propria colonna sonora mentre lavora.

Riferimenti multimodali

Nel testo-in-video puoi allegare fino a 10 immagini di riferimento, fino a 5 video di riferimento (15 secondi in totale) e fino a 5 tracce audio di riferimento (15 secondi in totale). Wan 3.0 ricava personaggio, stile, movimento e tono dal tuo materiale invece di tirare a indovinare.

Controllo primo e ultimo frame

Dagli un'immagine di partenza e, se vuoi, una di arrivo: Wan 3.0 renderizza il movimento tra le due. La via più diretta a reveal di prodotto, trasformazioni e archi prima-dopo.

480P, 720P e 1080P

Tre livelli di risoluzione, incluso un vero output 1080P. Abbozza l'idea in 480P per pochi crediti, poi renderizza in 1080P la versione che consegni davvero.

Da 5 a 30 secondi

Sei durate fisse: 5, 10, 15, 20, 25 o 30 secondi. Un test da cinque secondi costa spiccioli; uno spot completo da 30 secondi sta dentro una sola generazione.

Audio nativo, attivo di default

Wan 3.0 scrive ambiente, effetti e suoni sincronizzati al movimento insieme all'immagine. L'interruttore è tuo, e spegnere l'audio non cambia il prezzo.

Cinque rapporti d'aspetto, con prezzo al secondo

16:9, 9:16, 1:1, 4:3 e 3:4. I crediti si contano al secondo — 3 in 480P, 6 in 720P, 12 in 1080P — e una generazione fallita viene rimborsata per intero.

Dal prompt, dai keyframe o dal tuo materiale al clip finito

Scegli l'ingresso che corrisponde a ciò che hai già. Wan 3.0 gestisce immagine e suono nello stesso passaggio, quindi dopo non c'è nulla da montare.

1

Scegli il tuo modo di entrare

Scrivi solo un prompt, carica un primo frame (e volendo un ultimo) oppure allega immagini, video e audio di riferimento accanto al tuo prompt. Poi imposta durata, rapporto d'aspetto e risoluzione.

2

Wan 3.0 renderizza immagine e suono

Il modello pianifica movimento, luce e ritmo lungo tutta la durata, poi renderizza il video con la traccia audio corrispondente. La maggior parte dei lavori arriva in uno-cinque minuti; i clip più lunghi richiedono più tempo.

3

Scarica e usa

Prendi il video finito con l'audio già integrato — senza filigrana e con diritti commerciali inclusi. Se una generazione fallisce, i tuoi crediti tornano subito indietro.

Per cosa è bravo Wan 3.0

Tre modalità di ingresso e un livello 1080P coprono molto terreno: pubblicità finite, tagli verticali per i social, lavoro di continuità costruito sul tuo materiale e lunghi film d'atmosfera.

Spot di prodotto e brand in 1080P

Uno spot da 30 secondi in full HD, renderizzato in un solo passaggio. Impostazione, dimostrazione, beneficio e chiusura stanno dentro una sola generazione, suono compreso.

  • Output 1080P per pre-roll, landing page e consegna al cliente
  • 16:9 per il widescreen, 4:3 per l'inquadratura broadcast classica
  • Suoni di prodotto e ambiente generati insieme all'immagine

Short verticali per i social

TikTok, Reels e Shorts in 9:16, dall'hook di 5 secondi alla storia da 30. L'audio arriva già attaccato, quindi non serve nessun passaggio successivo per la colonna sonora.

  • 9:16 verticale, oppure 1:1 per i post quadrati nel feed
  • Fai le bozze in 480P a 3 crediti al secondo, pubblica in 720P o 1080P
  • Audio nativo al posto di una traccia musicale su licenza

Coerenza lungo tutta una serie

Allega le stesse immagini, gli stessi video e lo stesso audio di riferimento a ogni generazione: personaggio, prodotto e tono passano da un clip all'altro invece di andare alla deriva.

  • Fino a 10 immagini di riferimento per tenere fermi personaggio e stile
  • Fino a 5 video di riferimento per movimento e lavoro di camera
  • Fino a 5 tracce audio di riferimento per tenere il suono in famiglia

Film di viaggio e d'atmosfera

Carrellate aeree, strade costiere e passeggiate a livello strada che hanno bisogno di tempo per respirare — più il vento, l'acqua e il suono della città che vendono il luogo.

  • Lunghi movimenti di camera fluttuanti che richiedono tutti i 30 secondi
  • Audio ambientale renderizzato insieme alle immagini
  • 1080P per i video hero in cima alla pagina

Guida alla scrittura dei prompt per Wan 3.0

Wan 3.0 accetta prompt fino a 20.000 caratteri, molto più spazio di quanto serva alla maggior parte dei clip. Queste abitudini spendono quello spazio sulle cose su cui il modello agisce davvero.

Nomina il tuo materiale, poi descrivi l'inquadratura finita

Scegli la modalità di ingresso prima di scrivere

Le tre modalità vogliono prompt diversi. Il testo-in-video deve reggere l'intera scena con le parole. Il primo-e-ultimo-frame ha già la composizione, quindi il prompt parla del movimento. La modalità riferimento riguarda cosa prendere in prestito dal materiale che hai allegato.

  • Solo testo: descrivi ambientazione, soggetto, camera e suono da zero
  • Primo e ultimo frame: descrivi il movimento tra i due, non i frame in sé
  • Riferimenti (allegati nel testo-in-video): di' cosa apporta ciascun elemento — volto, abbigliamento, movimento di camera, tono

Esempio

"First frame: a sealed cardboard box on a table. Last frame: the box open with a camera inside. Prompt: "hands lift the flaps in one smooth motion, soft window light"."

Richiama i tuoi riferimenti per numero

In modalità riferimento puoi indicare il materiale in modo diretto — immagine 1, video 1, audio 1 — così il modello sa quale elemento governa quale parte dell'inquadratura invece di mescolare tutto insieme.

  • Fino a 10 immagini di riferimento, 5 video di riferimento e 5 tracce audio di riferimento
  • Il video di riferimento somma 15 secondi in totale; l'audio di riferimento somma 15 secondi in totale
  • Dai un solo compito a ogni elemento: l'identità da un'immagine, il movimento di camera da un video

Esempio

"Keep the woman from image 1 and the jacket from image 2, follow the slow dolly-in of video 1, and match the room tone of audio 1."

Pianifica l'arco sulla durata che hai scelto

Trenta secondi sono un sacco di tempo su schermo. Scrivi la progressione nell'ordine in cui deve accadere, altrimenti il modello terrà una sola idea per mezzo minuto.

  • Apri con l'ambientazione, porta dentro il soggetto, poi il movimento
  • Nomina ciò che cambia nel tempo: luce, meteo, distanza, velocità
  • Le durate brevi (5-10s) si prestano a un'unica azione continua

Esempio

"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera slowly settles on a cup of coffee going cold."

Scrivi il suono, non solo l'immagine

L'audio viene generato di default, quindi tutto ciò che non dici viene inventato per te. Una o due righe di regia sonora bastano di solito a tenerlo in carattere.

  • Nomina l'ambiente: pioggia sul vetro, traffico lontano, suono della stanza
  • Nomina i suoni che accompagnano il movimento: passi, motore, vento
  • Chiedere silenzio è una regia legittima — dillo se lo vuoi essenziale
  • Allega audio di riferimento se hai già in mente un tono

Esempio

"Sound: steady rain on a tin roof, an occasional low roll of thunder in the distance, no music."

Scambia le parole di lode con fatti visivi

Stupendo, epico e cinematografico non dicono nulla al modello. Materiali, colori, direzione della luce e verbi forti sì.

  • Lascia perdere: stupendo, epico, mozzafiato, splendido, capolavoro
  • Usa verbi con forza: sbatte, scivola, si incendia, sferza
  • Nomina la fonte di luce e l'ora del giorno

Esempio

"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."

Scegli durata, rapporto e risoluzione fin dall'inizio

Wan 3.0 offre 5, 10, 15, 20, 25 e 30 secondi, cinque rapporti d'aspetto e tre risoluzioni. Decidere prima di generare fa risparmiare crediti e mantiene giusta la composizione.

  • 16:9 e 4:3 per l'orizzontale, 9:16 e 3:4 per il verticale, 1:1 per i feed
  • Fai le bozze in 480P (3 crediti al secondo), rifinisci in 720P (6) o 1080P (12)
  • Scrivi per l'inquadratura che hai scelto — il verticale vuole il soggetto vicino e centrato
  • La durata è fissa a 5, 10, 15, 20, 25 o 30 secondi — arrotonda il tuo storyboard a una di queste

Esempio

"A 15-second 9:16 vertical clip: a barista pulling an espresso shot, steam rising into warm café light, shallow depth of field."

Domande frequenti









Inizia oggi il tuo viaggio creativo con l'IA

Unisciti a OVOV per generare immagini, video, musica e voce con l'IA—libera una creatività senza limiti.
Registrati ora e ricevi 10 crediti gratis all'istante. Senza attese, inizia a creare subito.