O Tongyi Wanxiang Wan 3.0 da Alibaba, na OVOV. Comece por um prompt, por um primeiro e último quadro, ou por um prompt apoiado nas suas próprias imagens, vídeos e áudios de referência — em 480P, 720P ou 1080P, de 5 a 30 segundos, com trilha sonora nativa.
Gerações reais dos nossos modelos de vídeo — Veo 3.1, Kling e Seedance. Passe o mouse sobre um clipe para reproduzir, clique no ícone de alto-falante para ouvir o áudio.
Passe o mouse para reproduzir · Clique no alto-falante para ativar o som
Gerações reais dos nossos modelos de vídeo — Veo 3.1, Kling e Seedance. Passe o mouse sobre um clipe para reproduzir, clique no ícone de alto-falante para ouvir o áudio.
Mundo alienígena fantástico
Anúncio de perfume de luxo
Teaser de lançamento
Comercial de viagem Maldivas
Duelo wuxia oriental
Cena de filme de corrida
Nave espacial às estrelas
Golden Retriever e borboletas
Chef de sushi em ação
Vestido vermelho no penhasco
Duelo à meia-noite
Vlog selfie portátil
Close-up de comida irresistível
Dança de rua urbana
Anúncio de batom de luxo
Um modelo que aceita texto, quadros-chave ou o seu próprio material, renderiza em até 1080P, chega a meio minuto e escreve a própria trilha sonora enquanto trabalha.
No texto para vídeo você pode anexar até 10 imagens de referência, até 5 vídeos de referência (15 segundos no total) e até 5 áudios de referência (15 segundos no total). O Wan 3.0 tira personagem, estilo, movimento e tom do seu próprio material em vez de adivinhar.
Dê a ele uma imagem inicial e, opcionalmente, uma imagem final, e o Wan 3.0 renderiza o movimento entre elas. O caminho mais direto para reveals de produto, transformações e arcos de antes e depois.
Três níveis de resolução, incluindo uma saída 1080P de verdade. Esboce a ideia em 480P por alguns créditos e depois renderize em 1080P a versão que você realmente vai publicar.
Seis durações fixas: 5, 10, 15, 20, 25 ou 30 segundos. Um teste de cinco segundos custa trocados; um comercial completo de 30 segundos cabe em uma única geração.
O Wan 3.0 escreve ambiência, efeitos e som sincronizado com o movimento junto com a imagem. O botão é seu, e desligar o áudio não muda o preço.
16:9, 9:16, 1:1, 4:3 e 3:4. Os créditos são cobrados por segundo — 3 em 480P, 6 em 720P, 12 em 1080P — e uma geração com falha é reembolsada integralmente.
Escolha a entrada que combina com o que você já tem. O Wan 3.0 cuida de imagem e som na mesma passada, então não há nada para montar depois.
Escreva um prompt sozinho, envie um primeiro quadro (e, opcionalmente, um último quadro), ou anexe imagens, vídeos e áudios de referência junto com o seu prompt. Depois defina duração, proporção e resolução.
O modelo planeja movimento, iluminação e ritmo ao longo de toda a duração e depois renderiza o vídeo com a trilha de áudio correspondente. A maioria das gerações fica pronta em um a cinco minutos; clipes mais longos demoram mais.
Leve o vídeo pronto com o áudio já embutido — sem marca d'água, com direitos comerciais incluídos. Se uma geração falhar, seus créditos voltam na hora.
Três modos de entrada e um nível 1080P cobrem bastante terreno: anúncios prontos, cortes verticais para redes sociais, trabalho de continuidade em cima do seu próprio material e filmes atmosféricos longos.
Um comercial de 30 segundos em Full HD, renderizado em uma única passada. Contextualização, demonstração, benefício e assinatura cabem em uma geração, com som incluído.
TikTok, Reels e Shorts em 9:16, de um gancho de 5 segundos a uma história de 30 segundos. O áudio já vem junto, então nada precisa de uma passada de trilha depois.
Anexe as mesmas imagens, vídeos e áudios de referência a cada geração e o personagem, o produto e o tom se mantêm de clipe para clipe em vez de derivar.
Sobrevoos aéreos, estradas litorâneas e caminhadas pelas ruas que precisam de tempo para respirar — mais o vento, a água e o som da cidade que vendem o lugar.
O Wan 3.0 aceita prompts de até 20.000 caracteres, muito mais espaço do que a maioria dos clipes precisa. Estes hábitos gastam esse espaço com as coisas em que o modelo realmente age.
Nomeie os seus materiais e depois descreva o plano pronto
Os três modos pedem prompts diferentes. O texto para vídeo tem que carregar a cena inteira em palavras. O primeiro e último quadro já traz a composição, então o prompt é sobre movimento. O modo de referência é sobre o que aproveitar do material que você anexou.
Exemplo
"First frame: a sealed cardboard box on a table. Last frame: the box open with a camera inside. Prompt: "hands lift the flaps in one smooth motion, soft window light"."
No modo de referência você pode apontar diretamente para o material — imagem 1, vídeo 1, áudio 1 — para que o modelo saiba qual arquivo governa qual parte do plano, em vez de misturar tudo.
Exemplo
"Keep the woman from image 1 and the jacket from image 2, follow the slow dolly-in of video 1, and match the room tone of audio 1."
Trinta segundos é muito tempo de tela. Escreva a progressão na ordem em que ela deve acontecer, ou o modelo vai segurar uma única ideia por meio minuto.
Exemplo
"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera slowly settles on a cup of coffee going cold."
O áudio é gerado por padrão, então tudo o que você deixar de dizer será inventado para você. Uma ou duas linhas de direção sonora costumam bastar para manter o tom certo.
Exemplo
"Sound: steady rain on a tin roof, an occasional low roll of thunder in the distance, no music."
Deslumbrante, épico e cinemático não dizem nada ao modelo. Materiais, cores, direção da luz e verbos fortes dizem.
Exemplo
"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."
O Wan 3.0 oferece 5, 10, 15, 20, 25 e 30 segundos, cinco proporções e três resoluções. Decidir antes de gerar economiza créditos e mantém a composição certa.
Exemplo
"A 15-second 9:16 vertical clip: a barista pulling an espresso shot, steam rising into warm café light, shallow depth of field."