Desenvolvido pela Alibaba Tongyi Wanxiang

Wan 3.0 · Um Modelo de Vídeo, Três Formas de Entrar

O Tongyi Wanxiang Wan 3.0 da Alibaba, na OVOV. Comece por um prompt, por um primeiro e último quadro, ou por um prompt apoiado nas suas próprias imagens, vídeos e áudios de referência — em 480P, 720P ou 1080P, de 5 a 30 segundos, com trilha sonora nativa.

Duração
Proporção
Resolução

Exemplos de vídeo IA na OVOV

Gerações reais dos nossos modelos de vídeo — Veo 3.1, Kling e Seedance. Passe o mouse sobre um clipe para reproduzir, clique no ícone de alto-falante para ouvir o áudio.

Passe o mouse para reproduzir · Clique no alto-falante para ativar o som

Exemplos de vídeo IA na OVOV

Gerações reais dos nossos modelos de vídeo — Veo 3.1, Kling e Seedance. Passe o mouse sobre um clipe para reproduzir, clique no ícone de alto-falante para ouvir o áudio.

Cinemático

Mundo alienígena fantástico

Fragrância

Anúncio de perfume de luxo

Produto

Teaser de lançamento

Viagem

Comercial de viagem Maldivas

Ação

Duelo wuxia oriental

Filme

Cena de filme de corrida

Sci-Fi

Nave espacial às estrelas

Lifestyle

Golden Retriever e borboletas

Comida

Chef de sushi em ação

Moda

Vestido vermelho no penhasco

Trailer

Duelo à meia-noite

Vlog

Vlog selfie portátil

Comida

Close-up de comida irresistível

Dança

Dança de rua urbana

Maquiagem

Anúncio de batom de luxo

Por que o Wan 3.0 merece atenção

Um modelo que aceita texto, quadros-chave ou o seu próprio material, renderiza em até 1080P, chega a meio minuto e escreve a própria trilha sonora enquanto trabalha.

Referências Multimodais

No texto para vídeo você pode anexar até 10 imagens de referência, até 5 vídeos de referência (15 segundos no total) e até 5 áudios de referência (15 segundos no total). O Wan 3.0 tira personagem, estilo, movimento e tom do seu próprio material em vez de adivinhar.

Controle de Primeiro e Último Quadro

Dê a ele uma imagem inicial e, opcionalmente, uma imagem final, e o Wan 3.0 renderiza o movimento entre elas. O caminho mais direto para reveals de produto, transformações e arcos de antes e depois.

480P, 720P e 1080P

Três níveis de resolução, incluindo uma saída 1080P de verdade. Esboce a ideia em 480P por alguns créditos e depois renderize em 1080P a versão que você realmente vai publicar.

De 5 a 30 Segundos

Seis durações fixas: 5, 10, 15, 20, 25 ou 30 segundos. Um teste de cinco segundos custa trocados; um comercial completo de 30 segundos cabe em uma única geração.

Áudio Nativo, Ligado por Padrão

O Wan 3.0 escreve ambiência, efeitos e som sincronizado com o movimento junto com a imagem. O botão é seu, e desligar o áudio não muda o preço.

Cinco Proporções, Cobradas por Segundo

16:9, 9:16, 1:1, 4:3 e 3:4. Os créditos são cobrados por segundo — 3 em 480P, 6 em 720P, 12 em 1080P — e uma geração com falha é reembolsada integralmente.

Do prompt, dos quadros-chave ou do seu material a um clipe pronto

Escolha a entrada que combina com o que você já tem. O Wan 3.0 cuida de imagem e som na mesma passada, então não há nada para montar depois.

1

Escolha a sua forma de entrar

Escreva um prompt sozinho, envie um primeiro quadro (e, opcionalmente, um último quadro), ou anexe imagens, vídeos e áudios de referência junto com o seu prompt. Depois defina duração, proporção e resolução.

2

O Wan 3.0 renderiza imagem e som

O modelo planeja movimento, iluminação e ritmo ao longo de toda a duração e depois renderiza o vídeo com a trilha de áudio correspondente. A maioria das gerações fica pronta em um a cinco minutos; clipes mais longos demoram mais.

3

Baixe e use

Leve o vídeo pronto com o áudio já embutido — sem marca d'água, com direitos comerciais incluídos. Se uma geração falhar, seus créditos voltam na hora.

Para que o Wan 3.0 é bom

Três modos de entrada e um nível 1080P cobrem bastante terreno: anúncios prontos, cortes verticais para redes sociais, trabalho de continuidade em cima do seu próprio material e filmes atmosféricos longos.

Anúncios de Produto e Marca em 1080P

Um comercial de 30 segundos em Full HD, renderizado em uma única passada. Contextualização, demonstração, benefício e assinatura cabem em uma geração, com som incluído.

  • Saída 1080P para pre-roll, landing pages e entrega ao cliente
  • 16:9 para widescreen, 4:3 para o enquadramento clássico de broadcast
  • Som do produto e ambiência gerados junto com a imagem

Shorts Verticais para Redes Sociais

TikTok, Reels e Shorts em 9:16, de um gancho de 5 segundos a uma história de 30 segundos. O áudio já vem junto, então nada precisa de uma passada de trilha depois.

  • 9:16 vertical, ou 1:1 para posts quadrados de feed
  • Rascunhe em 480P por 3 créditos por segundo, publique em 720P ou 1080P
  • Áudio nativo no lugar de uma trilha musical licenciada

Consistência ao Longo de uma Série

Anexe as mesmas imagens, vídeos e áudios de referência a cada geração e o personagem, o produto e o tom se mantêm de clipe para clipe em vez de derivar.

  • Até 10 imagens de referência para segurar personagem e estilo
  • Até 5 vídeos de referência para movimento e comportamento de câmera
  • Até 5 áudios de referência para manter o som na mesma família

Filmes de Viagem e Atmosfera

Sobrevoos aéreos, estradas litorâneas e caminhadas pelas ruas que precisam de tempo para respirar — mais o vento, a água e o som da cidade que vendem o lugar.

  • Movimentos longos e à deriva de câmera que exigem os 30 segundos completos
  • Áudio ambiente renderizado junto com as imagens
  • 1080P para vídeos hero no topo da página

Guia de escrita de prompts para o Wan 3.0

O Wan 3.0 aceita prompts de até 20.000 caracteres, muito mais espaço do que a maioria dos clipes precisa. Estes hábitos gastam esse espaço com as coisas em que o modelo realmente age.

Nomeie os seus materiais e depois descreva o plano pronto

Escolha o modo de entrada antes de escrever

Os três modos pedem prompts diferentes. O texto para vídeo tem que carregar a cena inteira em palavras. O primeiro e último quadro já traz a composição, então o prompt é sobre movimento. O modo de referência é sobre o que aproveitar do material que você anexou.

  • Só texto: descreva cenário, sujeito, câmera e som do zero
  • Primeiro e último quadro: descreva o movimento entre eles, não os quadros em si
  • Referências (anexadas no texto para vídeo): diga o que cada arquivo contribui — rosto, roupa, movimento de câmera, tom

Exemplo

"First frame: a sealed cardboard box on a table. Last frame: the box open with a camera inside. Prompt: "hands lift the flaps in one smooth motion, soft window light"."

Chame as suas referências pelo número

No modo de referência você pode apontar diretamente para o material — imagem 1, vídeo 1, áudio 1 — para que o modelo saiba qual arquivo governa qual parte do plano, em vez de misturar tudo.

  • Até 10 imagens de referência, 5 vídeos de referência e 5 áudios de referência
  • O vídeo de referência soma 15 segundos no total; o áudio de referência soma 15 segundos no total
  • Dê uma função a cada arquivo: identidade de uma imagem, movimento de câmera de um vídeo

Exemplo

"Keep the woman from image 1 and the jacket from image 2, follow the slow dolly-in of video 1, and match the room tone of audio 1."

Planeje o arco ao longo da duração escolhida

Trinta segundos é muito tempo de tela. Escreva a progressão na ordem em que ela deve acontecer, ou o modelo vai segurar uma única ideia por meio minuto.

  • Abra com o cenário, traga o sujeito, depois o movimento
  • Nomeie o que muda com o tempo: luz, clima, distância, velocidade
  • Durações mais curtas (5-10s) combinam com uma única ação contínua

Exemplo

"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera slowly settles on a cup of coffee going cold."

Escreva o som, não só a imagem

O áudio é gerado por padrão, então tudo o que você deixar de dizer será inventado para você. Uma ou duas linhas de direção sonora costumam bastar para manter o tom certo.

  • Nomeie a ambiência: chuva no vidro, trânsito distante, ruído de sala
  • Nomeie os sons que acompanham o movimento: passos, motor, vento
  • Pedir silêncio é uma direção válida — diga se quiser algo esparso
  • Anexe áudio de referência quando já tiver um tom em mente

Exemplo

"Sound: steady rain on a tin roof, an occasional low roll of thunder in the distance, no music."

Troque palavras de elogio por fatos visuais

Deslumbrante, épico e cinemático não dizem nada ao modelo. Materiais, cores, direção da luz e verbos fortes dizem.

  • Pule: deslumbrante, épico, de tirar o fôlego, lindíssimo, obra-prima
  • Use verbos com força: bate, desliza, incendeia, chicoteia
  • Nomeie a fonte de luz e a hora do dia

Exemplo

"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."

Escolha duração, proporção e resolução logo no início

O Wan 3.0 oferece 5, 10, 15, 20, 25 e 30 segundos, cinco proporções e três resoluções. Decidir antes de gerar economiza créditos e mantém a composição certa.

  • 16:9 e 4:3 para paisagem, 9:16 e 3:4 para vertical, 1:1 para feeds
  • Rascunhe em 480P (3 créditos por segundo), finalize em 720P (6) ou 1080P (12)
  • Escreva para o quadro que você escolheu — o vertical pede o sujeito perto e centralizado
  • A duração é fixa em 5, 10, 15, 20, 25 ou 30 segundos — arredonde seu storyboard para uma delas

Exemplo

"A 15-second 9:16 vertical clip: a barista pulling an espresso shot, steam rising into warm café light, shallow depth of field."

Perguntas frequentes









Comece hoje sua jornada criativa com IA

Junte-se ao OVOV para gerar imagens, vídeos, música e voz com IA—liberte uma criatividade sem limites.
Cadastre-se agora e receba 10 créditos grátis imediatamente. Sem esperas, comece a criar já.