A Black Forest Labs — o time por trás dos modelos de imagem FLUX — construiu um modelo de vídeo. Na OVOV ele renderiza de 5 a 20 segundos em HD ou FHD, escreve o próprio áudio sincronizado e deixa você fixar até dez quadros-chave ao longo da linha do tempo, em vez de se contentar com um primeiro e um último quadro.
Gerações reais dos nossos modelos de vídeo — Veo 3.1, Kling e Seedance. Passe o mouse sobre um clipe para reproduzir, clique no ícone de alto-falante para ouvir o áudio.
Passe o mouse para reproduzir · Clique no alto-falante para ativar o som
Gerações reais dos nossos modelos de vídeo — Veo 3.1, Kling e Seedance. Passe o mouse sobre um clipe para reproduzir, clique no ícone de alto-falante para ouvir o áudio.
Mundo alienígena fantástico
Anúncio de perfume de luxo
Teaser de lançamento
Comercial de viagem Maldivas
Duelo wuxia oriental
Cena de filme de corrida
Nave espacial às estrelas
Golden Retriever e borboletas
Chef de sushi em ação
Vestido vermelho no penhasco
Duelo à meia-noite
Vlog selfie portátil
Close-up de comida irresistível
Dança de rua urbana
Anúncio de batom de luxo
Até dez quadros-chave ordenados, um nível FHD, vinte segundos de pista e uma trilha sonora escrita na mesma passada — do time que fez os modelos de imagem FLUX.
Envie uma imagem e ela vira o quadro inicial. Envie duas e elas viram o primeiro e o último quadro. Envie até dez e os quadros extras são distribuídos uniformemente ao longo da linha do tempo — você passa a coreografar o clipe inteiro, e não só as suas pontas.
O FLUX 3 Video escreve ambiência, efeitos e som sincronizado com o movimento junto com a imagem, casando com o que está na tela. Você pode desligar o áudio se pretende fazer a trilha por conta própria — o preço é o mesmo dos dois jeitos.
Dois níveis de resolução: HD em cerca de 1280×704 e FHD em cerca de 1920×1088. Esboce a ideia em HD e depois gaste créditos de FHD quando o prompt e os quadros-chave estiverem fechados.
Quatro durações fixas: 5, 10, 15 ou 20 segundos. A maioria dos nossos modelos de vídeo para em 15, então o nível mais alto aqui deixa espaço para uma preparação, uma virada e um desfecho dentro de uma única geração.
16:9, 9:16, 1:1, 4:3, 3:4, mais 21:9 e 2:1 para aberturas cinematográficas e cartelas em letterbox. Defina o quadro antes de gerar — a composição é planejada para a proporção que você escolher.
A Black Forest Labs construiu os modelos de imagem FLUX que já rodam na OVOV. O FLUX 3 Video é o mesmo laboratório entrando em movimento, então os hábitos de prompt que funcionam nas imagens deles se aproveitam aqui.
Escreva o plano, fixe opcionalmente os quadros que ele precisa acertar, e o FLUX 3 Video renderiza imagem e som juntos — não sobra nada para montar depois.
Comece por um prompt sozinho, ou envie de uma a dez imagens de quadro-chave na ordem em que devem aparecer. Depois escolha a duração (5, 10, 15 ou 20 segundos), a proporção e HD ou FHD.
O modelo planeja movimento, iluminação e ritmo ao longo de toda a duração — passando pelos seus quadros-chave na ordem, se você os enviou — e depois renderiza o vídeo com a trilha de áudio correspondente.
Leve o vídeo pronto com o áudio já embutido — sem marca d'água, com direitos comerciais incluídos. Se uma geração falhar ou for recusada pela moderação de conteúdo, seus créditos voltam integralmente na hora.
Quadros-chave ordenados, um nível FHD e duas proporções ultralargas cobrem o trabalho em que o plano precisa cair em imagens específicas em momentos específicos — e ainda soar como alguma coisa.
Quando o clipe precisa passar por imagens que você já tem — um logo, um estado do produto, uma pose de personagem — fixe-as como quadros-chave em ordem e deixe o modelo preencher o movimento entre elas.
Um filme de marca em cerca de 1920×1088, ou uma sequência de abertura em 21:9 que se lê como cinema e não como feed. O som já vem junto, então não há passada de trilha antes de mostrar para alguém.
TikTok, Reels e Shorts em 9:16 ou 3:4, de um gancho de cinco segundos a uma história de vinte, com áudio nativo no lugar de uma trilha musical licenciada.
Estradas litorâneas, chuva na janela, um mercado acordando — planos que precisam de tempo para respirar, mais o vento, a água e o barulho de rua que fazem o lugar parecer real.
O modelo lê o seu prompt e os seus quadros-chave juntos. Estes hábitos mantêm os dois puxando para o mesmo lado em vez de brigarem.
Fixe os quadros que importam e descreva o movimento entre eles
Só texto entrega ao modelo a cena inteira para inventar. Os quadros-chave tiram essa liberdade imagem por imagem. Nenhum dos dois é melhor — eles só pedem prompts diferentes.
Exemplo
"With two keyframes (closed box, open box): "hands lift the flaps in one smooth motion, soft window light, cardboard scrape and a soft thud"."
A quantidade importa tanto quanto o conteúdo. Uma imagem é um ponto de partida. Duas são as pontas de um percurso. Mais do que isso é um cronograma que o modelo tem que cumprir, espaçado uniformemente ao longo da duração escolhida.
Exemplo
"Four keyframes across 20 seconds land at roughly 0s, 6.7s, 13.3s and 20s — so pick images that make sense five to seven seconds apart."
Vinte segundos é muito tempo para sustentar uma única ideia. Escreva a progressão na ordem em que ela deve acontecer e o modelo terá em que gastar a duração.
Exemplo
"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera settles on a cup of coffee going cold."
O áudio é gerado por padrão e sincronizado com a ação, então tudo o que você deixar de dizer será inventado para você. Uma ou duas linhas de direção sonora costumam bastar para manter o tom certo.
Exemplo
"Sound: steady rain on a tin roof, a low roll of thunder in the distance, no music."
Deslumbrante, épico e cinemático não dizem nada ao modelo. Materiais, cores, direção da luz e verbos fortes dizem — a mesma disciplina que funciona nos modelos de imagem FLUX.
Exemplo
"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."
O FLUX 3 Video oferece 5, 10, 15 e 20 segundos, sete proporções e dois níveis de resolução. Decidir antes de gerar economiza créditos e mantém a composição certa.
Exemplo
"A 10-second 21:9 opener: headlights sweeping across a wet runway at dusk, low camera, tyre spray catching the light."