El Tongyi Wanxiang Wan 3.0 de Alibaba, en OVOV. Empieza desde un prompt, desde un primer y un último frame, o desde un prompt respaldado por tus propias imágenes, videos y audio de referencia — en 480P, 720P o 1080P, de 5 a 30 segundos, con banda sonora nativa.
Generaciones reales de nuestros modelos de vídeo: Veo 3.1, Kling y Seedance. Pasa el cursor sobre un clip para reproducirlo y haz clic en el icono del altavoz para oír el audio.
Pasa el cursor para reproducir · Haz clic en el altavoz para activar el sonido
Generaciones reales de nuestros modelos de vídeo: Veo 3.1, Kling y Seedance. Pasa el cursor sobre un clip para reproducirlo y haz clic en el icono del altavoz para oír el audio.
Mundo alienígena fantástico
Anuncio de perfume de lujo
Teaser de lanzamiento
Anuncio de viaje a Maldivas
Duelo wuxia oriental
Escena de película de carreras
Nave espacial hacia las estrellas
Golden Retriever y mariposas
Chef de sushi en acción
Mujer de vestido rojo en el acantilado
Duelo a medianoche
Vlog selfie en mano
Primer plano de comida irresistible
Danza urbana callejera
Anuncio de labial de lujo
Un solo modelo que acepta texto, keyframes o tu propio material, renderiza hasta 1080P, aguanta medio minuto y escribe su propia banda sonora mientras trabaja.
En texto a video puedes adjuntar hasta 10 imágenes de referencia, hasta 5 videos de referencia (15 segundos en total) y hasta 5 pistas de audio de referencia (15 segundos en total). Wan 3.0 saca personaje, estilo, movimiento y tono de tu propio material en lugar de adivinar.
Dale una imagen de inicio y, opcionalmente, una de final, y Wan 3.0 renderiza el movimiento entre ambas. La vía más directa a los reveals de producto, las transformaciones y los arcos de antes y después.
Tres niveles de resolución, incluida una salida 1080P de verdad. Desbasta la idea en 480P por unos pocos créditos y renderiza en 1080P la versión que de verdad vas a entregar.
Seis duraciones fijas: 5, 10, 15, 20, 25 o 30 segundos. Una prueba de cinco segundos cuesta calderilla; un spot completo de 30 segundos cabe en una sola generación.
Wan 3.0 escribe ambiente, efectos y sonido sincronizado con el movimiento junto a la imagen. El interruptor es tuyo, y apagar el audio no cambia el precio.
16:9, 9:16, 1:1, 4:3 y 3:4. Los créditos se cobran por segundo — 3 en 480P, 6 en 720P, 12 en 1080P — y una generación fallida se reembolsa íntegramente.
Elige la entrada que encaje con lo que ya tienes. Wan 3.0 resuelve imagen y sonido en la misma pasada, así que después no hay nada que montar.
Escribe solo un prompt, sube un primer frame (y opcionalmente uno último) o adjunta imágenes, videos y audio de referencia junto a tu prompt. Luego fija la duración, la relación de aspecto y la resolución.
El modelo planifica movimiento, iluminación y ritmo a lo largo de toda la duración, y luego renderiza el video con su pista de audio a juego. La mayoría de los trabajos salen en uno a cinco minutos; los clips más largos tardan más.
Llévate el video terminado con el audio integrado — sin marca de agua y con derechos comerciales incluidos. Si una generación falla, tus créditos vuelven de inmediato.
Tres modos de entrada y un nivel 1080P cubren mucho terreno: anuncios acabados, cortes verticales para redes, trabajo de continuidad construido sobre tu propio material y películas largas de atmósfera.
Un anuncio de 30 segundos en full HD, renderizado en una sola pasada. Planteamiento, demostración, beneficio y cierre caben en una generación, con sonido incluido.
TikTok, Reels y Shorts en 9:16, desde un hook de 5 segundos hasta una historia de 30. El audio viene incorporado, así que nada necesita una pasada de banda sonora después.
Adjunta las mismas imágenes, videos y audio de referencia a cada generación y el personaje, el producto y el tono pasarán de un clip a otro en vez de irse a la deriva.
Barridos aéreos, carreteras de costa y paseos a pie de calle que necesitan tiempo para respirar — más el viento, el agua y el sonido de la ciudad que venden el lugar.
Wan 3.0 acepta prompts de hasta 20.000 caracteres, mucho más espacio del que necesita la mayoría de los clips. Estos hábitos gastan ese espacio en lo que el modelo realmente atiende.
Nombra tus materiales y luego describe el plano terminado
Los tres modos piden prompts distintos. El texto a video tiene que sostener toda la escena con palabras. El de primer y último frame ya tiene la composición, así que el prompt va del movimiento. El modo de referencia va de qué tomar prestado del material que has adjuntado.
Ejemplo
"First frame: a sealed cardboard box on a table. Last frame: the box open with a camera inside. Prompt: "hands lift the flaps in one smooth motion, soft window light"."
En el modo de referencia puedes señalar el material directamente — imagen 1, video 1, audio 1 — para que el modelo sepa qué elemento gobierna cada parte del plano en vez de mezclarlo todo.
Ejemplo
"Keep the woman from image 1 and the jacket from image 2, follow the slow dolly-in of video 1, and match the room tone of audio 1."
Treinta segundos son mucho tiempo de pantalla. Escribe la progresión en el orden en que debe ocurrir o el modelo sostendrá una sola idea durante medio minuto.
Ejemplo
"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera slowly settles on a cup of coffee going cold."
El audio se genera por defecto, así que todo lo que no digas se inventará por ti. Una o dos líneas de dirección sonora suelen bastar para mantener el tono.
Ejemplo
"Sound: steady rain on a tin roof, an occasional low roll of thunder in the distance, no music."
Impresionante, épico y cinematográfico no le dicen nada al modelo. Los materiales, los colores, la dirección de la luz y los verbos fuertes sí.
Ejemplo
"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."
Wan 3.0 ofrece 5, 10, 15, 20, 25 y 30 segundos, cinco relaciones de aspecto y tres resoluciones. Decidir antes de generar ahorra créditos y mantiene bien la composición.
Ejemplo
"A 15-second 9:16 vertical clip: a barista pulling an espresso shot, steam rising into warm café light, shallow depth of field."