Tongyi Wanxiang Wan 3.0 от Alibaba — теперь на OVOV. Начните с промпта, с первого и последнего кадра или с промпта, подкреплённого вашими референсными изображениями, видео и аудио — в 480P, 720P или 1080P, от 5 до 30 секунд, с нативной звуковой дорожкой.
Реальные генерации наших видеомоделей — Veo 3.1, Kling и Seedance. Наведите курсор на клип для воспроизведения, кликните по значку динамика, чтобы услышать звук.
Наведите для воспроизведения · Кликните по динамику, чтобы включить звук
Реальные генерации наших видеомоделей — Veo 3.1, Kling и Seedance. Наведите курсор на клип для воспроизведения, кликните по значку динамика, чтобы услышать звук.
Инопланетный фэнтези-мир
Реклама премиум-парфюма
Тизер запуска продукта
Реклама Мальдив
Восточная дуэль уся
Голливудский гоночный фильм
Корабль к звёздам
Золотистый ретривер и бабочки
Мастер суши за работой
Красное платье на скалах
Полуночная дуэль
Ручной селфи-влог
Соблазнительный крупный план еды
Уличный танец
Реклама премиум-помады
Одна модель принимает текст, ключевые кадры или ваш собственный материал, рендерит до 1080P, тянет до полуминуты и попутно пишет собственную звуковую дорожку.
В режиме «текст в видео» можно приложить до 10 референсных изображений, до 5 референсных видео (15 секунд суммарно) и до 5 референсных аудиодорожек (15 секунд суммарно). Wan 3.0 берёт персонажа, стиль, движение и тон из вашего материала, а не угадывает их.
Дайте модели стартовое изображение и, при желании, финальное — и Wan 3.0 отрендерит движение между ними. Самый прямой путь к эффектным показам продукта, трансформациям и сюжетам «до и после».
Три уровня разрешения, включая настоящий вывод 1080P. Набросайте идею в 480P за пару кредитов, а потом отрендерите в 1080P ту версию, которую действительно выпустите.
Шесть фиксированных длительностей: 5, 10, 15, 20, 25 или 30 секунд. Пятисекундный тест стоит копейки, а полноценный 30-секундный ролик умещается в одну генерацию.
Wan 3.0 пишет эмбиенс, эффекты и совпадающий с движением звук одновременно с картинкой. Переключатель в ваших руках, и отключение звука не меняет цену.
16:9, 9:16, 1:1, 4:3 и 3:4. Кредиты списываются за секунду — 3 в 480P, 6 в 720P, 12 в 1080P — а за неудачную генерацию кредиты возвращаются полностью.
Выберите вход под то, что у вас уже есть. Wan 3.0 делает изображение и звук в одном проходе, поэтому потом ничего собирать не нужно.
Напишите один только промпт, загрузите первый кадр (и, опционально, последний) или приложите референсные изображения, видео и аудио вдобавок к промпту. Затем задайте длительность, соотношение сторон и разрешение.
Модель планирует движение, свет и ритм на всю длительность, а затем рендерит видео вместе с подходящей звуковой дорожкой. Большинство задач укладывается в одну-пять минут; длинные клипы занимают больше времени.
Забирайте готовое видео со встроенным звуком — без водяных знаков, с коммерческими правами. Если генерация не удалась, кредиты возвращаются сразу.
Три режима входа и уровень 1080P закрывают многое: готовые рекламные ролики, вертикальные нарезки для соцсетей, работу на консистентность поверх вашего материала и длинные атмосферные фильмы.
30-секундный рекламный ролик в Full HD, отрендеренный за один проход. Завязка, демонстрация, выгода и финальный кадр умещаются в одну генерацию, вместе со звуком.
TikTok, Reels и Shorts в 9:16 — от 5-секундного хука до 30-секундной истории. Звук приходит сразу, поэтому отдельный проход для музыки не нужен.
Прикладывайте одни и те же референсные изображения, видео и аудио к каждой генерации — и персонаж, продукт и тон будут переходить из клипа в клип, а не расползаться.
Аэросъёмка, поездки вдоль побережья и прогулки по улицам, которым нужно время, чтобы раскрыться, — плюс ветер, вода и городской звук, которые и продают место.
Wan 3.0 принимает промпты до 20 000 символов — это гораздо больше, чем нужно большинству клипов. Эти привычки тратят место на то, на что модель действительно реагирует.
Назовите свои материалы, а затем опишите готовый кадр
Три режима требуют разных промптов. «Текст в видео» должен нести всю сцену словами. У «первого и последнего кадра» композиция уже есть, поэтому промпт — про движение. Режим референсов — про то, что позаимствовать из приложенного материала.
Пример
"First frame: a sealed cardboard box on a table. Last frame: the box open with a camera inside. Prompt: "hands lift the flaps in one smooth motion, soft window light"."
В режиме референсов можно указывать на материал напрямую — изображение 1, видео 1, аудио 1 — чтобы модель знала, какой файл отвечает за какую часть кадра, а не смешивала всё в одно.
Пример
"Keep the woman from image 1 and the jacket from image 2, follow the slow dolly-in of video 1, and match the room tone of audio 1."
Тридцать секунд — это много экранного времени. Пишите развитие в том порядке, в котором оно должно происходить, иначе модель будет держать одну идею полминуты.
Пример
"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera slowly settles on a cup of coffee going cold."
Звук генерируется по умолчанию, поэтому всё, что вы не проговорите, модель придумает за вас. Одной-двух строк звуковой режиссуры обычно достаточно, чтобы попасть в характер.
Пример
"Sound: steady rain on a tin roof, an occasional low roll of thunder in the distance, no music."
«Потрясающий», «эпичный» и «кинематографичный» не говорят модели ничего. А материалы, цвета, направление света и сильные глаголы — говорят.
Пример
"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."
Wan 3.0 предлагает 5, 10, 15, 20, 25 и 30 секунд, пять соотношений сторон и три разрешения. Решение до генерации экономит кредиты и сохраняет правильную композицию.
Пример
"A 15-second 9:16 vertical clip: a barista pulling an espresso shot, steam rising into warm café light, shallow depth of field."