От Alibaba Tongyi Wanxiang

Wan 3.0 · Одна видеомодель, три способа начать

Tongyi Wanxiang Wan 3.0 от Alibaba — теперь на OVOV. Начните с промпта, с первого и последнего кадра или с промпта, подкреплённого вашими референсными изображениями, видео и аудио — в 480P, 720P или 1080P, от 5 до 30 секунд, с нативной звуковой дорожкой.

Длительность
Формат
Разрешение

Примеры ИИ-видео на OVOV

Реальные генерации наших видеомоделей — Veo 3.1, Kling и Seedance. Наведите курсор на клип для воспроизведения, кликните по значку динамика, чтобы услышать звук.

Наведите для воспроизведения · Кликните по динамику, чтобы включить звук

Примеры ИИ-видео на OVOV

Реальные генерации наших видеомоделей — Veo 3.1, Kling и Seedance. Наведите курсор на клип для воспроизведения, кликните по значку динамика, чтобы услышать звук.

Кино

Инопланетный фэнтези-мир

Аромат

Реклама премиум-парфюма

Продукт

Тизер запуска продукта

Путешествия

Реклама Мальдив

Экшн

Восточная дуэль уся

Фильм

Голливудский гоночный фильм

Фантастика

Корабль к звёздам

Стиль

Золотистый ретривер и бабочки

Еда

Мастер суши за работой

Мода

Красное платье на скалах

Трейлер

Полуночная дуэль

Влог

Ручной селфи-влог

Еда

Соблазнительный крупный план еды

Танец

Уличный танец

Макияж

Реклама премиум-помады

Почему на Wan 3.0 стоит взглянуть

Одна модель принимает текст, ключевые кадры или ваш собственный материал, рендерит до 1080P, тянет до полуминуты и попутно пишет собственную звуковую дорожку.

Мультимодальные референсы

В режиме «текст в видео» можно приложить до 10 референсных изображений, до 5 референсных видео (15 секунд суммарно) и до 5 референсных аудиодорожек (15 секунд суммарно). Wan 3.0 берёт персонажа, стиль, движение и тон из вашего материала, а не угадывает их.

Контроль первого и последнего кадра

Дайте модели стартовое изображение и, при желании, финальное — и Wan 3.0 отрендерит движение между ними. Самый прямой путь к эффектным показам продукта, трансформациям и сюжетам «до и после».

480P, 720P и 1080P

Три уровня разрешения, включая настоящий вывод 1080P. Набросайте идею в 480P за пару кредитов, а потом отрендерите в 1080P ту версию, которую действительно выпустите.

От 5 до 30 секунд

Шесть фиксированных длительностей: 5, 10, 15, 20, 25 или 30 секунд. Пятисекундный тест стоит копейки, а полноценный 30-секундный ролик умещается в одну генерацию.

Нативный звук, включён по умолчанию

Wan 3.0 пишет эмбиенс, эффекты и совпадающий с движением звук одновременно с картинкой. Переключатель в ваших руках, и отключение звука не меняет цену.

Пять соотношений сторон, оплата по секундам

16:9, 9:16, 1:1, 4:3 и 3:4. Кредиты списываются за секунду — 3 в 480P, 6 в 720P, 12 в 1080P — а за неудачную генерацию кредиты возвращаются полностью.

От промпта, ключевых кадров или своего материала до готового клипа

Выберите вход под то, что у вас уже есть. Wan 3.0 делает изображение и звук в одном проходе, поэтому потом ничего собирать не нужно.

1

Выберите способ начать

Напишите один только промпт, загрузите первый кадр (и, опционально, последний) или приложите референсные изображения, видео и аудио вдобавок к промпту. Затем задайте длительность, соотношение сторон и разрешение.

2

Wan 3.0 рендерит изображение и звук

Модель планирует движение, свет и ритм на всю длительность, а затем рендерит видео вместе с подходящей звуковой дорожкой. Большинство задач укладывается в одну-пять минут; длинные клипы занимают больше времени.

3

Скачайте и используйте

Забирайте готовое видео со встроенным звуком — без водяных знаков, с коммерческими правами. Если генерация не удалась, кредиты возвращаются сразу.

Для чего хорош Wan 3.0

Три режима входа и уровень 1080P закрывают многое: готовые рекламные ролики, вертикальные нарезки для соцсетей, работу на консистентность поверх вашего материала и длинные атмосферные фильмы.

Ролики о продукте и бренде в 1080P

30-секундный рекламный ролик в Full HD, отрендеренный за один проход. Завязка, демонстрация, выгода и финальный кадр умещаются в одну генерацию, вместе со звуком.

  • Вывод 1080P для пре-ролла, лендингов и сдачи клиенту
  • 16:9 для широкого экрана, 4:3 для классического эфирного кадра
  • Звук продукта и эмбиенс генерируются вместе с изображением

Вертикальные ролики для соцсетей

TikTok, Reels и Shorts в 9:16 — от 5-секундного хука до 30-секундной истории. Звук приходит сразу, поэтому отдельный проход для музыки не нужен.

  • Вертикальные 9:16 или 1:1 для квадратных постов в ленте
  • Черновик в 480P по 3 кредита за секунду, публикация в 720P или 1080P
  • Нативный звук вместо лицензированного музыкального трека

Консистентность внутри серии

Прикладывайте одни и те же референсные изображения, видео и аудио к каждой генерации — и персонаж, продукт и тон будут переходить из клипа в клип, а не расползаться.

  • До 10 референсных изображений, чтобы удержать персонажа и стиль
  • До 5 референсных видео для движения и поведения камеры
  • До 5 референсных аудиодорожек, чтобы звук остался в одном семействе

Тревел-ролики и атмосферные фильмы

Аэросъёмка, поездки вдоль побережья и прогулки по улицам, которым нужно время, чтобы раскрыться, — плюс ветер, вода и городской звук, которые и продают место.

  • Долгие плавные движения камеры, которым нужны все 30 секунд
  • Звук окружения рендерится вместе с картинкой
  • 1080P для заглавных видео в верхней части страницы

Гайд по написанию промптов для Wan 3.0

Wan 3.0 принимает промпты до 20 000 символов — это гораздо больше, чем нужно большинству клипов. Эти привычки тратят место на то, на что модель действительно реагирует.

Назовите свои материалы, а затем опишите готовый кадр

Выберите режим входа до того, как писать

Три режима требуют разных промптов. «Текст в видео» должен нести всю сцену словами. У «первого и последнего кадра» композиция уже есть, поэтому промпт — про движение. Режим референсов — про то, что позаимствовать из приложенного материала.

  • Только текст: опишите обстановку, объект, камеру и звук с нуля
  • Первый и последний кадр: описывайте движение между ними, а не сами кадры
  • Референсы (прикладываются в «текст в видео»): скажите, что даёт каждый файл — лицо, одежду, движение камеры, тон

Пример

"First frame: a sealed cardboard box on a table. Last frame: the box open with a camera inside. Prompt: "hands lift the flaps in one smooth motion, soft window light"."

Обращайтесь к референсам по номеру

В режиме референсов можно указывать на материал напрямую — изображение 1, видео 1, аудио 1 — чтобы модель знала, какой файл отвечает за какую часть кадра, а не смешивала всё в одно.

  • До 10 референсных изображений, 5 референсных видео и 5 референсных аудиодорожек
  • Референсное видео суммарно 15 секунд; референсное аудио суммарно 15 секунд
  • Дайте каждому файлу одну задачу: личность — с одного изображения, движение камеры — с одного видео

Пример

"Keep the woman from image 1 and the jacket from image 2, follow the slow dolly-in of video 1, and match the room tone of audio 1."

Продумайте арку на выбранную длительность

Тридцать секунд — это много экранного времени. Пишите развитие в том порядке, в котором оно должно происходить, иначе модель будет держать одну идею полминуты.

  • Начните с обстановки, введите объект, затем движение
  • Назовите, что меняется со временем: свет, погода, расстояние, скорость
  • Короткие длительности (5-10 с) хорошо подходят одному непрерывному действию

Пример

"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera slowly settles on a cup of coffee going cold."

Пишите звук, а не только картинку

Звук генерируется по умолчанию, поэтому всё, что вы не проговорите, модель придумает за вас. Одной-двух строк звуковой режиссуры обычно достаточно, чтобы попасть в характер.

  • Назовите эмбиенс: дождь по стеклу, далёкий шум машин, тон комнаты
  • Назовите звуки, совпадающие с движением: шаги, двигатель, ветер
  • Просьба о тишине — тоже режиссура: скажите, если хотите разреженный звук
  • Приложите референсное аудио, если тон уже у вас в голове

Пример

"Sound: steady rain on a tin roof, an occasional low roll of thunder in the distance, no music."

Меняйте хвалебные слова на визуальные факты

«Потрясающий», «эпичный» и «кинематографичный» не говорят модели ничего. А материалы, цвета, направление света и сильные глаголы — говорят.

  • Пропустите: потрясающий, эпичный, захватывающий дух, великолепный, шедевр
  • Используйте сильные глаголы: врезается, дрейфует, вспыхивает, хлещет
  • Назовите источник света и время суток

Пример

"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."

Выбирайте длину, формат и разрешение заранее

Wan 3.0 предлагает 5, 10, 15, 20, 25 и 30 секунд, пять соотношений сторон и три разрешения. Решение до генерации экономит кредиты и сохраняет правильную композицию.

  • 16:9 и 4:3 для горизонтали, 9:16 и 3:4 для вертикали, 1:1 для лент
  • Черновики в 480P (3 кредита за секунду), финал в 720P (6) или 1080P (12)
  • Пишите под выбранный кадр — в вертикали объект нужен ближе и по центру
  • Длительность фиксированная: 5, 10, 15, 20, 25 или 30 секунд — округлите раскадровку до одной из них

Пример

"A 15-second 9:16 vertical clip: a barista pulling an espresso shot, steam rising into warm café light, shallow depth of field."

Часто задаваемые вопросы









Начните своё творческое путешествие с ИИ сегодня

Присоединяйтесь к OVOV и создавайте изображения, видео, музыку и голос с помощью ИИ — раскройте безграничное творчество.
Зарегистрируйтесь сейчас и получите 10 бесплатных кредитов мгновенно. Без ожидания — начните творить сразу.