阿里通义万相 Wan 3.0,现已入驻 OVOV。可以从一段提示词开始,可以从首尾帧开始,也可以从一段配上你自己的参考图、参考视频与参考音频的提示词开始——480P、720P 或 1080P,5 到 30 秒,自带原生音轨。
来自我们视频模型的真实生成——Veo 3.1、Kling 与 Seedance。悬停任意片段即可播放,点击扬声器图标聆听音频。
悬停播放 · 点击扬声器取消静音
来自我们视频模型的真实生成——Veo 3.1、Kling 与 Seedance。悬停任意片段即可播放,点击扬声器图标聆听音频。
外星奇幻世界
奢华香水广告
产品发布会宣传片
马尔代夫旅游广告
东方武侠顶峰对决
好莱坞赛车电影镜头
飞船驶向深蓝宇宙
金毛小狗追蝴蝶
寿司师傅精心制作
红裙女子悬崖漫步
深夜高手对决
手持自拍 Vlog
爆汁美食特写
街舞高速动作
奢华口红广告
一个模型同时接收文本、关键帧或你自己的素材,最高渲染到 1080P,最长跑到半分钟,还会在生成画面的同时写好自己的音轨。
在文生视频中,最多可附 10 张参考图、最多 5 段参考视频(合计 15 秒)以及最多 5 段参考音频(合计 15 秒)。Wan 3.0 会从你自己的素材里提取角色、风格、运动与基调,而不是靠猜。
给它一张起始图,也可以再给一张结束图,Wan 3.0 会渲染两者之间的运动。做产品揭示、变形过程与前后对比叙事,这是最直的一条路。
三档分辨率,包含真正的 1080P 输出。先用 480P 花几个积分把想法打磨出来,再用 1080P 渲染真正要发布的那一版。
六档固定时长:5、10、15、20、25 或 30 秒。五秒试片花不了几个积分;完整的 30 秒广告片也能装进一次生成。
Wan 3.0 在渲染画面的同时写好环境音、音效与匹配动作的声音。开关在你手上,而且关掉音频并不会改变价格。
16:9、9:16、1:1、4:3 与 3:4。积分按秒计费——480P 每秒 3 积分,720P 每秒 6 积分,1080P 每秒 12 积分——生成失败全额退还。
按你手上已有的东西选择输入方式。Wan 3.0 在同一次生成中处理画面与声音,事后没有任何需要拼接的东西。
只写一段提示词,或上传一张首帧(也可以再加一张尾帧),或在提示词之外附上参考图、参考视频与参考音频。然后设定时长、宽高比与分辨率。
模型会先规划整段时长内的运动、光影与节奏,再渲染出视频与相配的音轨。多数任务在 1 到 5 分钟内完成;更长的片段耗时更久。
拿到自带音频的成片——无水印,附商用授权。若生成失败,积分会立即退回。
三种输入方式加上 1080P 档位,覆盖面很广:成品广告、竖屏社媒短片、基于你自己素材的连贯创作,以及长篇氛围影片。
一支全高清的 30 秒广告,一次生成完成。铺垫、演示、卖点与落板全部装进一次生成,声音也一并搞定。
TikTok、Reels 与 Shorts 的 9:16 竖屏,从 5 秒钩子到 30 秒故事。音频随片附带,事后无需再补一遍配乐。
给每次生成都附上同一组参考图、参考视频与参考音频,角色、产品与基调就能在片段之间延续下去,而不会越跑越偏。
航拍扫掠、海岸公路与街头漫步,这些镜头需要时间呼吸——还有风声、水声与城市声把地方感卖出去。
Wan 3.0 支持最长 20,000 字符的提示词,远超多数片段所需的篇幅。下面这些习惯,能把篇幅花在模型真正会照做的地方。
先点名你的素材,再描述成片的样子
三种模式需要的提示词并不一样。文生视频得靠文字撑起整个场景;首尾帧模式构图已经定了,提示词要写的是运动;参考模式要写的则是从你附上的素材里借什么。
示例
"First frame: a sealed cardboard box on a table. Last frame: the box open with a camera inside. Prompt: "hands lift the flaps in one smooth motion, soft window light"."
在参考模式里,你可以直接指着素材说——图 1、视频 1、音频 1——让模型知道哪份素材管镜头的哪一部分,而不是把所有素材糊成一团。
示例
"Keep the woman from image 1 and the jacket from image 2, follow the slow dolly-in of video 1, and match the room tone of audio 1."
30 秒是一段很长的画面时间。按发生顺序把推进过程写清楚,否则模型会把一个想法拖满半分钟。
示例
"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera slowly settles on a cup of coffee going cold."
音频默认生成,所以你没写的部分会被模型自行发挥。一两句声音方向的描述,通常就足以让它不跑偏。
示例
"Sound: steady rain on a tin roof, an occasional low roll of thunder in the distance, no music."
「惊艳」「史诗」「电影感」什么都没告诉模型。材质、颜色、光线方向和有力的动词才有用。
示例
"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."
Wan 3.0 提供 5、10、15、20、25 和 30 秒、5 种宽高比与三档分辨率。生成前就定下来,既省积分又不会构图出错。
示例
"A 15-second 9:16 vertical clip: a barista pulling an espresso shot, steam rising into warm café light, shallow depth of field."