阿里通義萬相 Wan 3.0,現已入駐 OVOV。可以從一段提示詞開始,可以從首尾幀開始,也可以從一段配上你自己的參考圖、參考影片與參考音訊的提示詞開始——480P、720P 或 1080P,5 到 30 秒,自帶原生音軌。
來自我們影片模型的真實生成——Veo 3.1、Kling 與 Seedance。游標懸停任一片段即可播放,點擊喇叭圖示聆聽音訊。
懸停播放 · 點擊喇叭取消靜音
來自我們影片模型的真實生成——Veo 3.1、Kling 與 Seedance。游標懸停任一片段即可播放,點擊喇叭圖示聆聽音訊。
外星奇幻世界
奢華香水廣告
產品發布會宣傳片
馬爾代夫旅遊廣告
東方武俠頂峰對決
好萊塢賽車電影鏡頭
飛船駛向深藍宇宙
金毛小狗追蝴蝶
壽司師傅精心製作
紅裙女子懸崖漫步
深夜高手對決
手持自拍 Vlog
爆汁美食特寫
街舞高速動作
奢華口紅廣告
一個模型同時接收文字、關鍵幀或你自己的素材,最高渲染到 1080P,最長跑到半分鐘,還會在生成畫面的同時寫好自己的音軌。
在文生影片中,最多可附 10 張參考圖、最多 5 段參考影片(合計 15 秒)以及最多 5 段參考音訊(合計 15 秒)。Wan 3.0 會從你自己的素材裡提取角色、風格、運動與基調,而不是靠猜。
給它一張起始圖,也可以再給一張結束圖,Wan 3.0 會渲染兩者之間的運動。做產品揭幕、變形過程與前後對比敘事,這是最直接的一條路。
三檔解析度,包含真正的 1080P 輸出。先用 480P 花幾點點數把想法打磨出來,再用 1080P 渲染真正要發布的那一版。
六檔固定長度:5、10、15、20、25 或 30 秒。五秒試片花不了幾點點數;完整的 30 秒廣告片也能裝進一次生成。
Wan 3.0 在渲染畫面的同時就寫好環境音、音效與貼合動作的聲音。開關在你手上,而且關掉音訊並不會改變價格。
16:9、9:16、1:1、4:3 與 3:4。點數按秒計費——480P 每秒 3 點數,720P 每秒 6 點數,1080P 每秒 12 點數——生成失敗全額退還。
按你手上已有的東西選擇輸入方式。Wan 3.0 在同一次生成中處理畫面與聲音,事後沒有任何需要拼接的東西。
只寫一段提示詞,或上傳一張首幀(也可以再加一張尾幀),或在提示詞之外附上參考圖、參考影片與參考音訊。然後設定長度、比例與解析度。
模型會先規劃整段長度內的運動、光影與節奏,再渲染出影片與相配的音軌。多數任務在 1 到 5 分鐘內完成;更長的片段耗時更久。
拿到自帶音訊的成片——無浮水印,附商用授權。若生成失敗,點數會立刻退回。
三種輸入方式加上 1080P 檔位,涵蓋面很廣:成品廣告、直式社群短片、以你自己素材為底的連貫創作,以及長篇氛圍影片。
一支全高清的 30 秒廣告,一次生成完成。鋪陳、實演、賣點與收尾全部裝進一次生成,聲音也一併搞定。
TikTok、Reels 與 Shorts 的 9:16 直式,從 5 秒鉤子到 30 秒故事。音訊隨片附帶,事後不必再補一次配樂。
每次生成都附上同一組參考圖、參考影片與參考音訊,角色、產品與基調就能在片段之間延續下去,而不會越跑越偏。
空拍掃掠、海岸公路與街頭漫步,這些鏡頭需要時間呼吸——還有風聲、水聲與城市聲把地方感賣出去。
Wan 3.0 支援最長 20,000 字元的提示詞,遠超多數片段所需的篇幅。下面這些習慣,能把篇幅花在模型真正會照做的地方。
先點名你的素材,再描述成片的樣子
三種模式需要的提示詞並不一樣。文生影片得靠文字撐起整個場景;首尾幀模式構圖已經定了,提示詞要寫的是運動;參考模式要寫的則是從你附上的素材裡借什麼。
範例
"First frame: a sealed cardboard box on a table. Last frame: the box open with a camera inside. Prompt: "hands lift the flaps in one smooth motion, soft window light"."
在參考模式裡,你可以直接指著素材說——圖 1、影片 1、音訊 1——讓模型知道哪份素材管鏡頭的哪一部分,而不是把所有素材糊成一團。
範例
"Keep the woman from image 1 and the jacket from image 2, follow the slow dolly-in of video 1, and match the room tone of audio 1."
30 秒是一段很長的畫面時間。按發生順序把推進過程寫清楚,否則模型會把一個想法拖滿半分鐘。
範例
"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera slowly settles on a cup of coffee going cold."
音訊預設會生成,所以你沒寫的部分會被模型自行發揮。一兩句聲音方向的描述,通常就足以讓它不走偏。
範例
"Sound: steady rain on a tin roof, an occasional low roll of thunder in the distance, no music."
「驚豔」「史詩」「電影感」什麼都沒告訴模型。材質、顏色、光線方向與有力的動詞才有用。
範例
"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."
Wan 3.0 提供 5、10、15、20、25 和 30 秒、5 種比例與三檔解析度。生成前就定下來,既省點數又不會構圖出錯。
範例
"A 15-second 9:16 vertical clip: a barista pulling an espresso shot, steam rising into warm café light, shallow depth of field."