Black Forest Labs——做出 FLUX 影像模型的那支團隊——做了一個影片模型。在 OVOV 上,它渲染 5 到 20 秒、HD 或 FHD 的片段,自己寫好同步的音軌,還讓你沿時間軸釘下最多十張關鍵幀,而不是只能將就一個首幀加一個尾幀。
來自我們影片模型的真實生成——Veo 3.1、Kling 與 Seedance。游標懸停任一片段即可播放,點擊喇叭圖示聆聽音訊。
懸停播放 · 點擊喇叭取消靜音
來自我們影片模型的真實生成——Veo 3.1、Kling 與 Seedance。游標懸停任一片段即可播放,點擊喇叭圖示聆聽音訊。
外星奇幻世界
奢華香水廣告
產品發布會宣傳片
馬爾代夫旅遊廣告
東方武俠頂峰對決
好萊塢賽車電影鏡頭
飛船駛向深藍宇宙
金毛小狗追蝴蝶
壽司師傅精心製作
紅裙女子懸崖漫步
深夜高手對決
手持自拍 Vlog
爆汁美食特寫
街舞高速動作
奢華口紅廣告
最多十張有序關鍵幀、一檔完整的 FHD、二十秒的長度空間,以及在同一次生成裡寫好的音軌——出自做過 FLUX 影像模型的那支團隊。
上傳一張圖,它就是起始幀。上傳兩張,它們就是首幀與尾幀。最多可以上傳十張,多出來的幀會沿時間軸平均分布——你編排的是整支片子,而不只是它的頭尾。
FLUX 3 Video 在渲染畫面的同時就寫好環境音、音效與貼合動作的聲音,與螢幕上發生的事同步。如果你打算自己配樂,也可以把音訊關掉——但兩種情況價格一樣。
兩檔解析度:HD 約 1280×704,FHD 約 1920×1088。先用 HD 把想法打成草稿,等提示詞與關鍵幀都定下來,再花 FHD 的點數。
四檔固定長度:5、10、15 或 20 秒。我們多數影片模型的上限是 15 秒,所以這裡最高的一檔留了餘裕——鋪陳、轉折與收尾可以裝進一次生成。
16:9、9:16、1:1、4:3、3:4,再加上適合電影感開場與遮幅字卡的 21:9 與 2:1。生成前先定好畫幅——構圖是按你選的比例規劃的。
OVOV 上已經在跑的 FLUX 影像模型,正是 Black Forest Labs 做的。FLUX 3 Video 是同一個實驗室轉向動態影像,所以在他們的靜態圖上管用的提示詞習慣,這裡同樣成立。
把鏡頭寫出來,也可以順手釘上它必須經過的幀,FLUX 3 Video 會把畫面與聲音一起渲染出來——事後沒有任何需要拼接的東西。
可以只從一段提示詞開始,也可以按出現順序上傳 1 到 10 張關鍵幀圖像。然後選擇長度(5、10、15 或 20 秒)、比例與 HD 或 FHD。
模型會先規劃整段長度內的運動、光影與節奏——如果你給了關鍵幀,就依序一一經過它們——再渲染出影片與相配的音軌。
拿到自帶音訊的成片——無浮水印,附商用授權。若生成失敗或被內容審核拒絕,點數會立刻全額退回。
有序關鍵幀、FHD 檔位與兩種超寬比例,涵蓋的是那類必須在特定時刻落到特定畫面上的活——而且成片還得有聲音。
當片子必須經過你手上已有的畫面——一個 logo、一個產品狀態、一個角色姿勢——就依序把它們釘成關鍵幀,讓模型去補中間的運動。
約 1920×1088 的品牌廣告,或者一段讀起來像電影而不像動態消息的 21:9 片頭。聲音隨片附帶,拿給別人看之前不必再補一輪配樂。
TikTok、Reels 與 Shorts 的 9:16 或 3:4,從五秒鉤子到二十秒故事,用原生音訊而不是授權音樂墊底。
海岸公路、雨打窗戶、正在甦醒的市場——這些鏡頭需要時間呼吸,還需要風聲、水聲與街聲把這個地方坐實。
模型會把你的提示詞和關鍵幀放在一起讀。下面這些習慣,能讓兩者朝同一個方向使力,而不是互相打架。
釘住關鍵的幀,描述幀與幀之間的運動
只給文字,整個場景都留給模型去發揮。給了關鍵幀,這份自由就一張圖一張圖被收走。兩者沒有優劣,只是需要的提示詞不一樣。
範例
"With two keyframes (closed box, open box): "hands lift the flaps in one smooth motion, soft window light, cardboard scrape and a soft thud"."
數量和內容一樣重要。一張圖是起點。兩張圖是一段旅程的兩端。再多就是一張模型必須遵守的時間表,沿你選定的長度平均排開。
範例
"四張關鍵幀鋪在 20 秒裡,大約落在 0s、6.7s、13.3s 和 20s——所以要挑那些相隔五到七秒仍然說得通的畫面。"
二十秒,用一個想法撐滿是很長的。按發生順序把推進過程寫清楚,模型才有東西去填這段長度。
範例
"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera settles on a cup of coffee going cold."
音訊預設會生成,而且與動作同步,所以你沒寫的部分會被模型自行發揮。一兩句聲音方向的描述,通常就足以讓它不走偏。
範例
"Sound: steady rain on a tin roof, a low roll of thunder in the distance, no music."
「驚豔」「史詩」「電影感」什麼都沒告訴模型。材質、顏色、光線方向與有力的動詞才有用——這和 FLUX 影像模型上管用的是同一套紀律。
範例
"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."
FLUX 3 Video 提供 5、10、15 和 20 秒、七種比例與兩檔解析度。生成前就定下來,既省點數又不會構圖出錯。
範例
"A 10-second 21:9 opener: headlights sweeping across a wet runway at dusk, low camera, tyre spray catching the light."