Black Forest Labs——做出 FLUX 图像模型的那支团队——做了一个视频模型。在 OVOV 上,它渲染 5 到 20 秒、HD 或 FHD 的片段,自己写好同步的音轨,还让你沿时间轴钉下最多十张关键帧,而不是只能将就一个首帧加一个尾帧。
来自我们视频模型的真实生成——Veo 3.1、Kling 与 Seedance。悬停任意片段即可播放,点击扬声器图标聆听音频。
悬停播放 · 点击扬声器取消静音
来自我们视频模型的真实生成——Veo 3.1、Kling 与 Seedance。悬停任意片段即可播放,点击扬声器图标聆听音频。
外星奇幻世界
奢华香水广告
产品发布会宣传片
马尔代夫旅游广告
东方武侠顶峰对决
好莱坞赛车电影镜头
飞船驶向深蓝宇宙
金毛小狗追蝴蝶
寿司师傅精心制作
红裙女子悬崖漫步
深夜高手对决
手持自拍 Vlog
爆汁美食特写
街舞高速动作
奢华口红广告
最多十张有序关键帧、一档完整的 FHD、二十秒的时长空间,以及在同一次生成里写好的音轨——出自做过 FLUX 图像模型的那支团队。
上传一张图,它就是起始帧。上传两张,它们就是首帧与尾帧。最多可以上传十张,多出来的帧会沿时间轴均匀分布——你编排的是整段片子,而不只是它的两头。
FLUX 3 Video 在渲染画面的同时写好环境音、音效与匹配动作的声音,与屏幕上发生的事同步。如果你打算自己配乐,也可以把音频关掉——但两种情况价格一样。
两档分辨率:HD 约 1280×704,FHD 约 1920×1088。先用 HD 把想法打个草稿,等提示词和关键帧都定下来,再花 FHD 的积分。
四档固定时长:5、10、15 或 20 秒。我们多数视频模型的上限是 15 秒,所以这里最高的一档留出了余地——铺垫、转折与落点可以装进一次生成。
16:9、9:16、1:1、4:3、3:4,再加上适合电影感开场与遮幅字卡的 21:9 与 2:1。生成前先定好画幅——构图是按你选的比例来规划的。
OVOV 上已经在跑的 FLUX 图像模型,正是 Black Forest Labs 做的。FLUX 3 Video 是同一个实验室转向动态影像,所以在他们的静态图上管用的提示词习惯,这里同样成立。
把镜头写出来,也可以顺便钉上它必须经过的帧,FLUX 3 Video 会把画面与声音一起渲染出来——事后没有任何需要拼接的东西。
可以只从一段提示词开始,也可以按出现顺序上传 1 到 10 张关键帧图像。然后选择时长(5、10、15 或 20 秒)、宽高比与 HD 或 FHD。
模型会先规划整段时长内的运动、光影与节奏——如果你给了关键帧,就按顺序依次经过它们——再渲染出视频与相配的音轨。
拿到自带音频的成片——无水印,附商用授权。若生成失败或被内容审核拒绝,积分会立即全额退回。
有序关键帧、FHD 档位与两种超宽比例,覆盖的是那类必须在特定时刻落到特定画面上的活儿——而且成片还得有声音。
当片子必须经过你手上已有的画面——一个 logo、一个产品状态、一个角色姿势——就按顺序把它们钉成关键帧,让模型去补中间的运动。
约 1920×1088 的品牌广告,或者一段读起来像电影而不像信息流的 21:9 片头。声音随片附带,拿给别人看之前不用再补一轮配乐。
TikTok、Reels 与 Shorts 的 9:16 或 3:4,从五秒钩子到二十秒故事,用原生音频而不是授权音乐垫底。
海岸公路、雨打窗户、正在苏醒的市场——这些镜头需要时间呼吸,还需要风声、水声与街声把这个地方坐实。
模型会把你的提示词和关键帧放在一起读。下面这些习惯,能让两者朝同一个方向使劲,而不是互相打架。
钉住关键的帧,描述帧与帧之间的运动
只给文本,整个场景都留给模型去发挥。给了关键帧,这份自由就一张图一张图地被收走。两者没有优劣,只是需要的提示词不一样。
示例
"With two keyframes (closed box, open box): "hands lift the flaps in one smooth motion, soft window light, cardboard scrape and a soft thud"."
数量和内容一样重要。一张图是起点。两张图是一段旅程的两头。再多就是一张模型必须遵守的时间表,沿你选定的时长均匀排开。
示例
"四张关键帧铺在 20 秒里,大约落在 0s、6.7s、13.3s 和 20s——所以要挑那些相隔五到七秒仍然说得通的画面。"
二十秒,用一个想法撑满是很长的。按发生顺序把推进过程写清楚,模型才有东西去填这段时长。
示例
"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera settles on a cup of coffee going cold."
音频默认生成,并与动作同步,所以你没写的部分会被模型自行发挥。一两句声音方向的描述,通常就足以让它不跑偏。
示例
"Sound: steady rain on a tin roof, a low roll of thunder in the distance, no music."
「惊艳」「史诗」「电影感」什么都没告诉模型。材质、颜色、光线方向和有力的动词才有用——这和 FLUX 图像模型上管用的是同一套纪律。
示例
"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."
FLUX 3 Video 提供 5、10、15 和 20 秒、七种宽高比与两档分辨率。生成前就定下来,既省积分又不会构图出错。
示例
"A 10-second 21:9 opener: headlights sweeping across a wet runway at dusk, low camera, tyre spray catching the light."