FLUX の画像モデルを作ったチーム、Black Forest Labs が動画モデルを作りました。OVOV では HD または FHD で 5〜20 秒を描画し、同期した音声を自分で書き上げ、始点と終点の 2 枚で妥協せずタイムラインに最大 10 枚のキーフレームを打てます。
当サイトの動画モデル(Veo 3.1 / Kling / Seedance)による実際の生成結果です。クリップにカーソルを重ねると再生、スピーカーアイコンをクリックすると音声を聞けます。
ホバーで再生 · スピーカーをクリックでミュート解除
当サイトの動画モデル(Veo 3.1 / Kling / Seedance)による実際の生成結果です。クリップにカーソルを重ねると再生、スピーカーアイコンをクリックすると音声を聞けます。
異星のファンタジー世界
ラグジュアリー香水広告
製品発表会ティザー
モルディブ旅行 CM
東洋武侠の頂上決戦
ハリウッド風レース映画
宇宙船が深い星空へ
ゴールデンレトリバーと蝶
寿司職人の手仕事
赤いドレスの女性が崖に立つ
深夜の達人対決
ハンディセルフィー Vlog
ジューシーグルメクローズアップ
ストリートダンス高速アクション
ラグジュアリー口紅広告
順序つきのキーフレームを最大 10 枚、フル HD のティア、20 秒の尺、そして同じパスで書き上がるサウンドトラック——FLUX の画像モデルを作ったチームから。
画像を 1 枚アップロードすれば、それが開始フレームになります。2 枚なら始点フレームと終点フレームです。最大 10 枚まで入れられ、増えた分はタイムラインに沿って均等に配置されます。つまり両端だけでなく、クリップ全体を振り付けできます。
FLUX 3 Video は映像と一緒に環境音・効果音・動きに合った音を書き上げ、画面で起きていることに同期させます。自分で劇伴をつけるつもりなら音声はオフにできますが、料金はどちらでも変わりません。
解像度は 2 段階。HD が約 1280×704、FHD が約 1920×1088 です。まず HD でアイデアを荒く固め、プロンプトとキーフレームが決まってから FHD のクレジットを使いましょう。
5・10・15・20 秒の 4 段階固定。当サイトの動画モデルはほとんどが 15 秒で頭打ちなので、ここの最上段なら 1 回の生成に導入・転回・落としまで収まります。
16:9、9:16、1:1、4:3、3:4 に加え、シネマティックなオープニング向けの 21:9 とレターボックスのタイトルカード向けの 2:1。生成前にフレームを決めてください——構図は選んだ比率に合わせて設計されます。
OVOV ですでに動いている FLUX の画像モデルを作ったのが Black Forest Labs です。FLUX 3 Video は同じラボが動きの世界に踏み出したもので、静止画で効くプロンプトの作法がそのまま活きます。
カットを書き、必要なら通過すべきフレームを打っておけば、FLUX 3 Video が映像と音を一緒に描画します。あとから組み立てる作業はありません。
プロンプトだけで始めても、キーフレーム画像を出したい順に 1〜10 枚アップロードしてもかまいません。そのうえで尺(5・10・15・20 秒)、アスペクト比、HD か FHD を選びます。
モデルは全尺にわたる動き・ライティング・テンポを設計し——キーフレームを渡していれば順番どおりに通過しながら——映像とそれに合う音声トラックを描画します。
音声が焼き込まれた完成動画をそのまま——ウォーターマークなし、商用利用権付き。生成に失敗した場合やコンテンツ審査で拒否された場合は、クレジットが全額そのまま戻ります。
順序つきキーフレーム、FHD のティア、2 つのウルトラワイド比率。決まった瞬間に決まった絵を通さなければならない仕事——しかもちゃんと音も要る仕事——に効きます。
ロゴ、製品の状態、キャラクターのポーズなど、すでに手元にある画像を必ず通したいときは、それらを順番にキーフレームとして打ち、あいだの動きはモデルに埋めさせましょう。
約 1920×1088 のブランドスポットや、フィードではなく映画として読める 21:9 のタイトルシーケンス。音が付いてくるので、人に見せる前にサウンドを足す工程は要りません。
9:16 や 3:4 の TikTok・Reels・Shorts を、5 秒のフックから 20 秒のストーリーまで。ライセンス楽曲のベッドではなくネイティブ音声で。
海沿いのドライブ、窓を打つ雨、目を覚ます市場——尺が要る画に、その場所を信じさせる風・水・街の音を添えて。
モデルはプロンプトとキーフレームを合わせて読みます。次の習慣があれば、その 2 つがけんかせず同じ方向を向きます。
大事なフレームを打ち、そのあいだの動きを書く
テキストだけなら、シーン全体をモデルが考えます。キーフレームを渡すたびに、その自由は 1 枚ずつ削られます。優劣ではなく、必要なプロンプトが違うだけです。
例
"With two keyframes (closed box, open box): "hands lift the flaps in one smooth motion, soft window light, cardboard scrape and a soft thud"."
枚数は中身と同じくらい効きます。1 枚は出発点。2 枚は旅の両端。それ以上は、選んだ尺に均等に割り付けられた、モデルが守るべきスケジュールです。
例
"20 秒に 4 枚のキーフレームなら、着地点はおよそ 0s・6.7s・13.3s・20s。つまり 5〜7 秒離れていても筋が通る画像を選んでください。"
20 秒は 1 つのアイデアを持たせるには長い時間です。起きてほしい順に進行を書けば、モデルはその尺に使えるものを手にできます。
例
"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera settles on a cup of coffee going cold."
音声はデフォルトで生成され、動きに同期します。だから書かなかった部分は勝手に作られます。音の方向づけは 1〜2 行あれば、たいてい狙いから外れません。
例
"Sound: steady rain on a tin roof, a low roll of thunder in the distance, no music."
stunning、epic、cinematic はモデルに何も伝えません。素材、色、光の向き、力のある動詞が伝えます——FLUX の画像モデルで効くのと同じ規律です。
例
"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."
FLUX 3 Video は 5・10・15・20 秒、7 種類のアスペクト比、2 段階の解像度に対応します。生成前に決めておけばクレジットを節約でき、構図も崩れません。
例
"A 10-second 21:9 opener: headlights sweeping across a wet runway at dusk, low camera, tyre spray catching the light."