Black Forest Labs — das Team hinter den FLUX-Bildmodellen — hat ein Videomodell gebaut. Auf OVOV rendert es 5 bis 20 Sekunden in HD oder FHD, schreibt seine eigene synchrone Tonspur und lässt Sie bis zu zehn Keyframes entlang der Timeline setzen, statt sich mit einem ersten und einem letzten Frame zu begnügen.
Echte Generierungen unserer Videomodelle — Veo 3.1, Kling und Seedance. Fahren Sie über einen Clip, um ihn abzuspielen, und klicken Sie auf das Lautsprecher-Symbol, um den Ton zu hören.
Zum Abspielen hovern · Lautsprecher klicken zum Entstummen
Echte Generierungen unserer Videomodelle — Veo 3.1, Kling und Seedance. Fahren Sie über einen Clip, um ihn abzuspielen, und klicken Sie auf das Lautsprecher-Symbol, um den Ton zu hören.
Außerirdische Fantasiewelt
Luxus-Parfum-Werbung
Produkt-Launch-Teaser
Malediven-Reise-Werbung
Östliches Wuxia-Duell
Hollywood-Rennfilm-Szene
Raumschiff zu den Sternen
Golden Retriever mit Schmetterlingen
Sushi-Meister bei der Arbeit
Rotes Kleid auf den Klippen
Mitternachts-Duell
Handheld-Selfie-Vlog
Mouth-watering Food Close-up
Urbaner Street Dance
Luxus-Lippenstift-Werbung
Bis zu zehn geordnete Keyframes, eine FHD-Stufe, zwanzig Sekunden Anlauf und eine Tonspur im selben Durchgang — vom Team, das die FLUX-Bildmodelle gemacht hat.
Laden Sie ein Bild hoch, wird es zum Startframe. Laden Sie zwei hoch, werden sie zum ersten und letzten Frame. Laden Sie bis zu zehn hoch, verteilen sich die zusätzlichen Frames gleichmäßig über die Timeline — Sie choreografieren dann den ganzen Clip und nicht nur seine Enden.
FLUX 3 Video schreibt Atmosphäre, Effekte und bewegungssynchronen Sound zusammen mit dem Bild, synchron zu dem, was im Bild passiert. Sie können den Ton abschalten, wenn Sie den Clip selbst vertonen wollen — am Preis ändert das nichts.
Zwei Auflösungsstufen: HD mit rund 1280×704 und FHD mit rund 1920×1088. Skizzieren Sie die Idee in HD und geben Sie die FHD-Credits erst aus, wenn Prompt und Keyframes sitzen.
Vier feste Längen: 5, 10, 15 oder 20 Sekunden. Die meisten unserer Videomodelle enden bei 15 — die oberste Stufe hier lässt also Platz für Aufbau, Wendung und Auflösung in einer einzigen Generierung.
16:9, 9:16, 1:1, 4:3, 3:4 sowie 21:9 und 2:1 für filmische Opener und Titelkarten im Letterbox-Format. Legen Sie das Format vor dem Generieren fest — die Komposition wird für das gewählte Verhältnis geplant.
Black Forest Labs hat die FLUX-Bildmodelle gebaut, die auf OVOV bereits laufen. FLUX 3 Video ist dasselbe Labor auf dem Weg in die Bewegung — die Prompt-Gewohnheiten, die bei ihren Standbildern funktionieren, tragen hierher hinüber.
Schreiben Sie die Einstellung, setzen Sie optional die Frames, die sie treffen muss, und FLUX 3 Video rendert Bild und Ton zusammen — danach gibt es nichts mehr zusammenzusetzen.
Starten Sie mit einem Prompt allein oder laden Sie ein bis zehn Keyframe-Bilder in der Reihenfolge hoch, in der sie erscheinen sollen. Wählen Sie dann Länge (5, 10, 15 oder 20 Sekunden), Seitenverhältnis und HD oder FHD.
Das Modell plant Bewegung, Licht und Tempo über die gesamte Dauer — und läuft dabei der Reihe nach durch Ihre Keyframes, wenn Sie welche mitgeliefert haben — und rendert dann das Video mit der passenden Tonspur.
Nehmen Sie das fertige Video mit eingebettetem Ton — ohne Wasserzeichen, kommerzielle Rechte inklusive. Schlägt eine Generierung fehl oder wird sie von der Inhaltsprüfung abgelehnt, kommen Ihre Credits vollständig zurück.
Geordnete Keyframes, eine FHD-Stufe und zwei ultrabreite Formate decken die Arbeiten ab, bei denen die Einstellung zu bestimmten Zeitpunkten auf bestimmten Bildern landen muss — und trotzdem nach etwas klingen soll.
Wenn der Clip durch Bilder laufen muss, die Sie schon haben — ein Logo, ein Produktzustand, eine Figurenpose —, setzen Sie sie der Reihe nach als Keyframes und lassen Sie das Modell die Bewegung dazwischen füllen.
Ein Markenspot mit rund 1920×1088 oder eine 21:9-Titelsequenz, die nach Kino aussieht und nicht nach Feed. Der Ton kommt gleich mit, es braucht also keinen Vertonungsdurchgang, bevor Sie das Ergebnis zeigen können.
TikTok, Reels und Shorts in 9:16 oder 3:4, vom Fünf-Sekunden-Hook bis zur Zwanzig-Sekunden-Story, mit nativem Ton statt lizenzierter Musikspur.
Küstenfahrten, Regen an der Scheibe, ein Markt, der erwacht — Einstellungen, die Zeit zum Atmen brauchen, dazu Wind, Wasser und Straßengeräusch, die den Ort glaubwürdig machen.
Das Modell liest Ihren Prompt und Ihre Keyframes zusammen. Diese Gewohnheiten sorgen dafür, dass beide in dieselbe Richtung ziehen, statt sich zu widersprechen.
Setzen Sie die Frames, auf die es ankommt, und beschreiben Sie die Bewegung dazwischen
Nur Text lässt dem Modell die ganze Szene zum Erfinden. Keyframes nehmen ihm diese Freiheit Bild für Bild. Keines ist besser — beide brauchen nur andere Prompts.
Beispiel
"With two keyframes (closed box, open box): "hands lift the flaps in one smooth motion, soft window light, cardboard scrape and a soft thud"."
Die Anzahl zählt genauso viel wie der Inhalt. Ein Bild ist ein Ausgangspunkt. Zwei sind die Enden einer Reise. Alles darüber ist ein Fahrplan, den das Modell einhalten muss, gleichmäßig über die gewählte Länge verteilt.
Beispiel
"Four keyframes across 20 seconds land at roughly 0s, 6.7s, 13.3s and 20s — so pick images that make sense five to seven seconds apart."
Zwanzig Sekunden sind eine lange Zeit für eine einzige Idee. Schreiben Sie den Ablauf in der Reihenfolge, in der er passieren soll, dann hat das Modell etwas, wofür es die Dauer ausgeben kann.
Beispiel
"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera settles on a cup of coffee going cold."
Der Ton wird standardmäßig erzeugt und ist auf die Handlung synchronisiert — alles, was Sie nicht sagen, wird für Sie erfunden. Ein bis zwei Zeilen Tonregie reichen meist, damit es im Charakter bleibt.
Beispiel
"Sound: steady rain on a tin roof, a low roll of thunder in the distance, no music."
Atemberaubend, episch und filmisch sagen dem Modell nichts. Materialien, Farben, Lichtrichtung und starke Verben schon — dieselbe Disziplin, die schon bei den FLUX-Bildmodellen funktioniert.
Beispiel
"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."
FLUX 3 Video bietet 5, 10, 15 und 20 Sekunden, sieben Seitenverhältnisse und zwei Auflösungsstufen. Sich vor dem Generieren zu entscheiden spart Credits und hält die Komposition richtig.
Beispiel
"A 10-second 21:9 opener: headlights sweeping across a wet runway at dusk, low camera, tyre spray catching the light."