Alibabas Tongyi Wanxiang Wan 3.0, jetzt auf OVOV. Starten Sie mit einem Prompt, mit einem ersten und letzten Frame oder mit einem Prompt, den Ihre eigenen Referenzbilder, -videos und -audios stützen — in 480P, 720P oder 1080P, 5 bis 30 Sekunden lang, mit eigener Tonspur.
Echte Generierungen unserer Videomodelle — Veo 3.1, Kling und Seedance. Fahren Sie über einen Clip, um ihn abzuspielen, und klicken Sie auf das Lautsprecher-Symbol, um den Ton zu hören.
Zum Abspielen hovern · Lautsprecher klicken zum Entstummen
Echte Generierungen unserer Videomodelle — Veo 3.1, Kling und Seedance. Fahren Sie über einen Clip, um ihn abzuspielen, und klicken Sie auf das Lautsprecher-Symbol, um den Ton zu hören.
Außerirdische Fantasiewelt
Luxus-Parfum-Werbung
Produkt-Launch-Teaser
Malediven-Reise-Werbung
Östliches Wuxia-Duell
Hollywood-Rennfilm-Szene
Raumschiff zu den Sternen
Golden Retriever mit Schmetterlingen
Sushi-Meister bei der Arbeit
Rotes Kleid auf den Klippen
Mitternachts-Duell
Handheld-Selfie-Vlog
Mouth-watering Food Close-up
Urbaner Street Dance
Luxus-Lippenstift-Werbung
Ein Modell, das Text, Keyframes oder Ihr eigenes Material annimmt, bis zu 1080P rendert, eine halbe Minute lang läuft und nebenbei seine eigene Tonspur schreibt.
Bei Text-zu-Video hängen Sie bis zu 10 Referenzbilder, bis zu 5 Referenzvideos (insgesamt 15 Sekunden) und bis zu 5 Referenz-Audiospuren (insgesamt 15 Sekunden) an. Wan 3.0 zieht Charakter, Stil, Bewegung und Klangfarbe aus Ihrem eigenen Material, statt zu raten.
Geben Sie ein Startbild vor und optional ein Endbild — Wan 3.0 rendert die Bewegung dazwischen. Der direkteste Weg zu Produkt-Reveals, Verwandlungen und Vorher-Nachher-Bögen.
Drei Auflösungsstufen, darunter eine echte 1080P-Ausgabe. Skizzieren Sie die Idee in 480P für ein paar Credits und rendern Sie die Fassung, die wirklich rausgeht, in 1080P.
Sechs feste Längen: 5, 10, 15, 20, 25 oder 30 Sekunden. Ein Fünf-Sekunden-Test kostet Kleingeld; ein kompletter 30-Sekunden-Spot passt in eine einzige Generierung.
Wan 3.0 schreibt Atmosphäre, Effekte und bewegungssynchronen Sound zusammen mit dem Bild. Der Schalter liegt bei Ihnen — und den Ton auszuschalten ändert nichts am Preis.
16:9, 9:16, 1:1, 4:3 und 3:4. Credits werden pro Sekunde berechnet — 3 in 480P, 6 in 720P, 12 in 1080P — und eine fehlgeschlagene Generierung wird vollständig erstattet.
Wählen Sie den Eingang, der zu dem passt, was Sie schon haben. Wan 3.0 erledigt Bild und Ton im selben Durchgang, danach gibt es nichts mehr zusammenzusetzen.
Schreiben Sie nur einen Prompt, laden Sie einen ersten Frame hoch (und optional einen letzten) oder hängen Sie neben Ihrem Prompt Referenzbilder, -videos und -audios an. Legen Sie dann Länge, Seitenverhältnis und Auflösung fest.
Das Modell plant Bewegung, Licht und Tempo über die gesamte Dauer und rendert dann das Video mit der passenden Tonspur. Die meisten Aufträge sind in ein bis fünf Minuten fertig; längere Clips brauchen länger.
Nehmen Sie das fertige Video mit eingebettetem Ton — ohne Wasserzeichen, kommerzielle Rechte inklusive. Schlägt eine Generierung fehl, kommen Ihre Credits direkt zurück.
Drei Eingabemodi und eine 1080P-Stufe decken viel ab: fertige Werbespots, vertikale Social-Schnitte, Anschlussarbeit auf Basis Ihres eigenen Materials und lange Atmosphärefilme.
Ein 30-Sekunden-Werbespot in Full HD, in einem Durchgang gerendert. Aufbau, Demonstration, Nutzen und Abbinder passen in eine einzige Generierung, Ton inklusive.
TikTok, Reels und Shorts in 9:16, vom 5-Sekunden-Hook bis zur 30-Sekunden-Story. Der Ton kommt gleich mit, danach braucht nichts mehr einen Soundtrack-Durchgang.
Hängen Sie an jede Generierung dieselben Referenzbilder, -videos und -audios an, dann tragen Charakter, Produkt und Klangfarbe von Clip zu Clip, statt zu driften.
Luftaufnahmen, Küstenfahrten und Streifzüge auf Straßenhöhe, die Zeit zum Atmen brauchen — dazu Wind, Wasser und Stadtgeräusch, die den Ort verkaufen.
Wan 3.0 nimmt Prompts mit bis zu 20.000 Zeichen an — weit mehr Platz, als die meisten Clips brauchen. Diese Gewohnheiten investieren diesen Platz in die Dinge, auf die das Modell tatsächlich reagiert.
Benennen Sie Ihr Material, dann beschreiben Sie die fertige Einstellung
Die drei Modi verlangen unterschiedliche Prompts. Text-zu-Video muss die ganze Szene in Worten tragen. First-and-Last-Frame hat die Komposition schon, dort geht es um die Bewegung. Im Referenzmodus geht es darum, was aus dem angehängten Material übernommen werden soll.
Beispiel
"First frame: a sealed cardboard box on a table. Last frame: the box open with a camera inside. Prompt: "hands lift the flaps in one smooth motion, soft window light"."
Im Referenzmodus können Sie direkt auf das Material zeigen — Bild 1, Video 1, Audio 1 — damit das Modell weiß, welches Asset welchen Teil der Einstellung bestimmt, statt alles miteinander zu vermischen.
Beispiel
"Keep the woman from image 1 and the jacket from image 2, follow the slow dolly-in of video 1, and match the room tone of audio 1."
Dreißig Sekunden sind viel Bildzeit. Schreiben Sie den Ablauf in der Reihenfolge, in der er passieren soll, sonst hält das Modell eine halbe Minute lang an einer einzigen Idee fest.
Beispiel
"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera slowly settles on a cup of coffee going cold."
Der Ton wird standardmäßig mitgeneriert — alles, was Sie nicht sagen, wird für Sie erfunden. Ein bis zwei Zeilen Tonregie reichen meist, damit es im Charakter bleibt.
Beispiel
"Sound: steady rain on a tin roof, an occasional low roll of thunder in the distance, no music."
Atemberaubend, episch und filmisch sagen dem Modell nichts. Materialien, Farben, Lichtrichtung und starke Verben schon.
Beispiel
"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."
Wan 3.0 bietet 5, 10, 15, 20, 25 und 30 Sekunden, fünf Seitenverhältnisse und drei Auflösungen. Sich vor dem Generieren zu entscheiden spart Credits und hält die Komposition richtig.
Beispiel
"A 15-second 9:16 vertical clip: a barista pulling an espresso shot, steam rising into warm café light, shallow depth of field."