Powered by Alibaba Tongyi Wanxiang

Wan 3.0 · Ein Videomodell, drei Wege hinein

Alibabas Tongyi Wanxiang Wan 3.0, jetzt auf OVOV. Starten Sie mit einem Prompt, mit einem ersten und letzten Frame oder mit einem Prompt, den Ihre eigenen Referenzbilder, -videos und -audios stützen — in 480P, 720P oder 1080P, 5 bis 30 Sekunden lang, mit eigener Tonspur.

Dauer
Format
Auflösung

KI-Video-Beispiele auf OVOV

Echte Generierungen unserer Videomodelle — Veo 3.1, Kling und Seedance. Fahren Sie über einen Clip, um ihn abzuspielen, und klicken Sie auf das Lautsprecher-Symbol, um den Ton zu hören.

Zum Abspielen hovern · Lautsprecher klicken zum Entstummen

KI-Video-Beispiele auf OVOV

Echte Generierungen unserer Videomodelle — Veo 3.1, Kling und Seedance. Fahren Sie über einen Clip, um ihn abzuspielen, und klicken Sie auf das Lautsprecher-Symbol, um den Ton zu hören.

Kino

Außerirdische Fantasiewelt

Parfüm

Luxus-Parfum-Werbung

Produkt

Produkt-Launch-Teaser

Reise

Malediven-Reise-Werbung

Action

Östliches Wuxia-Duell

Film

Hollywood-Rennfilm-Szene

Sci-Fi

Raumschiff zu den Sternen

Lifestyle

Golden Retriever mit Schmetterlingen

Essen

Sushi-Meister bei der Arbeit

Mode

Rotes Kleid auf den Klippen

Game Trailer

Mitternachts-Duell

Vlog

Handheld-Selfie-Vlog

Essen

Mouth-watering Food Close-up

Tanz

Urbaner Street Dance

Makeup

Luxus-Lippenstift-Werbung

Warum sich ein Blick auf Wan 3.0 lohnt

Ein Modell, das Text, Keyframes oder Ihr eigenes Material annimmt, bis zu 1080P rendert, eine halbe Minute lang läuft und nebenbei seine eigene Tonspur schreibt.

Multimodale Referenzen

Bei Text-zu-Video hängen Sie bis zu 10 Referenzbilder, bis zu 5 Referenzvideos (insgesamt 15 Sekunden) und bis zu 5 Referenz-Audiospuren (insgesamt 15 Sekunden) an. Wan 3.0 zieht Charakter, Stil, Bewegung und Klangfarbe aus Ihrem eigenen Material, statt zu raten.

First- & Last-Frame-Steuerung

Geben Sie ein Startbild vor und optional ein Endbild — Wan 3.0 rendert die Bewegung dazwischen. Der direkteste Weg zu Produkt-Reveals, Verwandlungen und Vorher-Nachher-Bögen.

480P, 720P und 1080P

Drei Auflösungsstufen, darunter eine echte 1080P-Ausgabe. Skizzieren Sie die Idee in 480P für ein paar Credits und rendern Sie die Fassung, die wirklich rausgeht, in 1080P.

5 bis 30 Sekunden

Sechs feste Längen: 5, 10, 15, 20, 25 oder 30 Sekunden. Ein Fünf-Sekunden-Test kostet Kleingeld; ein kompletter 30-Sekunden-Spot passt in eine einzige Generierung.

Nativer Ton, standardmäßig aktiv

Wan 3.0 schreibt Atmosphäre, Effekte und bewegungssynchronen Sound zusammen mit dem Bild. Der Schalter liegt bei Ihnen — und den Ton auszuschalten ändert nichts am Preis.

Fünf Seitenverhältnisse, sekundengenau abgerechnet

16:9, 9:16, 1:1, 4:3 und 3:4. Credits werden pro Sekunde berechnet — 3 in 480P, 6 in 720P, 12 in 1080P — und eine fehlgeschlagene Generierung wird vollständig erstattet.

Vom Prompt, von Keyframes oder von eigenem Material zum fertigen Clip

Wählen Sie den Eingang, der zu dem passt, was Sie schon haben. Wan 3.0 erledigt Bild und Ton im selben Durchgang, danach gibt es nichts mehr zusammenzusetzen.

1

Wählen Sie Ihren Weg hinein

Schreiben Sie nur einen Prompt, laden Sie einen ersten Frame hoch (und optional einen letzten) oder hängen Sie neben Ihrem Prompt Referenzbilder, -videos und -audios an. Legen Sie dann Länge, Seitenverhältnis und Auflösung fest.

2

Wan 3.0 rendert Bild und Ton

Das Modell plant Bewegung, Licht und Tempo über die gesamte Dauer und rendert dann das Video mit der passenden Tonspur. Die meisten Aufträge sind in ein bis fünf Minuten fertig; längere Clips brauchen länger.

3

Herunterladen und verwenden

Nehmen Sie das fertige Video mit eingebettetem Ton — ohne Wasserzeichen, kommerzielle Rechte inklusive. Schlägt eine Generierung fehl, kommen Ihre Credits direkt zurück.

Wofür Wan 3.0 gut ist

Drei Eingabemodi und eine 1080P-Stufe decken viel ab: fertige Werbespots, vertikale Social-Schnitte, Anschlussarbeit auf Basis Ihres eigenen Materials und lange Atmosphärefilme.

1080P Produkt- & Markenspots

Ein 30-Sekunden-Werbespot in Full HD, in einem Durchgang gerendert. Aufbau, Demonstration, Nutzen und Abbinder passen in eine einzige Generierung, Ton inklusive.

  • 1080P-Ausgabe für Pre-Roll, Landingpages und Kundenauslieferung
  • 16:9 für Widescreen, 4:3 für klassische Broadcast-Kadrierung
  • Produktsound und Atmosphäre werden mit dem Bild erzeugt

Vertikale Social Shorts

TikTok, Reels und Shorts in 9:16, vom 5-Sekunden-Hook bis zur 30-Sekunden-Story. Der Ton kommt gleich mit, danach braucht nichts mehr einen Soundtrack-Durchgang.

  • 9:16 vertikal oder 1:1 für quadratische Feed-Posts
  • In 480P für 3 Credits pro Sekunde entwerfen, in 720P oder 1080P veröffentlichen
  • Nativer Ton statt lizenzierter Musikspur

Konsistenz über eine ganze Serie

Hängen Sie an jede Generierung dieselben Referenzbilder, -videos und -audios an, dann tragen Charakter, Produkt und Klangfarbe von Clip zu Clip, statt zu driften.

  • Bis zu 10 Referenzbilder, um Charakter und Stil zu halten
  • Bis zu 5 Referenzvideos für Bewegung und Kameraführung
  • Bis zu 5 Referenz-Audiospuren, damit der Klang in der Familie bleibt

Reise- & Atmosphärefilme

Luftaufnahmen, Küstenfahrten und Streifzüge auf Straßenhöhe, die Zeit zum Atmen brauchen — dazu Wind, Wasser und Stadtgeräusch, die den Ort verkaufen.

  • Lange, driftende Kamerafahrten, die die vollen 30 Sekunden brauchen
  • Umgebungston wird zusammen mit dem Bild gerendert
  • 1080P für Hero-Videos ganz oben auf der Seite

Prompt-Leitfaden für Wan 3.0

Wan 3.0 nimmt Prompts mit bis zu 20.000 Zeichen an — weit mehr Platz, als die meisten Clips brauchen. Diese Gewohnheiten investieren diesen Platz in die Dinge, auf die das Modell tatsächlich reagiert.

Benennen Sie Ihr Material, dann beschreiben Sie die fertige Einstellung

Wählen Sie den Eingabemodus, bevor Sie schreiben

Die drei Modi verlangen unterschiedliche Prompts. Text-zu-Video muss die ganze Szene in Worten tragen. First-and-Last-Frame hat die Komposition schon, dort geht es um die Bewegung. Im Referenzmodus geht es darum, was aus dem angehängten Material übernommen werden soll.

  • Nur Text: Schauplatz, Motiv, Kamera und Ton von Grund auf beschreiben
  • First und Last Frame: die Bewegung dazwischen beschreiben, nicht die Frames selbst
  • Referenzen (im Text-zu-Video angehängt): sagen Sie, was jedes Asset beiträgt — Gesicht, Outfit, Kamerafahrt, Klangfarbe

Beispiel

"First frame: a sealed cardboard box on a table. Last frame: the box open with a camera inside. Prompt: "hands lift the flaps in one smooth motion, soft window light"."

Sprechen Sie Ihre Referenzen mit Nummern an

Im Referenzmodus können Sie direkt auf das Material zeigen — Bild 1, Video 1, Audio 1 — damit das Modell weiß, welches Asset welchen Teil der Einstellung bestimmt, statt alles miteinander zu vermischen.

  • Bis zu 10 Referenzbilder, 5 Referenzvideos und 5 Referenz-Audiospuren
  • Referenzvideo insgesamt 15 Sekunden, Referenz-Audio insgesamt 15 Sekunden
  • Geben Sie jedem Asset eine Aufgabe: Identität aus einem Bild, Kamerafahrt aus einem Video

Beispiel

"Keep the woman from image 1 and the jacket from image 2, follow the slow dolly-in of video 1, and match the room tone of audio 1."

Planen Sie den Bogen über die gewählte Länge

Dreißig Sekunden sind viel Bildzeit. Schreiben Sie den Ablauf in der Reihenfolge, in der er passieren soll, sonst hält das Modell eine halbe Minute lang an einer einzigen Idee fest.

  • Mit dem Schauplatz eröffnen, dann das Motiv einführen, dann die Bewegung
  • Benennen Sie, was sich über die Zeit ändert: Licht, Wetter, Distanz, Tempo
  • Kürzere Längen (5-10s) eignen sich für eine einzelne durchgehende Handlung

Beispiel

"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera slowly settles on a cup of coffee going cold."

Schreiben Sie den Ton, nicht nur das Bild

Der Ton wird standardmäßig mitgeneriert — alles, was Sie nicht sagen, wird für Sie erfunden. Ein bis zwei Zeilen Tonregie reichen meist, damit es im Charakter bleibt.

  • Benennen Sie die Atmosphäre: Regen an der Scheibe, ferner Verkehr, Raumton
  • Benennen Sie die Geräusche zur Bewegung: Schritte, Motor, Wind
  • Um Stille zu bitten ist gültige Regie — sagen Sie es, wenn es sparsam sein soll
  • Hängen Sie Referenz-Audio an, wenn Sie den Ton schon im Kopf haben

Beispiel

"Sound: steady rain on a tin roof, an occasional low roll of thunder in the distance, no music."

Tauschen Sie Lobworte gegen visuelle Fakten

Atemberaubend, episch und filmisch sagen dem Modell nichts. Materialien, Farben, Lichtrichtung und starke Verben schon.

  • Weglassen: atemberaubend, episch, umwerfend, großartig, Meisterwerk
  • Verben mit Wucht verwenden: knallt, driftet, entzündet sich, peitscht
  • Benennen Sie die Lichtquelle und die Tageszeit

Beispiel

"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."

Länge, Format und Auflösung vorab wählen

Wan 3.0 bietet 5, 10, 15, 20, 25 und 30 Sekunden, fünf Seitenverhältnisse und drei Auflösungen. Sich vor dem Generieren zu entscheiden spart Credits und hält die Komposition richtig.

  • 16:9 und 4:3 für Querformat, 9:16 und 3:4 für Hochformat, 1:1 für Feeds
  • In 480P entwerfen (3 Credits pro Sekunde), in 720P (6) oder 1080P (12) finalisieren
  • Schreiben Sie für das gewählte Format — vertikal braucht das Motiv nah und mittig
  • Die Länge ist auf 5, 10, 15, 20, 25 oder 30 Sekunden festgelegt — runden Sie Ihr Storyboard auf einen dieser Werte

Beispiel

"A 15-second 9:16 vertical clip: a barista pulling an espresso shot, steam rising into warm café light, shallow depth of field."

Häufig gestellte Fragen









Starte heute deine KI-Kreativreise

Werde Teil von OVOV und generiere Bilder, Videos, Musik und Stimmen mit KI—entfessle grenzenlose Kreativität.
Jetzt registrieren und 10 Gratis-Credits sofort erhalten. Kein Warten, sofort loslegen.