アリババの通義万相 Wan 3.0 が OVOV に登場。プロンプトから、始点・終点フレームから、あるいは自分の参照画像・参照動画・参照音声を添えたプロンプトから始められます——480P・720P・1080P、5〜30 秒、ネイティブ音声トラックつき。
当サイトの動画モデル(Veo 3.1 / Kling / Seedance)による実際の生成結果です。クリップにカーソルを重ねると再生、スピーカーアイコンをクリックすると音声を聞けます。
ホバーで再生 · スピーカーをクリックでミュート解除
当サイトの動画モデル(Veo 3.1 / Kling / Seedance)による実際の生成結果です。クリップにカーソルを重ねると再生、スピーカーアイコンをクリックすると音声を聞けます。
異星のファンタジー世界
ラグジュアリー香水広告
製品発表会ティザー
モルディブ旅行 CM
東洋武侠の頂上決戦
ハリウッド風レース映画
宇宙船が深い星空へ
ゴールデンレトリバーと蝶
寿司職人の手仕事
赤いドレスの女性が崖に立つ
深夜の達人対決
ハンディセルフィー Vlog
ジューシーグルメクローズアップ
ストリートダンス高速アクション
ラグジュアリー口紅広告
テキストもキーフレームも自前の素材も受け取れる 1 つのモデル。最大 1080P、最長 30 秒、そして描画しながら自分でサウンドトラックまで書き上げます。
テキストから動画では、参照画像を最大 10 枚、参照動画を最大 5 本(合計 15 秒)、参照音声を最大 5 本(合計 15 秒)まで添付できます。Wan 3.0 はキャラクター・スタイル・動き・トーンを、推測ではなくあなたの素材から取り込みます。
開始画像を、必要なら終了画像も渡せば、Wan 3.0 がその間の動きを描画します。プロダクトのリビール、変形、ビフォーアフターの流れへの最短ルートです。
3 段階の解像度、しかも本物の 1080P 出力つき。まずは 480P で数クレジットだけ使ってアイデアを詰め、実際に世に出す 1 本を 1080P で描画しましょう。
5・10・15・20・25・30 秒の 6 段階固定。5 秒のテストなら小銭程度、30 秒のフル尺 CM も 1 回の生成に収まります。
Wan 3.0 は映像と一緒に環境音・効果音・動きに合った音を書き上げます。スイッチはあなたの手元にあり、音声をオフにしても料金は変わりません。
16:9、9:16、1:1、4:3、3:4。クレジットは秒単位で課金され、480P は 1 秒あたり 3、720P は 6、1080P は 12 です。生成に失敗した場合は全額返還されます。
手元にあるものに合った入力を選んでください。Wan 3.0 は映像と音を同じパスで処理するので、あとから組み立てる作業はありません。
プロンプトだけを書くか、始点フレーム(必要なら終点フレームも)をアップロードするか、プロンプトに加えて参照画像・参照動画・参照音声を添付します。そのうえで尺・アスペクト比・解像度を設定します。
モデルは全尺にわたる動き・ライティング・テンポを設計したうえで、映像とそれに合う音声トラックを描画します。ほとんどのジョブは 1〜5 分で完了し、長いクリップほど時間がかかります。
音声が焼き込まれた完成動画をそのまま——ウォーターマークなし、商用利用権付き。生成に失敗した場合、クレジットはすぐに戻ってきます。
3 つの入力モードと 1080P のティアがあれば守備範囲は広くなります。完成した広告、縦型の SNS カット、自前の素材に合わせた継続性のある制作、そして長尺の雰囲気重視の映像まで。
フル HD の 30 秒 CM を 1 パスで描画。導入・実演・ベネフィット・締めが、音つきで 1 回の生成に収まります。
9:16 の TikTok・Reels・Shorts を、5 秒のフックから 30 秒のストーリーまで。音声が付いてくるので、あとからサウンドを足す工程は不要です。
同じ参照画像・参照動画・参照音声を毎回添付すれば、キャラクター・製品・トーンがクリップをまたいでブレずに引き継がれます。
空撮のスイープ、海沿いのドライブ、街歩き——尺が要る画に、その場所を売る風・水・街の音を添えて。
Wan 3.0 は最大 20,000 文字のプロンプトを受け付けます。ほとんどのクリップに必要な量をはるかに超える余裕です。次の習慣が、その余裕をモデルが実際に反応する部分に使わせます。
まず素材を名指しし、それから完成カットを描写する
3 つのモードで必要なプロンプトは変わります。テキストから動画は、シーン全体を言葉だけで支える必要があります。始点・終点フレームは構図がすでに決まっているので、プロンプトは動きの話になります。参照モードは、添付した素材から何を借りるかの話です。
例
"First frame: a sealed cardboard box on a table. Last frame: the box open with a camera inside. Prompt: "hands lift the flaps in one smooth motion, soft window light"."
参照モードでは素材を直接指し示せます——画像 1、動画 1、音声 1。こうするとモデルは、どの素材がカットのどの部分を支配するのかを理解し、すべてを混ぜてしまうことがなくなります。
例
"Keep the woman from image 1 and the jacket from image 2, follow the slow dolly-in of video 1, and match the room tone of audio 1."
30 秒は長い画面時間です。起きてほしい順に進行を書きましょう。そうでないと、モデルは 1 つのアイデアを 30 秒間持ち続けます。
例
"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera slowly settles on a cup of coffee going cold."
音声はデフォルトで生成されるため、書かなかった部分は勝手に作られます。音の方向づけは 1〜2 行あれば、たいてい狙いから外れません。
例
"Sound: steady rain on a tin roof, an occasional low roll of thunder in the distance, no music."
stunning、epic、cinematic はモデルに何も伝えません。素材、色、光の向き、力のある動詞が伝えます。
例
"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."
Wan 3.0 は 5・10・15・20・25・30 秒、5 種類のアスペクト比、3 つの解像度に対応します。生成前に決めておけばクレジットを節約でき、構図も崩れません。
例
"A 15-second 9:16 vertical clip: a barista pulling an espresso shot, steam rising into warm café light, shallow depth of field."