アリババ通義万相 提供

Wan 3.0 · 1 つの動画モデル、3 つの入口

アリババの通義万相 Wan 3.0 が OVOV に登場。プロンプトから、始点・終点フレームから、あるいは自分の参照画像・参照動画・参照音声を添えたプロンプトから始められます——480P・720P・1080P、5〜30 秒、ネイティブ音声トラックつき。

長さ
アスペクト比
解像度

OVOV の AI 動画サンプル

当サイトの動画モデル(Veo 3.1 / Kling / Seedance)による実際の生成結果です。クリップにカーソルを重ねると再生、スピーカーアイコンをクリックすると音声を聞けます。

ホバーで再生 · スピーカーをクリックでミュート解除

OVOV の AI 動画サンプル

当サイトの動画モデル(Veo 3.1 / Kling / Seedance)による実際の生成結果です。クリップにカーソルを重ねると再生、スピーカーアイコンをクリックすると音声を聞けます。

シネマ

異星のファンタジー世界

フレグランス

ラグジュアリー香水広告

プロダクト

製品発表会ティザー

トラベル

モルディブ旅行 CM

アクション

東洋武侠の頂上決戦

映画

ハリウッド風レース映画

SF

宇宙船が深い星空へ

ライフスタイル

ゴールデンレトリバーと蝶

グルメ

寿司職人の手仕事

ファッション

赤いドレスの女性が崖に立つ

ゲームPV

深夜の達人対決

Vlog

ハンディセルフィー Vlog

グルメ

ジューシーグルメクローズアップ

ダンス

ストリートダンス高速アクション

メイク

ラグジュアリー口紅広告

Wan 3.0 に注目すべき理由

テキストもキーフレームも自前の素材も受け取れる 1 つのモデル。最大 1080P、最長 30 秒、そして描画しながら自分でサウンドトラックまで書き上げます。

マルチモーダル参照

テキストから動画では、参照画像を最大 10 枚、参照動画を最大 5 本(合計 15 秒)、参照音声を最大 5 本(合計 15 秒)まで添付できます。Wan 3.0 はキャラクター・スタイル・動き・トーンを、推測ではなくあなたの素材から取り込みます。

始点・終点フレーム制御

開始画像を、必要なら終了画像も渡せば、Wan 3.0 がその間の動きを描画します。プロダクトのリビール、変形、ビフォーアフターの流れへの最短ルートです。

480P・720P・1080P

3 段階の解像度、しかも本物の 1080P 出力つき。まずは 480P で数クレジットだけ使ってアイデアを詰め、実際に世に出す 1 本を 1080P で描画しましょう。

5〜30 秒

5・10・15・20・25・30 秒の 6 段階固定。5 秒のテストなら小銭程度、30 秒のフル尺 CM も 1 回の生成に収まります。

ネイティブ音声、デフォルトでオン

Wan 3.0 は映像と一緒に環境音・効果音・動きに合った音を書き上げます。スイッチはあなたの手元にあり、音声をオフにしても料金は変わりません。

5 種類のアスペクト比、秒単位の料金

16:9、9:16、1:1、4:3、3:4。クレジットは秒単位で課金され、480P は 1 秒あたり 3、720P は 6、1080P は 12 です。生成に失敗した場合は全額返還されます。

プロンプト・キーフレーム・素材から完成クリップまで

手元にあるものに合った入力を選んでください。Wan 3.0 は映像と音を同じパスで処理するので、あとから組み立てる作業はありません。

1

入口を選ぶ

プロンプトだけを書くか、始点フレーム(必要なら終点フレームも)をアップロードするか、プロンプトに加えて参照画像・参照動画・参照音声を添付します。そのうえで尺・アスペクト比・解像度を設定します。

2

Wan 3.0 が映像と音を描画

モデルは全尺にわたる動き・ライティング・テンポを設計したうえで、映像とそれに合う音声トラックを描画します。ほとんどのジョブは 1〜5 分で完了し、長いクリップほど時間がかかります。

3

ダウンロードして使う

音声が焼き込まれた完成動画をそのまま——ウォーターマークなし、商用利用権付き。生成に失敗した場合、クレジットはすぐに戻ってきます。

Wan 3.0 が得意なこと

3 つの入力モードと 1080P のティアがあれば守備範囲は広くなります。完成した広告、縦型の SNS カット、自前の素材に合わせた継続性のある制作、そして長尺の雰囲気重視の映像まで。

1080P のプロダクト/ブランド広告

フル HD の 30 秒 CM を 1 パスで描画。導入・実演・ベネフィット・締めが、音つきで 1 回の生成に収まります。

  • プレロール・ランディングページ・クライアント納品向けの 1080P 出力
  • ワイドスクリーンには 16:9、クラシックな放送向けの画面比には 4:3
  • 製品の音と環境音を映像と一緒に生成

縦型の SNS ショート

9:16 の TikTok・Reels・Shorts を、5 秒のフックから 30 秒のストーリーまで。音声が付いてくるので、あとからサウンドを足す工程は不要です。

  • 縦型 9:16、または正方形のフィード投稿には 1:1
  • 1 秒 3 クレジットの 480P で下書きし、720P か 1080P で公開
  • ライセンス楽曲ではなくネイティブ音声

シリーズ全体での一貫性

同じ参照画像・参照動画・参照音声を毎回添付すれば、キャラクター・製品・トーンがクリップをまたいでブレずに引き継がれます。

  • キャラクターとスタイルを固定する参照画像を最大 10 枚
  • 動きとカメラワークのための参照動画を最大 5 本
  • 音の質感を揃えるための参照音声を最大 5 本

旅と雰囲気の映像

空撮のスイープ、海沿いのドライブ、街歩き——尺が要る画に、その場所を売る風・水・街の音を添えて。

  • 30 秒をまるごと使う長いドリフト系のカメラワーク
  • 環境音を映像と並行して描画
  • ページ上部のヒーロー動画には 1080P

Wan 3.0 のプロンプト作成ガイド

Wan 3.0 は最大 20,000 文字のプロンプトを受け付けます。ほとんどのクリップに必要な量をはるかに超える余裕です。次の習慣が、その余裕をモデルが実際に反応する部分に使わせます。

まず素材を名指しし、それから完成カットを描写する

書き始める前に入力モードを選ぶ

3 つのモードで必要なプロンプトは変わります。テキストから動画は、シーン全体を言葉だけで支える必要があります。始点・終点フレームは構図がすでに決まっているので、プロンプトは動きの話になります。参照モードは、添付した素材から何を借りるかの話です。

  • テキストのみ:舞台・被写体・カメラ・音をゼロから描写する
  • 始点・終点フレーム:フレームそのものではなく、その間の動きを描写する
  • 参照(テキストから動画で添付):各素材が何を担うかを書く——顔、衣装、カメラワーク、トーン

"First frame: a sealed cardboard box on a table. Last frame: the box open with a camera inside. Prompt: "hands lift the flaps in one smooth motion, soft window light"."

参照素材は番号で名指しする

参照モードでは素材を直接指し示せます——画像 1、動画 1、音声 1。こうするとモデルは、どの素材がカットのどの部分を支配するのかを理解し、すべてを混ぜてしまうことがなくなります。

  • 参照画像は最大 10 枚、参照動画は 5 本、参照音声は 5 本まで
  • 参照動画は合計 15 秒、参照音声も合計 15 秒
  • 各素材に役割を 1 つずつ与える:人物の同一性はある画像から、カメラワークはある動画から

"Keep the woman from image 1 and the jacket from image 2, follow the slow dolly-in of video 1, and match the room tone of audio 1."

選んだ尺に合わせて流れを設計する

30 秒は長い画面時間です。起きてほしい順に進行を書きましょう。そうでないと、モデルは 1 つのアイデアを 30 秒間持ち続けます。

  • 舞台から始め、被写体を入れ、そのあと動きへ
  • 時間とともに変わるものを明示する:光、天気、距離、速度
  • 短い尺(5〜10 秒)は 1 つの連続したアクション向き

"The room starts dim and empty, morning light climbs the far wall, dust drifts through the beam, and the camera slowly settles on a cup of coffee going cold."

画だけでなく音も書く

音声はデフォルトで生成されるため、書かなかった部分は勝手に作られます。音の方向づけは 1〜2 行あれば、たいてい狙いから外れません。

  • 環境音を指定する:窓を打つ雨、遠くの車、部屋の空気感
  • 動きに合う音を指定する:足音、エンジン、風
  • 静けさを求めるのも有効な指示です——控えめにしたいなら書きましょう
  • 音のイメージが既にあるなら参照音声を添付する

"Sound: steady rain on a tin roof, an occasional low roll of thunder in the distance, no music."

褒め言葉を視覚的な事実に置き換える

stunning、epic、cinematic はモデルに何も伝えません。素材、色、光の向き、力のある動詞が伝えます。

  • 避ける:stunning、epic、breathtaking、gorgeous、masterpiece
  • 力のある動詞を使う:叩きつける、漂う、燃え上がる、鞭打つ
  • 光源と時間帯を明示する

"Avoid: "a stunning epic mountain shot". Prefer: "granite ridges under low side light, snow spilling off the crest in a thin plume"."

尺・比率・解像度を先に決める

Wan 3.0 は 5・10・15・20・25・30 秒、5 種類のアスペクト比、3 つの解像度に対応します。生成前に決めておけばクレジットを節約でき、構図も崩れません。

  • 横型は 16:9 と 4:3、縦型は 9:16 と 3:4、フィードは 1:1
  • 下書きは 480P(1 秒 3 クレジット)、仕上げは 720P(6)か 1080P(12)
  • 選んだフレームに合わせて書く——縦型は被写体を近く、中央に
  • 尺は 5・10・15・20・25・30 秒に固定——絵コンテをどれかに丸める

"A 15-second 9:16 vertical clip: a barista pulling an espresso shot, steam rising into warm café light, shallow depth of field."

よくある質問









今すぐ AI クリエイティブの旅を始めよう

OVOV に参加して、AI で画像・動画・音楽・音声を生成し、無限のクリエイティビティを解き放とう。
新規登録で 10 クレジットを無料プレゼント。待ち時間なし、すぐに創作開始。