MiniMax 搭載

MiniMax H3 · 同期音声つきネイティブ 2K 動画

テキスト・画像・参照素材から、同期音声、自然な台詞、マルチショットの物語表現を備えた 5〜15 秒のネイティブ 2K 動画を生成します。

長さ
アスペクト比
解像度

OVOV の AI 動画サンプル

当サイトの動画モデル(Veo 3.1 / Kling / Seedance)による実際の生成結果です。クリップにカーソルを重ねると再生、スピーカーアイコンをクリックすると音声を聞けます。

ホバーで再生 · スピーカーをクリックでミュート解除

OVOV の AI 動画サンプル

当サイトの動画モデル(Veo 3.1 / Kling / Seedance)による実際の生成結果です。クリップにカーソルを重ねると再生、スピーカーアイコンをクリックすると音声を聞けます。

シネマ

異星のファンタジー世界

フレグランス

ラグジュアリー香水広告

プロダクト

製品発表会ティザー

トラベル

モルディブ旅行 CM

アクション

東洋武侠の頂上決戦

映画

ハリウッド風レース映画

SF

宇宙船が深い星空へ

ライフスタイル

ゴールデンレトリバーと蝶

グルメ

寿司職人の手仕事

ファッション

赤いドレスの女性が崖に立つ

ゲームPV

深夜の達人対決

Vlog

ハンディセルフィー Vlog

グルメ

ジューシーグルメクローズアップ

ダンス

ストリートダンス高速アクション

メイク

ラグジュアリー口紅広告

MiniMax H3 が際立つ理由

品質最優先のフラッグシップ:ネイティブ 2K 解像度、映像と同期して生成される音声と台詞、そして 1 回の生成で完結する本物のマルチショット・ナラティブ。

ネイティブ 2K 出力

H3 は低解像度からのアップスケールではなく、ネイティブ 2K で描画します。繊細な質感、読めるテキスト、シャープなエッジは、大画面やポストプロダクションにも耐えます。

同期音声と台詞

キャラクターが実際に話します。H3 は自然な台詞、環境音、効果音を口の動きや画面上のアクションと同期して生成——1 パスで完結し、別途の音声工程は不要です。

マルチショットの物語表現

ショットの流れを記述すると、H3 はキャラクター・ライティング・テンポの一貫性を保ったままカットをつなぎ、1 本のクリップで完結した物語を描きます。

オムニ参照コントロール

テキストから動画のモードでは、最大 9 枚の参照画像、3 本の参照動画(合計 15 秒)、3 本の音声トラックを入力して、スタイル・キャラクター・サウンドの方向性を固定できます。

始点・終点フレーム制御

画像から動画のモードでは、最初のフレーム(任意で最後のフレームも)を指定すると、H3 がその間の動きをアニメーション化します。リビール、トランジション、ブランドに忠実なショットに最適です。

5〜15 秒の柔軟な尺

5・10・15 秒から選べ、21:9 ワイドスクリーンから 9:16 縦型まで 6 種類のアスペクト比に対応。クレジットは尺に対して線形に増えるため、コストは常に予測できます。

アイデアから 2K 動画まで 3 ステップ

H3 は品質最優先——速度重視のモデルより少し時間がかかりますが、その分は仕上がりに表れます。

1

台詞込みでシーンを書く

ショットを記述し、話す台詞を引用符で囲みます。参照画像・動画・音声の添付も可能です。画像から動画のモードなら、最初のフレームから始めることもできます。

2

H3 が映像と音を同時に描画

モデルは映像・台詞・効果音を 1 回の同期パスで生成します。品質優先の描画のためピーク時は順番待ちになることがあります——生成に失敗した場合、クレジットは自動で返還されます。

3

ネイティブ 2K をダウンロードして即公開

ウォーターマークなし・完全な商用利用権付きで、ネイティブ 2K(下書きは 768P)のクリップを書き出せます。

クリエイターは H3 で何を作るか

生の速度より画質と説得力ある音が重要な場面で、H3 は真価を発揮します。

台詞主導の広告

キャラクターがカメラに向かって話すスポークスパーソン動画、証言広告、ストーリー広告——唇・声・身振りがすべて同期し、アフレコは不要です。

  • 脚本どおりの自然な台詞
  • ネイティブ 2K はテレビでもウェブでも通用
  • 効果音と環境音も込みで生成

ショートフィルムと物語シーン

一貫したキャラクターと連続した物語——提示、反応、解決——を、1 回の 15 秒生成で描くマルチショットシーン。

  • ショット間でキャラクターが一貫
  • 21:9 や 16:9 のシネマティックな構図
  • 台詞がドラマを牽引

SNS と縦型動画

TikTok・Reels・Shorts 向けの 9:16 クリップ。鮮明なディテールと本物の音声がスクロールを止めます——顔出しトーク、ミニコント、冒頭フックの物語。

  • 9:16・3:4・1:1 の縦型向き比率
  • 5 秒フックか 15 秒ストーリー
  • 音声オンのフィードに対応した台詞とサウンド

プロダクトとブランドの見せ場

最初のフレームに実際の商品写真を、最後のフレームにヒーローショットを指定すれば、H3 がその間のリビールを 2K でアニメーション化します。

  • 始点・終点フレームで商品が崩れない
  • 最大 9 枚の参照画像でブランドスタイルを固定
  • 2K のディテールが素材と質感を引き立てる

MiniMax H3 のプロンプト作成ガイド

H3 はミニ脚本のようなプロンプトに応えます:ショット、アクション、引用符に入れた台詞。

シーンを書き、台詞を引用符に——映像と音は H3 が仕上げます

台詞は引用符に入れる

H3 は引用符内のテキストを同期した音声に変換します。誰が話すかを明示し、台詞を引用し、話し方を描写しましょう。

  • 各台詞に話者を明記する
  • 台詞は短く——5 秒のクリップには 1〜2 文が限度
  • ささやく・叫ぶ・ためらう、などのトーン指示を添える

"An old fisherman looks at the horizon and says softly: "The sea remembers everything." Waves lap against the hull, gulls cry in the distance."

マルチショットの構成を組む

状況提示、アクション、リアクションの順にショットを記述すると、H3 はキャラクターとライティングの一貫性を保ったままカットをつなぎます。

  • 1 ショット 1 文、物語の順に
  • 10〜15 秒には 2〜3 ショットが収まる
  • キャラクターの描写語を繰り返して一貫性を固定

"Shot 1: wide view of a neon street market at night. Shot 2: a chef flips noodles in a wok, flames leap. Shot 3: close-up of a customer's delighted face, steam rising."

目的に合ったモードを選ぶ

テキストから動画はマルチモーダル参照に対応——最大 9 枚の画像、3 本の動画(合計 15 秒)、3 本の音声トラック。画像から動画は指定した最初のフレームから始まり、最後のフレームも任意で指定できます。

  • テキストから動画 + 参照:スタイルとキャラクターの制御
  • 画像から動画:ピクセル単位で正確な始点
  • 結末が重要なら最後のフレームを追加

"Image-to-video: first frame is your product photo. Prompt: "slow 180-degree orbit, studio light sweeping across the surface, gentle whoosh sound"."

解像度と尺を予算に合わせる

768P は 5 秒あたり 25 クレジット、ネイティブ 2K は 40 クレジット——10 秒/15 秒は 2 倍/3 倍の線形です。下書きは安く、仕上げはシャープに。

  • プロンプトの試行は 768P で、決定版だけ 2K で描画
  • 5 秒のテストが最も低コスト
  • 生成失敗時はクレジットが自動返還

"Workflow: three 768P 5s drafts (75 credits) to nail the prompt, then one 2K 15s final (120 credits)."

アスペクト比は冒頭で宣言する

H3 は 21:9、16:9、4:3、1:1、3:4、9:16 に対応します。構図はフレームに合わせて変わるため、シーンを描写する前に比率を宣言しましょう。

  • シネマティックや YouTube は 21:9 か 16:9
  • TikTok・Reels・Shorts は 9:16
  • フィード投稿は 1:1 と 3:4

"A 9:16 vertical clip: a barista looks up at the camera and says "Your usual?" — morning light through the cafe window."

参照は意図を持って重ねる

参照の役割はそれぞれ異なります:画像はスタイルとアイデンティティを、動画はモーションとテンポを、音声はムードを運びます。そのショットに必要なものだけを使いましょう。

  • キャラクター画像:ランダムな 9 枚より 2〜3 アングル
  • 参照動画は合計 15 秒——欲しい動きだけに刈り込む
  • 音声参照は音楽とトーンの指針で、そのまま再生されるわけではない

"3 photos of the same mascot + 1 dance clip + 1 upbeat track: "the mascot performs this dance on a rooftop at sunset"."

よくある質問









今すぐ AI クリエイティブの旅を始めよう

OVOV に参加して、AI で画像・動画・音楽・音声を生成し、無限のクリエイティビティを解き放とう。
新規登録で 10 クレジットを無料プレゼント。待ち時間なし、すぐに創作開始。