由 MiniMax 驅動

MiniMax H3 · 原生 2K 影片 + 同步音訊

從文字、圖片或參考素材出發,生成 5-15 秒原生 2K 影片——音訊同步、對白自然、支援多鏡頭敘事。

時長
畫面比例
解析度

OVOV AI 影片範例

來自我們影片模型的真實生成——Veo 3.1、Kling 與 Seedance。游標懸停任一片段即可播放,點擊喇叭圖示聆聽音訊。

懸停播放 · 點擊喇叭取消靜音

OVOV AI 影片範例

來自我們影片模型的真實生成——Veo 3.1、Kling 與 Seedance。游標懸停任一片段即可播放,點擊喇叭圖示聆聽音訊。

電影感

外星奇幻世界

香氛

奢華香水廣告

產品

產品發布會宣傳片

旅行

馬爾代夫旅遊廣告

動作

東方武俠頂峰對決

電影

好萊塢賽車電影鏡頭

科幻

飛船駛向深藍宇宙

生活

金毛小狗追蝴蝶

美食

壽司師傅精心製作

時尚

紅裙女子懸崖漫步

遊戲預告

深夜高手對決

Vlog

手持自拍 Vlog

美食

爆汁美食特寫

舞蹈

街舞高速動作

彩妝

奢華口紅廣告

MiniMax H3 的過人之處

畫質優先的旗艦模型:原生 2K 解析度、音訊與對白和畫面同步生成、單次生成即可完成真正的多鏡頭敘事。

原生 2K 輸出

H3 以原生 2K 渲染——並非低解析度放大。細膩紋理、清晰文字與銳利邊緣,經得起大螢幕與後製的考驗。

同步音訊與對白

角色真的會開口說話。H3 生成的自然對白、環境音與音效與唇形和畫面動作精準同步——一次生成,無需另外的音訊工序。

多鏡頭敘事

描述一組鏡頭序列,H3 會在鏡頭間切換,同時保持角色、光線與節奏一致——單支片段講完一個完整的敘事段落。

全模態參考控制

文生影片模式下,最多可輸入 9 張參考圖、3 段參考影片(合計 15 秒)與 3 段音訊,鎖定風格、角色與聲音方向。

首尾幀控制

圖生影片模式下,設定首幀——也可選設尾幀——H3 會補全兩者之間的運動。適合揭幕鏡頭、轉場與品牌精準鏡頭。

5-15 秒彈性時長

可選 5、10 或 15 秒,以及從 21:9 電影寬屏到 9:16 直式的 6 種比例。點數隨時長線性計費,成本始終可預期。

三步從想法到 2K 影片

H3 畫質優先——比追求速度的模型略慢,但成片見真章。

1

寫下你的場景——帶上台詞

描述鏡頭,把要說的話放進引號裡,可選附上參考圖、影片或音訊。也可以在圖生影片模式下從首幀開始。

2

H3 同步渲染畫面與聲音

模型在一次同步渲染中生成畫面、對白與音效。畫質優先的渲染在尖峰時段可能需要排隊——若生成失敗,點數會自動退還。

3

下載原生 2K,即刻發布

以原生 2K(或草稿用 768P)匯出片段,無浮水印,附完整商用授權。

創作者用 H3 做什麼

凡是畫質與可信聲音比速度更重要的場景,H3 都大放異彩。

對白驅動的廣告

代言人影片、顧客見證與劇情廣告——角色面對鏡頭開口,唇形、聲音與手勢全程同步,無需錄音室。

  • 按你的腳本生成自然台詞
  • 原生 2K 在電視與網頁上都經得住看
  • 音效與環境音一併生成

短片與敘事場景

多鏡頭場景,角色一致、故事邏輯連貫——鋪陳、反應、收束——一次 15 秒生成全部完成。

  • 鏡頭間角色保持一致
  • 21:9 或 16:9 電影構圖
  • 對白推動劇情

社群與直式影片

為 TikTok、Reels 和 Shorts 準備的 9:16 片段——清晰細節與真實音訊讓人停下滑動:口播、迷你短劇、開頭即鉤子的敘事。

  • 9:16、3:4、1:1 直式友善比例
  • 5 秒鉤子或 15 秒故事
  • 語音與音效為開聲瀏覽而生

產品與品牌展示

用首幀控制從你的產品照精確出發,用尾幀控制收在主視覺鏡頭,讓 H3 以 2K 補全揭幕動畫。

  • 首尾幀讓產品始終不走樣
  • 最多 9 張參考圖鎖定品牌風格
  • 2K 細節凸顯材質與紋理

MiniMax H3 提示詞寫作指南

H3 偏愛寫得像微型劇本的提示詞:鏡頭、動作,以及放在引號裡的台詞。

寫好場景、引好台詞——畫面和聲音交給 H3

把台詞放進引號裡

H3 會把引號內的文字轉成同步語音。寫明誰在說、引用說什麼、描述怎麼說。

  • 每句台詞註明說話的角色
  • 台詞要短——5 秒片段只裝得下一兩句話
  • 加上語氣提示:低語、喊叫、遲疑

範例

"An old fisherman looks at the horizon and says softly: "The sea remembers everything." Waves lap against the hull, gulls cry in the distance."

搭好多鏡頭結構

按順序描述鏡頭——定場、動作、反應——H3 會在保持角色與光線一致的前提下完成切換。

  • 每個鏡頭一句話,按敘事順序排列
  • 10-15 秒可以從容容納 2-3 個鏡頭
  • 重複角色描述詞以錨定一致性

範例

"Shot 1: wide view of a neon street market at night. Shot 2: a chef flips noodles in a wok, flames leap. Shot 3: close-up of a customer's delighted face, steam rising."

為任務選對模式

文生影片支援多模態參考——最多 9 張圖、3 段影片(合計 15 秒)與 3 段音訊。圖生影片從你的精確首幀出發,尾幀可選。

  • 文生影片 + 參考素材:控制風格與角色
  • 圖生影片:像素級精確的起點
  • 結尾重要時補上尾幀

範例

"Image-to-video: first frame is your product photo. Prompt: "slow 180-degree orbit, studio light sweeping across the surface, gentle whoosh sound"."

按預算匹配解析度與時長

768P 每 5 秒 25 點數,原生 2K 每 5 秒 40 點數——10 秒/15 秒按 2 倍/3 倍線性計費。草稿用低價檔,成片用高畫質檔。

  • 用 768P 迭代提示詞,定稿再渲 2K
  • 5 秒測試花費最少
  • 生成失敗自動退還點數

範例

"Workflow: three 768P 5s drafts (75 credits) to nail the prompt, then one 2K 15s final (120 credits)."

開頭就聲明比例

H3 支援 21:9、16:9、4:3、1:1、3:4 和 9:16。構圖隨畫幅變化,所以先聲明比例,再描述場景。

  • 電影感和 YouTube 用 21:9 或 16:9
  • TikTok、Reels 和 Shorts 用 9:16
  • 動態貼文用 1:1 和 3:4

範例

"A 9:16 vertical clip: a barista looks up at the camera and says "Your usual?" — morning light through the cafe window."

有意識地疊加參考素材

每類參考各司其職:圖片承載風格與身分,影片承載運動與節奏,音訊承載情緒。只用鏡頭需要的那部分。

  • 角色圖:2-3 個角度勝過 9 張隨手拍
  • 參考影片合計 15 秒,剪出你想要的動作
  • 音訊參考引導音樂與基調,不是原樣重播

範例

"3 photos of the same mascot + 1 dance clip + 1 upbeat track: "the mascot performs this dance on a rooftop at sunset"."

常見問題









立即開始你的 AI 創作之旅

加入 OVOV,用 AI 生成圖片、影片、音樂與語音,釋放無限創意。
新用戶註冊即送 10 個免費積分,無需等待,即刻開始創作。