由 MiniMax 驱动

MiniMax H3 · 原生 2K 视频 + 同步音频

从文本、图像或参考素材出发,生成 5-15 秒原生 2K 视频——音频同步、对白自然、支持多镜头叙事。

时长
画面比例
分辨率

OVOV AI 视频示例

来自我们视频模型的真实生成——Veo 3.1、Kling 与 Seedance。悬停任意片段即可播放,点击扬声器图标聆听音频。

悬停播放 · 点击扬声器取消静音

OVOV AI 视频示例

来自我们视频模型的真实生成——Veo 3.1、Kling 与 Seedance。悬停任意片段即可播放,点击扬声器图标聆听音频。

电影感

外星奇幻世界

香氛

奢华香水广告

产品

产品发布会宣传片

旅行

马尔代夫旅游广告

动作

东方武侠顶峰对决

电影

好莱坞赛车电影镜头

科幻

飞船驶向深蓝宇宙

生活

金毛小狗追蝴蝶

美食

寿司师傅精心制作

时尚

红裙女子悬崖漫步

游戏预告

深夜高手对决

Vlog

手持自拍 Vlog

美食

爆汁美食特写

舞蹈

街舞高速动作

彩妆

奢华口红广告

MiniMax H3 的过人之处

画质优先的旗舰模型:原生 2K 分辨率、音频与对白和画面同步生成、单次生成即可完成真正的多镜头叙事。

原生 2K 输出

H3 以原生 2K 渲染——不是低分辨率放大。细腻纹理、清晰文字与锐利边缘,经得起大屏幕与后期制作的考验。

同步音频与对白

角色真的会开口说话。H3 生成的自然对白、环境声与音效与唇形和画面动作精准同步——一次生成,无需单独的音频环节。

多镜头叙事

描述一组镜头序列,H3 会在镜头间切换,同时保持角色、光线与节奏一致——单条片段讲完一个完整的叙事段落。

全模态参考控制

文生视频模式下,最多可输入 9 张参考图、3 段参考视频(合计 15 秒)与 3 段音频,锁定风格、角色与声音方向。

首尾帧控制

图生视频模式下,设定首帧——也可选设尾帧——H3 会补全两者之间的运动。适合揭幕镜头、转场与品牌精准镜头。

5-15 秒灵活时长

可选 5、10 或 15 秒,以及从 21:9 宽屏到 9:16 竖屏的 6 种宽高比。积分随时长线性计费,成本始终可预期。

三步从想法到 2K 视频

H3 画质优先——比追求速度的模型略慢,但成片见真章。

1

写下你的场景——带上台词

描述镜头,把要说的话放进引号里,可选附上参考图、视频或音频。也可以在图生视频模式下从首帧开始。

2

H3 同步渲染画面与声音

模型在一次同步渲染中生成画面、对白与音效。画质优先的渲染在高峰期可能需要排队——若生成失败,积分会自动退还。

3

下载原生 2K,即刻发布

以原生 2K(或草稿用 768P)导出片段,无水印,附完整商用授权。

创作者用 H3 做什么

凡是画质与可信声音比速度更重要的场景,H3 都大放异彩。

对白驱动的广告

代言人视频、客户证言与剧情广告——角色面对镜头开口,唇形、声音与手势全程同步,无需配音棚。

  • 按你的脚本生成自然台词
  • 原生 2K 在电视与网页上都经得住看
  • 音效与环境声一并生成

短片与叙事场景

多镜头场景,角色一致、故事逻辑连贯——铺垫、反应、收束——一次 15 秒生成全部完成。

  • 镜头间角色保持一致
  • 21:9 或 16:9 电影构图
  • 对白推动剧情

社交与竖屏视频

为 TikTok、Reels 和 Shorts 准备的 9:16 片段——清晰细节与真实音频让人停下滑动:口播、迷你短剧、开头即钩子的叙事。

  • 9:16、3:4、1:1 竖屏友好比例
  • 5 秒钩子或 15 秒故事
  • 语音与音效为开声浏览而生

产品与品牌展示

用首帧控制从你的产品照片精确出发,用尾帧控制收在主视觉镜头,让 H3 以 2K 补全揭幕动画。

  • 首尾帧让产品始终不走样
  • 最多 9 张参考图锁定品牌风格
  • 2K 细节凸显材质与纹理

MiniMax H3 提示词写作指南

H3 偏爱写得像微型剧本的提示词:镜头、动作,以及放在引号里的台词。

写好场景、引好台词——画面和声音交给 H3

把台词放进引号里

H3 会把引号内的文字转成同步语音。写明谁在说、引用说什么、描述怎么说。

  • 每句台词注明说话的角色
  • 台词要短——5 秒片段只装得下一两句话
  • 加上语气提示:低语、喊叫、迟疑

示例

"An old fisherman looks at the horizon and says softly: "The sea remembers everything." Waves lap against the hull, gulls cry in the distance."

搭好多镜头结构

按顺序描述镜头——定场、动作、反应——H3 会在保持角色与光线一致的前提下完成切换。

  • 每个镜头一句话,按叙事顺序排列
  • 10-15 秒可以从容容纳 2-3 个镜头
  • 重复角色描述词以锚定一致性

示例

"Shot 1: wide view of a neon street market at night. Shot 2: a chef flips noodles in a wok, flames leap. Shot 3: close-up of a customer's delighted face, steam rising."

为任务选对模式

文生视频支持多模态参考——最多 9 张图、3 段视频(合计 15 秒)与 3 段音频。图生视频从你的精确首帧出发,尾帧可选。

  • 文生视频 + 参考素材:控制风格与角色
  • 图生视频:像素级精确的起点
  • 结尾重要时补上尾帧

示例

"Image-to-video: first frame is your product photo. Prompt: "slow 180-degree orbit, studio light sweeping across the surface, gentle whoosh sound"."

按预算匹配分辨率与时长

768P 每 5 秒 25 积分,原生 2K 每 5 秒 40 积分——10 秒/15 秒按 2 倍/3 倍线性计费。草稿用低价档,成片用高清档。

  • 用 768P 迭代提示词,定稿再渲 2K
  • 5 秒测试花费最少
  • 生成失败自动退还积分

示例

"Workflow: three 768P 5s drafts (75 credits) to nail the prompt, then one 2K 15s final (120 credits)."

开头就声明宽高比

H3 支持 21:9、16:9、4:3、1:1、3:4 和 9:16。构图随画幅变化,所以先声明比例,再描述场景。

  • 电影感和 YouTube 用 21:9 或 16:9
  • TikTok、Reels 和 Shorts 用 9:16
  • 信息流帖子用 1:1 和 3:4

示例

"A 9:16 vertical clip: a barista looks up at the camera and says "Your usual?" — morning light through the cafe window."

有意识地叠加参考素材

每类参考各司其职:图片承载风格与身份,视频承载运动与节奏,音频承载情绪。只用镜头需要的那部分。

  • 角色图:2-3 个角度胜过 9 张随手拍
  • 参考视频合计 15 秒,剪出你想要的动作
  • 音频参考引导音乐与基调,不是原样回放

示例

"3 photos of the same mascot + 1 dance clip + 1 upbeat track: "the mascot performs this dance on a rooftop at sunset"."

常见问题









立即开始你的 AI 创作之旅

加入 OVOV,用 AI 生成图片、视频、音乐与语音,释放无限创意。
新用户注册即送 10 个免费积分,无需等待,即刻开始创作。