Skip to main content
POST
MiniMax H3
MiniMax H3 是 MiniMax 2026 年 7 月发布的全模态视频模型。一个 endpoint 同时吃文本、图片、视频、音频四类输入,单次渲染直接出带音轨的成片,不用再单独配音。 三种用法在同一个接口里,靠传什么决定:
  • 文生视频 — 只给 prompt
  • 图生视频 — 给 image_urls,或用 first_frame_image / last_frame_image 指定首尾帧
  • 参考生视频 — 给 video_urls(参考运镜与风格)或 audio_urls(参考节奏与配乐)
异步任务:提交返回 task_id,轮询 任务状态 直到 completed

定价

本页不列单价 —— 价格会随上游调整,写在文档里迟早和实际对不上。看实时价格: 控制台「模型市场」,或 GET /v1/models 查询接口(见 模型列表)。 看单次实际花费: 每次调用的响应里都带 cost / usage.cost,以它为准。

可用模型

分辨率 × 时长 计费,2k 档更贵。传参考视频(video_urls)时按 2× 单价计:上游按输入视频时长 + 输出时长收,这是过渡折算;minimax-h3-regeneration 的单价已含输入部分,不再翻倍。参考图前 5 张免费,之后上游按张加收,我们目前不另计

调用示例

通用参数

string
必填
固定 minimax-h3
string
必填
画面描述。即使给了参考素材也建议写清楚要什么 —— 参考素材负责”像什么”,prompt 负责”做什么”
string
默认值:"768p"
768p / 2k
integer
默认值:"5"
4–15 之间任意整数秒
string[]
参考图或首帧。公网可访问的图片 URL
string
首帧图 URL
string
尾帧图 URL,与 first_frame_image 配合做「从 A 变到 B」
string[]
参考视频,提供运镜、节奏与风格参考
string[]
参考音频,影响成片的节奏与配乐走向
string
任务到达终态时回调,见回调机制
图生与参考生互斥。 首尾帧(first_frame_image / last_frame_image)与参考素材(video_urls / audio_urls)不能在同一次请求里混用 —— 上游把它们当两种不同的生成模式。

资源限制

相关文档