MiniMax H3 发布了:如何通过 ClawSocket 使用 H3 视频 API
MiniMax 在 2026 年 7 月 31 日 发布了 MiniMax H3。它不是只接收一句提示词的视频模型:官方将其定义为开放的通用多模态视频模型,可结合文本、图像、视频和音频理解创作上下文,生成最高 2K、最长 15 秒、带原生立体声音频的视频[^1]。对准备把视频生成放进产品或工作流的开发者,关键不只是模型发布,而是把异步任务、素材 URL、结果下载和模型路由接好。
本文面向需要调用视频生成 API 的开发者和内容工具团队,重点讲清 MiniMax H3 的输入边界、官方 API 的三步工作流,以及通过 ClawSocket 控制台 使用 H3 API 时应如何配置和验证。
快速结论
MiniMax H3于2026 年 7 月 31 日发布,官方 API 模型名为MiniMax-H3[^1][^2]- 官方文档列出的输出规格为
768P或2K,时长为4到15秒的整数值[^3] - 它支持文生视频、首尾帧图生视频和参考生成;参考输入可包含图像、视频和音频[^3]
- 视频生成是异步任务:创建接口返回
task_id,成功后从content.url取得视频文件[^2][^3] - ClawSocket 已可使用 H3 API;实际模型名、计费、速率限制和兼容端点应以 ClawSocket 控制台 当前展示为准
MiniMax H3 发布了什么
MiniMax H3 的发布重点是把多种素材类型放进同一条视频生成链路。官方说明中,文本、图片、视频和音频可以共同构成输入上下文;模型不仅能从零生成视频,也能把指定首帧或尾帧做成连贯镜头,或参考已有的人物、动作、镜头、风格和音色[^1][^3]。
这让它更适合真实的内容生产任务。例如,营销团队可以给一张产品主视觉和一段镜头描述;影视预演工具可以给首帧、尾帧和转场要求;角色内容工作流则可以结合参考图、参考视频和参考音频。无论采用哪种模式,请求里都必须有一条非空的文本 prompt,不能只上传素材[^2]。
| 能力 | MiniMax H3 官方说明 | 适合的任务 |
|---|---|---|
| 文生视频 | 文本提示词 | 从零生成短片、概念验证、分镜草稿 |
| 首帧 / 尾帧图生视频 | 文本加 1 至 2 张图 | 让静态 KV 动起来,或控制转场起止画面 |
| 参考生成 | 文本加参考图、视频或音频 | 延续人物、镜头节奏、风格与声音线索 |
| 原生音画输出 | 最高 2K、最长 15 秒、原生立体声 | 需要一次性得到带声音的短视频素材 |
MiniMax H3 API 的输入和限制
官方 POST /v2/video_generation 接口使用 content 数组传递多模态输入。每个元素由 type 标识,例如 text、image_url、video_url 或 audio_url;需要时再用 role 指明它是 first_frame、last_frame、reference_image、reference_video 或 reference_audio[^2]。
几个边界会直接影响实现:输出时长只能填写 4 至 15 的整数;提示词上限为 7000 个字符;单张图片最大 30 MB,单段参考视频最大 50 MB,API 请求体总量不应超过 64 MB。大素材建议提供可访问的 URL,而不是把 Base64 堆进请求体[^2][^3]。
首尾帧模式和参考模式不能混用。若请求包含 reference_image、reference_video 或 reference_audio,就不能同时传 first_frame 或 last_frame;而参考音频也不能单独发送,至少还要配一张参考图或一段参考视频[^2]。这些规则适合在业务侧提前校验,避免任务提交后才收到参数错误。
官方 H3 API 怎么调用
H3 的工作流固定分为三步:创建任务、查询状态、下载结果。创建接口成功后只会返回 task_id,而不是直接返回 MP4;官方示例建议每 10 秒查询一次,直到状态变为 succeeded、failed 或 cancelled[^3]。
下面是最小的文生视频请求,端点和字段来自 MiniMax 官方 V2 文档:
bash
curl https://api.minimax.io/v2/video_generation \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $MINIMAX_API_KEY" \
-d '{
"model": "MiniMax-H3",
"content": [{
"type": "text",
"text": "产品在晨光中的桌面上缓慢旋转,镜头由近到远推进,干净的商业广告风格,环境音自然。"
}],
"resolution": "2K",
"duration": 5,
"ratio": "16:9"
}'拿到 task_id 后,再查询任务:
bash
curl "https://api.minimax.io/v2/query/video_generation/$TASK_ID" \
-H "Authorization: Bearer $MINIMAX_API_KEY"响应中的 task.status 为 succeeded 时,下载地址位于 task.content.url。生产实现不要无限轮询:对 failed 和 cancelled 立刻结束;对网络错误实行有限次数重试;把 task_id、模型名、时长、分辨率和最终状态写入自己的任务表,方便追查成本和失败原因。
通过 ClawSocket 使用 H3 API
已经使用 ClawSocket 管理模型调用时,不必为 H3 另起一套应用侧密钥和模型配置。先在 ClawSocket 控制台 创建 API Key,并确认 H3 的实际模型 ID、视频生成端点、计费方式和并发限制;再按控制台给出的 Base URL 与认证方式,将上面的“创建任务 - 查询任务 - 下载结果”封装接入。
这里有一个必须保留的边界:MiniMax 官方 API 的 MiniMax-H3、/v2/video_generation 和查询路径是官方文档中的写法;第三方统一入口可能沿用它们,也可能提供自己的模型别名或兼容路由。因此上线代码中不要从文章复制一个模型名后永久写死,应该以控制台模型列表和请求示例为准。
推荐的接入顺序如下:
- 在 ClawSocket 控制台 创建 API Key,并查看 H3 当前模型名与可用端点。
- 先用
5秒、768P的文本任务验证认证、请求结构和回调链路。 - 接入任务存储与轮询,只有
succeeded才向用户展示content.url。 - 再增加首尾帧或参考素材,并在上传前检查格式、大小与素材 URL 可访问性。
- 稳定后再将默认分辨率升级到
2K,同时记录每次任务的时长、失败率和成本。
对已有 OpenAI-compatible 文本工作流的团队,视频生成通常不是“把模型名换一下”就结束了。它还需要一个任务状态层和结果文件处理层;先把异步编排完成,再比较不同模型的提示词和画质,效率会高得多。
哪些场景适合用 H3
MiniMax H3 最适合“有明确素材约束”的短视频任务。纯文生视频可以快速探索创意方向;有首帧或尾帧时,适合把品牌视觉、商品图或故事板转成可控的动态片段;需要人物、动作或声音一致性时,则应使用参考生成。
| 场景 | 推荐输入 | 先验证什么 |
|---|---|---|
| 商品动态海报 | 首帧图片加文本 | 商品外观、构图和镜头运动是否保持一致 |
| 社媒短视频 | 文本或参考图 | 9:16 比例、字幕预留区和前 2 秒信息密度 |
| 角色口播片段 | 参考图 / 视频加参考音频 | 人物一致性、音画同步和素材授权 |
| 剪辑转场 | 首帧和尾帧图片 | 两端画面衔接是否自然 |
对于高频生产,建议固定一组内部测试任务:至少包含一条纯文本、一个商品首帧、一个首尾帧转场和一个参考素材任务。每次模型或路由升级后,统一比较成功率、平均排队时间、生成耗时、返工次数和每秒成本,而不是只看单条样片。
FAQ
MiniMax H3 的 API 模型名是什么?
MiniMax 官方 V2 视频生成文档当前列出的模型名是 MiniMax-H3。通过 ClawSocket 等第三方入口调用时,应以控制台实时模型列表为准,因为模型别名与上架节奏可能不同。
MiniMax H3 能生成多长的视频?
官方文档列出 H3 的输出时长为 4 到 15 秒,且必须填写整数值;输出分辨率可选 768P 或 2K。具体可用选项仍可能受账户、区域、路由或平台限制影响。
H3 API 是同步返回视频吗?
不是。创建任务后先返回 task_id,客户端需要查询任务状态;状态为 succeeded 时,从 task.content.url 获取生成结果。官方示例使用 10 秒的查询间隔。
通过 ClawSocket 调用 H3 时,能直接照抄官方 URL 吗?
不要假定可以。MiniMax 官方 URL 是 https://api.minimax.io/v2/video_generation;通过 ClawSocket 调用时,请使用控制台提供的 Base URL、认证方式、模型名和端点。这样才能避免把官方协议和第三方兼容协议混在一起。
总结
MiniMax H3 发布 的价值,不只是多了一个短视频模型,而是它把文本、图像、视频和音频参考放到了同一套异步视频 API 里。对开发者而言,先把 task_id、状态轮询、错误处理和视频结果存储做成稳定能力,再把首尾帧与参考生成接进来,才是可扩展的实现方式。
现在可通过 ClawSocket 控制台 使用 H3 API。创建 Key 后,先以控制台的实时模型清单验证最小任务,再将 H3 接入现有的多模型调用层;需要继续整理统一接入结构,可阅读本站的 快速接入指南、OpenAI-compatible API 说明 和 开发者统一 API 网关指南。
参考资料
- MiniMax:MiniMax H3 发布说明
- MiniMax API Docs:Video Generation
- MiniMax API Docs:Create Video Generation Task
[^1]: MiniMax,《MiniMax H3: An Open Model Breaking the Boundaries Between Tasks and Modalities》,2026 年 7 月 31 日:发布时间、多模态输入、原生立体声音频、最高 2K 分辨率与最长 15 秒输出。 [^2]: MiniMax API Docs,《Create Video Generation Task》:POST /v2/video_generation、MiniMax-H3、content 结构、输入组合、文件限制与异步任务结果。 [^3]: MiniMax API Docs,《Video Generation》:H3 输出规格、输入格式、时长限制、三步异步流程、10 秒轮询建议与 content.url 结果字段。