Skip to content

MiniMax H3 发布了:如何通过 ClawSocket 使用 H3 视频 API

MiniMax 在 2026 年 7 月 31 日 发布了 MiniMax H3。它不是只接收一句提示词的视频模型:官方将其定义为开放的通用多模态视频模型,可结合文本、图像、视频和音频理解创作上下文,生成最高 2K、最长 15 秒、带原生立体声音频的视频[^1]。对准备把视频生成放进产品或工作流的开发者,关键不只是模型发布,而是把异步任务、素材 URL、结果下载和模型路由接好。

本文面向需要调用视频生成 API 的开发者和内容工具团队,重点讲清 MiniMax H3 的输入边界、官方 API 的三步工作流,以及通过 ClawSocket 控制台 使用 H3 API 时应如何配置和验证。

MiniMax H3 视频 API 从任务提交到下载结果的异步接入流程图
H3 的一次生成由“提交任务、轮询状态、下载结果”组成;把这三步封装好,才能稳定接入应用。

快速结论

  • MiniMax H32026 年 7 月 31 日 发布,官方 API 模型名为 MiniMax-H3[^1][^2]
  • 官方文档列出的输出规格为 768P2K,时长为 415 秒的整数值[^3]
  • 它支持文生视频、首尾帧图生视频和参考生成;参考输入可包含图像、视频和音频[^3]
  • 视频生成是异步任务:创建接口返回 task_id,成功后从 content.url 取得视频文件[^2][^3]
  • ClawSocket 已可使用 H3 API;实际模型名、计费、速率限制和兼容端点应以 ClawSocket 控制台 当前展示为准

MiniMax H3 发布了什么

MiniMax H3 的发布重点是把多种素材类型放进同一条视频生成链路。官方说明中,文本、图片、视频和音频可以共同构成输入上下文;模型不仅能从零生成视频,也能把指定首帧或尾帧做成连贯镜头,或参考已有的人物、动作、镜头、风格和音色[^1][^3]。

这让它更适合真实的内容生产任务。例如,营销团队可以给一张产品主视觉和一段镜头描述;影视预演工具可以给首帧、尾帧和转场要求;角色内容工作流则可以结合参考图、参考视频和参考音频。无论采用哪种模式,请求里都必须有一条非空的文本 prompt,不能只上传素材[^2]。

能力MiniMax H3 官方说明适合的任务
文生视频文本提示词从零生成短片、概念验证、分镜草稿
首帧 / 尾帧图生视频文本加 1 至 2 张图让静态 KV 动起来,或控制转场起止画面
参考生成文本加参考图、视频或音频延续人物、镜头节奏、风格与声音线索
原生音画输出最高 2K、最长 15 秒、原生立体声需要一次性得到带声音的短视频素材

MiniMax H3 API 的输入和限制

官方 POST /v2/video_generation 接口使用 content 数组传递多模态输入。每个元素由 type 标识,例如 textimage_urlvideo_urlaudio_url;需要时再用 role 指明它是 first_framelast_framereference_imagereference_videoreference_audio[^2]。

几个边界会直接影响实现:输出时长只能填写 415 的整数;提示词上限为 7000 个字符;单张图片最大 30 MB,单段参考视频最大 50 MB,API 请求体总量不应超过 64 MB。大素材建议提供可访问的 URL,而不是把 Base64 堆进请求体[^2][^3]。

首尾帧模式和参考模式不能混用。若请求包含 reference_imagereference_videoreference_audio,就不能同时传 first_framelast_frame;而参考音频也不能单独发送,至少还要配一张参考图或一段参考视频[^2]。这些规则适合在业务侧提前校验,避免任务提交后才收到参数错误。

官方 H3 API 怎么调用

H3 的工作流固定分为三步:创建任务、查询状态、下载结果。创建接口成功后只会返回 task_id,而不是直接返回 MP4;官方示例建议每 10 秒查询一次,直到状态变为 succeededfailedcancelled[^3]。

下面是最小的文生视频请求,端点和字段来自 MiniMax 官方 V2 文档:

bash
curl https://api.minimax.io/v2/video_generation \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $MINIMAX_API_KEY" \
  -d '{
    "model": "MiniMax-H3",
    "content": [{
      "type": "text",
      "text": "产品在晨光中的桌面上缓慢旋转,镜头由近到远推进,干净的商业广告风格,环境音自然。"
    }],
    "resolution": "2K",
    "duration": 5,
    "ratio": "16:9"
  }'

拿到 task_id 后,再查询任务:

bash
curl "https://api.minimax.io/v2/query/video_generation/$TASK_ID" \
  -H "Authorization: Bearer $MINIMAX_API_KEY"

响应中的 task.statussucceeded 时,下载地址位于 task.content.url。生产实现不要无限轮询:对 failedcancelled 立刻结束;对网络错误实行有限次数重试;把 task_id、模型名、时长、分辨率和最终状态写入自己的任务表,方便追查成本和失败原因。

通过 ClawSocket 使用 H3 API

已经使用 ClawSocket 管理模型调用时,不必为 H3 另起一套应用侧密钥和模型配置。先在 ClawSocket 控制台 创建 API Key,并确认 H3 的实际模型 ID、视频生成端点、计费方式和并发限制;再按控制台给出的 Base URL 与认证方式,将上面的“创建任务 - 查询任务 - 下载结果”封装接入。

这里有一个必须保留的边界:MiniMax 官方 API 的 MiniMax-H3/v2/video_generation 和查询路径是官方文档中的写法;第三方统一入口可能沿用它们,也可能提供自己的模型别名或兼容路由。因此上线代码中不要从文章复制一个模型名后永久写死,应该以控制台模型列表和请求示例为准。

推荐的接入顺序如下:

  1. ClawSocket 控制台 创建 API Key,并查看 H3 当前模型名与可用端点。
  2. 先用 5 秒、768P 的文本任务验证认证、请求结构和回调链路。
  3. 接入任务存储与轮询,只有 succeeded 才向用户展示 content.url
  4. 再增加首尾帧或参考素材,并在上传前检查格式、大小与素材 URL 可访问性。
  5. 稳定后再将默认分辨率升级到 2K,同时记录每次任务的时长、失败率和成本。

对已有 OpenAI-compatible 文本工作流的团队,视频生成通常不是“把模型名换一下”就结束了。它还需要一个任务状态层和结果文件处理层;先把异步编排完成,再比较不同模型的提示词和画质,效率会高得多。

哪些场景适合用 H3

MiniMax H3 最适合“有明确素材约束”的短视频任务。纯文生视频可以快速探索创意方向;有首帧或尾帧时,适合把品牌视觉、商品图或故事板转成可控的动态片段;需要人物、动作或声音一致性时,则应使用参考生成。

场景推荐输入先验证什么
商品动态海报首帧图片加文本商品外观、构图和镜头运动是否保持一致
社媒短视频文本或参考图9:16 比例、字幕预留区和前 2 秒信息密度
角色口播片段参考图 / 视频加参考音频人物一致性、音画同步和素材授权
剪辑转场首帧和尾帧图片两端画面衔接是否自然

对于高频生产,建议固定一组内部测试任务:至少包含一条纯文本、一个商品首帧、一个首尾帧转场和一个参考素材任务。每次模型或路由升级后,统一比较成功率、平均排队时间、生成耗时、返工次数和每秒成本,而不是只看单条样片。

FAQ

MiniMax H3 的 API 模型名是什么?

MiniMax 官方 V2 视频生成文档当前列出的模型名是 MiniMax-H3。通过 ClawSocket 等第三方入口调用时,应以控制台实时模型列表为准,因为模型别名与上架节奏可能不同。

MiniMax H3 能生成多长的视频?

官方文档列出 H3 的输出时长为 415 秒,且必须填写整数值;输出分辨率可选 768P2K。具体可用选项仍可能受账户、区域、路由或平台限制影响。

H3 API 是同步返回视频吗?

不是。创建任务后先返回 task_id,客户端需要查询任务状态;状态为 succeeded 时,从 task.content.url 获取生成结果。官方示例使用 10 秒的查询间隔。

通过 ClawSocket 调用 H3 时,能直接照抄官方 URL 吗?

不要假定可以。MiniMax 官方 URL 是 https://api.minimax.io/v2/video_generation;通过 ClawSocket 调用时,请使用控制台提供的 Base URL、认证方式、模型名和端点。这样才能避免把官方协议和第三方兼容协议混在一起。

总结

MiniMax H3 发布 的价值,不只是多了一个短视频模型,而是它把文本、图像、视频和音频参考放到了同一套异步视频 API 里。对开发者而言,先把 task_id、状态轮询、错误处理和视频结果存储做成稳定能力,再把首尾帧与参考生成接进来,才是可扩展的实现方式。

现在可通过 ClawSocket 控制台 使用 H3 API。创建 Key 后,先以控制台的实时模型清单验证最小任务,再将 H3 接入现有的多模型调用层;需要继续整理统一接入结构,可阅读本站的 快速接入指南OpenAI-compatible API 说明开发者统一 API 网关指南

参考资料

[^1]: MiniMax,《MiniMax H3: An Open Model Breaking the Boundaries Between Tasks and Modalities》,2026 年 7 月 31 日:发布时间、多模态输入、原生立体声音频、最高 2K 分辨率与最长 15 秒输出。 [^2]: MiniMax API Docs,《Create Video Generation Task》:POST /v2/video_generationMiniMax-H3content 结构、输入组合、文件限制与异步任务结果。 [^3]: MiniMax API Docs,《Video Generation》:H3 输出规格、输入格式、时长限制、三步异步流程、10 秒轮询建议与 content.url 结果字段。

Last updated:

本站为独立第三方信息与服务站点,非 OpenAI、Google、Anthropic 官方网站,与上述品牌无官方隶属关系 · 免责声明