MiniMax H3 Reference-to-Video API

minimax/h3/reference-to-video
2K · 5–15 sec

MiniMax H3 Reference-to-Video API 接受提示词、最多 9 张参考图片、3 个参考视频和 3 个可选参考音频。请求必须至少包含一张图片或一个视频,再选择 5–15 秒时长及 adaptive 或固定画面比例,提交固定 2K 视频任务。

输入

101/2000
1/9
Reference preview
1/3
1/3
natural-rain-5s.mp3

输出

已就绪
5 秒 × $0.105/秒 + 参考素材 $0.525 = $1.05

继续使用

MiniMax H3 Reference-to-Video API

MiniMax H3 Reference-to-Video API 将必填提示词与公开 HTTP(S) 图片、视频及可选音频 URL 放在同一请求中。请求必须至少包含一张图片或一个视频,音频不能作为唯一参考类型;成功提交后返回固定 2K 视频的异步任务。

为什么选择 MiniMax H3 Reference-to-Video API?

  • 在一个请求中组合三种参考素材。同时提交参考图片和参考视频 URL,并可添加参考音频 URL。

  • 使用明确的参考素材上限。在一次请求中组合最多 9 张图片、3 个视频和 3 个音频。

  • 明确分配素材角色。在提示词中写明每张图片、每个视频和每个音频的预期作用。

  • 选择 adaptive 或固定画面比例。aspect_ratio 可设置为 adaptive、21:9、16:9、4:3、1:1、3:4 或 9:16。

  • 固定 2K 输出并分项计费。生成秒数、参考视频计费秒数和第五张之后的参考图片分别计价。

参数说明

参数要求说明
prompt必填

描述目标场景、动作和每项参考素材的作用。去除首尾空格后长度为 1–2,000 个字符。

reference_image_urls条件必填,最多 9 个

最多 9 个公开 HTTP(S) 图片 URL。必须至少包含一个图片或视频参考。

reference_video_urls条件必填,最多 3 个

最多 3 个公开 HTTP(S) 视频 URL。计费视频时长会计入最终费用。

reference_audio_urls可选,最多 3 个

最多 3 个公开 HTTP(S) 音频 URL。不能在没有图片或视频参考的情况下单独提交音频。

duration可选

取值为 5–15 的整数生成秒数。

默认值55–15
resolution固定

不接受其他分辨率。

默认值2K
aspect_ratio可选

让画幅自动适配,或选择固定交付比例。

adaptive21:916:94:31:13:49:16

使用方法

  1. 选择素材组合至少添加一张图片或一个视频;只有声音或节奏需要引导结果时才添加音频。

  2. 分配素材角色明确哪项素材负责外观、运动、环境、镜头行为或声音。

  3. 描述素材关系和动作说明参考主体、运动、环境和声音应如何组合到新的场景中。

  4. 设置构图和时长选择 adaptive 或固定构图,再设置 5–15 秒时长。

  5. 提交并跟踪运行请求,然后轮询 task ID,或使用回调 URL 接收结果。

计费

费用由生成时长和参考素材用量共同决定。生成视频和计费参考视频均按每秒 21 积分计费;超过前五张的参考图片会产生额外费用。

计费项目费率详情
生成视频每秒 21 积分未计参考素材费用前,5 秒消耗 105 积分,10 秒消耗 210 积分,15 秒消耗 315 积分。
参考视频每个计费秒 21 积分后端会分别向下取整每个参考视频的时长,再将所有计费秒数相加。
第 1–5 张参考图片无图片附加费前五张参考图片不会产生图片专项费用。
第 6–9 张参考图片每张 6.4 积分超过前五张后,每增加一张图片消耗 6.4 积分,最多使用九张。

适用场景

  • 角色一致性在新的短场景中延续易于识别的角色外观和视觉语言。

  • 营销活动参考素材集在一次视频请求中提交已审核的产品图片、运动示例和可选音频参考。

  • 产品与电商变体利用现有产品、环境和运动参考,引导发布及商品目录视频创作。

  • 游戏与影视预演基于同一组创意参考素材,探索调度、镜头运动和声音方向。

实用技巧

  • 尽量使用主体或用途单一明确、画面干净的参考素材。
  • 为每项素材指定一个主要作用,不要让所有参考素材同时控制整个结果。
  • 明确描述素材关系,例如图片一负责角色外观、视频一负责运动、音频一负责声音方向。
  • 使用图片控制外观和环境,使用视频控制运动与镜头行为,并用可选音频提供声音方向。
  • 源素材画幅不同时使用 adaptive;已确定交付格式时选择固定比例,复杂互动则预留更长时长。
  • 添加更多素材前,先删除重复或相互冲突的参考内容。

注意事项

  • 参考音频为可选项,并且只有在请求同时包含至少一张参考图片或一个参考视频时才有效。
  • 每个参考视频的时长会分别向下取整,再汇总为参考视频计费秒数。
  • 参考图片附加费从第六张开始计算,前五张不收取图片附加费。
  • 成功提交后返回任务 ID;可轮询至 finished 或 failed,也可提供 callback_url。

MiniMax H3 参考素材生视频 API 常见问题

什么是 MiniMax H3 Reference-to-Video API?

MiniMax H3 Reference-to-Video API 接受提示词、最多 9 张参考图片、3 个参考视频和 3 个可选参考音频,并返回固定 2K 视频的异步任务。请求必须至少包含一张图片或一个视频,因此只提交音频会被拒绝。

如何调用 MiniMax H3 Reference-to-Video API?

使用 Bearer API Key 向 /api/generate/submit 发送 POST 请求,将 model 设为 minimax/h3/reference-to-video,并把生成参数放入 input。接口会立即返回 task_id;API 页签提供可运行的 cURL、JavaScript 和 Python 示例,完整字段定义见 https://docs.vidgo.ai/api-manual/video-series/minimax-h3-reference-to-video。

MiniMax H3 Reference-to-Video 如何计费?

生成视频每秒消耗 21 积分。每个参考视频的时长会分别向下取整,并按每秒 21 积分计费;第 6–9 张参考图片每张额外消耗 6.4 积分。运行按钮会显示计算后的美元价格;远程参考视频时长未知时则显示最低美元价格。

MiniMax H3 Reference-to-Video 接受哪些输入?

核心输入包括 prompt、reference_image_urls、reference_video_urls、reference_audio_urls、duration、resolution 和 aspect_ratio。必须至少包含一张图片或一个视频,不能只提交音频;duration 为 5–15 的整数秒,resolution 固定为 2K。上方参数表列出了 9/3/3 素材上限、默认值以及 adaptive 或固定构图选项。

如何获取生成的视频?

使用返回的 task_id 轮询 GET /api/generate/status/{task_id},直到状态变为 finished 或 failed。任务完成后从 data.files[].file_url 读取视频地址;也可以在提交请求中加入 callback_url,异步接收最终结果。

应该选择哪个 MiniMax H3 API 模式?

请求需要多张图片、多个视频或可选音频参考时选择 Reference-to-Video;需要一张必填首帧和一张可选尾帧时选择 Image-to-Video;请求不包含源素材时选择 Text-to-Video。