Hailuo 02 Standard Image to Video API

minimax/hailuo-02/standard/image-to-video

Hailuo 02 Standard Image to Video 将静态首帧图像与提示词转化为 512P 与 768P 动态视频,支持 6 秒或 10 秒单次生成、可选尾帧定向过渡与智能提示词优化。它能够高度保留输入图像的主体外貌、构图色彩与光影层次,同时赋予画面符合物理规律的自然运动与镜头变焦。

输入
489/1500
Clockmaker Puppet

必填,一张 JPG、PNG 或 WebP 图片,上传不超过 10 MiB。

Clockmaker Puppet

可选,上传格式及大小限制同首帧。使用尾帧时请选择 768P。

使用尾帧时需选择 768P,512P 暂不可选。

输出已就绪
768P · 6 秒 · 42 积分 = $0.210

示例

One continuous locked-camera shot. The astronaut stays near the handrail and watches the single floating wrench directly in front of her open hand. She reaches that open hand forward, wraps her fingers firmly around the middle of the wrench handle, and holds the captured wrench still. This one precise gentle catch is the entire action. The wrench remains one solid metal object and stops moving when gripped. Keep the other hand on the rail, the same face, orange suit, body proportions and cabin geometry throughout. Very subtle zero-gravity drift only. No cuts, no extra tools, no throwing, no text.

Animate this exact macro composition. One transparent bubble swells slowly from the center of the warm mineral pool, forms a rounded dome, then gently ruptures. A single concentric ripple travels outward across the turquoise water while fine steam curls upward. Keep the terraced orange-and-white mineral deposits fixed and sharply detailed. Locked camera, natural fluid surface tension, no sudden boiling, no new landscape or cuts.

Hailuo 02 Standard Image to Video

Hailuo 02 Standard Image to Video 由 MiniMax 研发,专为静态图像动态化与首尾帧转场创作设计。用户上传一张主体清晰的起始图片,并配合时序动作描述,即可生成 6 秒或 10 秒的自然动态成片;当选用 768P 分辨率时,还可上传一张可选尾帧,精确锁定镜头的终点构图。模型在人像面部稳定、衣着细节延续与复杂运镜下展现出优秀的保真度,结合按秒透明计费,适用于各类视觉创意的高效落地。

为什么选择此模式?

  • 卓越的主体与构图延续以首帧为基准,深度保留人物面部轮廓、服饰纹理与原始构图,避免动作开始后发生形变。

  • 支持可选尾帧定向过渡在 768P 分辨率下支持指定结束画面,实现首尾两张静态图片的自然插值与平滑运镜。

  • 6 秒与 10 秒整秒时长选择自由选择轻量节奏或叙事长镜头,充分适配社交媒体与故事叙述等不同场景。

  • 拟真物理与光影交互人物毛发、衣物摆动、水面反光等均遵从写实物理动态,动作平顺无断裂感。

  • 经济明晰的按秒计费体系根据 512P(每秒 3 积分)或 768P(每秒 7 积分)及生成时长按秒计费,失败即刻全额退还。

参数说明

参数要求说明
prompt必填

必填字符串,去除首尾空白后不能为空。最多 1500 个 Unicode 字符。

resolution可选

512P 或 768P,默认 768P。

默认值768P
duration可选

6 或 10 秒,默认 6 秒。

默认值6
image_urls必填

必须包含且仅包含一个首帧图片 HTTP(S) URL。

end_image_url可选

可选尾帧图片 HTTP(S) URL,必须同时提供首帧。仅支持 768P。

prompt_optimizer可选

可选布尔值;省略时由上游处理,体验区默认关闭。

使用方法

  1. 上传清晰的首帧图片准备一张主体明确的 JPG、PNG 或 WebP 格式图片作为视觉起点(体验区单张不超过 10 MiB)。

  2. 规划动态与运镜提示词在提示词中重点描述主体的运动趋势与镜头运镜(例如“人物微笑着轻轻转头,镜头缓慢拉远”)。

  3. 按需指定尾帧画面若希望视频过渡到特定终点构图,请选择 768P 分辨率并在 end_image_url 中上传尾帧图片。

  4. 设定时长与分辨率选择 6 秒或 10 秒输出时长,并指定 512P 或 768P 分辨率规格。

  5. 提交任务并查收成片发起异步生成请求并获得 task_id,通过状态接口或回调通知下载完成的 MP4 视频。

计费说明

1 credit = $0.005。按分辨率和输出秒数计费。

计费项费率说明
512P / 6s18 credits ($0.090)3 credits/秒
512P / 10s30 credits ($0.150)3 credits/秒
768P / 6s42 credits ($0.210)7 credits/秒
768P / 10s70 credits ($0.350)7 credits/秒

适用场景

  • 静态人像与摄影作品动态化为静止的人物肖像、风光摄影赋予细腻微表情与自然环境微风动势。

  • 电商商品与设计资产动态展示将静态产品渲染图或包装图转化为 360 度运镜展示视频,提升转化率。

  • 故事板首尾关键帧过渡合成利用首帧与尾帧定向衔接,制作影视概念分镜与戏剧转场预演。

  • 社交媒体视觉循环素材生成以原创插画或摄影为蓝本,生成 6–10 秒高质量短视频并分享至社媒矩阵。

创作技巧

  • 首尾帧风格尺寸保持一致:同时使用首帧与尾帧时,两张图的主体人物、画面比例与光线风格越协调,中间过渡越平滑。
  • 提示词聚焦增量动态而非静态描述:首帧已包含的物体外观无需逐一重复罗列,提示词应着重描述“动作如何发生”及“镜头如何运动”。
  • 尾帧的分辨率先决条件:使用尾帧 end_image_url 时请务必选择 768P 分辨率,以满足模型端点校验规则。
  • 分层描述细微动作:针对人物面部可具体描写“眼波流转、嘴角微翘”,配合“推近特写”运镜能获得更惊艳的质感。
  • 合理运用提示词优化:对于动作描述较短的提示词,可开启 prompt_optimizer 让模型智能匹配合乎常理的环境交互动态。

注意事项

  • 首帧为必填项:本端点必须传入且仅传入 1 张起始图片 URL(image_urls),前端体验区单张图片上限为 10 MiB。
  • 尾帧使用规则:尾帧 end_image_url 为可选参数,且必须在 768P 分辨率下使用;512P 模式不接受尾帧。
  • 计费与时长规则:时长支持 6 秒或 10 秒整秒,计费由分辨率与时长共同决定,任务若未成功交付将自动退还已扣除积分。

相关模型

Hailuo 02 Standard Image to Video API 常见问题

Hailuo 02 Standard Image to Video API 是什么?

Hailuo 02 Standard Image to Video 是 MiniMax 研发的图像生成视频模型。它根据单张起始图片与文本提示词生成 512P 或 768P 高清动态视频,支持 6 秒与 10 秒输出时长、可选尾帧定向过渡与智能提示词优化。基于 MiniMax 先进的视频生成架构,它在严格保持输入图片主体面貌与场景构图的同时,赋予画面细腻自然的物理动态与运镜轨迹。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。

Hailuo 02 Standard Image to Video 支持指定视频尾帧吗?

支持。你可以在请求中通过 end_image_url 传入一张公开可访问的尾帧图片,模型将以首帧为起始、以尾帧为终点进行平滑连续的动态过渡与镜头运动。

在 Hailuo 02 Standard Image to Video 中使用尾帧需要哪种分辨率?

使用尾帧 end_image_url 时必须选择 768P 分辨率。Standard 模式下的 512P 规格不支持尾帧参数,若需要使用尾帧过渡功能,请将 resolution 参数设为 768P。

Hailuo 02 Standard Image to Video 支持上传几张起始图片?

本端点的 image_urls 数组必须且仅能包含 1 张起始图片 URL。多图混合生成不属于本端点的输入规范,如有明确终点画面需求,可通过 end_image_url 字段提供尾帧。

Hailuo 02 Standard Image to Video 如何保持首图的主体一致性?

模型深度提取首帧的面部五官、服装材质与色彩空间特征,并在整个时间序列中进行动态跟踪。建议在提示词中集中描述身体动作与镜头移动,避免对主体的固有外貌给出冲突描述。

Hailuo 02 Standard Image to Video 支持生成 10 秒视频吗?

支持。模型提供 6 秒与 10 秒两种整秒时长选项(默认时长为 6 秒)。选择 10 秒能够在保持主体稳定的前提下,展现更充裕的动作发展过程与缓和的运镜节奏。

Hailuo 02 Standard Image to Video 的计费方式是什么?

计费按输出分辨率与生成秒数计算(1 积分 = $0.005)。512P 规格为每秒 3 积分(6 秒 18 积分,10 秒 30 积分);768P 规格为每秒 7 积分(6 秒 42 积分,10 秒 70 积分),使用尾帧或开启提示词优化不会产生额外附加费用。