Kling O3 Pro Image to Video API

kwaivgi/kling-video-o3-pro/image-to-video

Kling O3 Pro 图生视频:使用首帧和可选尾帧生成 3–15 秒视频。支持单镜头和多镜头;sound 必须显式传入,多镜头必须开启声音。

输入

多镜头必须开启声音。表单自动按分镜总时长填写 duration。

422/2,500
410/2,500

Duration: 5 (3-15)

Image Urls[0]
Image Urls[0]
Image Urls[1](可选)
输出
已就绪
5 秒 × 16 积分/秒 = 80 积分 ($0.400)
继续使用

示例

Animate the supplied chameleon photo as a natural-history macro shot. Preserve its exact striped skin, horns-free head, curled tail, branch and dry rocky terrarium. The visible turret eye slowly rotates toward the camera while the nearest forefoot opens its two opposing toe groups and reaches a short distance forward onto the same branch. End after the foot grips securely. Very subtle breathing. Fixed camera, no color transformation, no tongue strike, no new limbs. No text, logos or watermarks.

Locked 16-bit sprite animation. Preserve this kitchen and chef on the SAME coarse square pixel grid throughout. Animate one small pancake as a FLAT 2D PIXEL SPRITE: it hops just above the pan, flips, lands back in the pan. Pan and pancake contours remain jagged staircase pixels, with flat palette colors. Sparse stepped keyframes, no tweening, no motion blur, no antialiasing, no 3D shading, no round painted edges. Keep the background still. Pixel steam rises beside the window. No text, logos or watermarks.

Kling O3 Pro Image to Video

Kling O3 Pro 图生视频:使用首帧和可选尾帧生成 3–15 秒视频。支持单镜头和多镜头;sound 必须显式传入,多镜头必须开启声音。

为什么选择此模型

  • 首尾关键帧高精插值精确绑定始末两张静态画面的物理空间坐标与构图约束,基于动力学自动计算平滑连贯的过渡形变与相机轨迹。

  • 1080p 影视级微纹理保真在 1080p 全高清分辨率下精准重构源图的面部毛孔、布料纤维、玻璃反光及阴影渐变,避免模糊与杂色。

  • 严苛的人物与资产一致性深度特征匹配网络在运动全过程中牢牢锁定角色五官、服装纹饰及道具几何比例,杜绝形变漂移。

  • 原生动作环境音画合成基于画面的物理运动轨迹(如击掌、水流撞击、脚步摩擦)原生解算声波时间对齐,提供演播室级听觉沉浸感。

  • 弹性时长与分镜叙事支持 3–15 秒整秒输出,兼顾单镜头精细动力学插值与多镜头结构化镜头组接,赋予静态静帧更丰富的影视叙事力。

参数说明

参数要求说明
prompt条件必填

multi_shots=false 时必填,描述场景、动作和镜头运动。去除首尾空白后须为非空文本,最多 2,500 字符。multi_shots=true 时请省略 prompt。

默认值-
multi_shots

必填,必须显式传入 false(单镜头)或 true(多镜头)。单镜头需要 prompt;多镜头需要 multi_prompt 和 sound=true,且顶层 prompt 不得为非空文本。省略此字段会报错。

默认值-
multi_prompt条件必填

multi_shots=true 时必填,单镜头模式请省略。至少提供一个分镜,每段包含非空 prompt(最多 2,500 字符)和整数 duration(1–12 秒)。分镜时长之和必须等于顶层 duration(3–15 秒)。分镜内的额外字段会被忽略。

默认值-
duration

必填,3–15 秒的整数。多镜头模式下必须等于所有分镜时长之和,积分按此值计算。

默认值-
sound

必填,必须显式传入 true(生成声音)或 false(无声视频)。单镜头可使用任一值,多镜头必须为 true。

默认值-
aspect_ratio

可省略;若传入,仅接受 16:9、9:16 或 1:1。图生会忽略该值,实际画幅由输入图片决定。

默认值-
image_urls

必填,包含 1–2 张图片的数组,第一张为首帧,第二张为可选尾帧。支持公开 HTTP(S) URL、图片 Data URI 或原始 Base64 图片数据。

默认值-

使用步骤

  1. 上传高分辨率关键帧上传 1 张起始参考静帧(必传);若需精准控制动作终点,可追加 1 张结束静帧。

  2. 描述动作与运镜轨迹在提示词中描写主体从起始状态到后续动作的物理过渡细节、速度感及摄像机调度。

  3. 设定时长与音频选择 3–15 秒的整数成片时长,并决定是否开启原生音画同步开关以合成环境音。

  4. 提交渲染任务点击运行或通过 API 提交生成请求,底层推理引擎依据首尾帧进行高精物理轨迹解算。

  5. 预览成片并下载生成完成后在线核对人物一致性与动作流畅度,下载无水印 1080p MP4 视频成品。

价格

费用 = 顶层 duration × 每秒费率。1 积分 = $0.005。若任务未能成功交付可用视频,扣除的积分将全额自动返还。

计费项费率说明
无声13 积分/秒 ($0.065/s)1080p 专业级关键帧动态插值,不包含音频轨道。
有声16 积分/秒 ($0.080/s)1080p 专业级成片画面,深度整合动作 Foley 音效与环境音轨。

适用场景

  • 高定品牌大片与电商动态化将拍摄好的高精模特写真与静物白底图转化为充满高级动态呼吸感的 1080p 视频。

  • 影视特效关键帧精准过渡设定特定起幅与落幅静帧构图,自动补齐符合空气阻力与重力规律的连续动作镜头。

  • 角色 IP 动态数字活化保持动漫角色或虚拟人面容五官毫厘不差,生成生动的表情对话与动作表演片段。

  • 建筑设计与空间环视展示将效果图渲染图以平稳推拉摇移运镜转化为沉浸式漫游视频,光影变幻真实可信。

使用技巧

  • 使用双关键帧时,建议首尾两张图在光影角度与人物特征上保持连贯,重点变化体现在机位景别或肢体姿态。
  • 提示词着重描写两张图片之间的“过程动态”,例如“从沉思逐渐展露微笑并抬头望向窗外”。
  • 输入图片建议使用清晰、无伪影的高清图,主体在画框中拥有充裕的运动缓冲空间。
  • 如需生成特定语言的对话对白,在提示词中加入中英文双引号对话内容,并确保首帧人物面部无明显遮挡。
  • 避免在提示词中要求发生瞬间突兀的角度反转(如从正面直接 180 度跳跃至背面),渐进式动作可获得最佳物理真实感。

注意事项

  • image_urls 支持 1–2 张图片(第一张为首帧,第二张为尾帧)。成片宽高比将自然适配输入图片的构图比例。
  • 开启多镜头 multi_shots 必须配置 sound=true,并确保每个分镜时长之和满足总时长约束。
  • 生成过程为异步执行,请通过返回的 task_id 定期轮询任务状态直至 finished 或 failed。

Kling O3 Pro Image to Video API 常见问题

这个端点可以生成什么?

Kling O3 Pro 图生视频:使用首帧和可选尾帧生成 3–15 秒视频。支持单镜头和多镜头;sound 必须显式传入,多镜头必须开启声音。

如何使用首帧和尾帧?

必填,包含 1–2 张图片的数组,第一张为首帧,第二张为可选尾帧。支持公开 HTTP(S) URL、图片 Data URI 或原始 Base64 图片数据。

视频画幅如何确定?

可省略;若传入,仅接受 16:9、9:16 或 1:1。图生会忽略该值,实际画幅由输入图片决定。

如何设置多镜头?

必填,必须显式传入 false(单镜头)或 true(多镜头)。单镜头需要 prompt;多镜头需要 multi_prompt 和 sound=true,且顶层 prompt 不得为非空文本。省略此字段会报错。 multi_shots=true 时必填,单镜头模式请省略。至少提供一个分镜,每段包含非空 prompt(最多 2,500 字符)和整数 duration(1–12 秒)。分镜时长之和必须等于顶层 duration(3–15 秒)。分镜内的额外字段会被忽略。

如何控制声音和提示词长度?

必填,必须显式传入 true(生成声音)或 false(无声视频)。单镜头可使用任一值,多镜头必须为 true。 提示词的 API 校验上限为 2,500 字符。部分多镜头生成请求曾因单段提示词超过 512 字符而失败,建议每段控制在 512 字符以内;这项建议不改变 API 校验上限。

时长和积分如何计算?

时长为 3–15 秒。无声视频 13 credits/秒,有声视频 16 credits/秒;积分为顶层 duration 乘以对应费率。

生成失败或请求超时怎么办?

非法参数会在创建生成任务和扣费前被拒绝。已受理的生成任务状态变为 failed 后,已扣积分会退回。客户端超时不代表任务失败,请先查询原 task_id 的状态,再决定是否重新提交。