Kling 3.0 Standard Image to Video API

kwaivgi/kling-v3.0-std/image-to-video

Kling 3.0 Standard Image to Video 将静态图片生成720p视频,结合原生音频与尾帧引导。以首帧和主体参考约束人物外观,让动作和运镜围绕原图展开。

输入

437/2,500

Image Urls[0]
Image Urls[0]
Image Urls[1]

为元素填写名称,选择 2–4 张 JPG/PNG 图片或一个 MP4/MOV 视频,再通过 @element_name 引用。

输出
视频已就绪
3 秒 × 39 积分/秒 = 117 积分 ($0.585)
探索其他创作方式

示例

A single ivory folded-paper glider gently rises along a short smooth arc from the supplied first frame to the supplied final frame in three seconds. Maintain precisely one glider and unchanged folded geometry, canyon layers, camera position and soft lighting. Controlled miniature stop-motion feel, no wobbling wings, no strings, no cuts or additional objects.

Preserve the source composition. During three seconds the mechanic makes one short gentle wipe across the copper fitting with the grey cloth, revealing a small change in reflected light, then stops. Keep hand anatomy, cloth, workwear and all train parts consistent. Stationary camera, subtle dust in skylight; the locomotive remains still. No transformation, new parts, text or cut.

Kling 3.0 Standard Image to Video

Kling 3.0 Standard Image to Video 是快手用于静态图片动画化的模型,适合从已有视觉稿探索运动方式。首帧建立场景起点,主体参考为人物或物体的外观提供依据,音画联合生成则补充场景声音。可用于比较产品亮相方式、角色动作和镜头路径,在进一步制作前确认图片如何转变为动态片段。

为什么选择 Kling 3.0 Standard Image to Video

  • 探索不同场景方向720p 档位的静音单镜头每秒 $0.135 起,适合在相同规格下比较不同提示词或动作方案。

  • 以选定视觉稿为起点由首帧建立主体与构图,再通过动作描述让静态视觉展开。

  • 为收尾设定目标为单镜头配上首帧与尾帧,引导画面朝设定的收尾图像发展。

  • 为重复主体提供依据为参考元素命名,并在提示词中点名引用,为角色或产品外观提供依据。

参数说明

参数使用条件用法
image_urls必填

索引 0 填首帧,索引 1 可填尾帧,使用可公开访问的 HTTP(S) 图片地址。单镜头使用 1–2 张图片,多镜头使用一张首帧。

默认值明确填写
promptmulti_shots=false 时

用 1–2,500 个字符描述参考画面中的动作和镜头运动。多镜头模式在 multi_prompt 中逐镜填写。

默认值明确填写
multi_shots可选

false 使用单条提示词;true 使用 multi_prompt 分别编排镜头,并设置 sound=true。

默认值false
multi_promptmulti_shots=true 时

添加至少一个含 prompt 和 duration 的对象。每条提示词为 1–2,500 个字符,每个镜头为 1–12 整数秒,分镜时长之和须等于 duration。

默认值明确填写
duration必填

总时长填写 3–15 的整数秒;多镜头模式填写各分镜时长之和。

默认值明确填写
sound可选

true 生成音频,静音单镜头使用 false,多镜头使用 true。

默认值true
aspect_ratio可选

输出画幅由首帧确定,请按目标构图准备首帧。

默认值由首帧确定
kling_elements可选

与 image_urls 一起提供元素对象,在提示词中用 @element_name 引用具名主体。每个元素填写 name,并选择 2–4 张 JPG/PNG 图片(每张最多 10 MB)或一个 MP4/MOV 视频(最多 50 MB),可用 description 补充外观特征。

默认值不使用时省略

使用方法

  1. 准备场景起点添加首帧并描述动作,可用尾帧安排收尾。

  2. 选择镜头结构单镜头填写一条提示词;多镜头开启 Multi Shots,逐镜填写内容与时长。 多镜头使用一张首帧;单镜头可同时使用首帧与尾帧。

  3. 检查时长与声音将总时长设为 3–15 秒,多镜头保持 Sound 开启,提交前查看显示的费用。

  4. 生成并查看片段点击 Run,完成后预览视频,再根据结果调整动作或运镜描述。

用量与计费

Kling 3.0 Standard Image to Video 按生成视频时长计费,以秒数乘以 Sound 对应单价。

生成方式每秒单价计费依据
静音单镜头$0.135/秒sound=false 且 multi_shots=false,5 秒视频费用为 $0.675。
有声单镜头或多镜头$0.195/秒sound=true,5 秒视频费用为 $0.975;多镜头按分镜总时长计费。

适用场景

  • 主视觉动作试稿以同一张首帧比较镜头推进、主体手势与缓慢揭示,输出720p动作方案。

  • 角色片段从角色图片出发,描述回望、转身或手势,并以元素参考提供外观依据。

  • 主视觉动画围绕已有品牌主视觉安排动作与声音,发展为短场景。

使用技巧

  • 选择主体清晰、构图符合目标的首帧。
  • 重点描述主体如何运动以及镜头如何移动,静态外观由参考图提供依据。
  • 为单镜头选择能承接开场动作的尾帧。
  • 为每个参考元素设置不同名称,并在提示词中使用对应的 @名称。

使用说明

  • 多镜头使用一张首帧;单镜头可同时使用首帧与尾帧。
  • 将总时长保持在 3–15 秒,多镜头开启 Sound。

相关模型

Kling 3.0 Standard Image to Video API 常见问题

Kling 3.0 Standard Image to Video API 是什么?

Kling 3.0 Standard Image to Video 是快手用于静态图片动画化的模型。它生成720p视频,结合原生音频与参考帧引导。图像条件引导开场构图,元素参考为重复主体提供外观依据。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。

Kling 3.0 Standard Image to Video 如何使用尾帧?

在 image_urls[0] 填开场图,在 image_urls[1] 填目标收尾图。多镜头使用一张首帧;单镜头可同时使用首帧与尾帧。在提示词中描述连接两幅构图的动作。

Kling 3.0 Standard Image to Video 如何使用主体参考?

同时提供 image_urls 与 kling_elements,再在提示词中用 @element_name 指定重复出现的主体。每个元素填写名称,并选择 2–4 张参考图或一个参考视频。

Kling 3.0 Standard Image to Video 如何安排分镜时长?

开启 multi_shots 与 sound,为每个镜头填写提示词和 1–12 整数秒时长。duration 填分镜时长之和,合计为 3–15 秒。多镜头使用一张首帧;单镜头可同时使用首帧与尾帧。

Kling 3.0 Standard Image to Video 如何生成音频?

设置 sound=true,并结合画面动作描述对白、环境声或音效。单镜头可设置 sound=false 生成静音视频,多镜头设置 sound=true。

Kling 3.0 Standard Image to Video 的首帧如何影响构图?

第一张图片确定开场构图与输出画幅。提交前按目标构图裁切首帧,再描述从该画面展开的主体动作和镜头运动。

何时选择 Kling 3.0 Standard 而非 Kling 3.0 Pro?

需要以较低每秒费用探索720p场景时选择 Standard;需要1080p细节时选择 Pro,两者均可生成音频并分别编排分镜时长。

Kling 3.0 Standard 的5秒图片动画如何计费?

静音单镜头按每秒 $0.135 计算,5 秒费用为 $0.675;开启声音后按每秒 $0.195 计算,5 秒费用为 $0.975。多镜头使用有声单价,并按分镜总时长计费。