Kling O3 Pro Text to Video API

kwaivgi/kling-video-o3-pro/text-to-video

Kling O3 Pro 文生视频:通过文本提示词生成 3–15 秒视频。支持单镜头和多镜头;sound 必须显式传入,多镜头必须开启声音。

输入

多镜头必须开启声音。表单自动按分镜总时长填写 duration。

410/2,500
399/2,500

Duration: 5 (3-15)

输出
已就绪
5 秒 × 16 积分/秒 = 80 积分 ($0.400)
继续使用

示例

Photoreal indoor roller-derby footage on a teal track. One adult skater in a mustard jersey, black helmet and protective pads takes a tight left curve on quad skates. Knees bent, center of gravity low, wheels contacting the floor as weight shifts naturally. Low camera tracks smoothly alongside. Empty stands, overhead arena lights and realistic motion blur. Complete one clear turn without falling. No text, logos or watermarks.

Photoreal aerial shot gliding alongside a vast cumulonimbus tower above a cloud sea at sunrise. Cool sculpted shadows contrast with an amber horizon. One internal lightning pulse briefly illuminates branching shapes deep in the cloud, then fades back to dawn light. Volumetric depth, delicate wisps and coherent lighting. No visible aircraft, ground, people or buildings. No text, logos or watermarks.

Kling O3 Pro Text to Video

Kling O3 Pro 文生视频:通过文本提示词生成 3–15 秒视频。支持单镜头和多镜头;sound 必须显式传入,多镜头必须开启声音。

为什么选择此模型

  • 1080p 广播级成片质感输出细腻的 1080p 全高清画质,真实还原发丝细节、皮肤微纹理与电影级丁达尔光效。

  • 深度视觉思维链(vCoT)生成前对场景透视、多主体互动与摄影机推拉摇移进行前置推理,杜绝空间形变与穿模。

  • 专业级多镜头分镜语法在单次任务中容纳多个分镜叙事段落,支持跨分镜的人物身份与环境色调高度统一。

  • 演播室级原生音画同步结合场景语义自动生成多声道空间环境音、物理接触 Foley 音效与精准唇形同步语音。

  • 电影摄影机运动模拟精准还原升降、环绕、希区柯克变焦等高难度影视运镜,呈现平稳且富有叙事张力的视觉运动。

参数说明

参数要求说明
prompt条件必填

multi_shots=false 时必填,描述场景、动作和镜头运动。去除首尾空白后须为非空文本,最多 2,500 字符。multi_shots=true 时请省略 prompt。

默认值-
multi_shots

必填,必须显式传入 false(单镜头)或 true(多镜头)。单镜头需要 prompt;多镜头需要 multi_prompt 和 sound=true,且顶层 prompt 不得为非空文本。省略此字段会报错。

默认值-
multi_prompt条件必填

multi_shots=true 时必填,单镜头模式请省略。至少提供一个分镜,每段包含非空 prompt(最多 2,500 字符)和整数 duration(1–12 秒)。分镜时长之和必须等于顶层 duration(3–15 秒)。分镜内的额外字段会被忽略。

默认值-
duration

必填,3–15 秒的整数。多镜头模式下必须等于所有分镜时长之和,积分按此值计算。

默认值-
sound

必填,必须显式传入 true(生成声音)或 false(无声视频)。单镜头可使用任一值,多镜头必须为 true。

默认值-
aspect_ratio

可选,支持 16:9(横屏)、9:16(竖屏)或 1:1(方形),用于设置视频画幅。

默认值-

使用步骤

  1. 构建影视级提示词详细描写场景的影调色彩、构图比例、主角外貌以及核心戏剧性冲突动作。

  2. 配置镜头与分镜结构选择单镜头长镜头推进,或开启多镜头分镜并细化各小节的分镜脚本与时长分配。

  3. 选定输出参数选择 3–15 秒的整秒成片时长,并选定 16:9、9:16 或 1:1 的成片画幅。

  4. 开启原生音频通道勾选 sound 选项,激活原生多模态声音合成引擎以自动配对对白与音效。

  5. 渲染交付与下载提交任务后进入异步渲染,在控制台监控进度并最终下载无水印 1080p MP4 视频。

价格

费用 = 顶层 duration × 每秒费率。1 积分 = $0.005。任务若执行失败,系统将全额自动返还扣除的积分。

计费项费率说明
无声13 积分/秒 ($0.065/s)专业 1080p 影视级画质,不包含声音轨道。
有声16 积分/秒 ($0.080/s)包含 1080p 全高清画面与演播室级原生音画同步轨道。

适用场景

  • 影视与剧集概念预演将导演分镜本快速转为 1080p 动态视频样片,直观评估视听语言与机位剪辑点。

  • 商业品牌广告成片生成具备细腻光影质感与高级调色的 1080p 广告短片,满足大屏投放要求。

  • 高质量微短剧制作借助多镜头与口型同步能力,单批次生成具备完整情节叙事与对白的小短剧片段。

  • 游戏与动画概念片将世界观设定转化为富有视觉冲击力的动态概念视频,表现复杂幻想生物与科幻机械运转。

使用技巧

  • 建议融入电影专业词汇指导画面,如“35mm 镜头景深”、“逆光边缘轮廓光”、“低机位缓慢跟拍”。
  • 当涉及多人物互动时,在提示词中分别描述各人物的位置分布与先后动作次序,引导模型建立明确的空间层级。
  • 多镜头模式下,各镜头的提示词风格保持统一的光影基调(如“冷色调胶片颗粒”),可实现镜头间丝滑的自然剪接。
  • 若需强调口型同步,提示词中请使用双引号明确标出对白内容并标明角色名。
  • 复杂动作场景建议配置 5 秒以上的时长,让物理形变与动量释放具有更充裕的动画插值空间。

注意事项

  • Pro 档位专注交付 1080p 高清画质,计算开销与推理深度显著高于 Standard 档位。
  • 开启 multi_shots 必须同时配置 sound=true,且顶层 prompt 必须置空。
  • 任务执行采用异步处理机制,请利用 task_id 查询进度,建议初始间隔 2–3 秒轮询。

Kling O3 Pro Text to Video API 常见问题

这个端点可以生成什么?

Kling O3 Pro 文生视频:通过文本提示词生成 3–15 秒视频。支持单镜头和多镜头;sound 必须显式传入,多镜头必须开启声音。

如何设置多镜头?

必填,必须显式传入 false(单镜头)或 true(多镜头)。单镜头需要 prompt;多镜头需要 multi_prompt 和 sound=true,且顶层 prompt 不得为非空文本。省略此字段会报错。 multi_shots=true 时必填,单镜头模式请省略。至少提供一个分镜,每段包含非空 prompt(最多 2,500 字符)和整数 duration(1–12 秒)。分镜时长之和必须等于顶层 duration(3–15 秒)。分镜内的额外字段会被忽略。

视频画幅如何确定?

可选,支持 16:9(横屏)、9:16(竖屏)或 1:1(方形),用于设置视频画幅。

如何控制声音?

必填,必须显式传入 true(生成声音)或 false(无声视频)。单镜头可使用任一值,多镜头必须为 true。

提示词有哪些长度限制?

提示词的 API 校验上限为 2,500 字符。部分多镜头生成请求曾因单段提示词超过 512 字符而失败,建议每段控制在 512 字符以内;这项建议不改变 API 校验上限。

时长和积分如何计算?

时长为 3–15 秒。无声视频 13 credits/秒,有声视频 16 credits/秒;积分为顶层 duration 乘以对应费率。

生成失败或请求超时怎么办?

非法参数会在创建生成任务和扣费前被拒绝。已受理的生成任务状态变为 failed 后,已扣积分会退回。客户端超时不代表任务失败,请先查询原 task_id 的状态,再决定是否重新提交。