Kling O3 Standard Text to Video API

kwaivgi/kling-video-o3-std/text-to-video

Kling O3 Standard 文生视频:通过文本提示词生成 3–15 秒视频。支持单镜头和多镜头;sound 必须显式传入,多镜头必须开启声音。

输入

多镜头必须开启声音。表单自动按分镜总时长填写 duration。

492/2,500
462/2,500

Duration: 5 (3-15)

输出
已就绪
5 秒 × 13 积分/秒 = 65 积分 ($0.325)
继续使用

示例

Traditional Chinese ink-and-watercolor animation on textured rice paper. An empty narrow Jiangnan alley in rain, pale stone paving, dark tiled eaves. One fallen ochre oil-paper umbrella lies sideways in the foreground. A gentle gust rolls it half a turn through a shallow puddle; its reflection blooms into soft ink ripples. Locked low camera, continuous movement, restrained monochrome palette with the single ochre accent. No people. No text, logos or watermarks.

Handcrafted stop-motion animation at tabletop scale. A tiny mint-green knitted caterpillar with six rounded wool segments inches over one horizontal wooden sewing-thread spool on a linen sewing table. Its body compresses, arches and extends in one readable crawling cycle. Visible fuzzy wool fibers, practical miniature lighting, warm shallow focus, fixed close camera, charming tactile handmade motion. No human hands. No text, logos or watermarks.

Kling O3 Standard Text to Video

Kling O3 Standard 文生视频:通过文本提示词生成 3–15 秒视频。支持单镜头和多镜头;sound 必须显式传入,多镜头必须开启声音。

为什么选择此模型

  • 720p 高效渲染兼顾出色的生成画质与快速的响应周期,为批量原型探索与社媒短片制作提供充沛产能。

  • 多镜头分镜叙事单次生成内支持多个分镜,独立定义每个镜头的提示词与时长,实现复杂叙事时序。

  • 原生音视频同步一键合成与画面动作精准匹配的环境音效、拟真对白与多语种口型,无需繁琐后期配音。

  • 视觉思维链推理依托统一多模态架构在渲染前系统规划场景空间构图、镜头轨迹与光影逻辑,保障运镜平滑稳定。

  • 灵活画幅随心切换预置 16:9 横屏、9:16 竖屏与 1:1 正方形画幅,无缝适配流媒体播放与移动端信息流传播。

参数说明

参数要求说明
prompt条件必填

multi_shots=false 时必填,描述场景、动作和镜头运动。去除首尾空白后须为非空文本,最多 2,500 字符。multi_shots=true 时请省略 prompt。

默认值-
multi_shots

必填,必须显式传入 false(单镜头)或 true(多镜头)。单镜头需要 prompt;多镜头需要 multi_prompt 和 sound=true,且顶层 prompt 不得为非空文本。省略此字段会报错。

默认值-
multi_prompt条件必填

multi_shots=true 时必填,单镜头模式请省略。至少提供一个分镜,每段包含非空 prompt(最多 2,500 字符)和整数 duration(1–12 秒)。分镜时长之和必须等于顶层 duration(3–15 秒)。分镜内的额外字段会被忽略。

默认值-
duration

必填,3–15 秒的整数。多镜头模式下必须等于所有分镜时长之和,积分按此值计算。

默认值-
sound

必填,必须显式传入 true(生成声音)或 false(无声视频)。单镜头可使用任一值,多镜头必须为 true。

默认值-
aspect_ratio

可选,支持 16:9(横屏)、9:16(竖屏)或 1:1(方形),用于设置视频画幅。

默认值-

使用步骤

  1. 明确主体与环境在提示词中详细描写角色外观、核心行为动作以及场景的光线氛围。

  2. 选择镜头调度模式可选择单镜头连续推进,或开启多镜头分镜模式并逐一配置各分镜的提示词与秒数。

  3. 设置成片时长与画幅选择 3–15 秒的整数时长,并指定适合发布渠道的画面比例(16:9、9:16 或 1:1)。

  4. 配置原生声音开关开启声音选项以同步生成环境声与匹配音效,多镜头模式下声音选项自动保持启用。

  5. 提交任务并获取成片提交生成任务,系统进入异步渲染流水线,完成后即可在线预览与下载高品质 MP4 视频。

价格

费用 = 顶层 duration × 每秒费率。1 积分 = $0.005。任务若执行失败,系统将全额自动返还扣除的积分。

计费项费率说明
无声10 积分/秒 ($0.050/s)文生视频标准 720p 规格,不含音频轨道。
有声13 积分/秒 ($0.065/s)包含原生同步合成的环境音效、音画对白与多语种口型。

适用场景

  • 短视频内容创意孵化快速将文案脑洞转化为 720p 成品样片,验证剧情节奏与视听效果。

  • 社交媒体动态信息流一键输出适配移动端竖屏的信息流短片,自带原生音效增强粉丝互动与完播率。

  • 微短剧分镜预演借助多镜头能力将剧本片段直接渲染为连贯视听小节,高效评估分镜衔接。

  • 电商概念视觉演示通过纯文本描述产品使用场景与动态光影,低成本生成电商动态主图素材。

使用技巧

  • 建议采用“主体外貌 + 动作时序 + 镜头轨迹 + 光照氛围”的四层结构编写提示词。
  • 开启多镜头模式时,确保所有分镜的时长总和精确等于顶层 duration 设定值。
  • 在提示词中加入具体的音效描写(如“踩过水洼的飞溅声”、“清脆的钟鸣”),有助于引导音频扩散引擎生成更为逼真的细节。
  • 使用平稳的运镜术语(如“平滑横摇”、“缓慢推近”),能够获得更加稳健的相机运动轨迹。
  • 叙事性内容建议单分镜分配 2–4 秒,使视觉动作拥有充分的物理展开时间。

注意事项

  • 单镜头模式下顶层 prompt 必填;开启多镜头模式时顶层 prompt 须为空,所有描述均配置在各分镜的 prompt 中。
  • 多镜头模式要求 sound 参数必须为 true,以保障跨分镜音画同步渲染。
  • 任务采用异步作业机制,提交后会立即返回任务 ID,可通过轮询或配置 Webhook 回调获取最终资产。

Kling O3 Standard Text to Video API 常见问题

这个端点可以生成什么?

Kling O3 Standard 文生视频:通过文本提示词生成 3–15 秒视频。支持单镜头和多镜头;sound 必须显式传入,多镜头必须开启声音。

如何设置多镜头?

必填,必须显式传入 false(单镜头)或 true(多镜头)。单镜头需要 prompt;多镜头需要 multi_prompt 和 sound=true,且顶层 prompt 不得为非空文本。省略此字段会报错。 multi_shots=true 时必填,单镜头模式请省略。至少提供一个分镜,每段包含非空 prompt(最多 2,500 字符)和整数 duration(1–12 秒)。分镜时长之和必须等于顶层 duration(3–15 秒)。分镜内的额外字段会被忽略。

视频画幅如何确定?

可选,支持 16:9(横屏)、9:16(竖屏)或 1:1(方形),用于设置视频画幅。

如何控制声音?

必填,必须显式传入 true(生成声音)或 false(无声视频)。单镜头可使用任一值,多镜头必须为 true。

提示词有哪些长度限制?

提示词的 API 校验上限为 2,500 字符。部分多镜头生成请求曾因单段提示词超过 512 字符而失败,建议每段控制在 512 字符以内;这项建议不改变 API 校验上限。

时长和积分如何计算?

时长为 3–15 秒。无声视频 10 credits/秒,有声视频 13 credits/秒;积分为顶层 duration 乘以对应费率。

生成失败或请求超时怎么办?

非法参数会在创建生成任务和扣费前被拒绝。已受理的生成任务状态变为 failed 后,已扣积分会退回。客户端超时不代表任务失败,请先查询原 task_id 的状态,再决定是否重新提交。