Kling 3.0 Standard Text to Video API

kwaivgi/kling-v3.0-std/text-to-video

Kling 3.0 Standard Text to Video 将文字生成720p视频,支持分镜编排与原生音频。通过逐镜描述人物动作和运镜,让场景沿着设定的叙事节奏展开。

输入

457/2,500

输出
视频已就绪
3 秒 × 27 积分/秒 = 81 积分 ($0.405)
探索其他创作方式

示例

One continuous three-second medium close shot in a modest basement rehearsal room. An adult drummer makes one clear controlled strike on the snare drum, the stick rebounds naturally and his shoulders settle. Keep both hands anatomically consistent and the drum fixed. Warm practical lighting, documentary realism, slight handheld breathing without a cut. Audio: one crisp synchronized snare hit and a short natural room decay, quiet room tone, no music, no speech. No lettering, brands or watermark.

A single adult flamingo in shallow rose-grey salt-marsh water takes one slow forward step during a continuous three-second shot. The planted foot stays grounded; the other foot enters the water once and makes small concentric ripples. Pale overcast dawn, soft reeds far behind, restrained natural colors. Vertical full-body composition, fixed camera, stable anatomy and reflection, wildlife documentary realism. No other birds, no cut, no time lapse, no text or logo.

Kling 3.0 Standard Text to Video

Kling 3.0 Standard Text to Video 是快手用于文字生成视频的模型,适合将故事想法整理为可观看的镜头草稿。音画联合生成把声音融入场景,逐镜提示词则让创作者安排人物动作、景别变化与叙事顺序。可用于比较广告开场、探索不同运镜,以及在进入精细制作前确定短片的镜头方向。

为什么选择 Kling 3.0 Standard Text to Video

  • 探索不同场景方向720p 档位的静音单镜头每秒 $0.135 起,适合在相同规格下比较不同提示词或动作方案。

  • 先明确场景,再安排镜头用提示词交代主体、环境和动作,将文字想法组织为动态场景。

  • 安排每段叙事的节奏为每个镜头分别填写提示词与时长,安排开场、重点转移和收尾。

  • 让声音参与场景生成开启 Sound,在描述画面动作时加入对白或环境声要求。

参数说明

参数使用条件用法
promptmulti_shots=false 时

用 1–2,500 个字符描述主体、场景与运镜。多镜头模式在 multi_prompt 中逐镜填写。

默认值明确填写
multi_shots可选

false 使用单条提示词;true 使用 multi_prompt 分别编排镜头,并设置 sound=true。

默认值false
multi_promptmulti_shots=true 时

添加至少一个含 prompt 和 duration 的对象。每条提示词为 1–2,500 个字符,每个镜头为 1–12 整数秒,分镜时长之和须等于 duration。

默认值明确填写
duration必填

总时长填写 3–15 的整数秒;多镜头模式填写各分镜时长之和。

默认值明确填写
sound可选

true 生成音频,静音单镜头使用 false,多镜头使用 true。

默认值true
aspect_ratio可选

选择 1:1、16:9 或 9:16,分别构建方形、横屏或竖屏场景。

默认值1:1

使用方法

  1. 准备场景起点在 Prompt 中写明主体、环境、动作和运镜。

  2. 选择镜头结构单镜头填写一条提示词;多镜头开启 Multi Shots,逐镜填写内容与时长。

  3. 检查时长与声音将总时长设为 3–15 秒,多镜头保持 Sound 开启,提交前查看显示的费用。

  4. 生成并查看片段点击 Run,完成后预览视频,再根据结果调整动作或运镜描述。

用量与计费

Kling 3.0 Standard Text to Video 按生成视频时长计费,以秒数乘以 Sound 对应单价。

生成方式每秒单价计费依据
静音单镜头$0.135/秒sound=false 且 multi_shots=false,5 秒视频费用为 $0.675。
有声单镜头或多镜头$0.195/秒sound=true,5 秒视频费用为 $0.975;多镜头按分镜总时长计费。

适用场景

  • 分镜方案比较围绕同一段短剧本编排不同镜头顺序,比较开场、揭示与收尾方式。

  • 广告情境构思把产品场景、镜头运动和对白放入同一片段,验证广告情境。

  • 环境镜头探索描述天气、光线和镜头运动,探索空间在动态画面中的呈现。

使用技巧

  • 先交代主体与动作,再补充运镜和氛围。
  • 各分镜沿用一致的人物特征与场景细节描述。
  • 每个镜头安排一个明确事件,并为动作展开分配时长。
  • 开启 Sound,将对白与环境声写在对应动作附近。

使用说明

  • 为每个镜头交代清楚主体、动作与运镜。
  • 将总时长保持在 3–15 秒,多镜头开启 Sound。

相关模型

Kling 3.0 Standard Text to Video API 常见问题

Kling 3.0 Standard Text to Video API 是什么?

Kling 3.0 Standard Text to Video 是快手用于文字生成视频场景的模型。它生成720p视频,结合原生音频与逐镜时长编排。音画联合生成让声音与场景共同展开,分镜提示词引导动作和场景衔接。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。

Kling 3.0 Standard Text to Video 如何安排分镜时长?

开启 multi_shots 与 sound,为每个镜头填写提示词和 1–12 整数秒时长。duration 填分镜时长之和,合计为 3–15 秒。

Kling 3.0 Standard Text to Video 可以生成静音分镜草稿吗?

设置 sound=false 与 multi_shots=false,可生成静音单镜头草稿。需要一次生成分镜序列时,开启 multi_shots 与 sound,并逐镜填写提示词。

Kling 3.0 Standard Text to Video 如何描述运镜?

同时写明景别、镜头方向与主体动作,例如特写后缓慢拉远。编排连续场景时,将不同运镜分别写入对应分镜,并安排时长。

Kling 3.0 Standard Text to Video 如何引导场景连续性?

各分镜沿用相同的人物特征、服装、环境和光线描述,再有目的地改变动作或机位,让后续镜头承接前一镜头。

Kling 3.0 Standard Text to Video 单次视频有多长?

duration 可填写 3–15 的整数秒。制作分镜序列时,将总时长分配给各条提示词,每个镜头为 1–12 秒。

何时选择 Kling 3.0 Standard 而非 Kling 3.0 Pro?

需要以较低每秒费用探索720p场景时选择 Standard;需要1080p细节时选择 Pro,两者均可生成音频并分别编排分镜时长。

Kling 3.0 Standard 的15秒分镜序列如何计费?

多镜头序列使用 sound=true,单价为每秒 $0.195,15 秒费用为 $2.925。各镜头时长为 1–12 秒,合计须为 15 秒。