Kling 3.0 Turbo Standard Text to Video API

kwaivgi/kling-v3-turbo-std/text-to-video

Kling 3.0 Turbo Standard Text to Video 将文本提示词转化为 3–15 秒 720p 动态视频,支持极速迭代生成、原生音画口型同步与 1–6 镜头分镜脚本。它能在多镜头叙事中保持角色外貌与场景连贯,并使肢体动态与环境音效自然契合。使用 multi_prompt 并省略顶层 duration 时,也支持镜头合计 1–2 秒。

输入
0/2500
输出
等待运行

生成的视频会显示在这里

填写提示词并添加所需素材,确认设置后点击“运行”。

Kling 3.0 Turbo Standard · 5 秒 × 17/秒 = $0.425 (85 积分)
继续使用

示例

Macro slow-motion shot of a raindrop falling onto a mossy forest floor, ripples expanding in a tiny puddle, spore dust drifting in a shaft of soft light, ultra detailed, nature documentary style

Rainy night in a neon-lit city street, a pedestrian with a transparent umbrella crosses the wet zebra crossing, reflections shimmering on the asphalt, cinematic vertical shot

A chef tossing a wok over intense heat, flames leaping up and wrapping around the ingredients, sparks and smoke, dynamic close-up in a professional kitchen

Kling 3.0 Turbo Standard Text to Video

Kling 3.0 Turbo Standard Text to Video 是快手快灵打造的高吞吐、敏捷文本生成视频模型。仅凭自然语言提示词即可输出 3 至 15 秒 720p 高清动态画面,并随画面同步生成多语言逼真对白口型与环境音效。通过原生 multi_prompt 分镜支持,单次请求即可按时序组织多达 6 个连贯镜头,特别适合社交媒体短视频批量产出、创意脚本快速概念打样与数字营销内容制作。使用 multi_prompt 并省略顶层 duration 时,也支持镜头合计 1–2 秒。

为什么选择它?

  • 极速批量生成与低延迟迭代针对高吞吐生产优化,大幅缩短单任务生成等待耗时,助力创作者在短时间内验证多样化创意提示词。

  • 原生音画与高保真口型同步在生成画面的同时同步合成高匹配度音频,人物对白口型与自然发音紧密对齐,免除后期配音与音画对齐步骤。

  • 最多 6 镜头多场景分镜脚本支持 multi_prompt 分镜参数,单次请求内可分别指定 1 至 6 个镜头的叙事描述与时长,由模型自主调度时序切镜。

  • 严密的多镜头主体连贯性在镜头切换与景别推移过程中,持续保持人物面容、服饰纹理与空间场景特征的连贯一致,让跨镜头叙事更稳更顺。

  • 3–15 秒灵活整数时长控制支持在 3 至 15 秒范围内任意指定整数生成秒数,无论是快节奏开屏黄金 3 秒还是完整叙事片段均能精准匹配。

  • 高性价比 720p 标准费率以每秒 17 积分($0.085/秒)的亲民费率提供清晰 720p 画质,大幅降低大规模内容生产的综合算力成本。

参数

参数要求说明
prompt可选

字符串,1–2500 字符。与 multi_prompt 互斥。

duration可选

显式 duration 必须为 3–15 秒;多镜头时须等于镜头总时长。省略时使用镜头总时长(允许 1–15 秒),无多镜头时默认为 5 秒。

默认值镜头总时长 / 5
aspect_ratio可选

字符串。文生视频画幅;体验区预选 16:9。

默认值16:99:161:1
multi_prompt可选

1–6 个镜头;每个镜头必须有非空 prompt,duration 可选,范围 1–15 秒,默认 5 秒。总时长不超过 15 秒。与非空 prompt 互斥。

使用方法

  1. 编写场景提示词在 prompt 中写清主体动作、运镜、光影,以及对白语言或环境声线索。单段叙事时只用 prompt,不要与 multi_prompt 同时提交。

  2. 编排 multi_prompt 分镜需要多镜头时改用 multi_prompt,为 1–6 个镜头分别填写 prompt,并可按镜头设置 duration。

  3. 设置输出时长在 3–15 秒整数范围内指定 duration,默认 5 秒;使用 multi_prompt 时须等于各镜头时长之和,且总时长不超过 15 秒。

  4. 选择画幅比例按投放版式选择 16:9、9:16 或 1:1,体验区默认预选 16:9。

  5. 核对分镜总时长使用 multi_prompt 配置 1–6 个镜头,每项 prompt 必填,duration 可省略,默认为 5 秒。总时长不超过 15 秒;顶层 duration 可省略,提供时须等于镜头总和且为 3–15 秒。

  6. 确认费用并运行查看运行按钮显示的当前配置费用,完成提示词与参数设置后点击“运行”。

  7. 预览并下载视频任务完成后,在输出面板预览画面与同步音频,点击“下载视频”保存结果。

价格

按输出视频秒数计费。1 credit = $0.005。Standard 档固定 720p。

用量费率说明
720p17 credits/sec ($0.085/sec)默认 5s 为 85 credits($0.425)。官方对比价 $0.106/sec。

适用场景

  • 社交媒体短视频批量产出以 9:16 竖屏与短时长配置,快速生成适合 TikTok、Reels、Shorts 等平台的高吞吐短内容。

  • 多镜头广告脚本一气呵成用 multi_prompt 在一次请求中排好开场特写、跟拍与收束镜头,保持产品与人物跨镜一致。

  • 创意概念快速打样以 720p Standard 档快速迭代提示词与节奏,验证分镜与声画方案后再进入更高清档位。

  • 口型同步人物演绎为口播、对白或反应镜头写入语音线索,让人物口型与多语言发音自然对齐。

  • 电商与品牌宣传短片用文本描述产品卖点与场景动势,生成带环境声的营销片段,适配横竖屏投放。

专业建议

  • 写清景别、运镜与光影,例如“低角度跟拍、侧光勾勒轮廓”,让动作与空间更容易落地。
  • 使用 multi_prompt 时,跨镜头复用同一套人物外貌与服饰描述,稳住主体连贯性。
  • 使用 multi_prompt 配置 1–6 个镜头,每项 prompt 必填,duration 可省略,默认为 5 秒。总时长不超过 15 秒;顶层 duration 可省略,提供时须等于镜头总和且为 3–15 秒。
  • 竖屏社交内容明确选择 9:16,并在提示词中写清主体在竖构图中的位置。
  • 需要口型与对白时,在提示词中加入具体语言与语气线索,引导原生音画同步。

使用说明

  • Kling 3.0 Turbo Standard Text to Video 以 prompt 或 multi_prompt 驱动生成,二者互斥,可配置 duration 与 aspect_ratio。
  • Standard 档固定输出 720p,并随画面同步生成原生音频与口型,无需额外音轨开关字段。
  • 通过 API 提交后保存返回的 task_id,用于查询任务进度并获取最终文件链接。
  • 生成结果为标准视频文件,可在主流播放器与剪辑软件中直接使用。

Kling 3.0 Turbo Standard Text to Video API 常见问题

Kling 3.0 Turbo Standard Text to Video API 是什么?

Kling 3.0 Turbo Standard Text to Video 是快手快灵用于纯文本生成视频的模型。它根据文本提示词通常生成 3–15 秒 720p 视频,具备高吞吐敏捷生成、原生音画口型同步(多语言)以及 multi_prompt 分镜编排能力。依托 Kling 3.0 Turbo 的高速生成机制,它在严格遵循提示词叙事与运镜的同时,保持多镜头中的角色外貌、场景连贯与音画对齐。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。 使用 multi_prompt 并省略顶层 duration 时,也允许镜头合计 1 或 2 秒。

Kling 3.0 Turbo Standard Text to Video 如何使用 multi_prompt?

multi_prompt 支持 1–6 个镜头,每个镜头必须有非空 prompt;镜头 duration 可选,须为 1–15 秒的整数,默认 5 秒。镜头总时长不能超过 15 秒。省略顶层 duration 时使用镜头时长之和,也允许合计 1 或 2 秒;显式传入时须为 3–15 秒的整数,且等于镜头时长之和。multi_prompt 不能与非空的顶层 prompt 同时使用。分镜请在 JSON 模式编辑;尝试切换表单时会保留 JSON 模式及全部镜头配置。

Kling 3.0 Turbo Standard Text to Video 一次能生成多久?

不使用 multi_prompt 时,duration 须为 3–15 秒的整数,默认 5 秒。使用 multi_prompt 时,每个镜头默认 5 秒,总时长不能超过 15 秒。省略顶层 duration 即使用镜头时长之和,也允许合计 1 或 2 秒;显式传入时须为 3–15 秒,且等于镜头时长之和。

Kling 3.0 Turbo Standard Text to Video 会同步生成原生音频吗?

会。生成画面时同步输出原生音频,并对白口型与多语言发音对齐,同时可带上环境声与动作音效。在提示词中写明对白语言、语气或环境声线索,可进一步引导声画匹配;无需单独的音轨开关字段。

Kling 3.0 Turbo Standard Text to Video 支持哪些画幅比例?

支持 16:9、9:16 与 1:1 三种画幅,体验区默认预选 16:9。横屏叙事选 16:9,竖屏短视频选 9:16,方形构图选 1:1;完整取值见本页参数说明。

Kling 3.0 Turbo Standard Text to Video 与 Pro 档有何区别?

Standard 档固定输出 720p,按 17 credits/秒计费,适合高吞吐迭代与批量草稿;同系列 Pro Text to Video 固定 1080p,清晰度更高,适合成片交付。两者均支持原生音画与 multi_prompt 分镜,常规时长为 3–15 秒;分镜模式省略顶层 duration 时也允许镜头合计 1–2 秒。选型时按清晰度与成本取舍。

Kling 3.0 Turbo Standard Text to Video 按秒计费如何计算?

按输出视频秒数计费:720p 为 17 credits/秒($0.085/秒),1 credit = $0.005。默认 5 秒任务为 85 credits($0.425);时长越长费用越高,完整费率见本页价格说明。