Kling O3 Image Text to Image API

kwaivgi/kling-image-o3/text-to-image
1K / 2K / 4K · 1–9 张

Kling O3 Image Text to Image 将纯文本提示词转化为最高 4K 原生分辨率的高保真图像,支持真实微观物理质感呈现、主体元素一致性锁定,以及 8 种主流构图画幅。它能够精确遵循复杂的多层级空间叙事与物理布光逻辑,并在生成包含人物、道具与宏大场景的多图批次时保持高度的视觉连贯性与艺术质感。

获取 API Key
输入
1182/2000
Elements

按顺序使用 @Element1、@Element2 引用主体。可提供主视图与补充视角;仅上传文件时需登录。

输出已就绪
1 × 3.5 = 3.5 积分 · $0.018

继续使用

示例

text-01-output.png

Create a warm storybook cinematic scene featuring one original little library robot: a squat ivory enamel spherical body, a teal horizontal glass faceplate with two amber circular eyes, an orange rectangular chest compartment, short brass articulated arms ending in simple grippers, one short antenna topped with an orange ball, and two stubby teal feet. Give its tactile painted-metal surfaces subtle scuffs and believable mechanical joints. In a circular old library with curved wooden shelves, the tiny robot is standing on the tips of its feet on a low wooden step, using both grippers to slide one oversized deep-blue clothbound book into a low shelf just above its head. The book is broad relative to the robot but physically manageable. A few books already fill that shelf. Full-body three-quarter view, robot in the left foreground, a curved balcony and spiral stair receding to the right, golden afternoon window light and floating dust, tactile miniature materials, charming believable mechanical pose, coherent perspective. One robot, two arms, two legs, one blue book being handled. No people, animals, visible writing, labels, logos, commercial messaging or watermarks.

text-02-output.png

纪实摄影,一位白发苍苍的中国老皮影艺人,穿着褪色的靛蓝棉布外套,在乡村小戏台后台的旧木桌前,用细针修补一件传统中国皮影戏偶的肩部连接处。皮影必须是薄而平的半透明染色牛皮剪影,侧面脸谱,红、赭黄和绿色的精细镂空花纹,关节用细线连接,配细竹签操纵杆;绝不是立体木偶或布偶。戏偶平放在桌面上,左手轻轻固定,右手持针。背景挂着三件同类平面彩色镂空皮影。侧窗自然光穿透皮革,呈现微微透光的暖色,真实的皱纹、双手、旧木纹和衣料质感。中景三分之四视角,老人面孔和完整双手与桌面都清晰可见,安静专注的开演前修补瞬间。只有一位老人,无其他人物,无广告、品牌、水印或文字。

text-03-output.png

Natural underwater wildlife photography of exactly one green sea turtle swimming calmly through shafts of sunlight in clear shallow tropical seawater. Three-quarter side view with the head facing right, the entire animal and all anatomically visible flippers within frame, realistic shell scutes and mottled skin, no human-like expression. The turtle occupies the middle left and glides toward open blue water on the right. Pale rippled sand and sparse seagrass well below it, a small coral outcrop confined to the lower left, shimmering surface near the top edge. Physically convincing light scattering and caustic patterns across the shell and sand, natural turquoise-to-blue depth gradient, crisp turtle detail with gently receding background. A tranquil observation of wildlife, no fantasy glow. No other animals, people, divers, buildings, plastic, typography, logos, frame or watermark.

Kling O3 Image Text to Image 概览

Kling O3 Image Text to Image 是快手(Kling AI)打造的新一代旗舰级多模态文本生成图像模型。它依托前沿视觉多模态推理能力与叙事美学引擎,原生支持 1K、2K 与 4K 超高清画面输出,无需二次超分即可呈现发丝、皮肤毛孔与环境光线的微观细节。模型支持 8 种构图比例、最多 9 张并发批量生成,并提供 Element 主体参考锁定机制,为专业视觉创作提供稳定可控的高保真生成能力。

为什么选择 Kling O3 Image Text to Image?

  • 原生 4K 超高清直出突破传统模型依赖算法二次放大的限制,直接生成原生 4K 高分辨率图像,细腻还原微观纹理与细腻光影。

  • 主体元素锁定(Element Consistency)支持通过可选的主体参考对象定义核心人物或产品,并在提示词中使用 @Element1 精准锚定,实现跨批次主体外观高度稳定。

  • 电影级叙事美学引擎深入解构专业摄影与影视构图逻辑,精准呈现具有空气感与情感张力的真实光照、色彩层次与环境氛围。

  • 单次 1–9 张高并发批量生成灵活配置单次请求生成 1 至 9 张独立画面变体,显著提升创意探索与视觉物料方案比选效率。

  • 清晰透明计费与失败全额退还统一按分辨率阶梯精准计费,无任何隐藏附加费,若任务因网络或系统异常中断,全额自动返还所扣积分。

参数

参数要求说明
prompt必填

字符串,去除首尾空白后 1–2,000 字符。

resolution可选

输出分辨率,按所选档位计费。

默认1K2K4K
size可选

画面比例;auto 仅编辑端点支持。 16:9, 9:16, 1:1, 4:3, 3:4, 3:2, 2:3, 21:9

默认16:99:161:14:33:43:22:321:9
output_format可选

输出图片格式。

默认pngjpegwebp
n可选

输出数量,整数 1–9;总积分为单价乘以 n。

默认1
elements可选

主体参考对象数组。在提示词中使用 @Element1、@Element2 等引用;无公开数量上限,保留扩展字段。

elements[].frontal_image_url可选

主体主视图的公开 HTTP(S) 图片 URL。

elements[].reference_image_urls可选

同一主体的补充视角 HTTP(S) 图片 URL 数组。

使用教程

  1. 编写分层结构提示词详细描述核心主体、空间景深、艺术风格与特定布光环境(最多 2,000 字符)。如需引用主体,可在提示词中加入 @Element1 标签。

  2. 配置主体参考(可选)如需指定特定人物或产品外观,在 elements 数组中填入主体的主视图或多视角参考图 URL。

  3. 选择分辨率与构图比例根据交付需求选定 1K、2K 或 4K 分辨率,并选择匹配目标媒介的画面比例(如 16:9 宽画幅或 9:16 竖版)。

  4. 设定输出格式与数量指定交付格式(JPEG、PNG 或 WebP)与单次生成张数 n(1–9 张)。

  5. 发起异步任务并获取成品提交 API 请求获取唯一任务 ID,轮询任务状态至完成阶段,直接读取高保真图像下载链接。

价格

1K/2K:3.5 积分/张(约 $0.018);4K:7 积分/张($0.035)。总积分 = 分辨率单价 × n,无输入图片或主体参考附加费。1 积分 = $0.005,3.5 积分精确等于 $0.0175;美元显示保留三位小数,总额计算后再舍入。

用量费率详情
1K / 2K3.5 积分/张 · 约 $0.018乘以输出数量 n。
4K7 积分/张 · $0.035乘以输出数量 n。

最佳应用场景

  • 商业广告大片与品牌主视觉依托原生 4K 直出能力,直接生成能够满足大屏广告、商业海报与线下物料印刷的高精度视觉作品。

  • 影视概念设计与故事板分镜将复杂的世界观剧本转化为具有电影级布光质感与透视张力的高清概念美术原画。

  • 数字角色与 IP 形象设计借助主体元素锁定机制,为原创角色或品牌吉祥物生成多种姿态、表情与场景的系列视觉物料。

  • 电商场景渲染与生活方式大片细致描述商品材质与空间氛围,批量生成光影自然、细节真实的商用主图与营销场景图。

专家技巧

  • 建议按照“核心主体 + 动作姿态 + 空间透视 + 摄影机参数与布光 + 材质细节”的递进逻辑编写提示词,便于模型深度理解视觉重心。
  • 追求顶级摄影感时,可在提示词中补充具体的专业摄影器材与布光术语,如“85mm 人像镜头”、“浅景深虚化”、“柔和伦勃朗侧光”或“日落逆光边缘发光”。
  • 需要保持固定人物形象时,可搭配 elements 参数上传清晰的正面肖像图,并在提示词中使用 @Element1 标记该人物。
  • 探索创意概念时可先使用 1K 分辨率生成多张候选作品,确定满意方案后再指定 4K 分辨率输出最终商业交付大图。

注意事项

  • prompt 为必填参数,去除首尾空白后字符数必须在 1 至 2,000 字符之间。
  • 单次请求的输出图片张数 n 必须为 1 至 9 之间的整数。
  • 文生图端点不接受 image_urls 参数;如需结合基底图片生成请使用 Kling O3 Image Edit 端点。
  • 任务执行采用异步机制,提交请求后立即返回 task_id,建议通过轮询或指定 callback_url 回调接收最终结果。

相关模型推荐

Kling O3 Image Text to Image API 常见问题

Kling O3 Image Text to Image API 是什么?

Kling O3 Image Text to Image 是快手(Kling AI)研发的多模态文本生成高保真图像模型。它根据文本提示词直接生成最高 4K 原生分辨率的高清图像,具备真实微观物理质感呈现、主体元素锁定与 8 种主流构图画幅支持。基于前沿多模态视觉智能与叙事美学底座,它在严格遵循复杂空间描述与物理布光的同时,呈现细腻逼真的光影质感与环境氛围。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。

Kling O3 Image Text to Image 生成的 4K 图像需要二次放大吗?

不需要。Kling O3 Image 支持原生 4K 分辨率直接渲染输出,画面中的微观毛孔、织物纤维与环境反光均为原生计算生成,而非依赖后期插值或超分算法拉伸,细节清晰自然。

Kling O3 Image Text to Image 如何使用主体参考保持人物或产品一致性?

通过在请求中传入 elements 数组指定主体的主视图与补充视角 URL,并在提示词中使用 @Element1、@Element2 等标签进行指代,模型即可在生成全新构图与动作时稳定延续该主体的面容、体态与标志性特征。

Kling O3 Image Text to Image 单次调用最多能生成多少张图片?

单次 API 请求支持通过 n 参数指定生成 1 至 9 张独立的图像变体。所有图片并行渲染并保持同一提示词风格,方便在同一次创意探索中快速遴选最佳方案。

Kling O3 Image Text to Image 支持哪些画幅比例与输出格式?

支持 16:9、9:16、1:1、4:3、3:4、3:2、2:3 和 21:9 共 8 种主流构图画幅,输出格式支持 JPEG、PNG 和 WebP(默认 PNG)。模型会在生成时直接按指定比例原生构图与布光。

Kling O3 Image Text to Image 的计费规则是什么?

费用按输出张数与选定的分辨率阶梯精确核算:1K 与 2K 均为 3.5 积分/张(约 $0.018/张),4K 为 7 积分/张($0.035/张),总积分等于单价乘以张数 n。无输入素材附加费,若任务因异常失败,系统全额自动退还扣除积分。

撰写 Kling O3 Image Text to Image 提示词有哪些实用建议?

建议按照主体属性、空间景深、光影环境与材质质感的递进顺序分层描述,明确主体在画面中的相对位置与镜头焦距,为高保真画面的物理渲染与构图提供清晰的指引。