Nano Banana Text to Image API

google/nano-banana/text-to-image
10 种比例 · 每次 5 积分($0.025)

Nano Banana Text to Image 将纯文本提示词转化为高保真图像,支持清晰的文字渲染与 10 种主流画幅。它在快速推理中精准理解复杂空间与材质,稳定呈现通透自然的光影。

获取 API Key
输入
485/5000
输出已就绪
每次 5 积分 · $0.025

继续使用

示例

text-02-output.jpg

Extreme close-up photograph of a clockmaker's hands assembling a brass gear train under a warm bench lamp. Fine steel tweezers hold one small gear so its teeth mesh cleanly with the neighboring wheel; the rest of the train sits in an open wooden movement frame. Accurate mechanical contact, visible tool steel, brass wear, a drop of oil on a pivot, wood grain, shallow depth of field and workshop bokeh. Show only the hands and the mechanism, no face, no text, no logos, no watermarks.

text-01-output.jpg

Photorealistic documentary photograph of a train-station lost-and-found glass window in late afternoon. Two centered lines of white painted capital letters on the glass: the first line is exactly LOST and the second line is exactly FOUND. No ampersand, no extra letters, no other words on the glass. A small paper card taped inside the lower right corner shows only the time 8:00-18:00. Behind the glass, on one wooden shelf: a brass tuba lying on its side, a folded red umbrella, and a pair of white ice skates. Soft concourse reflections, warm side light, realistic glass and wood. No advertisements, brands, logos, signatures, or watermarks.

text-03-output.jpg

A behind-the-screen rehearsal photograph of a traditional shadow-puppet stage. In the foreground, two adult puppeteers hold a deer puppet and a boat puppet against a taut rice-paper screen; an oil lamp throws sharp silhouettes of the deer and the boat onto the paper. The carved leather puppets and the puppeteers' hands stay visible on the lamp side, while the silhouettes read clearly on the screen. Warm amber practical light, layered space, empty room, no audience. No text, no logos, no watermarks.

Nano Banana Text to Image

Nano Banana Text to Image 是 Google DeepMind 研发的高效原生文本生成图像模型,底层基于 Gemini 2.5 Flash 架构。模型在深度提示词理解、自然光影质感、图内文字排版渲染及常识融合上表现卓越,支持 1K/2K 分辨率与 10 种画幅,为创意原型与商业视觉提供高速经济的生产力支持。

为什么选择 Nano Banana Text to Image?

  • Google DeepMind 原生多模态架构底层搭载经过海量图文联合训练的 Gemini 2.5 Flash Image 架构,具备强大的常识推理与视觉先验,深入理解复杂抽象提示词与物理规律。

  • 清晰精准的画面文字与标语排版攻克传统图像模型文字乱码难题,原生支持在画面招牌、包装标签及海报中直接呈现清晰可读、边缘锐利的多语言文字排版。

  • 深度融合真实世界常识与地标认知内嵌深厚的世界知识网络,能够准确呈现特定现实地标、自然景观与文化符号的标志性外观结构,避免常识性构图偏差。

  • 10 种全画幅比例原生构图支持原生支持 1:1、2:3、3:2、3:4、4:3、4:5、5:4、9:16、16:9 与 21:9 十种画幅,自动优化构图透视,无缝适配移动端全屏与横版宽幅设计。

  • 高性价比与敏捷出图体验单次生成固定仅需 5 积分($0.025),以远低于行业均价的稳定费率实现高效高通量推理,大幅降低批量概念探索与商业测试成本。

参数

参数要求说明
prompt必填

描述要生成的图片,长度 1–5,000 个字符,至少包含 1 个非空白字符。

size可选

输出图片比例。选择 auto 时由模型决定画幅,API 请求省略 size。

默认auto1:12:33:23:44:34:55:49:1616:921:9

使用教程

  1. 输入结构化文本提示词在 prompt 参数中描述画面主体、艺术风格、材质肌理与光影环境;如需在画面中渲染特定文字,请使用英文半角双引号包裹文案内容。

  2. 设置目标画面比例根据展示终端选择 1:1、16:9、9:16 等 10 种画幅比例之一;若选择 auto 则由模型根据提示词自适应决定最优构图。

  3. 发起异步生成任务向端点提交 POST 请求,接口立即返回专属 task_id,后台算力集群开始执行高速扩散推理。

  4. 轮询获取任务状态使用 task_id 轮询任务状态接口,或者在请求中配置 callback_url,在任务完成(finished)后自动接收回调通知。

  5. 下载高保真成品图像从结果对象中获取高清晰度图片 URL,直接用于下游设计排版或商业分发。

价格

每次生成 5 积分($0.025),1 积分 = $0.005。

用量费率详情
文生图5 积分 / 次$0.025 / 次

最佳应用场景

  • 电商商品白底图与概念场景快速生成纯净白底专业影棚级商品展示图、各场景实景搭配图及包装概念,大幅缩短前期选品与视觉渲染周期。

  • 商业广告与海报宣传物料精准结合清晰文字排版与主体构图,直接出图包含特定英文标语和宣传 Slogan 的高质量节日贺卡与营销宣发主视觉。

  • 真实地标与文旅场景概念设计依托深厚真实世界知识,准确还原世界知名建筑、旅行胜地与标志性场景,为旅游文创与纪实插画提供高保真视觉素材。

  • 创意设计前期分镜与草图发散借助经济的调用成本与敏捷出图速度,在创意阶段快速发散多视角、不同艺术基调的概念线索,加速视觉方案定稿。

专家技巧

  • 使用 FRAME 框架组织提示词:建议从主体核心(Focus)、渲染介质(Rendering)、镜头机位(Angle)、光影情绪(Mood)与细节补充(Extras)五个维度构建完整提示词,引导模型精准捕捉视觉意图。
  • 使用英文半角双引号包裹画面文字:画面中若需要精准呈现印刷文字或招牌标语,请使用半角双引号清晰注明(例如 "SPECIAL COFFEE"),有助于提升字符拼写准确率与排版边缘清晰度。
  • 具体描述布光与材质细节:明确指定“柔和柔光箱摄影”、“侧逆轮廓光”或“哑光磨砂质感”等具体属性,比“最高画质”、“超级细节”等泛化词汇能获得更有质感的出图效果。
  • 阶梯式参数验证与选型:在方案构思阶段可先使用 auto 比例进行低成本快速探索,确定满意的画面主体与风格基调后,再指定精确比例输出终稿。

注意事项

  • prompt 为必填参数,去除首尾空白字符后长度需在 1 至 5,000 个字符之间,且至少包含 1 个非空白字符。
  • 文生图端点专用于通过文本生成全新画面,不接收图片输入;如需上传参考图进行修改或多图融合,请使用 Nano Banana Edit 端点。
  • 任务执行采用异步处理机制,提交后立即返回任务标识 task_id;若任务因参数异常或系统中断失败,系统将全额自动返还扣除的积分。

相关模型推荐

Nano Banana Text to Image API 常见问题

Nano Banana Text to Image API 是什么?

Nano Banana Text to Image 是 Google DeepMind 研发的高效文本生成图像模型。它根据纯文本提示词生成高保真原生图像,具备清晰精准的画面文字排版渲染能力、深厚的真实世界常识还原,并原生适配 10 种主流画幅比例。基于先进的 Gemini 2.5 Flash Image 多模态架构,它在严格遵循复杂空间透视与光影规律的同时,呈现通透自然的视觉质感与稳定的主体表现。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。

Nano Banana Text to Image 支持在画面中生成文字吗?

支持。模型在底层架构中专门强化了多语言排版图文生成能力,能够在广告牌、包装标签、路标及图书封面上生成清晰工整、边缘锐利的短文本。在提示词中使用英文半角双引号包裹文案内容(例如 "SUMMER SALE"),即可获得最佳的拼写与字体排版效果。

Nano Banana Text to Image 支持还原真实世界地标与常识吗?

支持。作为深度整合 Google 知识图谱的多模态模型,Nano Banana 能够精确识别并还原埃菲尔铁塔、富士山等世界级著名地标、特定动植物特征以及常见工业产品的标志性构造,避免因常识欠缺导致物体结构失真。

Nano Banana Text to Image 支持哪些画面画幅比例?

模型原生支持 10 种画幅比例:1:1(正方形)、2:3、3:2、3:4、4:3、4:5、5:4、9:16(移动端全屏)、16:9(横版宽屏)与 21:9(超宽电影画幅)。在 API 请求中省略 size 参数或选择 auto 时,模型将根据提示词智能自适应决定画幅。

Nano Banana 与 Nano Banana 2 Lite 应该如何选型?

两者在定位上各有侧重:Nano Banana(基于 Gemini 2.5 Flash)在复杂提示词遵循度、真实常识还原和细腻光影质感上更显均衡扎实;而 Nano Banana 2 Lite 则针对延迟进行了极限优化,单张生成仅约 4 秒,更适合需要超高并发交互与即时原型发散的轻量级场景。

Nano Banana Text to Image 的调用费用是多少?

文生图端点每次生成固定消耗 5 积分,折合 $0.025(1 积分 = $0.005),无任何画幅溢价。如果生成任务因系统异常中断或校验未通过,系统将全额自动返还所扣积分。

如何编写 Nano Banana Text to Image 的高质量提示词?

推荐使用 FRAME 分层框架撰写提示词:依次指明核心主体、渲染材质、机位视角、布光氛围以及文字排版细节;使用连贯具体的自然语言描述,明确“影棚柔光箱光照”或“哑光塑料质感”等具体属性,尽量避免堆砌模糊的形容词。