Gemini 3.7 Flash API

google/gemini-3.7-flash
1,048,576 tokens · 输入 120 / 缓存输入 12 / 输出 600 积分 / 1M tokens

Gemini 3.7 Flash 将文本、图像、音频、视频和文档转化为代码与分析结果,适合开发与知识任务。百万 token 上下文可关联大量资料,系统指令和生成参数可控制回答。

Gemini 3.7 Flash

Google · chat-completions

与 Gemini 3.7 Flash 开始对话

每个模型都有独立对话。切换模型不会发送其他模型的聊天记录,切回后可继续原对话。请求按实际 Token 用量计费。

Ctrl / ⌘ + Enter 发送0 / 32,000

继续体验

Gemini 3.7 Flash

Gemini 3.7 Flash 适合代理式编程、网页开发、多模态分析与长文档处理,可在 1,048,576-token 上下文中关联相关资料。Chat Completions 使用有序 messages;Gemini Native 通过 contents、systemInstruction 和 generationConfig 组织请求。两种格式均提供生成内容与 token 用量,也可使用流式响应。本页 Playground 用于文本对话,API 请求可按协议提交支持的多模态输入。

为什么选择 Gemini 3.7 Flash?

  • 多步骤软件开发结合需求、代码库上下文和工具结果,处理编程、调试与代码审查任务。

  • 网页界面开发根据设计参考与文字需求规划界面、生成代码并检查实现细节。

  • 长上下文知识处理在 1,048,576-token 上下文窗口中分析相互关联的文档与源文件。

  • 多模态理解将文字指令与图像、音频、视频及 PDF 结合,进行针对性分析与提取。

  • 两种请求格式通过 Chat Completions 传入有序消息,或通过 Gemini Native 传入 contents 与 generationConfig。

输入参数

参数要求说明
modelChat Completions 必填

填写 google/gemini-3.7-flash。

messagesChat Completions 必填

由 role 和 content 组成的非空有序消息数组。

temperature可选

采样温度;体验区范围 0–2,步长 0.1。

默认值1.0
max_tokensChat Completions 可选

体验区支持设置 1–65,536 的输出 token 上限。

默认值4096
top_pChat Completions 可选

核采样概率;体验区范围 0–1,步长 0.1。

默认值1.0
contentsGemini Native 必填

由 role 和 parts 组成的非空对话数组。

systemInstructionGemini Native 可选

通过 parts 提供系统指令。

generationConfig.temperatureGemini Native 可选

采样温度;体验区范围 0–2,步长 0.1。

默认值1.0
generationConfig.maxOutputTokensGemini Native 可选

体验区支持设置 1–65,536 的输出 token 上限。

默认值4096
generationConfig.topPGemini Native 可选

核采样概率;体验区范围 0–1,步长 0.1。

默认值1.0
streamChat Completions 可选

设为 true 返回 SSE;Gemini Native 使用 streamGenerateContent 方法。

默认值falsetrue

使用方法

  1. 描述任务提供问题、来源资料及预期输出格式。

  2. 选择接口格式向 Chat Completions 发送 messages,或向 Gemini Native 发送 contents。

  3. 设置生成参数按需要设置输出上限、系统指令与采样参数。

  4. 读取结果查看生成内容与 token 用量,并在后续对话中补充相关上下文。

价格

输入、缓存输入与输出分别计量。以下费率均按每 1M tokens 计算,并以积分结算。

用量费率说明
Input$0.600 · 120 积分 / 1M tokens请求中按标准输入计量的 token。
Cached input$0.060 · 12 积分 / 1M tokens响应报告的缓存读取输入 token。
Output (including thinking tokens)$3.00 · 600 积分 / 1M tokens生成内容与思考过程使用的 token。

适用场景

  • 代码库开发结合需求与相关源文件,生成代码、排查步骤或审查意见。

  • 网页界面实现将设计参考和交互需求整理为前端代码与修改建议。

  • 长文档分析在一项任务中对照报告、PDF 和研究资料中的细节。

  • 多模态审查围绕图像、音频、视频及文档提出明确问题。

使用建议

  • 编程任务中一起提供目标、相关源文件和验收标准。
  • 在 Gemini Native 中用 systemInstruction 说明回答格式与任务范围。
  • 按照接口格式设置 max_tokens 或 generationConfig.maxOutputTokens,以匹配所需回答篇幅。

使用说明

  • 输入上下文窗口为 1,048,576 tokens,最大输出为 65,536 tokens。
  • 本页文本聊天 Playground 默认输出上限为 4,096 tokens,可设置 1–65,536。
  • Chat Completions 的 model 及 Gemini Native 路径均使用完整 ID google/gemini-3.7-flash。
  • 模型可在 API 请求中选择 low、medium 或 high thinking level。

相关模型

Gemini 3.7 Flash API 常见问题

Gemini 3.7 Flash API 是什么?

Gemini 3.7 Flash 是 Google 面向编程、多模态分析与长上下文知识任务的模型,可将文本、图像、音频、视频和文档转化为代码、分析结果与具体回答。1,048,576-token 上下文窗口可关联大量来源资料,生成参数帮助控制回答。你可以通过 Chat Completions 或 Gemini Native 调用,也可以在上方 Playground 进行文本对话。

Gemini 3.7 Flash 的上下文窗口有多大?

Gemini 3.7 Flash 最多接收 1,048,576 输入 tokens,最大输出为 65,536 tokens。需要关联多个来源时,可在同一任务中提供相关文档、代码和指令。

Gemini 3.7 Flash 可以分析哪些输入?

Gemini 3.7 Flash 可分析文本、图像、音频、视频及 PDF。在 API 请求中结合明确问题、提取目标或开发任务提供资料。

Gemini 3.7 Flash 如何辅助编程与网页开发?

提供需求、代码库上下文、设计参考和验收标准后,模型可规划改动、生成代码、解释错误并审查界面实现。

Gemini 3.7 Flash 可以使用哪两种 API 格式?

向 /v1/chat/completions 发送 model 和 messages,或向 /v1beta/models/google/gemini-3.7-flash:generateContent 发送 contents。流式响应使用对应的 SSE 调用方式。

Gemini 3.7 Flash 的缓存输入如何计费?

响应报告缓存读取时,缓存输入费率为每 1M tokens $0.060 或 12 积分。标准输入为 $0.600 或 120 积分;包含思考 token 的输出为 $3.00 或 600 积分。

Gemini 3.7 Flash 有哪些 thinking levels?

Gemini 3.7 Flash 提供 low、medium 和 high 三种 thinking levels。可在 API 请求中根据任务的响应速度、token 用量和推理深度选择。

Gemini 3.7 Flash 体验区可设置多少输出 tokens?

Max Tokens 默认值为 4,096,可输入 1–65,536 的整数。Chat Completions 使用 max_tokens;Gemini Native 使用 generationConfig.maxOutputTokens。