Veo 3.1 Fast Official Image-to-Video API

google/veo3.1-fast/image-to-video

Veo 3.1 Fast Official 将静态图像与文本指令转化为高保真动态影像。支持首帧画面动态唤醒与首尾双帧平滑过渡,在极速出片与材质光影保真之间取得黄金平衡,同步生成动作对齐的原生音频,最高输出 4K,是电商演示与品牌视觉量产的主力引擎。

输入
305/1000
输出
等待运行

生成的视频会显示在这里

填写提示词并添加所需素材,确认设置后点击“运行”。

8 seconds × 15/s = $0.600 (120 积分)
继续使用

示例

A paper boat released into a clear forest stream drifts downstream toward the lip of a small mossy waterfall, the camera following at water level past smooth stones and ferns. Natural sound: babbling water growing louder near the falls, birdsong, a distant woodpecker. Realistic motion, no text, no logos.

The ginger cat on the sunny windowsill lifts its head, ears swiveling toward a sound off-camera, then looks directly into the lens as sunlight creeps across its fur. Natural sound: a soft meow, purring, muted street noise through the glass. Realistic motion, no text, no logos.

Time-lapse of a seedling rising from dark soil, unfurling leaves and opening a single white blossom, ending on the open flower with fine water droplets. Soft diffused light, clean macro focus, quiet studio stillness. Realistic botanical motion, no text, no logos.

Veo 3.1 Fast Official Image-to-Video

Google Veo 3.1 Fast Official 图生视频端点专为视觉资产的高速动态化打造。以单张首帧启动镜头动作,或输入两张图片构建首尾帧自然演进,结合文本指令控制运镜与空间声场,将产品摄影与概念原画快速转化为 4–8 秒可交付的商业动态片段。

为什么选择此端点?

  • 首帧动态唤醒深度解析并继承输入图片的构图、角色特征与光影质感,自然顺畅地展开第一秒运动轨迹。

  • 首尾双帧精准过渡传入首尾两张关键帧图片,模型将基于物理规律自动补全中间平滑演进与姿态变换。

  • 高保真主体连贯性在极速生成节奏下仍保持面容、产品细节与光照反射稳定,适合高频电商与品牌视觉量产。

  • 动作对齐的原生音效根据画面动势与提示词一体化生成环境声与物理音效,批量出片时显著减少后期音轨工作。

  • 720p 至 4K 全梯队输出支持 720p、1080p 与 4K,探索阶段高速迭代,交付阶段一键升至超高清终版。

  • 灵活透明的按秒计费支持 4/6/8 秒精确时长控制与独立音频开关,让从草稿验证到批量成片的成本清晰可控。

参数

参数要求说明
prompt必填

字符串。描述场景、动作、运镜、光线和声音;去除首尾空格后为 1–1,000 个字符。

image_urls必填

包含 1–2 个公开 URL 的字符串数组。第一张是首帧,可选第二张是尾帧,传入两张图时会发送 generation_type 为 frame。JPEG、PNG 或 WebP,每张最大 10 MB。

generation_type可选

可省略。单图省略时不发送该字段;双图省略时默认 frame。显式传 frame 必须提供两张图片。

duration可选

整数。设置输出时长;体验区默认预选 8 秒。

默认846
aspect_ratio可选

字符串。控制画面比例;体验区默认预选 16:9。图生视频还可使用 auto。

默认16:9auto9:16
resolution可选

字符串。设置输出分辨率;体验区默认预选 720p。

默认720p1080p4k
sound可选

布尔值。是否生成原生音频;体验区默认预选 true。

默认truefalse

如何使用

  1. 上传清晰首帧图片选取主体鲜明、光影层次丰富的图片作为开场基准(JPEG/PNG/WebP,最大 10MB),为模型确立视觉起点。

  2. 选配尾帧引导过渡如需设计确定性的终点画面或姿态变化,添加可选尾帧图片,模型将自动切换为首尾帧演变模式。

  3. 用提示词指导动势与运镜描述从起始画面的动态演变,例如“人物从静止状态缓缓转身走向落地窗,摄影机平稳跟随推近,窗外雨滴声渐强”。

  4. 配置画幅、时长与音频画面比例可选用 auto 继承原图比例或指定 16:9 / 9:16;配置 4/6/8 秒时长与原生音效开关,日常量产用 720p/1080p,终版可升 4K。

  5. 查看费用预估并运行确认当前按秒折算的积分预估,点击“运行”,任务完成后直接在线预览视听效果并下载。

价格

Veo 3.1 Fast Official 按生成秒数计费。最终费用 = 时长 × 所选每秒费率。美元换算采用当前基础 API 计费:2,000 积分 = $10。示例:Fast 8 秒 720p 带音频任务为 8 × 15 = 120 积分,按基础 API 积分汇率约 $0.6。

用量费率说明
720p,无音频10 积分/秒($0.05/秒)8 秒 = 80 积分($0.4)。
720p,带音频15 积分/秒($0.075/秒)默认 720p / 8 秒带音频为 120 积分($0.6)。
1080p,无音频10 积分/秒($0.05/秒)8 秒 = 80 积分($0.4)。
1080p,带音频15 积分/秒($0.075/秒)8 秒 = 120 积分($0.6)。
4k,无音频30 积分/秒($0.15/秒)8 秒 = 240 积分($1.20)。
4k,带音频35 积分/秒($0.175/秒)8 秒 = 280 积分($1.40)。

适用场景

  • 电商产品高速演示量产将棚拍产品图批量转化为环绕展示或微距光影流动短片,在保证主体一致性的同时支撑高频上新节奏。

  • 品牌视觉与动态海报结合竖屏画幅与原生音效,把静态平面海报快速延展为具备视听冲击力的社媒投放素材。

  • 概念原画快速唤醒为游戏设定、插画立绘注入自然肢体动作与光影视差,适合评审前的多版动势试拍与快速定稿。

  • 首尾帧转场批量打样用双图关键帧快速验证环境变迁与姿态过渡,确认节奏后升至 1080p/4K 完成带音频的商业交付。

专业建议

  • 尊重首帧既有物理逻辑:提示词应基于首帧已有的主体形态、光影朝向与空间纵深展开运动描述,避免提出违背原图物理结构的突兀指令。
  • 首尾帧过渡的提示词策略:使用双图模式时,提示词重点应描述“中间过程是如何发生的”,明确主体的动作路径、摄影机运动轨迹与中间过渡节奏。
  • 利用 auto 画幅保持构图完整:首帧上传后推荐将 aspect_ratio 设为 auto,模型将自动契合原图长宽比,避免画面拉伸或边缘裁剪。
  • 声画细节联动描写:描述与原图动作相关的声音源,例如“Audio: 激流奔涌与水汽弥漫的浑厚水声”,增强视听沉浸感。
  • 阶梯式量产工作流:先用 Lite(720p/无音频)摸索动势与首尾帧契合度,锁定后再切换至 Fast 1080p 或 4K 并开启音频完成批量交付。

使用说明

  • Veo 3.1 Fast Official Image-to-Video 使用必填文本提示词生成视频,并可通过时长、分辨率、画面比例和音频设置配置输出。
  • 提示词上限为 1,000 个字符。时长支持 4、6 或 8 秒。
  • 通过 sound 参数请求带音频或静音输出。带音频与无音频任务使用不同的按秒费率。
  • Fast 和 Quality Official 支持 720p、1080p 和 4K。
  • 图生视频可传入一张首帧,或两张图做首尾帧控制。
  • 通过 API 提交后保存 task_id,用于查询任务进度和获取生成结果。

Veo 3.1 Fast Official Image-to-Video API 常见问题

Veo 3.1 Fast Official Image-to-Video API 是什么?

Veo 3.1 Fast Official Image-to-Video 是 Google Veo 3.1 系列中面向高频生产的图生视频平衡档位。它能以单张静态图片作为首帧生成连贯运动,或通过两张图片实现精准的首尾关键帧平滑过渡,支持最高 4K 与同步原生音效,适合电商演示与品牌视觉量产。可通过 Vidgo API 程序化调用,或在上方工作区直接体验。

在 API 请求中应使用哪个 model 标识?

在提交请求的 model 字段中请填入 google/veo3.1-fast/image-to-video。如需使用 Quality 或 Lite 变体,请分别填入 google/veo3.1/image-to-video 或 google/veo3.1-lite/image-to-video。请勿使用包含 -official 的页面路径作为模型 ID。

图生视频支持传入几张图片?工作模式有何区别?

支持传入 1 张或 2 张图片:传入 1 张图片时为首帧启动模式,模型以该图为第一帧展开后续动作;传入 2 张图片时为首尾帧模式,系统会自动发送 generation_type: "frame",并解算出两张图片之间的平滑过渡动作。

Fast 图生视频能生成动作对齐的原生音频吗?

可以。配置 sound: true 并在提示词中描述声音要素(例如风声、引擎声、脚步声),模型即可在输出 MP4 中直接内嵌与画面动作精准对齐的原生音轨,显著缩短批量出片的后期流程。

画幅比例选择 auto 有什么好处?

当选择 auto 时,系统会自适应输入图片的原始比例生成视频,最大程度保留原图的构图完整性与画面边缘细节;也可主动指定 16:9 横屏或 9:16 竖屏以适配特定终端媒介。

什么时候该选 Lite、Fast 或 Quality?

需要低成本、超高速验证动画可行性时选 Lite;需要兼顾出片效率、主流画质与 4K 支持、支撑高频商业量产时选 Fast;需要最高画质保真度与旗舰成片交付时选用 Quality。

Fast 的按秒计费如何支持批量生产?

任务费用严格按视频时长(4/6/8 秒)乘以对应分辨率与音频状态的每秒费率计算。预览阶段可关闭音频、选用 720p 控制成本;确认动势后再开启音频并升至 1080p/4K,实现从打样到量产的精细管控。

对上传的图片素材有什么要求?

支持 JPEG、PNG 和 WebP 格式,每张图片大小不超过 10 MB。建议上传主体轮廓清晰、光影分明的高分辨率图像,以帮助模型精准理解画面结构与深度信息。