Gemini Omni 1.1 Flash Reference-to-Video API

google/gemini-omni-1.1-flash/reference-to-video

Gemini Omni 1.1 Flash(Reference-to-Video)结合文本提示词与 1–7 张参考图片生成视频,支持角色与风格参考、原生音频和 360p 至 4K 输出。将参考图中的外观特征带入新的场景,再通过提示词编排环境、动作与运镜,创作角色故事和品牌短片。

输入
657/20000
0/7 · 剩余 7
输出
等待运行

生成的视频会显示在这里

填写提示词并添加所需素材,确认设置后点击“运行”。

720p · 8 秒 = $0.375 (75 积分)
继续使用

示例

Use the reference images only for this woman's face, hair, olive linen shirt, terracotta necklace, and identity. New scene, not a portrait studio and not a rainy alley: a sunny glass greenhouse at late morning. She walks two steps along a gravel path, then tips a plain metal watering can over a bed of leafy plants. Camera: medium tracking shot, eye level, one slow lateral move. Lighting: bright greenhouse sun with leaf shadows. Native audio: birds outside the glass, water from the can, footsteps on gravel. Keep identity consistent. No logos, no readable text, no products, no packaging, no prices, no CTA, no advertising, no watermark, no brand marks.

Use the references only for this exact tabby: orange-brown stripes, forehead M, white chest, white left front paw, notched right ear. New scene: a quiet afternoon wooden windowsill above a sunlit room. The cat walks slowly from left to right along the sill and pauses to look outside. Camera: locked medium side view. Lighting: warm afternoon window light. Native audio: room tone, a distant clock tick, soft paw steps on wood. Not a pet-product scene. No logos, no readable text, no products, no packaging, no prices, no CTA, no advertising, no watermark, no brand marks.

Use reference 1 only for ink-wash bamboo style, wet-paper texture, and mist. Use reference 2 only for the walking-coat silhouette. New scene: a foggy bamboo path at dawn, the silhouette walker takes three slow steps away along the path. Camera: gentle push-in, 16:9. Lighting: pale ink dawn, no neon, no rain city. Native audio: insects, soft footsteps on damp earth, distant water drip. No logos, no readable text, no products, no packaging, no prices, no CTA, no advertising, no watermark, no brand marks.

Gemini Omni 1.1 Flash Reference-to-Video

Gemini Omni 1.1 Flash Reference-to-Video 将文本提示词与 1–7 张参考图片结合,生成带原生音频的新场景视频。利用图片提供角色外观、产品特征或视觉风格,再通过提示词设计环境、动作与运镜,为角色故事和品牌内容建立清晰的视觉方向。

为什么选择此端点?

  • 角色外观参考用参考图片提供面部、发型与服装等视觉特征,为角色在新环境中的表演建立外观依据。

  • 多角度图片引导同一任务可使用 1–7 张图片,结合正面、侧面和细节视角说明主体的外观与造型。

  • 产品特征参考通过产品图片提供轮廓、材质和配色,再描述新的摆放环境与镜头运动,创作产品场景视频。

  • 视觉风格延续用风格参考图说明色调、光线和艺术方向,将品牌的视觉语言用于新的场景设计。

  • 新场景与动作设计参考图提供视觉依据,提示词描述新的地点、动作和镜头,让角色或产品进入新的故事。

  • 场景声音一并创作在同一条提示词中描述对白、音乐与环境声,为新场景配合原生音频,并选择横屏或竖屏输出。

参数

参数要求说明
prompt必填

字符串。为每张参考图分配职责,并定义新场景、运镜和声音;去除首尾空格后为 1–20,000 个字符。

reference_image_urls必填

包含 1–7 个公开图片 URL 的字符串数组,用于提供角色、产品或视觉风格参考。JPEG、PNG 或 WebP,每张最大 30 MiB。

duration可选

整数。设置输出时长;体验区默认预选 8 秒。

默认84610
resolution可选

字符串。设置输出分辨率;体验区默认预选 720p。

默认720p360p1080p4k
aspect_ratio可选

字符串。控制画面比例;体验区默认预选 16:9。

默认16:99:16

如何使用

  1. 上传参考图片添加 1–7 张 JPEG、PNG 或 WebP 图片,每张最大 30 MiB,用于提供角色、产品或风格参考。

  2. 描述图片用途与新场景在提示词中说明各张参考图的作用,再描述目标环境、人物或产品的位置以及主要动作。

  3. 补充运镜与声音写出镜头的移动方向、光线和对白、音乐或环境声,围绕目标场景组织视听细节。

  4. 选择分辨率选择 360p、720p、1080p 或 4K,默认 720p;按后续剪辑或展示所需的输出规格配置。

  5. 选择视频时长选择 4、6、8 或 10 秒,默认 8 秒,根据主要动作和镜头节奏安排片段长度。

  6. 选择画面比例选择 16:9 横屏或 9:16 竖屏,默认 16:9,结合展示版式安排主体位置。

  7. 确认费用并运行查看运行按钮显示的当前配置费用,完成素材上传和提示词填写后点击“运行”。

  8. 预览并下载视频任务完成后,在输出面板预览画面与声音,点击“下载视频”保存结果。

价格

按次计费,费用由视频时长和分辨率档位决定,原生音频包含在生成结果中。1 积分 = $0.005。

用量费率说明
360p / 720p / 1080p4 秒=45、6 秒=60、8 秒=75、10 秒=90 积分默认 720p / 8 秒为 75 积分($0.375)。
4k4 秒=105、6 秒=120、8 秒=135、10 秒=150 积分4k / 8 秒为 135 积分($0.675)。

适用场景

  • 角色故事短片以角色设定图或照片提供外观参考,描述新的地点和动作,制作角色出场与故事片段。

  • 产品场景展示使用产品图片作为视觉参考,为产品设计室内、户外或节日环境,创作品牌展示素材。

  • 品牌风格短片结合品牌风格板与场景提示词,将既定色调和艺术方向用于带声音的视频创意。

  • 多场景创意方案围绕同一组人物或产品参考图分别设计场景,形成用于品牌提案的多个短片方向。

专业建议

  • 为每张参考图说明用途,例如第一张提供角色外观、第二张提供服装、第三张提供场景风格。
  • 使用同一主体的正面、侧面和细节图片,向模型展示需要参考的外观信息。
  • 直接描述目标环境的地点、光线和背景元素,为参考主体建立新的活动空间。
  • 将外观参考和动作指令分句表达,例如“采用参考图中的红色外套,人物沿雨夜街道向前行走”。
  • 描述与新场景有关的脚步、环境声或配乐,使声音方向与人物动作和场景氛围对应。

使用说明

  • Gemini Omni 1.1 Flash Reference-to-Video 结合文本提示词和 1–7 张参考图片生成视频,主要输入为 prompt 和 reference_image_urls。图片提供角色、产品或风格参考,时长、分辨率和画面比例用于配置输出。
  • 在提示词中描述对白、音乐或环境声,生成结果包含原生音频。
  • API 素材链接使用可公开访问的 HTTP(S) 地址,供服务读取输入文件。
  • 通过 API 提交后保存 task_id,用于查询任务进度和获取生成结果。

Gemini Omni 1.1 Flash Reference-to-Video API 常见问题

Gemini Omni 1.1 Flash Reference-to-Video API 是什么?

Gemini Omni 1.1 Flash Reference-to-Video 是 Google 研发的多参考生成视频模型。它支持输入 1–7 张参考图片与文本提示词,在新场景中重构具有高度一致性的角色面貌、道具细节或艺术风格,并同步输出带原生音轨的高清视频。基于 Gemini 多模态智能架构,它突破了单图起步的局限,在保持主体关键视觉特征的同时实现多角度叙事与镜头演进。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。

Gemini Omni 1.1 Flash 参考生视频最多支持几张图片?

单个请求最多可输入 7 张参考图片。你可以同时上传主体的正面、侧面特写以及服饰配件细节,丰富的多视角素材有助于模型建立立体的角色与外观认知,在多变运镜下保持稳定。

Gemini Omni 1.1 Flash 参考生视频能把角色带入全新场景吗?

能。参考生视频的核心优势即是将参考素材中的角色或商品解耦出来,根据提示词直接迁移至全新的时间、地点与光影氛围中,例如将摄影棚中的模特带入赛博朋克雨夜街道。

如何在提示词中为 Gemini Omni 1.1 Flash 指定不同参考图?

在提示词中可以使用分工描述明确各图用途,例如“参考图 1 用于主角面容与发型,参考图 2 用于红色复古风衣,参考图 3 用于手持复古相机”。明确的特征绑定指引能让模型精准分配视觉权重。

Gemini Omni 1.1 Flash 参考生视频生成声音时会参考原图氛围吗?

会。模型会综合所有参考素材的视觉意象与提示词的新场景描述,直接合成匹配新画面的原生音频。例如当新场景设为喧闹集市时,成片会自动伴随人声喧哗与市井声效。

参考图光线不一致会影响 Gemini Omni 1.1 Flash 的生成质感吗?

模型具备强大的光照重光照(Re-lighting)理解力,能将不同光源环境下拍摄的参考图统一融入提示词指定的目标光影中。若提示词中明确了主光源方向与色温,画面光影的一体化质感会更加自然。

有静态起始画面时该选 Gemini Omni 1.1 Flash 图生视频还是参考生视频?

若视频第一帧必须与上传图片在构图、机位上完全吻合,应选择图生视频模式;若仅需要继承人物容貌、服装或商品外观,但第一帧构图与场景需要自由创作,则应选择参考生视频模式。