Gemini Omni 1.1 Flash Text-to-Video API

google/gemini-omni-1.1-flash/text-to-video

Gemini Omni 1.1 Flash(Text-to-Video)将文本提示词转化为带原生音频的短视频,支持镜头与光线控制,以及 360p 至 4K 输出。用同一套创作指令编排场景、动作和声音,为产品概念、故事分镜与社交内容制作 4–10 秒视听片段。

输入
564/20000
输出
等待运行

生成的视频会显示在这里

填写提示词并添加所需素材,确认设置后点击“运行”。

720p · 8 秒 = $0.375 (75 积分)
继续使用

示例

One continuous 8-second cinematic shot. Slow push-in down a wet-asphalt night avenue lined with neon storefronts; rain beads on the pavement and a metal awning. No people in close-up, no shops selling products, no readable signs. Lighting: high-contrast neon magenta and teal bouncing off black puddles. Camera: locked-axis slow dolly-in at chest height, no cuts. Native audio: rain on metal, distant traffic hiss, and a low analog music pulse. No logos, no readable text, no products, no packaging, no prices, no CTA, no advertising, no watermark, no brand marks.

Vertical 9:16, 4 seconds. Dawn on a weathered wooden fishing pier, pale peach sky, no rain, no city. One adult fisherman in a plain grey jacket stands at the rail, backs three-quarter to camera, and says one short quiet line in English: "The tide is turning." Camera: gentle handheld hold, slight drift, no cuts. Lighting: cool marine dawn with a warm horizon band. Native audio: one spoken line, sea wind, water slapping pilings. Not a cafe, shop, or product scene. No logos, no readable text, no products, no packaging, no prices, no CTA, no advertising, no watermark, no brand marks.

One continuous 4-second 16:9 macro shot. A single clear glass marble rolls along a brushed-steel toy track, tapping each joint. Low camera two centimeters above the rail, tracking beside the marble. Lighting: hard workshop sidelight, sharp highlights on glass and metal. Native audio: precise Foley of glass on steel, tiny ticks, quiet room tone. No hands, no toys as products, no packaging. No logos, no readable text, no products, no packaging, no prices, no CTA, no advertising, no watermark, no brand marks.

Gemini Omni 1.1 Flash Text-to-Video

Gemini Omni 1.1 Flash Text-to-Video 将文本提示词转化为短视频,同时生成对白、音乐和环境音效。通过文字设计主体动作、镜头运动、光线与声音,把产品创意、故事场景和品牌氛围呈现为视听片段。

为什么选择此端点?

  • 文字驱动场景创作用主体、环境和动作描述构建画面,将产品创意或故事片段转化为可观看的短视频。

  • 镜头运动控制通过推进、跟随、环绕和景别描述设计镜头,让摄影机运动服务于产品细节或故事重点。

  • 光线与氛围塑造描述光源、色调和场景情绪,为同一个创意探索晨光、霓虹或柔和室内光等视觉方向。

  • 原生对白与音效在视频生成时一并创作对白、音乐和环境声,用同一条提示词安排画面内容与声音氛围。

  • 多档分辨率输出提供 360p、720p、1080p 和 4K 输出选项,按预览、剪辑和内容交付所需的规格选择。

  • 横竖屏短片创作结合 16:9 或 9:16 画幅与 4、6、8、10 秒时长,为横屏叙事和竖屏社交内容安排构图与节奏。

参数

参数要求说明
prompt必填

字符串。描述场景、动作、运镜、光线、情绪和声音;去除首尾空格后为 1–20,000 个字符。

duration可选

整数。设置输出时长;体验区默认预选 8 秒。

默认84610
resolution可选

字符串。设置输出分辨率;体验区默认预选 720p。

默认720p360p1080p4k
aspect_ratio可选

字符串。控制画面比例;体验区默认预选 16:9。

默认16:99:16

如何使用

  1. 描述场景与动作在提示词中写清主体、环境和主要动作,例如“玻璃珠沿金属轨道滚动,经过一盏暖色台灯”。

  2. 补充运镜与声音加入镜头运动、光线和对白、音乐或环境声,例如“低机位跟拍,伴随清脆滚动声”。

  3. 选择分辨率选择 360p、720p、1080p 或 4K,默认 720p;按后续剪辑或展示所需的输出规格配置。

  4. 选择视频时长选择 4、6、8 或 10 秒,默认 8 秒,根据主要动作和镜头节奏安排片段长度。

  5. 选择画面比例选择 16:9 横屏或 9:16 竖屏,默认 16:9,结合展示版式安排主体位置。

  6. 确认费用并运行查看运行按钮显示的当前配置费用,完成素材上传和提示词填写后点击“运行”。

  7. 预览并下载视频任务完成后,在输出面板预览画面与声音,点击“下载视频”保存结果。

价格

按次计费,费用由视频时长和分辨率档位决定,原生音频包含在生成结果中。1 积分 = $0.005。

用量费率说明
360p / 720p / 1080p4 秒=45、6 秒=60、8 秒=75、10 秒=90 积分默认 720p / 8 秒为 75 积分($0.375)。
4k4 秒=105、6 秒=120、8 秒=135、10 秒=150 积分4k / 8 秒为 135 积分($0.675)。

适用场景

  • 产品概念短片将产品场景、核心动作和配乐方向写入提示词,生成用于创意提案与品牌展示的概念镜头。

  • 故事分镜预演把剧本中的一个动作节拍转化为带声音的短片,用于沟通景别、镜头运动和场面调度。

  • 竖屏品牌内容围绕一个品牌主题描述主体和环境,选择 9:16 画幅,制作面向社交渠道的竖屏素材。

  • 视听氛围镜头结合雨夜、街道或室内光线等场景与环境声描述,创作可用于片头或故事过渡的氛围片段。

专业建议

  • 按主体与环境、动作、镜头、光线、声音的顺序组织提示词,让每部分承担明确的创作任务。
  • 将主体动作与镜头运动分句描述,例如“人物走向门口,镜头从侧面缓慢跟随”,说明两者的运动关系。
  • 设计一镜到底时,写明“连续镜头”,再描述镜头的起始位置、移动方向和结束构图。
  • 用“Audio:”引出对白、音乐与音效,并描述声音对应的动作,例如“人物推开门时响起门轴声”。
  • 让一个 4–10 秒片段围绕一个主要动作展开,并写清开场状态、动作变化和收尾画面。

使用说明

  • Gemini Omni 1.1 Flash Text-to-Video 使用文本提示词生成视频,必填输入是提示词(prompt),并可通过时长、分辨率和画面比例设置安排输出。
  • 在提示词中描述对白、音乐或环境声,生成结果包含原生音频。
  • 提示词去除首尾空格后为 1–20,000 个字符,清楚描述场景、动作、运镜与声音。
  • 通过 API 提交后保存 task_id,用于查询任务进度和获取生成结果。

Gemini Omni 1.1 Flash Text-to-Video API 常见问题

Gemini Omni 1.1 Flash Text-to-Video API 是什么?

Gemini Omni 1.1 Flash Text-to-Video 是 Google 研发的文本生成视频模型。它根据文本提示词生成最高 4K 分辨率、包含对白、音乐与环境声的短视频,支持精准的镜头运动、光影和场景氛围控制。基于 Gemini 多模态智能架构,它在严格遵循提示词物理规律与画面连贯性的同时,呈现具有影视质感的动态叙事。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。

Gemini Omni 1.1 Flash 文生视频能生成对白和音乐吗?

可以。模型原生具备全模态音画联合生成能力,无需后期合成音轨。在提示词中分别描述对白内容、配乐情绪或环境音效(例如脚步声、雨滴声),模型即可在输出 MP4 中直接内嵌精准对齐动作的原生音频。

Gemini Omni 1.1 Flash 文生视频一次最长能生成多久?

单次调用支持生成最长 10 秒的独立视频片段,可选 4、6、8 或 10 秒(体验区默认预设 8 秒)。对于需要更长时间跨度的情节,可在提示词中按时序清晰组织镜头节拍,或通过场景延续机制逐步延伸镜头叙事。

Gemini Omni 1.1 Flash 文生视频支持 4K 分辨率吗?

支持。模型提供从 360p、720p、1080p 到 4K 的多档原生及超分辨率输出选项。4K 模式适合用于高质量广告大片和商业交付,细腻保留光影反射与材质纹理;日常测试则推荐使用 720p 平衡画质与响应速度。

可以用 360p 快速验证 Gemini Omni 1.1 Flash 文生视频创意吗?

可以。360p 分辨率专为低延迟快速迭代设计,相比高清生成能大幅缩短等待时间并降低积分消耗。建议在创意构思阶段先用 360p 校验主体的构图走位与运镜节奏,确认效果符合预期后再切换至 1080p 或 4K 渲染成片。

如何用镜头语言控制 Gemini Omni 1.1 Flash 文生视频?

在提示词中建议将主体动作与摄影机运动分置于独立分句。使用明确的运镜词汇,如“推镜头跟拍”、“360度平稳环绕”或“低机位仰拍”,并指定光线类型(如暖色侧光、霓虹反射),即可获得符合影视规律的镜头运动。

Gemini Omni 1.1 Flash 文生视频适合制作 9:16 竖屏内容吗?

适合。模型提供 16:9 横屏和 9:16 竖屏两种标准画幅。选择 9:16 比例时,建议在提示词中优先规划垂直纵深构图与主体人物走位,模型会自动适配竖屏视角下的视觉焦点与环境展现。