Underwater documentary tracking shot: a green sea turtle glides through a towering kelp forest, volumetric sunbeams piercing deep blue water, a school of small silver fish scattering, fine particles drifting in the light. Camera smoothly follows the turtle at a steady distance, no cuts. Natural lighting, photorealistic. Audio: soft muffled ocean ambience and a distant whale call. No logos, no readable text, no products, no watermark, no brand marks.
Gemini Omni Flash Text to Video API
google/gemini-omni-flash/text-to-videoGemini Omni Flash Text to Video 将文本提示词转化为 4–10 秒动态视频,支持原生音画口型同步、电影级运镜与光影控制,以及 720p 至 4K 分辨率输出。它能严格遵循提示词叙事与节奏,并在镜头中保持主体运动、场景连贯与音画对齐。
生成的视频会显示在这里
填写提示词并添加所需素材,确认设置后点击“运行”。
示例
REST API
快速开始
完成 API 鉴权,提交提示词与参数,再用任务 ID 取回视频。
连接 Vidgo API
创建 API 密钥,仅保存在服务端,并发送 Authorization: Bearer VIDGO_API_KEY。
- 接口
- POST
https://api.vidgo.ai/api/generate/submit - 认证
- Authorization: Bearer VIDGO_API_KEY
提交一次生成任务
按请求示例填写本端点参数,保存返回的 task_id 以查询进度与结果。
REQUEST_BODY=$(cat <<'JSON'
{
"model": "google/gemini-omni-flash/text-to-video",
"input": {
"prompt": "Underwater documentary tracking shot: a green sea turtle glides through a towering kelp forest, volumetric sunbeams piercing deep blue water, a school of small silver fish scattering, fine particles drifting in the light. Camera smoothly follows the turtle at a steady distance, no cuts. Natural lighting, photorealistic. Audio: soft muffled ocean ambience and a distant whale call. No logos, no readable text, no products, no watermark, no brand marks.",
"duration": 8,
"resolution": "720p",
"aspect_ratio": "16:9"
}
}
JSON
)
RESPONSE=$(curl --silent --show-error --fail-with-body \
--request POST \
--url "https://api.vidgo.ai/api/generate/submit" \
--header "Authorization: Bearer $VIDGO_API_KEY" \
--header "Content-Type: application/json" \
--data "$REQUEST_BODY")
CODE=$(printf '%s' "$RESPONSE" | jq -r '.code // empty')
if [ "$CODE" != "0" ] && [ "$CODE" != "200" ]; then
printf 'API error: %s
' "$RESPONSE" >&2
exit 1
fi
printf '%s
' "$RESPONSE"等待结果
用 task_id 查询,not_started/running 时继续,finished/failed 时停止。成功时读取 data.files[].file_url。
查询状态
GET https://api.vidgo.ai/api/generate/status/{task_id}以 2 秒为基准间隔轮询状态,较长任务可加大间隔。仅在 not_started 或 running 时继续,finished 或 failed 后停止。也可在请求中指定 callback_url 接收 webhook 通知。
not_startedrunningfinishedfailed{
"code": 200,
"data": {
"task_id": "task-unified-...",
"status": "running",
"created_time": "2026-09-15T10:00:00Z"
}
}{
"code": 200,
"data": {
"task_id": "task-unified-...",
"status": "finished",
"files": [
{
"file_url": "https://storage.vidgo.ai/generated/video.mp4",
"file_type": "video"
}
],
"created_time": "2026-08-22T10:00:00Z",
"progress": 100,
"error_message": null
}
}完整可运行示例
展开查看含 HTTP 与业务码校验、task_id 验证、轮询、终态处理与超时边界的完整脚本。
set -euo pipefail
: "${VIDGO_API_KEY:?Set VIDGO_API_KEY in your environment}"
REQUEST_BODY=$(cat <<'JSON'
{
"model": "google/gemini-omni-flash/text-to-video",
"input": {
"prompt": "Underwater documentary tracking shot: a green sea turtle glides through a towering kelp forest, volumetric sunbeams piercing deep blue water, a school of small silver fish scattering, fine particles drifting in the light. Camera smoothly follows the turtle at a steady distance, no cuts. Natural lighting, photorealistic. Audio: soft muffled ocean ambience and a distant whale call. No logos, no readable text, no products, no watermark, no brand marks.",
"duration": 8,
"resolution": "720p",
"aspect_ratio": "16:9"
}
}
JSON
)
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
--request POST \
--url "https://api.vidgo.ai/api/generate/submit" \
--header "Authorization: Bearer $VIDGO_API_KEY" \
--header "Content-Type: application/json" \
--data "$REQUEST_BODY")
TASK_ID=$(printf '%s' "$SUBMIT_RESPONSE" | jq -r '.data.task_id // .task_id // empty')
BUSINESS_CODE=$(printf '%s' "$SUBMIT_RESPONSE" | jq -r '.code // empty')
if [ "$BUSINESS_CODE" != "0" ] && [ "$BUSINESS_CODE" != "200" ]; then
printf 'Submit failed:
%s
' "$SUBMIT_RESPONSE" >&2
exit 1
fi
if [ -z "$TASK_ID" ]; then
printf 'Submit response did not include task_id:
%s
' "$SUBMIT_RESPONSE" >&2
exit 1
fi
START_TIME=$(date +%s)
POLL_DELAY=2
while true; do
if [ $(( $(date +%s) - START_TIME )) -ge 600 ]; then
printf 'Timed out after 600 seconds
' >&2
exit 1
fi
STATUS_RESPONSE=$(curl --silent --show-error --fail-with-body \
--url "https://api.vidgo.ai/api/generate/status/$TASK_ID" \
--header "Authorization: Bearer $VIDGO_API_KEY")
STATUS=$(printf '%s' "$STATUS_RESPONSE" | jq -r '.data.status // .status // empty')
BUSINESS_CODE=$(printf '%s' "$STATUS_RESPONSE" | jq -r '.code // empty')
if [ "$BUSINESS_CODE" != "0" ] && [ "$BUSINESS_CODE" != "200" ]; then
printf 'Status request failed:
%s
' "$STATUS_RESPONSE" >&2
exit 1
fi
case "$STATUS" in
finished)
printf '%s' "$STATUS_RESPONSE" | jq -r '(.data.files // .files // [])[]?.file_url'
break
;;
failed)
printf '%s' "$STATUS_RESPONSE" | jq -r '.data.error_message // .error_message // "Generation failed"' >&2
exit 1
;;
not_started|running)
sleep "$POLL_DELAY"
if [ "$POLL_DELAY" -lt 10 ]; then POLL_DELAY=$((POLL_DELAY + 1)); fi
;;
*)
printf 'Unexpected task status: %s
' "$STATUS" >&2
exit 1
;;
esac
doneinput 参数
下表列出可用输入参数、类型与默认值。请求示例还包含必填的顶层 model 字段。
| 字段 | 类型 | 必填 | 默认值 | 说明 |
|---|---|---|---|---|
| prompt | string | 是 | — | 去除首尾空格后 1–20,000 个字符。 |
| duration | integer | 否 | 6 | 4、6、8 或 10 秒。 |
| resolution | string | 否 | 720p | 720p、1080p 或 4k。 |
| aspect_ratio | string | 否 | 16:9 | 16:9 或 9:16。 |
响应字段
提交成功会返回任务 ID。状态查询提供进度、输出文件,以及失败时的错误详情。
| 字段 | 类型 | 说明 |
|---|---|---|
| code | integer | 应用结果码;成功响应为 0 或 200。 |
| message | string | 可读消息,或存在时的错误详情。 |
| data.task_id | string | 用于状态接口路径的任务 ID。 |
| data.status | string | not_started、running、finished 或 failed。 |
| data.created_time | string | 任务创建时间,日期时间格式。 |
| data.progress | integer | 提供方上报时为 0–100 进度。 |
| data.files[] | array | 成功任务的全部输出文件,按响应顺序排列。 |
| data.files[].file_url | string | 生成视频的公开 URL。 |
| data.files[].file_type | string | 文件类型,例如 video。 |
| data.error_message | string | null | status 为 failed 时的失败详情。 |
任务生命周期
在 status 为 not_started 或 running 时继续查询。到达 finished 或 failed 后结束轮询,并分别处理输出文件或错误详情。
not_started任务已受理,等待开始。
running生成进行中。继续用同一 task_id 轮询。
finished生成成功。从 data.files[].file_url 读取全部视频地址。
failed生成因错误停止。读取 data.error_message 并停止轮询。
轮询与错误
- 认证收到 401 时,检查 Authorization 中的 Bearer API 密钥,更新凭证后重试。
- 校验收到 400 时,根据响应详情核对必填字段、参数范围与可用积分,调整后重新提交。
- 网络与超时状态查询遇网络错误或超时,保留原 task_id 重试查询,再按返回的任务状态处理结果。
- 轮询间隔以 2 秒为基准间隔轮询状态,较长任务可逐步加大间隔。
- 终态仅在 not_started 或 running 时继续;一旦 finished 或 failed 立即停止。
- 回调选项可在请求顶层提供 callback_url 接收最终扁平任务对象;投递失败时仍可轮询。
模型规格
| 规格 | 取值 | 说明 |
|---|---|---|
| 输入模式 | 纯文本 | 由提示词定义场景、运镜、光影、情绪与声音。 |
| 输出 | 视频 | 返回异步任务 ID;完成后包含带原生音频的视频文件。 |
| 分辨率 | 720p / 1080p / 4k | 默认为 720p。 |
| 时长 | 4 / 6 / 8 / 10 秒 | 默认为 6 秒。 |
| 画面比例 | 16:9 / 9:16 | 默认为 16:9。 |
| 计费依据 | 按次生成 | 720p/1080p:4 秒=120、6 秒=150、8 秒=200、10 秒=220 积分。4k:4 秒=250、6 秒=300、8 秒=350、10 秒=450 积分。 |
Gemini Omni Flash Text to Video
Gemini Omni Flash Text to Video 是 Google DeepMind 打造的多模态文本生成视频模型。仅凭自然语言提示词即可输出 4–10 秒短片,并同步生成对白、音乐与环境音效,同时响应推进、跟拍等运镜与光影指令。可在 720p、1080p 与 4K 之间选择,配合 16:9 或 9:16 画幅,适合社交短视频批量制作、广告概念打样、品牌故事板与创意原型验证。
为什么选择此端点?
纯文本一次生成全能短片用自然语言描述主体、场景、情绪与动作,即可一次输出带画面与声音的完整短片,无需另建音频流水线。
原生音频与口型同步将对白、音乐与环境声嵌入 MP4,使口型与发声时机、画面动作紧密对齐。
电影级运镜与光影语言响应推进、推轨、跟拍、环绕与光影提示,便于编排产品揭示与故事节拍的视觉方向。
720p 至 4K 交付档位日常迭代用 720p 或 1080p,需要更清晰纹理与光影细节时再升级到 4K 终稿。
4–10 秒灵活节奏可选 4、6、8、10 秒(默认 6 秒),覆盖开屏钩子、中等时长演示与更完整短叙事。
横竖屏画幅可选16:9 适合横向叙事,9:16 适合 Reels、Shorts 与 TikTok 竖屏分发。
参数
| 参数 | 要求 | 说明 |
|---|---|---|
| prompt | 必填 | 字符串。描述场景、动作、运镜、光影、情绪与声音;去除首尾空格后为 1–20,000 个字符。 |
| duration | 可选 | 整数。输出时长(秒);体验区预选 6 秒。 默认 64810 |
| resolution | 可选 | 字符串。输出清晰度档位;体验区预选 720p。 默认 720p1080p4k |
| aspect_ratio | 可选 | 字符串。输出画幅;体验区预选 16:9。 默认 16:99:16 |
如何使用
编写场景提示词在 prompt 中写清主体、环境与主要动作,例如金色时刻光线下的产品英雄镜头与自信走场。
补充运镜与音频指引写明推进、推轨或跟拍,以及光影情绪、对白或环境声线索,使画面与声音保持对齐。
设置输出时长选择 4、6、8 或 10 秒(默认 6 秒),匹配本段节拍需要的长度。
选择分辨率快速迭代选 720p,更清晰交付选 1080p,高细节终稿选 4K。
选择画面比例按分发版式选择 16:9 横屏或 9:16 竖屏。
确认费用并运行查看运行按钮显示的费用,完成提示词与参数后点击运行。
预览并下载视频任务完成后,在输出面板预览画面与同步音频,再选择下载视频保存结果。
价格
按次计费,费用由时长与分辨率档位决定,原生音频包含在结果中。1 积分 = $0.005。
| 用量 | 费率 | 说明 |
|---|---|---|
| 720p / 1080p | 4 秒=120、6 秒=150、8 秒=200、10 秒=220 积分 | 默认 720p / 6 秒为 150 积分($0.75)。 |
| 4k | 4 秒=250、6 秒=300、8 秒=350、10 秒=450 积分 | 4k / 6 秒为 300 积分($1.50)。 |
适用场景
社交短视频制作批量产出带口型同步音频的 9:16 钩子与对白镜头,适配 TikTok、Reels 与 Shorts。
电商产品动效展示描述产品揭示、材质特写与环境声,生成可用于落地页与货架页的动效演示。
品牌概念故事板将战役简报转化为 4–10 秒电影感节拍,在正式制作前对齐创意方向。
对白与虚拟人内容用语言与语气线索指导说话表演,使口型跟踪脚本化表达。
专业建议
- 按主体与环境、动作、运镜、光影、音频的顺序组织提示词,让每一层承担明确任务。
- 明确写出 slow push-in、dolly、side tracking 等运镜,并将主体动作分句描述。
- 用 Audio 行补充对白语言、配乐情绪与对应画面事件的环境声。
- 写清光质与色调——金色侧光、柔和窗光、霓虹反射——以锁定氛围。
- 每个片段围绕一个主动作,写清开场状态、过程变化与收尾画面,降低画面漂移。
使用说明
- Gemini Omni Flash Text to Video 以必填 prompt 驱动,并可配置 duration、resolution 与 aspect_ratio。
- 在提示词中描述对白、音乐或环境声;结果包含原生音画口型同步。
- 提示词去除首尾空格后为 1–20,000 个字符;指令宜具体、电影化。
- API 提交后保存返回的 task_id,用于查询进度并获取最终媒体地址。
相关模型
Gemini Omni Flash Text to Video API 常见问题
Gemini Omni Flash Text to Video API 是什么?
Gemini Omni Flash Text to Video 是 Google DeepMind 用于文本生成视频的多模态模型。它根据文本提示词生成 4–10 秒短片,具备原生音画口型同步、电影级运镜与光影控制,并支持 720p 至 4K 分辨率。基于 Gemini 统一多模态架构,它在遵循提示词物理规律与叙事节奏的同时,保持主体运动、场景连贯与音画对齐。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。
Gemini Omni Flash Text to Video 一次能生成多久?
单次可选 4、6、8 或 10 秒,体验区预选 6 秒。短钩子选较短时长,更完整节拍选较长时长;具体积分随时长与分辨率变化,见本页价格说明。
Gemini Omni Flash Text to Video 支持原生口型同步吗?
支持。对白、音乐与环境声随画面一并生成并写入 MP4。在提示词中补充语言、语气与环境声线索,口型与发声时机即可跟踪表达。
Gemini Omni Flash Text to Video 何时适合用 4K?
需要更清晰纹理、光影反射与终稿交付时选 4K。日常迭代先用 720p 或 1080p——时长选项相同、积分更低——再把选定镜头升到 4K。
Gemini Omni Flash Text to Video 如何遵循运镜提示?
把 slow push-in、dolly、side tracking 等明确运镜单独成句,并与主体动作分开写。再配合光影线索,构图与氛围会更可控。
Gemini Omni Flash Text to Video 适合做 9:16 竖屏吗?
适合。选择 9:16 并描述竖向构图与主体位置,适配移动信息流。需要横向叙事或横屏广告位时改用 16:9。
Gemini Omni Flash Text to Video 积分如何计算?
按次按时长与分辨率扣积分。720p/1080p 下 6 秒为 150 积分($0.75);同等时长 4K 为 300 积分($1.50)。完整费率见本页价格说明。















