Grok Imagine Video Text to Video API

xai/grok-imagine-video/text-to-video
6 / 10 秒 · 3 种风格

Grok Imagine Video Text to Video 将场景描述转为短片,结合文字引导的主体动作与运镜。提示词组织场景和动态过程,时长、生成模式与画幅共同确定镜头的呈现形式。

获取 API Key
输入
664/5000

示例

One continuous ten-second fixed full-body shot inside a small circular circus rehearsal ring. A single adult male acrobat with closely cropped dark hair wears plain burgundy practice clothes and soft black shoes. He starts standing centered, holding one straight white baton horizontally. He tosses that single baton gently a short distance above his head, watches it, catches it cleanly with one hand, then makes a controlled half turn and gives a modest bow toward the camera. Keep his whole body and the baton visible throughout, with one consistent person and one consistent baton. Warm overhead rehearsal lighting, empty wooden benches, realistic movement, no cuts, no extra performers, no text or logos.

A single continuous six-second aerial tracking shot from behind and slightly above one small cream-yellow minibus driving forward at a steady sensible speed along a winding paved road through lush rolling green hills. Follow the same vehicle smoothly as it rounds one broad S-shaped bend. Keep its wheels on the road, preserve the road geometry, vehicle shape and forward direction. Early morning sunlight, gentle long shadows, distant layered hills, natural documentary color. No abrupt zoom, no cut, no other vehicles, no text, branding or advertising.

Grok Imagine Video Text to Video

Grok Imagine Video Text to Video 是 xAI 用于根据文字描述生成短视频场景的模型。提示词将主体、环境、动作与镜头方向组织成一个动态场景,生成模式则为同一创意提供不同的视觉处理选择,使脚本中的动作构想具备可供讨论的画面。这种从创作简报直接建立镜头的方式,适合分镜动态预演、产品亮相概念和竖屏叙事片段。

为什么选择 Grok Imagine Video Text to Video?

  • 文字场景直接形成动态镜头创作简报同时描述画面内容与运动方式,适合在创作起步时探索一个镜头的动态表现。

  • 主体动作与镜头方向协同描述提示词可同时表达物件动作与平移、推进等镜头方向,将主体的变化与预期取景联系起来。

  • 同一创意探索不同视觉处理fun、normal、spicy 提供可选生成风格,与场景描述搭配,便于比较同一创意在不同设置下的表现。

  • 短片适配不同展示位置两档时长与五种画幅适配单个分镜、横向场景和竖屏内容概念,让镜头形式对应展示用途。

参数

参数要求说明
prompt必填

描述场景与动作,长度为 1–5,000 个字符。

aspect_ratio可选

可选值为 1:1、2:3、3:2、16:9、9:16。

1:12:33:216:99:16
mode可选

生成风格,可选 fun、normal、spicy。

funnormalspicy
duration可选

视频时长,单位为秒,可选整数 6、10;默认 6。

默认610

使用步骤

  1. 描述场景与动作填写主体、环境、动作以及镜头方向。

  2. 设置短片形式选择 Duration、Mode 和 Aspect Ratio。

  3. 运行并查看结果核对费用后点击 Run,生成完成后预览并下载。

价格

1 credit 等于 $0.005。

用量费率详情
6 秒视频30 credits / video$0.150 / video
10 秒视频40 credits / video$0.200 / video

应用场景

  • 分镜动态预演将文字分镜转化为短片,在制作前讨论主体动作与镜头方向。

  • 产品亮相概念描述设想中的产品、周围环境和亮相动作,探索短片开场的节奏与取景。

  • 竖屏故事片段从脚本中的场景描述出发,在竖幅画面内呈现一个完整动作,用于短篇社交叙事。

提示词建议

  • 先写主体与环境,再给主体安排一个清晰的动作。
  • 区分主体动作与镜头动作,例如“骑行者经过,镜头向右平移跟随”。
  • 围绕所选的 6 秒或 10 秒时长,规划一个重点明确的镜头。
  • 按展示位置选择 aspect_ratio,并说明动作发生在画面的哪个位置。
  • 比较 mode 时保留场景提示词、duration 和 aspect_ratio,便于判断该设置的影响。

使用说明

  • 保存 task_id 以查询结果,或提供 callback_url 接收任务完成通知。

相关模型

Grok Imagine Video Text to Video API 常见问题

Grok Imagine Video Text to Video API 是什么?

Grok Imagine Video Text to Video 是 xAI 用于根据文字生成视频场景的模型。它生成 6 秒或 10 秒短片,提供可选视觉模式及方形、竖幅和横幅画面。提示词共同描述主体、环境、动作与镜头方向,为片段建立明确的场景和运动过程。你可以通过 API 调用,也可以在“体验”标签中在线试用。

Grok Imagine Video Text to Video 如何使用运镜指令?

在 prompt 中同时说明主体动作和镜头运动。例如,主体保持静止而镜头逐渐推进,或镜头跟随人物穿过场景,让两种运动各自承担清晰的作用。

Grok Imagine Video Text to Video 有哪些视觉模式?

mode 可选 fun、normal、spicy,与场景提示词一同使用。比较不同视觉处理时,保留相同提示词及其他设置,便于观察该选项带来的变化。

Grok Imagine Video Text to Video 如何选择短片时长?

duration 可设为 6 秒或 10 秒,省略时按 6 秒生成。按所选长度安排动作:短镜头集中呈现一次运动,需要更长展开过程的动作可选择 10 秒。

Grok Imagine Video Text to Video 提供哪些画幅?

aspect_ratio 可选 1:1、2:3、3:2、16:9 和 9:16,分别用于方形配图视频、竖幅场景或横向构图。

何时应选择 Grok Imagine Video Text to Video 而非 Grok Imagine Video Image to Video?

希望通过文字简报定义场景、主体和动作时,选择 Grok Imagine Video Text to Video;希望已有图片提供视觉起点时,选择 Grok Imagine Video Image to Video。

Grok Imagine Video Text to Video 的 10 秒短片如何计费?

10 秒短片每条为 40 credits,即 $0.200;6 秒短片每条为 30 credits,即 $0.150。费用按所选时长对应的单条视频计算。