FLUX 3 Image to Video API

blackforestlabs/flux-3/image-to-video

FLUX 3 Image to Video 将 1 张首帧图片与文本提示词转化为 5–20 秒高保真视频,支持逼真物理运动注入、运镜控制与可选原生同步音频。它忠实继承原图主体、服饰细节与光影构图,再按提示词平滑展开动作、镜头与声场。

输入
152/20000
输出
等待运行

生成的视频会显示在这里

填写提示词并添加所需素材,确认设置后点击“运行”。

720p · 5 秒 × 34/秒 = $0.850 (170 积分)
继续使用

示例

The subject turns their head slightly toward the camera with a calm expression while a warm breeze gently moves their collar. Preserve the same face, clothing, window light, and background. Camera: locked medium close-up. Native audio: soft outdoor breeze and quiet room tone. No logos, no readable text, no products, no packaging, no prices, no CTA, no advertising, no watermark, no brand marks.

A sudden countryside gust lifts the cream sheet and the faded shirt on the line; they billow and slap, then settle. Preserve the same posts, yard, dusk light, and camera. Camera: locked wide shot. Native audio: fabric slap, dry grass wind, distant insects. No logos, no readable text, no products, no packaging, no prices, no CTA, no advertising, no watermark, no brand marks.

Steam rises from the tea cup in slow curling ribbons and drifts toward the open window; dust motes shimmer in the morning light. Preserve the same cup, book, windowsill, and lighting. Camera: locked close shot. Native audio: a faint breeze, a distant kettle tick, quiet room tone. No logos, no readable text, no products, no packaging, no prices, no CTA, no advertising, no watermark, no brand marks.

FLUX 3 Image to Video

FLUX 3 Image to Video 以单张静帧为视觉起点,结合文本提示词生成连贯动态短片与可选原生音频。模型延续首图中的主体身份、材质质感与环境光照,并支持 5–20 秒时长、8 种画幅比例以及 720p / 1080p 输出。

为什么选择此端点?

  • 静帧驱动的物理运动以首帧主体、光影与构图为基准,平滑注入逼真物理运动,让产品主视觉、人像或场景静帧自然动起来。

  • 原生音画同步生成自动推理并匹配环境音效与动态声场,也可通过 sound 字段开启或关闭原生音频。

  • 主体与构图忠实延续深度解析面部轮廓、服饰纹理与空间布光,在动作演进中持续保持身份与画面结构稳定。

  • 提示词指导动作与运镜用自然语言描述转头、衣物摆动、镜头推进或环绕,让已有画面围绕具体动量展开。

  • 5–20 秒高保真连贯输出单次生成 5 至 20 秒连贯动作,为微表情、产品展示与叙事镜头提供充裕时长。

  • 多画幅与双档清晰度提供含 auto 在内的 8 种画幅比例,以及 720p 与 1080p 分辨率,适配多渠道发布规格。

参数

参数要求说明
prompt必填

字符串,长度至少 1。指导在首帧基础上的主体动作、运镜、变化与声音。

image_urls必填

包含恰好 1 个可公开访问图片 URL 的字符串数组,作为视频开场首帧与视觉基准。

duration可选

整数。设置输出时长,取值范围为 5–20 秒;体验区默认预选 5 秒。

默认5
resolution可选

字符串。设置输出分辨率,可选 720p 或 1080p;体验区默认预选 720p。

默认720p1080p
aspect_ratio可选

字符串。控制画面比例,支持 auto 及常见横纵比例;体验区默认预选 auto。

默认auto21:92:116:94:31:13:49:16
sound可选

布尔值。控制是否生成原生音频;体验区默认预选 true。

默认truefalse

如何使用

  1. 提供首帧图片 URL准备一张主体与构图清晰、可公开访问的图片地址,填入 image_urls 作为开场基准。

  2. 描述动作、运镜与声音在 prompt 中写清从首帧开始的主体动作、镜头运动以及希望呈现的环境声或动作音。

  3. 设定视频时长在 5–20 秒之间选择整数时长,默认 5 秒,按主要动作与节奏安排片段长度。

  4. 选择分辨率与画幅选择 720p 或 1080p,并指定画幅比例,或保持 auto 以匹配首帧构图。

  5. 确认音频开关保持 sound 为 true 生成带原生同步音频的短片,或设为 false 仅输出画面。

  6. 确认费用并运行查看运行按钮显示的当前配置费用,完成素材与提示词后点击“运行”。

  7. 预览并下载视频任务完成后,在输出面板预览画面与声音,再下载成片。

价格

按输出视频秒数与分辨率阶梯计费,原生同步音频包含在生成结果中。1 积分 = $0.005。

用量费率说明
720p34 积分/秒($0.17/秒)默认 5 秒 720p 为 170 积分($0.85)。
1080p58 积分/秒($0.29/秒)5 秒 1080p 为 290 积分($1.45)。

适用场景

  • 商品主视觉动画以商品静帧为首帧,描述镜头推进、环绕与材质反光,制作品牌展示动态素材。

  • 人像与角色动态短片从人物照片出发,设计转头、表情或衣物动作,让静态角色自然进入镜头叙事。

  • 概念画与插画动态化为场景设定图注入风动、云层与光线变化,并匹配对应的自然环境音。

  • 社交内容竖屏成片将精选摄影作品转为带原生音频的 9:16 短视频,丰富多平台内容形式。

专业建议

  • 选择主体轮廓、光线与构图清晰的首帧,为镜头提供明确的视觉起点。
  • 从首帧已有内容继续描述动作,例如“人物抬起手中的杯子,镜头缓慢推进”,明确画面开始后的变化。
  • 用一句话点明需要延续的面部、服装或场景特征,再单独写出镜头运动,区分保持内容与动态变化。
  • 描述动作动量时写清起止与节奏,例如“缓慢转头后停顿注视镜头”,帮助模型建立连贯物理惯性。
  • 围绕可见动作与场景撰写声音线索,例如“Audio: soft outdoor breeze and natural ambient sound”。

使用说明

  • FLUX 3 Image to Video 使用 1 张首帧图片与文本提示词生成视频,主要输入为 prompt 和 image_urls;还可设置时长、分辨率、画幅比例与 sound。
  • sound 为 true 时,结果包含原生同步音频;也可在提示词中补充环境声或动作音线索。
  • API 素材链接使用可公开访问的 HTTP(S) 地址,供服务读取输入文件。
  • 通过 API 提交后保存 task_id,用于查询任务进度和获取生成结果。

FLUX 3 Image to Video API 常见问题

FLUX 3 Image to Video API 是什么?

FLUX 3 Image to Video 是 Black Forest Labs 的图生视频模型。它以 1 张首帧图片与文本提示词为输入,生成 5–20 秒高保真连贯动作视频,并可输出原生同步音频,自动匹配环境音效与动态声场。模型以静帧主体、光影与构图为基准平滑注入逼真物理运动,忠实继承首图构图、服饰细节与光照。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。

FLUX 3 Image to Video 如何保持静帧角色面部与服装一致性?

模型以首帧图片中的面容结构、服饰纹理与空间布光为视觉锚点。建议使用主体清晰、细节充分的素材,并在提示词中强调需要延续的外观特征,再单独描述转头、抬手等动作,为主体运动提供明确方向。

编写 FLUX 3 Image to Video 提示词时如何描述动作动量?

从首帧已可见的内容继续写动作,标明起止与节奏,例如“缓慢转头后停顿注视镜头,衣领随微风轻动”。再补充镜头推进或环绕等运镜,让物理惯性与画面变化按同一条时间线展开。

FLUX 3 Image to Video 是否会自动生成匹配的环境音?

会。当 sound 为 true 时,模型会根据首帧场景氛围与提示词中的动作线索,自动推理并生成匹配的环境音效与动态声场。也可在提示词末尾补充具体声音描述,例如户外微风或室内环境底噪。

静帧画幅与 FLUX 3 Image to Video 的 aspect_ratio 如何匹配?

将 aspect_ratio 设为 auto 时,系统会依据首帧宽高比输出匹配画幅;若指定 16:9、9:16 等固定比例,模型会在保持主体视觉中心的前提下完成构图适配,便于直接对接目标发布渠道。

FLUX 3 Image to Video 的 sound 字段如何控制原生音频?

sound 默认为 true,生成结果会附带原生同步音频;设为 false 时仅输出画面。开启音频时,可在 prompt 中补充对白、环境声或动作音线索,让声场与可见动作对齐。

需要精确控制结束画面时应如何搭配 FLUX 3 Image to Video?

本端点聚焦从单张首帧向前演进动作与运镜。若需要同时锚定起始与收束构图,可改用 FLUX 3 First Last Frame to Video,传入有序的首尾两帧完成双锚点过渡生成。