FLUX 3 First Last Frame to Video API

blackforestlabs/flux-3/first-last-frame-to-video

FLUX 3 First Last Frame to Video 提供首尾两张静帧精确锚定起始与收束构图,结合文本提示词生成 5–20 秒连贯动态过渡与可选原生同步音频。以两个视觉定点为边界指导中间运动轨迹、转场变化与镜头调度,实现精准的分镜把控。

输入
124/20000
输出
等待运行

生成的视频会显示在这里

填写提示词并添加所需素材,确认设置后点击“运行”。

720p · 5 秒 × 34/秒 = $0.850 (170 积分)
继续使用

示例

Begin exactly on the first frame and finish on the last frame. One continuous 5-second locked close-up: the folded paper crane's wings slowly uncrease and lift until they match the end still. Preserve the same crane, paper color, table, window light, and camera. Native audio: dry paper flex, a faint wooden-table creak, quiet room tone. No logos, no readable text, no products, no packaging, no prices, no CTA, no advertising, no watermark, no brand marks.

Begin on the first frame and finish on the last frame. One continuous 5-second studio shot: the dancer rises from the low opening stance into the tall closing pose with one smooth turn. Preserve the same dancer, practice clothes, wooden floor, and soft side light. Camera: locked full-body wide shot. Native audio: bare feet on wood, steady breath, room tone. No logos, no readable text, no products, no packaging, no prices, no CTA, no advertising, no watermark, no brand marks.

Begin on the first frame and finish on the last frame. One continuous 5-second locked wide shot of the same rooftop garden: dawn blue light warms into gold morning sun, plant leaves lift gently in a rising breeze. Preserve the same pots, railing, skyline, and camera. Native audio: morning birds, a distant city hum, soft wind. No logos, no readable text, no products, no packaging, no prices, no CTA, no advertising, no watermark, no brand marks.

FLUX 3 First Last Frame to Video

FLUX 3 First Last Frame to Video 专为需要精确控制镜头起止状态的创作者打造。传入有序的首尾两帧图片作为视觉两极,模型能自动推演其间符合物理规律的位移、形变与摄像机运镜,生成 5–20 秒高保真过渡动态并同步配齐原生环境音效。

为什么选择此端点?

  • 双锚点精准构图控制严格锁定镜头开场画面(首帧)与落幅构图(尾帧),引导视频在指定姿态与场景位置上收束。

  • 平滑物理插值过渡基于深度运动时空模型,计算两张静帧之间的连贯位移与形变轨迹,生成自然的肢体动作与场景演进。

  • 提示词导演中间过程在 prompt 中指引过渡中的具体细节,例如运镜路径、主体动作转折及灯光明暗变化,赋予防抖过渡以创意叙事。

  • 原生音画同步生成随画面生成起承转合的同步原生音频,使脚步声、环境音及配乐自然契合从起点到终点的动作演变。

  • 5–20 秒灵活时长调节支持在 5 至 20 秒之间设定过渡时长,既可做迅捷利落的转场,也能表现悠长舒缓的姿态变化。

  • 720p 与 1080p 高清输出提供 720p 与 1080p 两种高清档位,适合从首帧到尾帧的高清动态呈现。

参数

参数要求说明
prompt必填

字符串。指导从首帧过渡到尾帧的主体动作、镜头轨迹、状态变化及原生音频线索。

image_urls必填

包含恰好 2 个公开图片 URL 的字符串数组。第 0 项为首帧(起始画面),第 1 项为尾帧(结束画面)。

duration可选

整数。设置生成视频的时长,取值范围为 5 至 20 秒;体验区默认预选 5 秒。

默认5
resolution可选

字符串。设置视频输出分辨率,可选 720p 或 1080p;体验区默认预选 720p。

默认720p1080p
aspect_ratio可选

字符串。控制视频画幅比例,支持 auto 及常见横纵比例;体验区默认预选 auto。

默认auto21:92:116:94:31:13:49:16
sound可选

布尔值。控制是否随视频同步生成原生音频;体验区默认预选 true。

默认truefalse

如何使用

  1. 准备首尾两帧图片获取开场静帧(首帧)与目标结束静帧(尾帧)的公开 URL,按顺序填入 image_urls 数组([首帧, 尾帧])。

  2. 编写过渡动作指令在 prompt 中描述主体如何从起始姿态过渡到结束姿态、摄像机的运镜运动及伴随的环境音效。

  3. 设定时长与节奏在 5 至 20 秒范围内设定生成时长,快节奏动作建议 5 秒,复杂平缓过渡可增加至 10 秒以上。

  4. 选择分辨率与画幅依据发布要求配置 720p 或 1080p 分辨率,画幅比例可保持 auto 或指定常用比例。

  5. 配置声音选项保持 sound 为 true 以同步生成契合动作变化的音频,或设为 false 仅生成画面。

  6. 提交运行并保存视频核对费用后点击“运行”,在任务处理完毕后预览流畅的首尾过渡效果并下载 MP4 视频。

价格

按生成的输出视频时长秒数与分辨率阶梯计费,原生同步音频包含在生成结果中。1 积分 = $0.005。

用量费率说明
720p34 积分 / 秒($0.17 / 秒)默认 5 秒 720p 为 170 积分($0.85)。
1080p58 积分 / 秒($0.29 / 秒)5 秒 1080p 为 290 积分($1.45)。

适用场景

  • 商业分镜精准转场通过指定上下两个场景的关键静态构图,自然生成镜头之间的推拉穿梭或转场动画。

  • 产品形态演变展示将产品开合、拆解前后的外观分别作为首帧和尾帧,生成展示内部构造的平滑过渡动画。

  • 人物姿态与动作衔接设定角色的起跑姿态与冲线姿态,中间由模型智能补全富有爆发力的运动轨迹与脚步声。

  • 无缝循环动态短片将同一张图片或高相似静帧分别设为首帧与尾帧,引导首尾衔接的流转循环视频。

专业建议

  • 首帧与尾帧尽量保持主体身份、光影色调与透视逻辑的一致性,有助于模型生成极其自然的过渡动作。
  • 在提示词中重点指引动作的过渡方式,例如“主体从坐姿缓缓站起,走向窗前,镜头跟随平移”。
  • 若首尾两帧主体位移较大,建议配置 8 秒以上的时长,为动作过渡留出充足的物理运动时间。
  • 制作无缝循环动图时,可将同一张图片同时作为首帧与尾帧,并在提示词中要求循环微动态。
  • 在提示词中针对动作转折点补充音效描述,如“动作起始为轻微呼吸声,收尾伴随清脆的关门声”。

使用说明

  • FLUX 3 First Last Frame to Video 要求 image_urls 数组必须恰好包含 2 个公开图片 URL,索引 0 代表起点,索引 1 代表终点。
  • 生成视频的第 1 帧严格对齐首帧,最后一帧严格对齐尾帧,中间各帧平滑推演插值。
  • 通过 API 提交后获得 task_id,随后通过查询接口轮询直至 finished 或 failed 终态。
  • 生成的 MP4 文件可直接嵌入视频剪辑软件,首尾画面能够无缝对接已有镜头分轨。

FLUX 3 First Last Frame to Video API 常见问题

FLUX 3 First Last Frame to Video API 是什么?

FLUX 3 First Last Frame to Video 是 Black Forest Labs 用于根据两张定点图像生成过渡视频的模型。它以用户提供的首帧与尾帧作为严格的起止构图边界,结合文本提示词生成 5 至 20 秒、最高 1080p 分辨率并包含可选原生同步音频的连贯动态短片。依托强大的物理插值算法,模型在保持起止两端构图与角色质感高度一致的前提下,推演出平滑自然的运镜轨迹与物理过渡过程。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。

FLUX 3 First Last Frame to Video 对两张图片的顺序有何要求?

传入 image_urls 数组时必须严格遵循顺序:数组中的第 1 个元素(索引 0)作为起始首帧,第 2 个元素(索引 1)作为结束尾帧。模型将据此推演从起点向终点的单向时间线演化。

如何通过 prompt 引导首尾两帧之间的动作细节?

提示词应重点描述从首帧状态过渡到尾帧状态的具体行为和运镜方式。例如“人物从左侧缓步走向右侧长椅坐下,镜头保持平行跟随”,明确中间过程有助于模型生成符合逻辑的连续插值画面。

如何使用 FLUX 3 First Last Frame to Video 制作闭环循环动画?

制作无缝循环视频时,可以将同一张静态图片同时作为首帧与尾帧传入(image_urls 填入两个相同 URL),并在提示词中描述一个闭环的动态动作(例如“微风吹拂发丝并回归初始状态”),有助于生成首尾衔接的循环镜头。

FLUX 3 First Last Frame to Video 在音画同步方面有何表现?

当 sound 设为 true 时,模型会结合首尾画面的场景属性以及提示词中描写的过渡动作,自动生成契合动作节奏的起承转合音效(如脚步声、布料摩擦声及环境氛围音)。

首尾两帧画面差异较大时,时长该如何配置?

如果首尾静帧在构图、主体姿态或光影上有显著位移变化,建议将 duration 设置为 8 至 15 秒以上,赋予模型充分的时长展现中间的物理加速与缓冲过程,避免过渡过于急促。

如果需要控制多于两个分镜关键画面,应该使用哪个端点?

首尾帧端点专注于双端点过渡控制;若需要沿 24 fps 时间轴定点规划多达 10 个镜头静帧,建议使用 FLUX 3 Keyframes to Video 端点进行细致的时间线多镜头编排。