FLUX 3 Text to Video API

blackforestlabs/flux-3/text-to-video

FLUX 3 Text to Video 将文本提示词转化为 5–20 秒高保真视频,支持精确物理运动模拟、可选原生同步音频与 8 种画幅构图。它在长镜头中保持动作与运镜连贯,并使对白、音效与画面事件同步生成。

输入
168/20000
输出
等待运行

生成的视频会显示在这里

填写提示词并添加所需素材,确认设置后点击“运行”。

720p · 5 秒 × 34/秒 = $0.850 (170 积分)
继续使用

示例

One continuous 5-second cinematic shot. A violinist performs in a sunlit stone cathedral, dust motes drifting through tall shafts of morning light. Camera: slow forward dolly at chest height, no cuts. Lighting: warm volumetric sunbeams against cool stone. Native audio: a rich solo violin melody echoing in the stone acoustic space, faint bow texture. No logos, no readable text, no products, no packaging, no prices, no CTA, no advertising, no watermark, no brand marks.

One continuous 5-second ultra-wide macro shot. Clear water cascades over mossy basalt steps in a rainforest, droplets scattering off wet stone. Camera: low locked shot two centimeters above the waterline. Lighting: soft canopy-filtered daylight with sparkling highlights. Native audio: close-miked water rush, droplet ticks, distant bird calls. No logos, no readable text, no products, no packaging, no prices, no CTA, no advertising, no watermark, no brand marks.

Vertical 9:16, one continuous 5-second shot. A single tumbleweed rolls across a cracked desert playa at dusk, casting a long shadow. Camera: low tracking shot beside the tumbleweed, steady pace. Lighting: low amber sun with purple sky. Native audio: dry stems scraping hardpan, a steady desert wind, one distant coyote call. No logos, no readable text, no products, no packaging, no prices, no CTA, no advertising, no watermark, no brand marks.

FLUX 3 Text to Video

FLUX 3 Text to Video 仅凭文本提示词即可生成具备电影质感的动态视频与同步原生音频。依托精确的物理运动模拟,模型支持 5–20 秒连续动态、8 种画幅比例及 720p / 1080p 输出,适合专业叙事与高质量视频制作。

为什么选择此端点?

  • 精确物理运动模拟自然呈现流体波动、布料摆动、复杂肢体动作与光线在不同材质上的反射变化,让运动符合真实世界规律。

  • 原生同步多轨音频随画面同步生成对白、动作音效、环境声与配乐,并通过 sound 参数独立开启或关闭音频生成。

  • 5–20 秒长时长连贯生成单次任务支持 5 至 20 秒连续视频,在较长时段内稳定保持镜头动量与物理一致性。

  • 8 种画幅智能适配支持从 21:9 宽银幕到 9:16 竖屏的 8 档比例,并提供 auto 智能画幅自适应,契合多平台发布。

  • 深度运镜与时间线遵循准确理解推拉、摇移、环绕等运镜指令及分阶段时序变化,让复杂镜头调度按提示词展开。

  • 720p 与 1080p 清晰度档位提供 720p 与 1080p 两种高清分辨率,兼顾快速创意验证与高质量成片交付。

参数

参数要求说明
prompt必填

字符串,minLength 为 1。指导场景、主体动作、镜头运动与原生音频。

duration可选

整数。设置输出时长,取值范围为 5–20 秒;体验区默认预选 5 秒。

默认5
resolution可选

字符串。设置输出分辨率;体验区默认预选 720p。

默认720p1080p
aspect_ratio可选

字符串。控制画面比例;体验区默认预选 auto。

默认auto21:92:116:94:31:13:49:16
sound可选

布尔值。控制是否随视频生成原生同步音频;体验区默认预选 true。

默认truefalse

如何使用

  1. 编写场景提示词在 prompt 中写清主体动作、环境光影、运镜方式以及希望呈现的原生声音,构建完整镜头意图。

  2. 设置视频时长根据叙事节奏在 5 到 20 秒之间指定输出时长,默认 5 秒。

  3. 选择输出分辨率按成片清晰度需求选择 720p 或 1080p,默认 720p。

  4. 设定画面比例选择 16:9、9:16、21:9 或 auto 等 8 种画幅之一,匹配投放平台版式。

  5. 确认音频开关保持 sound 为 true 生成带同步音效的短片,或设为 false 输出无声纯视频。

  6. 确认费用并运行查看运行按钮显示的当前配置费用,完成提示词与参数设置后点击“运行”。

  7. 预览并下载视频任务完成后,在输出面板预览画面与声音,点击“下载视频”保存结果。

价格

按输出视频秒数与分辨率阶梯计费,原生同步音频包含在生成结果中。1 积分 = $0.005。

用量费率说明
720p34 积分/秒($0.17/秒)默认 5 秒 720p 为 170 积分($0.85)。
1080p58 积分/秒($0.29/秒)5 秒 1080p 为 290 积分($1.45)。

适用场景

  • 电影级镜头概念预演用详尽的运镜与光影描述直接生成动态视效样片,快速验证导演构想与分镜节奏。

  • 数字广告与品牌视频结合产品特性与环境声景生成富有视觉张力的宣传短片,提升跨平台创意产出效率。

  • 短视频与社交叙事使用 9:16 比例与情节描述,生成带同步对白和音效的高品质竖屏内容。

  • 自然风光与环境动态展现流动水面、飞扬风沙等自然景观,并伴随真实风声、雨声等环境音。

  • 视听氛围镜头围绕雨夜街道、室内暖光等场景描述画面与声音,制作片头或过渡氛围片段。

专业建议

  • 按 CASTLE 结构组织复杂提示:核心摘要、场景、主体、动态叙事、音频、风格与色彩,让各部分职责清晰。
  • 如需特定音效,在提示词中加入明确声音描述,例如“Native audio: 缓慢脚步声与沉稳大提琴低音”。
  • 描述运镜时指定具体摄影机运动,例如“平稳缓慢向前推镜”,帮助建立稳定空间透视。
  • 单一核心动作建议选择 5–8 秒;需要展开多节拍情节时可选择 10–20 秒。
  • 选择 auto 画幅时,模型会结合提示词中的构图描述自动匹配适宜纵横比。

使用说明

  • FLUX 3 Text to Video 以纯文本 prompt 驱动生成,可配置 duration、resolution、aspect_ratio 与 sound。
  • sound 为 true 时,输出包含与画面事件同步的对白、音效、环境声或配乐。
  • 通过 API 提交后保存返回的 task_id,用于查询任务进度并获取最终文件链接。
  • 生成结果为标准视频文件,可在主流播放器与剪辑软件中直接使用。

FLUX 3 Text to Video API 常见问题

FLUX 3 Text to Video API 是什么?

FLUX 3 Text to Video 是 Black Forest Labs 用于纯文本生成视频的模型。它根据文本提示词生成 5–20 秒高保真视频,具备精确物理运动模拟与可选原生同步多轨音频,并支持 720p / 1080p 输出。依托时空生成与视听联合建模,模型在遵循提示词中的运镜与声景设计的同时,保持长镜头中的物理自然度与画面连贯性。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。

FLUX 3 Text to Video 如何控制原生同步音频?

默认 sound 为 true,模型会随画面同步生成对白、动作音效、环境声与配乐。在 prompt 中写明声音线索(例如脚步、回响或配乐方向)可进一步指导声轨;若只要画面,将 sound 设为 false 即可输出无声音频关闭的视频。

FLUX 3 Text to Video 复杂提示词如何遵循 CASTLE 原则?

复杂镜头可按 CASTLE 六要素组织:核心摘要、场景环境、主体描述、动态叙事(含运镜与时序)、音频线索、风格与色彩。先写清整段弧线,再保持主体描述一致,并用具体可见动词描述动作与摄影机运动,有助于稳定呈现多节拍连贯结果。

FLUX 3 Text to Video 在 20 秒时长下如何保持物理稳定性?

模型针对重力、惯性、布料与刚体等物理规律进行了连贯动力学建模。配置接近 20 秒的任务时,在提示词中保持主体动势与运镜方向一致,并按时间顺序写清节拍变化,可在长镜头中维持自然、稳定的物理表现。

FLUX 3 Text to Video 的画幅比例该如何选择?

可选 auto、21:9、2:1、16:9、4:3、1:1、3:4、9:16 共 8 种。投放渠道明确时可直接指定固定画幅;选择 auto 时,模型会根据提示词中的构图与场景描述自动匹配适宜纵横比。完整取值见本页参数说明。

FLUX 3 Text to Video 选择 720p 还是 1080p 更合适?

720p 费率更低,适合创意探索与分镜打样;1080p 纹理与边缘更细腻,适合作为成片素材进入剪辑。两者均按输出秒数计费,时长越长费用越高,可在本页价格说明中对照具体积分。

FLUX 3 Text to Video 如何指导镜头连续性与运镜?

在动态叙事部分写明起始景别、移动方向与结束构图,例如“平视中景跟拍,末段缓慢推近”。单次 5–20 秒适合一段连贯运镜或动作发展;需要更长叙事串联时,可结合本页相关模型中的视频延长或关键帧端点继续编排。