Wan 3.0 Prime Text-to-Video API

alibaba/wan-3.0-prime/text-to-video

Wan 3.0 Prime(Text-to-Video)将文本提示词转化为最长 30 秒的连续视频,支持原生音画同步、分层动作与运镜控制,以及最高 1080p 输出。它按提示词中的节拍推进镜头,让主体运动、场景关系与时间节奏保持可读连贯。

输入

537/20000

输出

等待运行

生成的视频会显示在这里

设置必填输入、分辨率和时长,然后运行任务。

5 秒 × $0.140/秒 = $0.700

继续使用

示例

Vertical 9:16, 4 seconds. A fleet of bright yellow rubber ducks paddles through a canyon of stacked rolling office chairs. Low tracking camera follows the lead duck along the chair-canyon floor. Overhead fluorescent office light, no people. Native audio: tiny plastic hulls bumping, chair-wheel squeaks, shallow water splash. No logos, no readable text, no products, no packaging, no prices, no CTA, no advertising, no watermark, no brand marks.

One continuous 4-second 4:3 shot at a rainy bus shelter. Two city pigeons in transparent plastic raincoats slap each other with their wings over a soggy bread crust. Locked medium shot, rain streaking the plexiglass. Native audio: wing slaps, pigeon coos, rain on the shelter roof, a distant bus hiss. No logos, no readable text, no products, no packaging, no prices, no CTA, no advertising, no watermark, no brand marks.

Wan 3.0 Prime Text-to-Video

Wan 3.0 Prime Text-to-Video 仅根据文本提示词生成带可选同步声音的连续片段。它按同一份文字方案展开主体、场景、动作顺序、运镜语言、光线与声音线索,使画面在时间上连贯推进。

为什么选择此模式?

  • Text-to-Video仅用书面场景生成连续视频,无需上传首帧或参考素材包。

  • 时空连贯写清开场、发展与收束节拍,让最长 30 秒片段中的主体运动与场景关系保持连贯。

  • 分层提示词控制先写主体表演,再单独控制景别、运镜路径、光线与氛围。

  • 原生音画同步保持音频开启,随画面一同生成对白、环境音、音效或音乐。

  • 画幅比例控制在锁定构图前选择 adaptive、16:9、4:3、1:1、3:4 或 9:16。

  • 交付规格输出 480p、720p 或 1080p,时长 2–30 秒,覆盖试片与正式交付。

参数

参数要求说明
prompt必填

字符串。定义场景、动作、运镜、视觉处理与声音意图;去除首尾空白后长度为 1–20,000 字符。

duration可选

整数。输出时长为 2–30 秒(含端点);默认 5。

resolution可选

字符串。输出分辨率;默认 720p。

480p720p1080p
aspect_ratio可选

字符串。控制画面比例;默认 adaptive。

adaptive16:94:31:13:49:16
audio可选

布尔值。是否生成音轨;默认 true。开启或关闭音频不会改变费率。

truefalse
seed可选

整数。可选复现种子,范围 0–2147483647。

enable_safety_checker可选

布尔值。是否启用安全检查;默认 true。

truefalse

使用方法

  1. 写清场景前提先写主体、环境与视觉处理:柔和窗光下,陶艺师在转轮上定心泥坯。

  2. 按顺序安排动作用具体节拍推进:她润湿泥坯,拉高器型,再在转轮减速时稳住口沿。

  3. 单独写运镜与声音另起一句写景别、机位与移动,再补充对白、环境音或音乐线索。

  4. 设置时长选择 2–30 的整秒时长;首次试片默认可用 5 秒。

  5. 选择分辨率用 480p 快速检查运动,用 720p 或 1080p 做评审与交付。

  6. 选择画幅比例在 adaptive、16:9、4:3、1:1、3:4、9:16 中选择匹配渠道的画幅。

  7. 配置音频需要同步声音时保持音频开启;制作静音片段时关闭该选项。

  8. 生成视频点击「运行」,任务完成后在输出区同时预览画面与声音。

价格

费用仅取决于输出时长与分辨率;音频开关不改变费率。

计费项费率说明
480p13.6 积分/输出秒($0.068/秒)2 秒计 27.2 积分($0.136),5 秒计 68 积分($0.340),30 秒计 408 积分($2.04)。
720p28 积分/输出秒($0.14/秒)2 秒计 56 积分($0.280),5 秒计 140 积分($0.70),30 秒计 840 积分($4.20)。
1080p56 积分/输出秒($0.28/秒)2 秒计 112 积分($0.560),5 秒计 280 积分($1.40),30 秒计 1,680 积分($8.40)。

推荐使用场景

  • 广告概念片将书面产品情景与镜头方案转化为概念片段,用于拍摄前创意评审。

  • 分镜预演把剧本节拍转成动态参考,检查节奏、调度与镜头方向。

  • 电商上新预告根据上新简报生成产品叙事短片,用于详情页与社媒评审。

  • 社媒画幅变体把同一条文案分别做成 9:16、1:1 或 16:9 概念片,按渠道回看。

  • 氛围与音乐视觉研究把光线方向、画面推进与声音线索做成短氛围片。

专业技巧

  • 按此骨架写提示词:时长与画幅意图 → 主体与资产 → 场景与光影 → 运镜与机位 → 对白与声音 → 时间线。
  • 不要只写「精品店开业」;改成可见节拍:店员开门,暖光亮起,镜头掠过陈列台。
  • 主体运动与镜头运动分句写,让每条指令职责清晰。
  • 多拍动作时用「先 / 然后 / 最后」把顺序写清楚。
  • 先用 480p / 5 秒验证运动与时序,结构成立后再渲染 1080p 与更长时长。

注意事项

  • 生成是异步的;保存 task_id,并在任务到达 finished 或 failed 时停止查询。

Wan 3.0 Prime Text-to-Video API — 常见问题

Wan 3.0 Prime Text-to-Video API 是什么?

Wan 3.0 Prime Text-to-Video 是阿里通义实验室研发的旗舰级文本生成视频模型。它根据纯文本提示词直接生成最长 30 秒、最高 1080p 分辨率、包含高保真原生同步音轨的连续视频,展现细腻的光影质感与复杂运镜。基于强化的时空扩散架构,它在维持长镜头主体一致性与真实物理规律的同时,赋予画面影视级的戏剧张力。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。

Wan 3.0 Prime 文生视频相比标准版在画质上有何升级?

Prime 版本在画面动态范围、复杂光线反射、皮肤毛孔与面部微表情上进行了深度增强。在复杂的快速运镜与大幅度动作下,能够呈现更加真实的物理惯性与光影流转,满足商业广告与影视预演对高端质感的要求。

Wan 3.0 Prime 文生视频如何编排 30 秒复杂长镜头?

建议在提示词中按时间线清晰划分叙事节拍(如“起幅……展开……收尾……”),并将角色动作与镜头调度(如“慢速推近”、“平滑横摇”或“低机位跟拍”)独立分句。清晰的时间线结构能让模型在 30 秒内稳定呈现多层次的镜头演进。

Wan 3.0 Prime 文生视频的声音生成支持哪些类型?

模型支持原生多层次音频生成,涵盖环境声场(如风雨声、机械运转)、拟音动作(如脚步声、衣物摩擦)以及情绪配乐。在提示词中分别描写期望听到的声效,模型即会在输出视频中生成高信噪比、严格音画同步的音轨。

Wan 3.0 Prime 文生视频关闭声音会影响生成速度或费用吗?

费用不变,实际生成耗时随任务处理情况变化。将 audio 参数设为 false 可以输出纯静音视频,计费标准与开启音频相同。你可以根据剪辑或后期自配音需求自由选择。

Wan 3.0 Prime 文生视频支持哪些分辨率输出?

支持 480p、720p(默认)和 1080p 三档原生分辨率。在前期创意验证阶段推荐使用 480p 或 720p 快速确认运镜与动作节奏,终稿输出时切换至 1080p 呈现全高清画质细节。

Wan 3.0 Prime 文生视频能根据提示词自适应画幅比例吗?

能。当 aspect_ratio 设为 adaptive(默认)时,模型会根据提示词中的场景空间智能匹配最佳长宽比;也可以手动指定 16:9、4:3、1:1、3:4 或 9:16,直接契合横屏大银幕或竖屏移动端发布需求。