Wan 3.0 Text-to-Video API

alibaba/wan-3.0/text-to-video

Wan 3.0(Text-to-Video)将文本提示词转化为 480p 至 1080p 高清视频,支持 2–30 秒单次连续生成、原生音画同步和多画幅构图。它能够根据文字指令稳定呈现面部微表情与复杂运镜,同时实现动作与环境声效的自然匹配。

输入

833/20000

输出

已就绪
5 秒 × $0.100/秒 = $0.500

继续使用

示例

A plump raccoon wearing a tiny translucent yellow rain poncho with the hood up stands at a flooded brick alley intersection at blue hour. Puddles cover the cobblestones. Several folded paper boats float in the largest puddle like tiny vehicles. The raccoon holds one autumn maple leaf as a conductor baton and directs the paper boats: first pointing left, then sweeping right, as if managing puddle traffic. Tiny raindrops tap the poncho. Camera: one continuous five-second waist-height lateral tracking shot moving left to right, staying parallel to the raccoon, gentle handheld sway, no cuts. Synchronized audio: steady rain on puddles, raccoon chitters, one distant bicycle bell. No readable text, letters, numbers, captions, labels, logos, brands, watermarks, advertisements, posters, UI screens, or product packaging. No people.

A beige office laser printer sits on a plain desk. There are no brand marks and no display text. A sandwich on a small plate sits on the input tray. The printer tray slowly swallows the whole sandwich. After a mechanical click-clunk, a slightly out-of-focus piece of toast ejects onto the output tray. The single status light blinks once, looking proud. Camera: locked-off medium shot, then a tiny punch-in on the click. Square 1:1 framing. One continuous five-second take, no cuts. Synchronized audio: paper-roller whir, a solid clunk, toast landing softly, one smug electronic beep. No readable text, letters, numbers, captions, labels, logos, brands, watermarks, advertisements, posters, UI screens, or product packaging.

A single goldfish wears an oversized vintage brass diving helmet inside a round glass bowl filled with water and two plants. The goldfish tries very hard to hold a dramatic movie-hero close-up stare, eyes wide. A few bubbles rise past the helmet visor. Then the goldfish gives one tiny solemn nod. Camera: slow vertical push-in from a medium portrait to a close-up of the helmet visor. 9:16 framing. One continuous five-second take, no cuts. Synchronized audio: underwater bubble pops, faint glass tap on the helmet, a small water slosh. No readable text, letters, numbers, captions, labels, logos, brands, watermarks, advertisements, posters, UI screens, or product packaging. No humans.

Wan 3.0 Text-to-Video

Wan 3.0 Text-to-Video 由阿里通义实验室开发,根据纯文本提示词直接生成带原生同步音轨的连续高清视频。在提示词中分别规划主体动作、场景发展与镜头运动,即可在单次生成中获得 2–30 秒、最高 1080p 分辨率的动态成片。

为什么选择此模式?

  • 纯文字驱动成片直接通过自然语言构筑主体形象、空间布景与动态故事,无需预先制作或上传任何静态起始图片。

  • 原生音画联合生成依托 Diffusion Transformer 架构直接输出视频与同步音频,自然匹配人物对白、环境声场与动作音效。

  • 长达 30 秒连续动态支持 2–30 秒整秒时长设定,在单次生成中保持角色面部特征稳定,连贯演绎多阶段戏剧动作。

  • 专业运镜与构图控制支持推拉摇移、跟拍与航拍等镜头语言描述,并提供横屏、竖屏、方形及自适应多画幅输出。

  • 最高 1080p 高清输出提供 480p、720p 与 1080p 原生分辨率选项,充分保留光影质感与材质细节,满足专业展示需求。

参数说明

参数要求说明
prompt必填

字符串。详细描述主体、动作、镜头运动、光影氛围与音效设计;去除首尾空格后支持 1–20,000 个字符。

duration可选

整数。设置生成视频的时长,取值范围为 2–30 秒;体验区默认预设为 5 秒。

默认值5
resolution可选

字符串。指定输出视频的分辨率规格;可选 480p、720p(默认)或 1080p。

默认值720p480p1080p
aspect_ratio可选

字符串。控制画面的长宽比例;支持 adaptive(自适应,默认)、16:9、4:3、1:1、3:4 和 9:16。

默认值adaptive16:94:31:13:49:16
audio可选

布尔值。控制是否同时生成与画面匹配的原生同步音频;默认为 true,与无音频输出同价。

默认值truefalse
seed可选

整数。随机数种子,取值范围为 0–2,147,483,647;固定种子有助于复现相似构图与运镜走势。

enable_safety_checker可选

布尔值。开启后对生成内容执行安全合规校验;默认为 true。

默认值truefalse

使用方法

  1. 定义主体与世界观在提示词第一句交代角色外貌、核心道具与所处环境背景,例如:赛博朋克雨夜街道中站立的穿黑色风衣的年轻侦探。

  2. 按时序组织动作节拍按照时间发展顺序依次描写动作变化,使用“首先、随后、最后”或具体秒数组织行为,例如:他抬头观察招牌,随即快步走进小巷。

  3. 单独补充镜头轨迹与运镜用独立句子指明摄影机景别与运动路线,例如:平视中景缓慢推近,镜头随角色步伐侧向跟拍并微仰角展现建筑高耸感。

  4. 细化光线氛围与声音提示补充色彩基调(如冷蓝色调与霓虹反光),并描述期待的声音元素,例如:伴随清晰的皮鞋踩水脚步声与远处隐约的雷鸣。

  5. 配置规格与参数根据发布平台选择合适的分辨率(推荐 720p 或 1080p)、目标画面比例(横屏 16:9 或竖屏 9:16)以及所需生成时长(2–30 秒)。

  6. 提交生成并检视成片点击运行提交异步任务,通过右侧预览面板或查询接口查看结果,画面动作与原生音效将同步呈现。

计费说明

Wan 3.0 Text-to-Video 按实际生成的成片秒数计费,费率仅由选择的分辨率决定;开启或关闭音频不影响计费费率(1 积分 = $0.005)。

计费项费率说明
480p10 积分 / 输出秒($0.05 / 秒)基础高清规格。生成默认 5 秒为 50 积分($0.25);生成最长 30 秒为 300 积分($1.50)。
720p(默认)20 积分 / 输出秒($0.10 / 秒)主流高清规格。生成默认 5 秒为 100 积分($0.50);生成最长 30 秒为 600 积分($3.00)。
1080p40 积分 / 输出秒($0.20 / 秒)旗舰全高清规格。生成默认 5 秒为 200 积分($1.00);生成最长 30 秒为 1200 积分($6.00)。

适用场景

  • 商业广告创意预演将文字脚本与摄影分镜直接转化为动态概念样片,在实拍前直观检验运镜节奏与氛围构思。

  • 短剧与影视故事板构思根据小说章节或剧本片段生成 2–30 秒连续剧情镜头,为导演和主创团队提供直观表演与视效参考。

  • 全渠道社交媒体内容制作同一文本创意灵活选择 16:9、9:16 或 1:1 画幅,生成配有环境音效的高清动态短视频。

  • 游戏与概念世界动态设定把天马行空的幻想生物、科幻飞船或自然风光描述转化为生动细腻的动态概念演示。

创作技巧

  • 提示词分层书写骨架:建议按“主体外观与环境设定 → 连续动作时序 → 摄影机运镜与景别 → 光影氛围与同期音效”的层级组织提示词。
  • 主体运动与镜头运动解耦:将角色的动作(如奔跑、转身)与摄影机的运动(如推近、环绕摇摄)写在不同分句中,有助于画面轨迹更加清晰明确。
  • 合理分配长时长的动作密度:生成 10 秒以上视频时,可以使用“第 0–5 秒……随后在第 6–10 秒……”的分段提示词,指导模型循序渐进展现故事发展。
  • 善用声音描述激活原生音效:在提示词中自然加入声音特征(如清脆的风铃声、低沉的汽车引擎轰鸣、带有回音的对话),模型会自动合成对应音效。
  • 循序渐进的调优策略:首次构思时建议先使用 5 秒 720p 快速验证画面动态与动作走向,满意后再调高至 1080p 和更长秒数输出成片。

注意事项

  • 纯文本输入模式:本端点专为文字生成视频设计,仅接收 prompt 文本,无需且不支持传入图片或参考媒体文件。
  • 整秒时长设定:duration 参数接受 2–30 之间的整数秒,请勿传递浮点数或超出该区间的数值。
  • 异步任务处理机制:API 采用异步工作流,POST 提交成功后立即返回 task_id,随后通过 GET 状态接口轮询或配置回调获取最终视频地址。

Wan 3.0 Text-to-Video API — 常见问题

Wan 3.0 Text-to-Video API 是什么?

Wan 3.0 Text-to-Video 是阿里通义实验室研发的文本生成视频模型。它根据纯文本提示词直接生成最长 30 秒、最高 1080p 分辨率、包含原生同步音轨的高清视频,支持专业镜头运镜与多画幅构图。基于 Diffusion Transformer 与 Flow Matching 架构,它在稳定呈现人物微表情与复杂运镜的同时,实现动作节拍与环境声效的自然匹配。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。

Wan 3.0 文生视频单次生成可以达到 30 秒吗?

可以。模型支持在 2 到 30 秒闭区间内任意指定整秒时长(体验区默认预设为 5 秒)。在长达 30 秒的连续动态中,能够保持角色面部特征与场景空间稳定,连贯演绎多阶段戏剧动作。

Wan 3.0 文生视频的音轨是后配的还是原生生成的?

是原生生成的。音轨由底层扩散网络随画面同步去噪生成,而非外部模型拼接。当保持 audio 参数默认开启时,模型会根据提示词中的动作与环境描写,自动合成紧密贴合画面的环境底噪、碰撞脚步与拟真氛围声。

Wan 3.0 文生视频支持生成纯静音视频吗?

支持。若只需要纯静音视频素材,只需将请求中的 audio 参数设为 false。开启或关闭音频不会改变计费标准。

如何让 Wan 3.0 文生视频在长镜头中保持角色面部稳定?

建议在提示词中按时间线清晰划分叙事节拍(如“首先……随后……最终……”),并分别独立描述角色的外观特征与摄影机运动。避免在单句中同时堆叠互相冲突的动作,有助于模型稳定维持角色的面容微表情与身体比例。

Wan 3.0 文生视频的 adaptive 自适应比例如何工作?

当 aspect_ratio 设为 adaptive(默认)时,模型会根据提示词所描绘的场景内容与镜头特征智能适配最和谐的构图画幅。此外,也可显式指定 16:9、4:3、1:1、3:4 或 9:16,直接适配横屏电影或竖屏社交媒体排版。

Wan 3.0 文生视频生成 1080p 成片需要额外参数吗?

不需要。只需在 resolution 参数中指定 1080p(可选 480p、720p 与 1080p)。1080p 原生全高清输出能充分保留发丝、水面反光与建筑纹理等细腻材质细节,满足专业成片交付需求。