Wan 2.6 Text to Video API

alibaba/wan-2.6/text-to-video

Wan 2.6 Text to Video 将文本提示词转化为 5–15 秒 1080p 高保真视频,支持多镜头叙事合成、丰富运镜控制与生动的动态光影。它在长镜头中严格遵循提示词中的情节发展与物理规律,同时保持多机位角度切换时的时空连续性与主体一致性。

输入
638/5000
输出已就绪
720p · 10 秒 · 160 积分 = $0.800

示例

A realistic indoor bouldering gym in bright diffuse daylight. One adult climber wearing a plain rust-red T-shirt, charcoal trousers and climbing shoes, close to the ground on a gently angled wall. In one continuous five-second side-tracking shot, the climber shifts weight onto the left foot, reaches the right hand to the next blue hold and moves one foothold sideways. Controlled modest movement, correct limb anatomy, convincing contact and body weight. Chalky wall texture, soft shoe scuff and breathing. No jumps, cuts, text, logos or music.

A realistic community kitchen in warm morning daylight. A cook in a plain pale-green apron lifts the lid of a large round bamboo steamer on a stainless counter with both hands, revealing six white steamed buns in one neat layer. One steady medium shot with a gentle push-in. Steam rises and thins naturally, the heavy lid moves as one rigid object, hands keep a secure grip. Soft lid clack, faint kitchen room tone, no dialogue or music. An ordinary shared breakfast preparation, not a product shot. No text, logos, cuts or sales imagery.

Wan 2.6 Text to Video

Wan 2.6 Text to Video 由阿里巴巴通义实验室开发,专为根据纯自然语言提示词生成电影质感动态视频而设计。模型支持单次 5、10 或 15 秒生成、最高 1080p 原生清晰度以及可选的多镜头(multi_shots)自动机位切换,让创作者无需预备静态图像即可完成具备故事弧线的动态短片制作。

为什么选择此模式?

  • 纯文本驱动多镜头叙事通过自然语言规划故事节拍,开启 multi_shots 即可在单次生成中呈现多机位视角自然切换。

  • 最高 1080p 原生全高清提供 720p 与 1080p 两种分辨率档位,细腻呈现微表情、织物纹理与自然环境光影。

  • 灵活 5–15 秒生成时长支持 5 秒、10 秒与 15 秒整秒输出时长,满足从快速镜头草稿到完整叙事片段的创作节奏。

  • 连贯的物理世界运动模拟基于 Diffusion Transformer 架构,真实模拟流体、重力、布料与复杂肢体交互动态。

  • 便捷的开发接入与在线试用提供开箱即用的在线 Playground 与规范的 REST API,支持异步任务提交、状态轮询与 Webhook 回调。

参数说明

参数要求说明
prompt必填

字符串。校验前去除首尾空白,支持 1–5,000 个 Unicode 字符。

duration可选

整数。输出时长支持 5、10、15 秒。

默认值51015
resolution可选

输出分辨率:720p 或 1080p。

默认值720p1080p
multi_shots可选

可选布尔值。省略时不指定上游设置;体验区初始为 false。不额外计费。

truefalse

使用方法

  1. 准备文本提示词在 prompt 中描述主体特征、场景环境、动作过程以及期望的运镜方式,支持 1–5,000 个字符。

  2. 选择生成时长根据叙事需要选择 5 秒、10 秒或 15 秒生成时长,默认 5 秒。

  3. 设定输出分辨率按清晰度要求选择 720p 或 1080p,默认 720p。

  4. 按需开启多镜头模式若希望在成片中实现分镜机位变换,可将 multi_shots 设为 true,该选项不收取额外费用。

  5. 确认费用并提交任务核对当前所选配置所需的积分后点击“运行”,或通过 POST /api/generate/submit 接口提交请求。

  6. 轮询任务状态使用返回的 task_id 查询执行进度,在 status 变为 finished 时获取生成的视频地址。

  7. 预览并下载视频在体验区播放器中预览生成效果,或直接下载高清晰度 MP4 视频成品。

计费说明

按输出分辨率和时长计费,多镜头不额外收费。1 积分 = $0.005。

计费项费率说明
720p · 5 秒80 积分 / $0.40每次视频生成
720p · 10 秒160 积分 / $0.80每次视频生成
720p · 15 秒240 积分 / $1.20每次视频生成
1080p · 5 秒120 积分 / $0.60每次视频生成
1080p · 10 秒240 积分 / $1.20每次视频生成
1080p · 15 秒360 积分 / $1.80每次视频生成

适用场景

  • 影视分镜与概念预演利用多镜头能力将剧本直接转化为动态视觉预演,快速验证机位构图与叙事节奏。

  • 数字广告与营销短片输入商品使用场景与品牌格调描述,快速生成 1080p 高清宣传样片与社交短视频。

  • 故事绘本与微短剧创作通过分节拍提示词编排人物对话与戏剧冲突,单次生成 15 秒连续剧情片段。

  • 自然风光与环境动态呈现晨雾、日出、海浪与风沙等大自然光影演变,保持光照流动与空气透视自然。

  • 艺术视效与创意概念设计实验超现实场景、异次元空间或奇幻生物动态,激发概念设计灵感。

创作技巧

  • 结构化编写提示词:建议按“主体外观 + 空间环境 + 连贯动作 + 摄影机运镜 + 光影风格”分层描述,有助于模型全面理解画面层次。
  • 合理运用多镜头开关:编写包含“先特写……随后切换远景……”等分镜头描述时,开启 multi_shots=true 可显著提升镜头切换的专业感。
  • 叙事节奏匹配时长:单机位焦点动作推荐选择 5 秒;包含动作起承转合或镜头推进的复杂场景推荐使用 10 秒或 15 秒。
  • 运镜词使用行业标准术语:使用“缓慢推镜(slow push-in)”、“环绕运镜(orbit shot)”或“低角度仰拍(low-angle tilt)”能获得更精确的摄影机轨迹。
  • 光线与质感描述增强真实感:明确说明“柔和侧逆光”、“晨曦丁达尔光效”或“漫反射阴影”,可显著提高 1080p 输出的画面质感。

注意事项

  • 输入格式与字数规范:本端点为纯文本生成模式,接收 prompt 字符串,去除首尾空格后支持 1–5,000 个 Unicode 字符。
  • 输出时长与画质档位:时长支持 5、10、15 秒,分辨率支持 720p(默认)与 1080p,计费按时长与分辨率阶梯扣除积分。
  • 多镜头功能无附加费用:multi_shots 为可选布尔值参数,体验区初始为 false,开启后不增加生成积分。
  • 异步任务机制与凭据保管:提交任务后需妥善保存返回的 task_id,通过轮询或设置 callback_url 获取生成完成的视频文件链接。

Wan 2.6 Text to Video API 常见问题

Wan 2.6 Text to Video API 是什么?

Wan 2.6 Text to Video 是阿里巴巴研发的文本生成视频模型。它根据纯文本提示词直接生成 5–15 秒、最高 1080p 分辨率的高清动态视频,支持专业镜头运镜与多镜头分镜叙事。基于先进的 Diffusion Transformer 时空生成架构,它在严格遵循提示词物理规律与动作节奏的同时,保持多机位转换时的场景与主体连贯性。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。

Wan 2.6 Text to Video 单次可以生成 15 秒吗?

可以。模型支持 5 秒、10 秒与 15 秒三种输出时长档位(体验区默认 5 秒)。在长达 15 秒的连续生成中,模型能够保持场景光影与主体形态稳定,连贯呈现多阶段动作发展。

Wan 2.6 Text to Video 的多镜头功能会额外收费吗?

不会额外收费。multi_shots 为可选布尔值参数,开启后模型会自动根据提示词中的场景推进生成多视角分镜切换,费用依然仅按输出分辨率和生成秒数标准计算。

Wan 2.6 Text to Video 生成 1080p 高清视频需要哪些设置?

在 resolution 参数中选择 1080p 即可。1080p 档位能呈现细腻的人物面部微表情、毛发纹理与环境漫反射光影,非常适合专业广告样片和商业成片交付。

Wan 2.6 Text to Video 支持通过提示词控制运镜吗?

支持。在 prompt 中加入具体的镜头语言描述,例如“缓慢推近(push-in)”、“环绕运镜(orbit)”或“低角度跟拍(tracking shot)”,模型便会根据指令执行平稳、符合电影工业手法的摄影机运动。

Wan 2.6 Text to Video 支持中文提示词吗?

支持。模型支持中英文等多种自然语言输入,去除首尾空白后最多支持 5,000 个 Unicode 字符,能够充分容纳包含角色、环境、运镜与色彩风格的详尽描述。

有静态参考图片时该选择 Wan 2.6 Text to Video 吗?

若已有设计图或人物素材,推荐使用 Wan 2.6 Image to Video 端点。Wan 2.6 Text to Video 专为纯文本提示词构筑全新画面而设计,输入图片时使用图生视频端点能更好地锚定首帧画面的角色外貌与构图细节。