Wan 2.7 Text to Video API

alibaba/wan-2.7/text-to-video

Wan 2.7 Text to Video 将文本提示词转化为 5–15 秒 720p 与 1080p 高清视频,具备 Thinking Mode 提示词深度推理、原生音视频同步与高保真物理运动模拟。它在支持多种画幅比例的同时严格遵循叙事细节,保持复杂光影与连贯镜头运动的时间一致性。

输入
446/5,000
Audio Url(可选)
输出
已就绪
720p · 5 秒 × 12 积分/秒 = 60 积分 ($0.300)
继续使用

示例

One continuous five-second low water-level camera push through a large natural sea arch. A single turquoise swell enters a shadowed basalt sea cave and curls into white foam around the rocks while sunlight glows through the arch ahead. Keep the arch geometry fixed and the water physically coherent. Gradual forward motion, no cuts. Natural surf ambience. No text, lettering, captions, logos, watermarks, brands, advertising or product packaging.

An adult cellist in simple dark clothing plays one slow sustained bow stroke in a quiet sunlit rehearsal room. Five-second continuous medium side shot drifting gently sideways. Preserve natural hands, bow contact with strings, instrument geometry and the seated posture. A single warm cello note and soft room ambience. No cut. No text, lettering, captions, logos, watermarks, brands, advertising or product packaging.

Inside a mountaintop astronomical observatory at night, the curved roof shutter slowly slides open to reveal a crisp star-filled sky. Five-second continuous upward-looking wide shot, gentle camera tilt follows the opening. Keep the telescope and dome mechanically consistent, subtle cool starlight enters. Soft motor hum. No time lapse, no cuts. No text, lettering, captions, logos, watermarks, brands, advertising or product packaging.

Wan 2.7 Text to Video 概览

Wan 2.7 Text to Video 是阿里通义实验室研发的高性能文本生成视频服务,可将自然语言描述直接转化为最长 15 秒的高保真视频。基于先进的 Diffusion Transformer 架构与 Wan-VAE 3D 因果时空压缩技术,模型通过内置的 Thinking Mode 深度理解多层次提示词,精确呈现真实物理交互、光影渐变与运镜轨迹,无需准备前置图像素材即可完成电影感镜头创作。

为什么选择 Wan 2.7 Text to Video?

  • 纯文本直接构建完整镜头仅需自然语言提示词即可全流程构思主体外貌、场景环境、动态细节与光影氛围,无需前置素材。

  • Thinking Mode 深度逻辑推理内置推理引擎深度解析多句复合提示词,准确拆解空间布局、角色动作与运镜时序,提升画面严谨度。

  • 5、10、15 秒三档时长自由选择灵活匹配不同创作阶段需求,无论是短促动作冲击还是长镜头叙事展开,均可稳定输出连贯画面。

  • 原生支持 5 种主流画幅比例提供 16:9 横屏、9:16 竖屏、1:1 方形以及 4:3、3:4 画幅,生成过程原生适配构图,免除二次裁切。

  • 伴随音频协同生成支持传入音频链接,使镜头切换、动态节奏与背景声音旋律协调统一,提升视听成片完整度。

参数说明

参数要求说明
prompt

提示词去除首尾空格后最多 5,000 字符;图生视频可不填。

默认值
audio_url

可选的公开 HTTP(S) 音频地址。

默认值
aspect_ratio

16:9、9:16、1:1、4:3 或 3:4,默认 16:9。

默认值16:9
resolution

720p 或 1080p,默认 720p。

默认值720p
duration

5、10 或 15 秒,默认 5 秒。

默认值5
seed

可选整数,范围为 0–2147483647。

默认值
enable_safety_checker

可选安全检查设置,默认不传。

默认值

如何使用 Wan 2.7 Text to Video

  1. 撰写场景描述提示词明确画面主体、环境特征、动作次序与镜头运镜语言,利用具体动词提升画面表现力。

  2. 设定时长、画幅与画质根据分发渠道选择视频时长(5/10/15秒)、分辨率(720p/1080p)以及相应的宽高比。

  3. 发起生成并取回视频通过 API 发送异步请求或在体验区点击运行,轮询任务状态并在完成后获取 MP4 视频链接。

计费说明

计费点数 = 生成时长(秒)× 分辨率费率。任务失败全额返还扣除积分。

计费项费率说明
720p12 积分/秒 ($0.06/s)四种模式使用相同费率。
1080p18 积分/秒 ($0.09/s)四种模式使用相同费率。

适用场景

  • 影视与短剧预演直接根据剧本文字片段快速生成光影、机位调度与分镜动态,用于开机前的概念验证。

  • 创意广告概念片为品牌广告提案快速渲染视觉动态演示与故事氛围板,大幅缩短客户沟通与推演周期。

  • 社交媒体动态内容一键输出 9:16 竖屏高保真短剧与动态视觉卡片,以细腻的 1080p 画质吸引社媒观众。

  • 故事绘本与小说动态化将文字作品中的奇幻场景、角色战斗与历史风貌直接动态呈现,免去繁杂的三维动画管线。

Wan 2.7 Text to Video 提示词技巧

  • 主体行为与运镜分段表述:建议在第一句集中描述主体外观与核心动作,第二句补充景别(如特写、全景)、运镜轨迹(如平移、环绕)与光线效果。
  • 融入节奏与物理时间指示:使用“缓缓拉升”、“加速穿过”、“微风拂动”等具备速度感与物理态势的词汇,引导模型计算更逼真的动态加速度。
  • 原型阶段使用 720p 快速验证:在构思分镜创意与微调提示词时优先选用 720p 规格快速测试,确认构图与动态满意后再以 1080p 输出成品。
  • 固定种子进行对照微调:当画面构图理想但需要微调局部色彩或动作幅度时,固定 seed 仅修改局部修饰词,保持核心构图骨架稳定。

注意事项

  • 提示词字符上限:提示词支持最多 5,000 个字符。建议着力描述具象的视觉要素,避免过多抽象抒情词。
  • 时长参数限制:Text to Video 端点仅支持 5 秒、10 秒或 15 秒整秒档位,传入其他数值将无法通过校验。
  • 失败全额退还积分:若任务在提交后未能成功生成视频或媒体处理异常,系统将自动退还该次扣除的全部积分。

Wan 2.7 Text to Video API 常见问题

Wan 2.7 Text to Video API 是什么?

Wan 2.7 Text to Video 是阿里通义实验室研发的文本生成视频模型。它根据文本提示词直接生成 5 至 15 秒 720p 或 1080p 高清视频,具备 Thinking Mode 提示词深度推理、伴随音频协同以及高保真物理运动模拟能力。基于 Diffusion Transformer 骨干网络与 Wan-VAE 3D 因果时空压缩架构,它在严格遵循复杂叙事指令的同时呈现连贯平滑的运镜轨迹与时间一致性。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。

Wan 2.7 Text to Video 单次可以生成多长时长的视频?

Wan 2.7 Text to Video 支持 5 秒、10 秒和 15 秒三个离散的时长档位。你可以在提交请求时按需传入对应的 duration 整数,系统将根据所选时长精确计费并生成完整镜头。

Wan 2.7 Text to Video 支持同步音频生成吗?

Wan 2.7 Text to Video 支持通过传入 audio_url 参数接入伴随音频。提供公开可访问的音频文件链接后,模型在生成视频画面时能够协同参考音频节奏,呈现视听统一的动态效果。

Wan 2.7 Text to Video 支持哪些输出分辨率?

Wan 2.7 Text to Video 支持 720p 与 1080p 两种原生分辨率。默认档位为 720p(12 积分/秒),若需用于大屏展示或商业级精细渲染,可指定为 1080p(18 积分/秒)。

Wan 2.7 Text to Video 支持哪些画幅比例?

Wan 2.7 Text to Video 支持 5 种原生画幅比例:16:9 横屏、9:16 竖屏、1:1 正方形以及 4:3 与 3:4。模型根据指定比例原生生成构图,无需后期黑边填充或画质裁切。

Thinking Mode 如何提升 Wan 2.7 Text to Video 的生成效果?

Thinking Mode 赋予模型在生成视频前进行多步语义推理的能力。它能够深入剖析复杂长提示词中的空间逻辑、主体间相对位置与动作前后衔接,显著减少物体形变并增强真实物理运动规律。

Wan 2.7 Text to Video 任务失败时如何计费?

系统在任务提交时根据设定的时长与分辨率费率预扣积分。如果任务在参数校验、媒体加载或生成过程中出现异常导致失败,系统会自动将预扣积分全额返还至你的账户。