A realistic indoor bouldering gym in bright diffuse daylight. One adult climber wearing a plain rust-red T-shirt, charcoal trousers and climbing shoes, close to the ground on a gently angled wall. In one continuous five-second side-tracking shot, the climber shifts weight onto the left foot, reaches the right hand to the next blue hold and moves one foothold sideways. Controlled modest movement, correct limb anatomy, convincing contact and body weight. Chalky wall texture, soft shoe scuff and breathing. No jumps, cuts, text, logos or music.
Wan 2.6 Text to Video API
alibaba/wan-2.6/text-to-videoWan 2.6 Text to Video 将文本提示词转化为 5–15 秒 1080p 高保真视频,支持多镜头叙事合成、丰富运镜控制与生动的动态光影。它在长镜头中严格遵循提示词中的情节发展与物理规律,同时保持多机位角度切换时的时空连续性与主体一致性。
示例
REST API 规格
快速开始
提交端点请求并查询任务状态。请将示例素材 URL 替换为可访问的真实文件。
第一步:配置 API 鉴权
在控制台申请 API Key,并在每个 HTTP 请求头中携带 Authorization: Bearer <API_KEY> 进行身份验证。
- 任务提交端点
- POST
https://api.vidgo.ai/api/generate/submit - 鉴权请求头
- Authorization: Bearer VIDGO_API_KEY
第 2 步:提交生成任务
POST /api/generate/submit。model 和可选 callback_url 位于根级,生成参数位于 input 内。
REQUEST_BODY=$(cat <<'JSON'
{
"model": "alibaba/wan-2.6/text-to-video",
"input": {
"prompt": "Documentary realism, dry daylight at a small archaeological dig, one adult female archaeologist in a plain sand-colored field shirt and blue neck scarf. Shot 1 [0-4s]: a wide view of the excavation grid; she kneels beside a shallow tray containing one pottery fragment. Shot 2 [4-10s]: cut to a medium close-up of the SAME woman, gently brushing dust from the fragment, then looking toward a colleague off camera and saying clearly: \"This edge belonged to a painted bowl.\" Preserve her face, clothes and location across the cut. Soft brush sounds, light outdoor breeze, natural synchronized speech. No music, titles, logos or advertising.",
"duration": 10,
"resolution": "720p",
"multi_shots": true
}
}
JSON
)
RESPONSE=$(curl --silent --show-error --fail-with-body \
--request POST \
--url "https://api.vidgo.ai/api/generate/submit" \
--header "Authorization: Bearer $VIDGO_API_KEY" \
--header "Content-Type: application/json" \
--data "$REQUEST_BODY")
CODE=$(printf '%s' "$RESPONSE" | jq -r '.code // empty')
if [ "$CODE" != "0" ] && [ "$CODE" != "200" ]; then
printf 'API error: %s
' "$RESPONSE" >&2
exit 1
fi
printf '%s
' "$RESPONSE"第三步:轮询任务执行结果
使用 task_id 查询进度;not_started 或 running 时继续轮询,finished 或 failed 时停止。成功后读取 data.files[].file_url,失败时读取 data.error_message。
状态查询端点
GET https://api.vidgo.ai/api/generate/status/{task_id}使用 task_id 查询进度;not_started 或 running 时继续轮询,finished 或 failed 时停止。成功后读取 data.files[].file_url,失败时读取 data.error_message。
not_startedrunningfinishedfailed{
"code": 200,
"data": {
"task_id": "W7R6RD872WMDLW7D",
"status": "running",
"created_time": "2026-09-21T17:09:32"
}
}{
"code": 200,
"data": {
"task_id": "task-unified-...",
"status": "finished",
"files": [
{
"file_url": "https://storage.vidgo.ai/generated/video.mp4",
"file_type": "video"
}
],
"created_time": "2026-08-22T10:00:00Z",
"progress": 100,
"error_message": null
}
}端到端完整脚本示例
展开查看在生产环境中具备轮询重试、异常保护和超时处理的完整自动化脚本。
set -euo pipefail
: "${VIDGO_API_KEY:?Set VIDGO_API_KEY in your environment}"
REQUEST_BODY=$(cat <<'JSON'
{
"model": "alibaba/wan-2.6/text-to-video",
"input": {
"prompt": "Documentary realism, dry daylight at a small archaeological dig, one adult female archaeologist in a plain sand-colored field shirt and blue neck scarf. Shot 1 [0-4s]: a wide view of the excavation grid; she kneels beside a shallow tray containing one pottery fragment. Shot 2 [4-10s]: cut to a medium close-up of the SAME woman, gently brushing dust from the fragment, then looking toward a colleague off camera and saying clearly: \"This edge belonged to a painted bowl.\" Preserve her face, clothes and location across the cut. Soft brush sounds, light outdoor breeze, natural synchronized speech. No music, titles, logos or advertising.",
"duration": 10,
"resolution": "720p",
"multi_shots": true
}
}
JSON
)
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
--request POST \
--url "https://api.vidgo.ai/api/generate/submit" \
--header "Authorization: Bearer $VIDGO_API_KEY" \
--header "Content-Type: application/json" \
--data "$REQUEST_BODY")
TASK_ID=$(printf '%s' "$SUBMIT_RESPONSE" | jq -r '.data.task_id // .task_id // empty')
BUSINESS_CODE=$(printf '%s' "$SUBMIT_RESPONSE" | jq -r '.code // empty')
if [ "$BUSINESS_CODE" != "0" ] && [ "$BUSINESS_CODE" != "200" ]; then
printf 'Submit failed:
%s
' "$SUBMIT_RESPONSE" >&2
exit 1
fi
if [ -z "$TASK_ID" ]; then
printf 'Submit response did not include task_id:
%s
' "$SUBMIT_RESPONSE" >&2
exit 1
fi
START_TIME=$(date +%s)
POLL_DELAY=2
while true; do
if [ $(( $(date +%s) - START_TIME )) -ge 600 ]; then
printf 'Timed out after 600 seconds
' >&2
exit 1
fi
STATUS_RESPONSE=$(curl --silent --show-error --fail-with-body \
--url "https://api.vidgo.ai/api/generate/status/$TASK_ID" \
--header "Authorization: Bearer $VIDGO_API_KEY")
STATUS=$(printf '%s' "$STATUS_RESPONSE" | jq -r '.data.status // .status // empty')
BUSINESS_CODE=$(printf '%s' "$STATUS_RESPONSE" | jq -r '.code // empty')
if [ "$BUSINESS_CODE" != "0" ] && [ "$BUSINESS_CODE" != "200" ]; then
printf 'Status request failed:
%s
' "$STATUS_RESPONSE" >&2
exit 1
fi
case "$STATUS" in
finished)
printf '%s' "$STATUS_RESPONSE" | jq -r '(.data.files // .files // [])[]?.file_url'
break
;;
failed)
printf '%s' "$STATUS_RESPONSE" | jq -r '.data.error_message // .error_message // "Generation failed"' >&2
exit 1
;;
not_started|running)
sleep "$POLL_DELAY"
if [ "$POLL_DELAY" -lt 10 ]; then POLL_DELAY=$((POLL_DELAY + 1)); fi
;;
*)
printf 'Unexpected task status: %s
' "$STATUS" >&2
exit 1
;;
esac
done请求参数(input 对象)
向 /api/generate/submit 提交 POST 请求时,input 内部所支持的生成参数配置:
| 字段 | 类型 | 必填 | 默认值 | 描述 |
|---|---|---|---|---|
| prompt | string | 是 | — | 字符串。校验前去除首尾空白,支持 1–5,000 个 Unicode 字符。 |
| duration | integer | 否 | 5 | 整数。输出时长支持 5、10、15 秒。 |
| resolution | string | 否 | 720p | 输出分辨率:720p 或 1080p。 |
| multi_shots | boolean | 否 | — | 可选布尔值。省略时不指定上游设置;体验区初始为 false。不额外计费。 |
响应字段(查询结果)
通过 GET /api/generate/status/{task_id} 轮询获取的任务详情:
| 字段 | 类型 | 描述 |
|---|---|---|
| code | integer | 业务响应状态码,200 表示成功。 |
| data.task_id | string | 异步任务全局唯一流水号。 |
| data.status | string | 任务执行阶段:not_started(排队中)、running(生成中)、finished(已完成)、failed(失败)。 |
| data.files | array | 生成成功时包含的成片文件列表,每项含 file_url 与 file_type。 |
| data.error_message | string | null | 任务执行异常时的具体错误描述。 |
任务生命周期
客户端应根据 status 字段判断任务进度,达到 finished 或 failed 终态时立即终止轮询:
not_started任务已接收,等待执行。
running正在生成。
finished生成完成,从 data.files 获取视频 URL。
failed生成失败,请查看 data.error_message,已扣积分按现有流程返还。
轮询与异常处理
- 轮询频次推荐建议初始轮询间隔设为 2–3 秒,随着任务持续可递增至 5 秒一次,避免过密请求。
- 网络波动与重试若查询网络出现 5xx 或连接超时,不代表任务失败,可稍作休眠后继续重试查询。
- 异步 Webhook 回调支持在提交请求体根层级传递 callback_url,在任务终态时系统将通过 POST 自动推送完整任务结果。
接口规格
| 规格项 | 取值 | 说明 |
|---|---|---|
| 模型 ID | alibaba/wan-2.6/text-to-video | 在请求根级 model 字段中发送此值。 |
| 时长 | 5, 10, 15s | 默认 5 秒。 |
| 分辨率 | 720p / 1080p | 默认 720p。 |
Wan 2.6 Text to Video
Wan 2.6 Text to Video 由阿里巴巴通义实验室开发,专为根据纯自然语言提示词生成电影质感动态视频而设计。模型支持单次 5、10 或 15 秒生成、最高 1080p 原生清晰度以及可选的多镜头(multi_shots)自动机位切换,让创作者无需预备静态图像即可完成具备故事弧线的动态短片制作。
为什么选择此模式?
纯文本驱动多镜头叙事通过自然语言规划故事节拍,开启 multi_shots 即可在单次生成中呈现多机位视角自然切换。
最高 1080p 原生全高清提供 720p 与 1080p 两种分辨率档位,细腻呈现微表情、织物纹理与自然环境光影。
灵活 5–15 秒生成时长支持 5 秒、10 秒与 15 秒整秒输出时长,满足从快速镜头草稿到完整叙事片段的创作节奏。
连贯的物理世界运动模拟基于 Diffusion Transformer 架构,真实模拟流体、重力、布料与复杂肢体交互动态。
便捷的开发接入与在线试用提供开箱即用的在线 Playground 与规范的 REST API,支持异步任务提交、状态轮询与 Webhook 回调。
参数说明
| 参数 | 要求 | 说明 |
|---|---|---|
| prompt | 必填 | 字符串。校验前去除首尾空白,支持 1–5,000 个 Unicode 字符。 |
| duration | 可选 | 整数。输出时长支持 5、10、15 秒。 默认值 51015 |
| resolution | 可选 | 输出分辨率:720p 或 1080p。 默认值 720p1080p |
| multi_shots | 可选 | 可选布尔值。省略时不指定上游设置;体验区初始为 false。不额外计费。 truefalse |
使用方法
准备文本提示词在 prompt 中描述主体特征、场景环境、动作过程以及期望的运镜方式,支持 1–5,000 个字符。
选择生成时长根据叙事需要选择 5 秒、10 秒或 15 秒生成时长,默认 5 秒。
设定输出分辨率按清晰度要求选择 720p 或 1080p,默认 720p。
按需开启多镜头模式若希望在成片中实现分镜机位变换,可将 multi_shots 设为 true,该选项不收取额外费用。
确认费用并提交任务核对当前所选配置所需的积分后点击“运行”,或通过 POST /api/generate/submit 接口提交请求。
轮询任务状态使用返回的 task_id 查询执行进度,在 status 变为 finished 时获取生成的视频地址。
预览并下载视频在体验区播放器中预览生成效果,或直接下载高清晰度 MP4 视频成品。
计费说明
按输出分辨率和时长计费,多镜头不额外收费。1 积分 = $0.005。
| 计费项 | 费率 | 说明 |
|---|---|---|
| 720p · 5 秒 | 80 积分 / $0.40 | 每次视频生成 |
| 720p · 10 秒 | 160 积分 / $0.80 | 每次视频生成 |
| 720p · 15 秒 | 240 积分 / $1.20 | 每次视频生成 |
| 1080p · 5 秒 | 120 积分 / $0.60 | 每次视频生成 |
| 1080p · 10 秒 | 240 积分 / $1.20 | 每次视频生成 |
| 1080p · 15 秒 | 360 积分 / $1.80 | 每次视频生成 |
适用场景
影视分镜与概念预演利用多镜头能力将剧本直接转化为动态视觉预演,快速验证机位构图与叙事节奏。
数字广告与营销短片输入商品使用场景与品牌格调描述,快速生成 1080p 高清宣传样片与社交短视频。
故事绘本与微短剧创作通过分节拍提示词编排人物对话与戏剧冲突,单次生成 15 秒连续剧情片段。
自然风光与环境动态呈现晨雾、日出、海浪与风沙等大自然光影演变,保持光照流动与空气透视自然。
艺术视效与创意概念设计实验超现实场景、异次元空间或奇幻生物动态,激发概念设计灵感。
创作技巧
- 结构化编写提示词:建议按“主体外观 + 空间环境 + 连贯动作 + 摄影机运镜 + 光影风格”分层描述,有助于模型全面理解画面层次。
- 合理运用多镜头开关:编写包含“先特写……随后切换远景……”等分镜头描述时,开启 multi_shots=true 可显著提升镜头切换的专业感。
- 叙事节奏匹配时长:单机位焦点动作推荐选择 5 秒;包含动作起承转合或镜头推进的复杂场景推荐使用 10 秒或 15 秒。
- 运镜词使用行业标准术语:使用“缓慢推镜(slow push-in)”、“环绕运镜(orbit shot)”或“低角度仰拍(low-angle tilt)”能获得更精确的摄影机轨迹。
- 光线与质感描述增强真实感:明确说明“柔和侧逆光”、“晨曦丁达尔光效”或“漫反射阴影”,可显著提高 1080p 输出的画面质感。
注意事项
- 输入格式与字数规范:本端点为纯文本生成模式,接收 prompt 字符串,去除首尾空格后支持 1–5,000 个 Unicode 字符。
- 输出时长与画质档位:时长支持 5、10、15 秒,分辨率支持 720p(默认)与 1080p,计费按时长与分辨率阶梯扣除积分。
- 多镜头功能无附加费用:multi_shots 为可选布尔值参数,体验区初始为 false,开启后不增加生成积分。
- 异步任务机制与凭据保管:提交任务后需妥善保存返回的 task_id,通过轮询或设置 callback_url 获取生成完成的视频文件链接。
Wan 2.6 Text to Video API 常见问题
Wan 2.6 Text to Video API 是什么?
Wan 2.6 Text to Video 是阿里巴巴研发的文本生成视频模型。它根据纯文本提示词直接生成 5–15 秒、最高 1080p 分辨率的高清动态视频,支持专业镜头运镜与多镜头分镜叙事。基于先进的 Diffusion Transformer 时空生成架构,它在严格遵循提示词物理规律与动作节奏的同时,保持多机位转换时的场景与主体连贯性。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。
Wan 2.6 Text to Video 单次可以生成 15 秒吗?
可以。模型支持 5 秒、10 秒与 15 秒三种输出时长档位(体验区默认 5 秒)。在长达 15 秒的连续生成中,模型能够保持场景光影与主体形态稳定,连贯呈现多阶段动作发展。
Wan 2.6 Text to Video 的多镜头功能会额外收费吗?
不会额外收费。multi_shots 为可选布尔值参数,开启后模型会自动根据提示词中的场景推进生成多视角分镜切换,费用依然仅按输出分辨率和生成秒数标准计算。
Wan 2.6 Text to Video 生成 1080p 高清视频需要哪些设置?
在 resolution 参数中选择 1080p 即可。1080p 档位能呈现细腻的人物面部微表情、毛发纹理与环境漫反射光影,非常适合专业广告样片和商业成片交付。
Wan 2.6 Text to Video 支持通过提示词控制运镜吗?
支持。在 prompt 中加入具体的镜头语言描述,例如“缓慢推近(push-in)”、“环绕运镜(orbit)”或“低角度跟拍(tracking shot)”,模型便会根据指令执行平稳、符合电影工业手法的摄影机运动。
Wan 2.6 Text to Video 支持中文提示词吗?
支持。模型支持中英文等多种自然语言输入,去除首尾空白后最多支持 5,000 个 Unicode 字符,能够充分容纳包含角色、环境、运镜与色彩风格的详尽描述。
有静态参考图片时该选择 Wan 2.6 Text to Video 吗?
若已有设计图或人物素材,推荐使用 Wan 2.6 Image to Video 端点。Wan 2.6 Text to Video 专为纯文本提示词构筑全新画面而设计,输入图片时使用图生视频端点能更好地锚定首帧画面的角色外貌与构图细节。