Wan 3.0 Prime Image-to-Video API

alibaba/wan-3.0-prime/image-to-video

Wan 3.0 Prime(Image-to-Video)将首帧图片与文本提示词转化为最长 30 秒的连续视频,支持可选尾帧引导、原生音画同步,以及最高 1080p 输出。它把源图的主体、构图与风格带入动态,同时加入动作、运镜与声音。

输入

514/20000

输出

等待运行

生成的视频会显示在这里

设置必填输入、分辨率和时长,然后运行任务。

5 秒 × $0.140/秒 = $0.700

继续使用

示例

Begin from the first frame. One continuous 4-second 16:9 shot: the eyed toast slides straight toward the lens on a thin butter trail, eyes widening, until it nearly fills the frame. Locked low table-level camera. Native audio: bread scrape on laminate, a tiny squeak, quiet kitchen room tone. No logos, no readable text, no products, no packaging, no prices, no CTA, no advertising, no watermark, no brand marks.

Begin from the first frame. One continuous 4-second 3:4 shot: the diving-helmet cat slowly turns its head toward the goldfish in the open briefcase. Preserve the same cat, helmet, briefcase, fish, and desk. Locked camera. Native audio: helmet metal tick, water slosh in the pouch, soft room tone. No logos, no readable text, no products, no packaging, no prices, no CTA, no advertising, no watermark, no brand marks.

Wan 3.0 Prime Image-to-Video

Wan 3.0 Prime Image-to-Video 根据首帧图片与可选文本提示词生成带可选同步声音的连续片段。它保留开场的主体、构图与光线,同时增加主体动作、运镜、场景推进与声音;可选第二张图可引导结尾状态。

为什么选择此模式?

  • Image-to-Video提供一至两个公开图片 URL,把已定稿静帧做成连续片段。

  • 保留原图特征将首帧的主体身份、构图、光线与风格带入生成运动。

  • 可选尾帧引导最终姿态、产品状态或构图需要可见终点时,在 image_urls 中加入第二张图。

  • 原生音画同步保持音频开启,随动态静帧一同生成环境音、动作音效、对白或音乐。

  • 提示词运动控制在开场之后描述主体动作、运镜路径、光线变化与氛围。

  • 交付规格输出 480p、720p 或 1080p,时长 2–30 秒,并支持 adaptive 与固定画幅。

参数

参数要求说明
image_urls必填

字符串数组,包含 1–2 个可直接下载的公开 URL。第一张为 Start,可选第二张为 End,请保持该顺序。

prompt可选

字符串。引导开场帧之后的动作、运镜、视觉变化与声音意图;提供时去除首尾空白后长度为 1–20,000 字符。

duration可选

整数。输出时长为 2–30 秒(含端点);默认 5。

resolution可选

字符串。输出分辨率;默认 720p。

480p720p1080p
aspect_ratio可选

字符串。控制画面比例;默认 adaptive。

adaptive16:94:31:13:49:16
audio可选

布尔值。是否生成音轨;默认 true。开启或关闭音频不会改变费率。

truefalse
seed可选

整数。可选复现种子,范围 0–2147483647。

enable_safety_checker可选

布尔值。是否启用安全检查;默认 true。

truefalse

使用方法

  1. 上传首帧提供主体、构图、光线与风格已经到位的公开图片 URL,作为第一帧基础。

  2. 添加尾帧(可选)需要引导结尾姿态或产品状态时,再添加一张相容的第二张图 URL。

  3. 描述动态变化写清静帧之后发生什么:主体动作、运镜路径、光线变化与声音意图。

  4. 设置时长选择 2–30 的整秒时长;首次试片默认可用 5 秒。

  5. 选择分辨率用 480p 检查运动,用 720p 或 1080p 做评审与交付。

  6. 选择画幅比例在 adaptive、16:9、4:3、1:1、3:4、9:16 中选择交付画幅。

  7. 配置音频需要同步声音时保持音频开启;制作静音片段时关闭该选项。

  8. 生成视频点击「运行」,任务完成后在输出区同时预览画面与声音。

价格

费用仅取决于输出时长与分辨率;音频开关不改变费率。

计费项费率说明
480p13.6 积分/输出秒($0.068/秒)2 秒计 27.2 积分($0.136),5 秒计 68 积分($0.340),30 秒计 408 积分($2.04)。
720p28 积分/输出秒($0.14/秒)2 秒计 56 积分($0.280),5 秒计 140 积分($0.70),30 秒计 840 积分($4.20)。
1080p56 积分/输出秒($0.28/秒)2 秒计 112 积分($0.560),5 秒计 280 积分($1.40),30 秒计 1,680 积分($8.40)。

推荐使用场景

  • 产品静帧转演示把已定稿产品图做成旋转、材质变化或光线变化的上新预告短片。

  • 海报与主视觉动态化把锁定的活动静帧做成短动态素材,用于社媒、展示或汇报。

  • 开闭帧转场预演用匹配的首尾帧做揭示或构图收束的转场研究。

  • 角色关键帧表演用肖像或角色静帧,再提示表情、手势与镜头回应,做成表演片段。

  • 概念原画转镜头把概念原画做成探索镜头,拍摄前评估运动与构图。

专业技巧

  • 把首帧当成开场句;提示词只写接下来发生什么,不要复述画面里已见细节。
  • 不要写「让这张肖像动起来」;改成可见过程:她看向窗外,呼气,再转回来,镜头缓慢推近。
  • 使用第二张图时,两张静帧的人物、光线逻辑与美术方向要相容。
  • 按主体动作 → 场景与光影 → 运镜与机位 → 对白与声音 → 时间线组织提示词。
  • 先用 480p / 5 秒验证运动,结构成立后再渲染 1080p 与更长时长。

注意事项

  • image_urls 需提供 1–2 个公开 http(s) URL;第一张为首帧,可选第二张为尾帧。
  • 生成是异步的;保存 task_id,并在任务到达 finished 或 failed 时停止查询。

Wan 3.0 Prime Image-to-Video API — 常见问题

Wan 3.0 Prime Image-to-Video API 是什么?

Wan 3.0 Prime Image-to-Video 是阿里通义实验室研发的旗舰级图像生成视频模型。它以静态首帧图片为视觉起点并支持可选尾帧图片,生成最长 30 秒、最高 1080p 分辨率、包含高保真原生同步音频的连续视频。基于强化的时空扩散与运动建模架构,它在严格锁定原图主体身份、服装纹理与环境光照的同时,赋予画面平滑自然的动作演绎。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。

Wan 3.0 Prime 图生视频能否在运动中完全锁定人物身份?

能。模型深度锚定首帧中人物的五官结构、发型与服装材质,并在长达 30 秒的连续动态中保持特征稳定。在提示词中补充具体的面部神态与动作方向,能让角色在大幅度动态中依然保持高辨识度。

Wan 3.0 Prime 图生视频支持首尾双帧平滑过渡吗?

支持。在 image_urls 数组中传入首帧和尾帧两张图片,模型会自动解析两帧之间的构图、光影与姿态差异,在指定时长内渲染出自然平滑的时空转场或动作演进,实现精准的定点镜头衔接。

Wan 3.0 Prime 图生视频如何根据画面自动匹配电影级音效?

当 audio 保持开启时,模型会自动分析首帧画面的视觉环境(如森林、引擎舱、雨夜)及提示词指示的动作行为,在去噪过程中同步合成真实的环境底噪与动作撞击声,无需额外准备音频文件。

Wan 3.0 Prime 图生视频上传的首帧图片有什么要求?

支持 JPEG、PNG、BMP 和 WebP 格式,单张图片大小最大支持 20MB。建议选用构图明确、主体对焦锐利且光照充足的高清素材,以利于模型充分捕捉微观材质并展开动态渲染。

Wan 3.0 Prime 图生视频能把静态构图转变为 30 秒大动作吗?

可以。模型支持在 2 到 30 秒内让静帧逐步演绎为大幅度连贯动态。编写提示词时建议描述渐进式的动作演变(例如“人物缓缓起身,走向窗台并推开窗户”),使长镜头运动自然连贯。

已有静止首帧时应该选 Wan 3.0 Prime 图生还是参考生视频?

如果成片的开场镜头必须与所持图片在像素级构图上严密对齐,应选择图生视频端点;如果仅需要参考图片中角色的长相或衣服,而生成视频需要全新的机位、构图和动作起步,则应选择参考生视频端点。