Wan 3.0 Image-to-Video API

alibaba/wan-3.0/image-to-video

Wan 3.0(Image-to-Video)将首帧图片与可选提示词转化为动态视频,支持可选尾帧精准定位和 2–30 秒单次连续生成。它能够牢固保留原始人物面貌、主体质感与背景构图,同时根据指令为画面注入流畅连贯的物理运动与同步声效。

输入

583/20000
首帧 preview
尾帧 preview

输出

已就绪
5 秒 × $0.100/秒 = $0.500

继续使用

示例

Begin exactly from Image 1 and finish on Image 2. In one continuous five-second shot, the suited tabby cat leans forward with mock seriousness, then suddenly face-plants into the keyboard. Papers twitch. The coffee cup stays put. Camera: locked medium shot with a tiny downward tilt at the impact. No cuts. Preserve the cat's face markings, suit, tie, desk, and lighting. Synchronized audio: chair creak, rapid keyboard clacks, a muffled meow. No readable text, letters, numbers, captions, labels, logos, brands, watermarks, advertisements, posters, UI screens, or product packaging.

Start from Image 1. In one continuous five-second shot, the stone frog statue slowly blinks both eyes once, then lifts the tiny sunglasses from the pedestal and slides them onto its face with a self-satisfied pause. Camera: locked medium shot, very slow push-in. No cuts. Keep the courtyard, moss, and stone texture consistent. Synchronized audio: faint stone grit, a soft blink, sunglasses clicking onto stone. No readable text, letters, numbers, captions, labels, logos, brands, watermarks, advertisements, posters, UI screens, or product packaging.

Start from Image 1. In one continuous five-second shot, the refrigerator door stays slightly open while the leftover containers sway gently left and right in a shy little queue, as if waiting their turn. Camera: locked interior shot, almost still. No cuts. Synchronized audio: low fridge hum, soft plastic taps. No readable text, letters, numbers, captions, labels, logos, brands, watermarks, advertisements, posters, UI screens, or product packaging.

Wan 3.0 Image-to-Video

Wan 3.0 Image-to-Video 由阿里通义实验室开发,能够根据一张起始图片和可选提示词生成带同步音频的高清视频。它在生成过程中持续保留原图中的角色形象、物体质感与空间构图,同时根据文字意图赋予画面逼真的物理动态、运镜轨迹与原生环境音效。

为什么选择此模式?

  • 坚固的主体与外观一致性在长达 30 秒的连续运动中,严格锚定原图人物的面容特征、发型服饰与商品材质,避免面部畸变与结构漂移。

  • 可选尾帧精准引导终态支持同时传入首帧与尾帧两张图片,让模型自主推断并生成平滑连贯的动作过渡与转场轨迹。

  • 图文联合指导镜头与物理动作可结合提示词精准指导相机的推拉摇移、光影流动以及主体的行走、转身或微表情变化。

  • 画面同步生成原生环境声音根据画面主体与动作内容自动生成拟真音效与环境底噪,无需在后期环节手动寻找音效配乐。

  • 全规格高清画幅输出提供 480p、720p 与 1080p 阶梯分辨率,默认自适应继承原图纵横比,或按需指定标准商业比例。

参数说明

参数要求说明
image_urls必填

字符串数组。包含 1–2 个公开可访问的图片 HTTP(S) 地址;第 1 张为视频首帧,可选第 2 张为视频尾帧。单张最大 30MB,支持 JPEG、PNG 和 WebP 格式。

prompt可选

字符串。用于指导主体动作、镜头轨迹、光影变化和环境声效;去除首尾空格后支持 1–20,000 个字符。

duration可选

整数。设置生成视频的时长,取值范围为 2–30 秒;体验区默认预设为 5 秒。

默认值5
resolution可选

字符串。指定输出视频的分辨率规格;可选 480p、720p(默认)或 1080p。

默认值720p480p1080p
aspect_ratio可选

字符串。控制画面长宽比例;默认为 adaptive(自适应跟随输入图片比例),也可强制指定 16:9、4:3、1:1、3:4 或 9:16。

默认值adaptive16:94:31:13:49:16
audio可选

布尔值。控制是否同时生成与画面匹配的原生同步音频;默认为 true,与无音频输出同价。

默认值truefalse
seed可选

整数。随机数种子,取值范围为 0–2,147,483,647;固定种子有助于复现相似动态走势。

enable_safety_checker可选

布尔值。开启后对生成内容执行安全合规校验;默认为 true。

默认值truefalse

使用方法

  1. 上传清晰的首帧图片选择主体清晰、光线良好的正面或特写图片作为视频起始帧(单张最大 30MB,分辨率建议 720p 以上)。

  2. 可选配置尾帧图片如果需要视频定向收尾到特定姿态、人物表情或场景构图,可上传第二张图片作为尾帧引导目标终态。

  3. 编写动作与运镜提示词简要描述画面中发生的动态与镜头语言,例如:角色面带微笑缓缓转头看向镜头,微风吹拂发丝,镜头缓慢推近特写。

  4. 设定时长与输出规格拖动滑块设定 2–30 秒时长,选择目标分辨率(推荐 720p 或 1080p),默认画面比例设为 adaptive 以维持原图构图。

  5. 确认声音与高级设置保持音频开关开启以获取自动匹配的动作与环境音效,或根据需要固定随机数种子以重现相似动态。

  6. 提交生成并查看成片点击生成按钮提交异步任务,在右侧输出面板查看实时渲染状态,完成后即可在线播放并下载高清 MP4 视频。

计费说明

Wan 3.0 Image-to-Video 按实际生成的成片秒数计费,费率仅由选择的分辨率决定;开启或关闭音频不影响计费费率(1 积分 = $0.005)。

计费项费率说明
480p10 积分 / 输出秒($0.05 / 秒)基础高清规格。生成默认 5 秒为 50 积分($0.25);生成最长 30 秒为 300 积分($1.50)。
720p(默认)20 积分 / 输出秒($0.10 / 秒)主流高清规格。生成默认 5 秒为 100 积分($0.50);生成最长 30 秒为 600 积分($3.00)。
1080p40 积分 / 输出秒($0.20 / 秒)旗舰全高清规格。生成默认 5 秒为 200 积分($1.00);生成最长 30 秒为 1200 积分($6.00)。

适用场景

  • 电商商品动态展示将商品白底图或场景静物照转化为光影流转的展示短片,立体呈现产品细节与质感。

  • 角色立绘与肖像动态化为动漫角色、游戏立绘或艺术肖像赋予自然的呼吸、眨眼、发丝飘动与生动微表情。

  • 照片纪念影像动态唤醒输入风景或历史人物纪念照片,生成逼真的动态回溯画面并搭配真实生动的环境声场。

  • 分镜首尾帧转场过渡输入分镜开场与结尾画面,自动生成平滑细腻的运动补间与视觉转场衔接。

创作技巧

  • 优先使用高质量首帧源图:首帧图像的分辨率和光影质量直接决定成片质感,建议输入主体边缘锐利、光线层次分明的原图素材。
  • 首尾帧风格与主体保持协调:使用尾帧时,两张图的人物身份、服饰质感与光影基调越接近,中间补间运动的流畅度和稳定性越高。
  • 提示词聚焦动作增量而非重述外观:由于画面主体外观已由原图决定,提示词应重点描述动作的变化过程、物理运动幅度与摄影机推拉轨迹。
  • 推荐保持自适应比例 adaptive:若输入图片并非标准 16:9 或 9:16,保持 adaptive 可避免对源图进行非必要的内容裁剪与形变拉伸。
  • 合理匹配动作幅度与时长:较大幅度的肢体动作建议搭配 8–15 秒生成时长,给模型足够的连续帧空间展现细腻的物理力学过程。

注意事项

  • 首尾帧数量限制:本端点必须提供 1 张首帧图片,可选再提供 1 张尾帧图片,单次请求最多支持上传 2 张图片。
  • 图片格式与体积要求:单张图片文件体积不得超过 30MB,支持标准的 JPEG、PNG 和 WebP 格式,请确保链接可公网直接访问。
  • 整秒时长设定:duration 参数接受 2–30 之间的整数秒,请勿传递浮点数或超出该区间的数值。

Wan 3.0 Image-to-Video API — 常见问题

Wan 3.0 Image-to-Video API 是什么?

Wan 3.0 Image-to-Video 是阿里通义实验室研发的图像生成视频模型。它以静态首帧图片为视觉起点并支持可选尾帧图片,生成最长 30 秒、最高 1080p 分辨率、包含原生同步音频的连续视频。基于 Diffusion Transformer 与 Wan-VAE 3D 时空架构,它在牢固继承原图人物面貌、服装质感与光影构图的同时,赋予画面平滑自然的物理运动。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。

Wan 3.0 图生视频如何指定尾帧引导成片画面?

在 image_urls 数组中传入第二张公开图片链接作为尾帧。模型会自动解析首尾两帧的构图与主体差异,在设定的时长内构建平滑自然的镜头位移与动作演化,实现高度可控的定点动作衔接。

Wan 3.0 图生视频能精准保留原图的衣服质感与面容吗?

能。模型将首帧图片作为外观与构图的锚点,忠实保留角色的面容细节、衣物褶皱纹理与场景固有光照。在提示词中说明具体的运镜方向或肢体位移,可确保角色在运动展开时保持外观前后一致。

只有一张静态图时 Wan 3.0 图生视频会自动生成音效吗?

会。模型具备全模态音画联合生成能力,当 audio 保持开启时,即使未额外提供音频素材,模型也会深度理解首帧画面环境与提示词动作,自动为成片配上精准对齐的环境声场与动作音效。

Wan 3.0 图生视频支持生成竖屏 9:16 短视频吗?

支持。当 aspect_ratio 设为 adaptive 时,视频会默认继承首帧原图的长宽比;若原图不是 9:16,也可以显式选择 9:16 强制生成竖屏视频,满足移动端短视频创作需求。

Wan 3.0 图生视频在长达 30 秒生成中动作会崩解吗?

不会。模型依托前沿的时空连续性建模能力,在 30 秒长时段内能稳定维持物体的物理真实感。建议对于大幅度长镜头,在提示词中规划渐进式的平稳运镜或分段动作节奏,避免瞬时剧烈形变。

有首帧图片时该用 Wan 3.0 图生视频还是参考生视频?

如果成片的开场镜头必须严格以这张图片为第一帧起始画面,应选用图生视频端点;如果只是需要提取图片中的人物容貌或商品细节,而新视频的起始画面和机位需要完全重新设计,则应选用参考生视频端点。