Wan 3.0 Reference-to-Video API

alibaba/wan-3.0/reference-to-video

Wan 3.0(Reference-to-Video)将文本提示词与图像、视频、音频、文档或网页等多模态参考资产转化为动态视频,支持多达 20 项组合素材输入与 2–30 秒单次连续生成。它能够跨镜头稳定继承主体身份、艺术风格与叙事逻辑,同时结合输入资产合成原生音画同步的连贯影像。

输入

631/20000
参考素材总数3/21 · 剩余 18
3/10 · 剩余 7
Reference preview
Reference preview
Reference preview
0/5 · 剩余 5
0/5 · 剩余 5

输出

已就绪
5 秒 × $0.100/秒 = $0.500

继续使用

示例

Use Reference Image 1 only for the proud pigeon with the aviator scarf. Use Reference Image 2 only for the oversized croissant. Use Reference Image 3 only for the subway grab handle. In one continuous five-second shot, the Image 1 pigeon holds the Image 2 croissant in its beak and stands on the Image 3 subway handle, swaying with the train. Camera: waist-height handheld sway matching the subway motion. No cuts. Synchronized audio: subway rumble, a proud coo, a faint pastry flake crunch. No readable text, letters, numbers, captions, labels, logos, brands, watermarks, advertisements, posters, UI screens, or product packaging.

Use Reference Image 1 only for the long-legged Victorian teapot character. Use Reference Image 2 only for the mossy library aisle. In one continuous five-second shot, the Image 1 teapot tiptoes down the Image 2 aisle, pausing to inspect a shelf, lid tilting like a polite nod. Camera: tracking follow from behind and slightly beside, staying at teapot-eye height. No cuts. Synchronized audio: porcelain foot taps, a floorboard creak, a hushed library room tone. No readable text, letters, numbers, captions, labels, logos, brands, watermarks, advertisements, posters, UI screens, or product packaging.

Parse Reference Document 1 as a one-page playful science comic about why toast usually lands butter-side down. Produce one continuous five-second explainer animation: the toast slides off a table, rotates in the air, and lands butter-side down while a tiny curious cat watches. Keep the homemade paper-comic look. No product brands, no advertisements, no logos. Camera: simple locked comic-panel push that follows the fall. No cuts. Synchronized audio: plate scrape, brief whoosh, buttered toast slap, a tiny cat chirp.

Wan 3.0 Reference-to-Video

Wan 3.0 Reference-to-Video 由阿里通义实验室研发,支持引入多张图片、视频片段、音频、PPT/PDF文档或网页作为引导资产,结合自然语言提示词生成全新高清视频。它能够在单次 2–30 秒的生成中跨场景保持角色容貌、服饰设计与艺术风格的高度一致,并根据参考资产直接合成原生同步音轨。

为什么选择此模式?

  • 全模态参考资产输入单次请求支持组合引入图片(最多 10 张)、视频(最多 5 段)、音频(最多 5 段)以及 PPT/PDF 文档或公开网页,资产总数可达 20 项。

  • 高保真角色与风格一致性通过跨素材特征对齐,长效锁定主角面容、服装细节与特定艺术渲染质感,满足连续剧集与长线 IP 创作需求。

  • 文档与网页智能提炼支持直接传入 1 份结构化文档(PPT/PDF/DOC等)或公开网页链接,自主理解图文要点并转化为连贯的解说动态视频。

  • 原生音画全模态联合生成根据输入的参考音频音色或画面动作意图,由扩散模型底层直接合成匹配环境底噪与动作声效的 30 fps 高清视频。

  • 长达 30 秒 1080p 成片支持 2–30 秒整秒时长及最高 1080p 原生分辨率,满足影视分镜、广告提案与社交自媒体专业交付标准。

参数说明

参数要求说明
prompt必填

字符串。详细描述创作目标、各参考资产的角色定位、时序动作与镜头语言;去除首尾空格后支持 1–20,000 个字符。

reference_image_urls可选

字符串数组。用于提供角色肖像、场景设定或道具图,最多支持 10 张;单张图片不超过 30MB,支持 JPEG、PNG 和 WebP。

reference_video_urls可选

最多 5 个公开 HTTP(S) 参考视频 URL,用于引导动作、运镜或节奏。

reference_audio_urls可选

字符串数组。用于提供音色参考、对白节奏或环境声源,最多支持 5 个;单个文件不超过 50MB,支持 MP3、WAV 格式。

reference_file_urls可选

最多 1 个公开 HTTP(S) 文档 URL,与 reference_link_urls 互斥。

reference_link_urls可选

字符串数组。最多包含 1 个免登录公开网页 URL;与 reference_file_urls 互斥。

duration可选

整数。设置生成视频的时长,取值范围为 2–30 秒;体验区默认预设为 5 秒。

默认值5
resolution可选

字符串。指定输出视频的分辨率规格;可选 480p、720p(默认)或 1080p。

默认值720p480p1080p
aspect_ratio可选

字符串。控制画面长宽比例;支持 adaptive(自适应参考素材)、16:9、4:3、1:1、3:4 和 9:16。

默认值adaptive16:94:31:13:49:16
audio可选

布尔值。控制是否同时生成与画面匹配的原生同步音频;默认为 true,与无音频输出同价。

默认值truefalse
seed可选

整数。随机数种子,取值范围为 0–2,147,483,647;固定种子有助于复现相似动态走势。

enable_safety_checker可选

布尔值。开启后对生成内容执行安全合规校验;默认为 true。

默认值truefalse

使用方法

  1. 准备并上传参考素材根据创作目的选择素材:可上传主角正面/侧面图片(最多 10 张)、动态动作参考视频(最多 5 个)、音色音频,或选择上传一份商业 PPT 文档/输入网页链接。

  2. 在提示词中明确分配资产角色使用清晰的代词指引模型关注特定素材,例如:以参考图1的人物作为主角,结合参考图2的机械手套道具,在参考图3设定的未来实验室内活动。

  3. 细化剧情发展与运镜轨迹按时间顺序说明故事动作推进,并指定镜头语言,例如:主角缓步走向实验台拿起道具,镜头顺畅环绕并切入特写。

  4. 设置时长与分辨率规格根据叙事复杂度设定 2–30 秒的时长,选择 720p 或 1080p 分辨率,若素材包含特定画幅可将画面比例设为 adaptive 或 16:9。

  5. 检查声音与资产互斥限制确认保持音频生成开关开启以合成匹配音轨;若传入文档,请确认未同时传入网页链接。

  6. 提交生成并获取高保真成片点击立即生成提交异步请求,在右侧渲染控制台跟踪状态并在完成后直接播放、核验角色一致性与下载视频。

计费说明

Wan 3.0 Reference-to-Video 按实际生成的成片秒数计费,费率仅由选择的分辨率决定;多模态参考素材的上传解析与音频合成不产生额外附加费(1 积分 = $0.005)。

计费项费率说明
480p10 积分 / 输出秒($0.05 / 秒)基础高清规格。生成默认 5 秒为 50 积分($0.25);生成最长 30 秒为 300 积分($1.50)。
720p(默认)20 积分 / 输出秒($0.10 / 秒)主流高清规格。生成默认 5 秒为 100 积分($0.50);生成最长 30 秒为 600 积分($3.00)。
1080p40 积分 / 输出秒($0.20 / 秒)旗舰全高清规格。生成默认 5 秒为 200 积分($1.00);生成最长 30 秒为 1200 积分($6.00)。

适用场景

  • IP 角色跨场景连续故事创作输入主角三视图与服饰参考图,在不同背景下生成角色动作连贯、面部恒定的 2–30 秒短剧分镜。

  • PPT 文档与方案动态解说上传商业提案、培训课件或产品发布 PDF/PPT,自动提取核心图文并转化为配有画外音氛围的宣讲视频。

  • 新闻资讯与网页内容视频化输入公开文章或产品落地页链接,模型自动提炼文字结构生成图文并茂的短视频动态资讯。

  • 指定动作与动态风格迁移输入已有动作视频片段与新的角色肖像图,引导模型将角色的运动姿态与镜头运动迁移至新角色成片中。

创作技巧

  • 多角度素材构建完整立体特征:提供 2–3 张主角在不同光影、正面与半侧面视角下的参考图片,能够大幅增强角色在转身走动时的形体稳定性。
  • 在提示词中精确建立资产绑定:使用“参考图1的主角穿着参考图2的机能外套”等明确绑定短语,避免多资产组合时特征相互混淆。
  • 遵守文档与网页的互斥规则:单次任务中,文档(reference_file_urls)与网页(reference_link_urls)二选一,请勿在同一请求中同时传入两者。
  • 文档内容保持清晰:突出核心图表和正文层次,便于提取重点并安排视频叙事。
  • 分镜头长故事制作策略:制作多镜头短剧时,建议使用固定的参考图片集生成各个分镜头,再进行串联剪辑,实现全片视觉高度统一。

注意事项

  • 参考素材总量上限:单次请求中所有参考资产总数不得超过 20 项(图片最多 10 张,视频最多 5 段,音频最多 5 段,文档/网页最多 1 项)。
  • 文档与网页互斥约束:reference_file_urls 与 reference_link_urls 属于互斥参数,同一任务只能指定其中一种。
  • 整秒时长设定:duration 参数接受 2–30 之间的整数秒,请勿传递浮点数或超出该区间的数值。

Wan 3.0 Reference-to-Video API — 常见问题

Wan 3.0 Reference-to-Video API 是什么?

Wan 3.0 Reference-to-Video 是阿里通义实验室研发的全模态参考生成视频模型。它支持组合文本提示词与图片、视频、音频、结构化文档或公开网页链接(总计多达 20 项参考资产),生成最长 30 秒、最高 1080p 的原生音画同步视频。基于多模态对齐与 Diffusion Transformer 架构,它能够跨镜头精准继承角色的面容外观、动作姿态或文档核心内容,实现高一致性的全新场景创作。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。

Wan 3.0 参考生视频能直接上传 PPT 或 PDF 出片吗?

可以。在 reference_file_urls 中传入一份结构化文档链接(支持 PPT、PPTX、PDF、DOCX、TXT、MD 等格式),模型能自动解析文档的图文结构与排版逻辑,并结合提示词转化为包含解说声场与动态运镜的专业讲解视频。

Wan 3.0 参考生视频能同时使用文档与网页链接吗?

不能。结构化文档(reference_file_urls)与网页链接(reference_link_urls)存在互斥约束,单次任务中只能二选一传入其一(最多 1 个)。如需补充更多视觉或声音参考,可搭配使用参考图片、视频或音频素材。

Wan 3.0 参考生视频最多支持传入几份参考资产?

单次调用总共支持传入最多 20 项素材组合,具体包括:最多 10 张参考图片、最多 5 个参考视频、最多 5 段参考音频,以及最多 1 个文档或网页链接。多素材组合极大丰富了复杂故事的创作灵活性。

如何在提示词中对 Wan 3.0 参考生视频的多主体进行点名?

建议使用分工指代语法,例如在提示词中写清“使用参考图 1 确定主角面容与风衣,使用参考图 2 确定手持道具,使用参考视频 1 引导行走步伐”。精准的点名指代能让模型将不同素材的特征分别绑定到对应实体。

传入参考音频后 Wan 3.0 参考生视频如何处理声音?

当传入 reference_audio_urls 时,模型会提取参考音频的音色、语调或旋律节奏,并将其与视频画面的主体动作、口型动态及环境底噪有机融合,生成音画节奏自然契合的视听成片。

如何提供文档参考?

在 reference_file_urls 中提供一个公开可访问的 HTTP(S) 文档 URL,不要同时提供 reference_link_urls。