Sora 2 Pro Image to Video API

openai/sora-2-pro/image-to-video

Sora 2 Pro(Image to Video)将高保真静态首帧图片演化为最高 1080p 全高清动态视频,支持 auto 原生画幅与多档分辨率。它能够在严格锁定原图主体身份、微观纹理与精妙光影的同时,赋予画面平滑的三维镜头调度与物理动力学演变。

输入
291
输出
等待运行

生成的视频会显示在这里

填写提示词并添加所需素材,确认设置后点击“运行”。

4 seconds × 80/s = $1.60 (320 积分)
继续使用

示例

The young woman on the balcony turns her head slowly toward the camera and smiles softly, long hair flowing in the golden sunset breeze, cinematic warm light. Natural sound: gentle wind, soft distant ambience, a quiet breath. Realistic motion, no text, no logos.

The impressionist lavender field sways in a gentle evening breeze, brushstroke textures coming alive with subtle motion, dusk light deepening across the canvas. Calm, painterly realistic motion, no text, no logos.

Sunlight and geometric shadows drift slowly across the modernist concrete facade, time-lapse feel, light raking over textured surfaces, minimalist composition. Quiet, calm, realistic architectural motion, no text, no logos.

Sora 2 Pro Image to Video

Sora 2 Pro Image to Video 是 OpenAI 研发的旗舰图像生成视频模型。它以单张静态图片作为视觉锚点,结合文本指令将静态画面扩展为包含电影级光影、微表情变化与原生立体声音频的高清视频。支持 auto 画幅智能适配与最高 1080p 全高清输出,专为品牌商业成片、高端电商视觉升级与超清动态资产制作打造。

为什么选择此端点?

  • 旗舰 1080p 全高清细腻呈现提供 1080p 超清画质,深度保留原图的人脸微毛孔、发丝光泽、金属反光与织物肌理,满足大屏商业成片标准。

  • auto 原生画幅智能跟随独家支持 auto 画幅比例,模型自动识别并严格继承上传图片的原始尺寸比例,帮助保留原图构图。

  • 首帧特征高保真继承与时空稳定基于最强旗舰扩散模型,精准维系角色身份、主体轮廓与空间布光,在大跨度动作演绎中保持形态不畸变崩解。

  • 画面同步原生立体声音频通过对视觉首图与运动提示词的深度联合推理,随视频渲染同步内嵌高动态立体声与环境音场,免去后期配音环节。

  • 多档分辨率与阶梯时长提供 720p/1024p/1080p 三档分辨率及 4 至 20 秒固定时长,可在低成本动态构图测试与商业母带渲染间自由切换。

  • 透明透明的秒级弹性预算按「选定分辨率费率 × 秒数」透明计费,支持按需充值调用,无强制性月费订阅,便于商业项目成本管控。

参数说明

参数要求说明
prompt必填

字符串。描述画面动态演进、主体肢体微动、运镜轨迹与声音环境;去除首尾空格后至少包含 1 个字符。

image_urls必填

字符串数组。包含恰好一张公开可访问的 JPEG、PNG 或 WebP 图片 URL,单图大小不超过 10MB。

duration可选

整数。设置生成视频的时长(秒);可选 4、8、12、16、20,体验区默认预设为 4 秒。

默认值48121620
aspect_ratio可选

字符串。设置视频画幅;可选 auto(自适应原图,默认推荐)、16:9 或 9:16,体验区默认预设为 16:9。

默认值16:9auto9:16
resolution可选

字符串。设置输出分辨率;可选 720p、1024p 或 1080p,体验区默认预设为 1024p。

默认值1024p720p1080p

使用流程

  1. 准备高保真参考图与 API Key获取公网图片链接(JPEG/PNG/WebP,≤10MB),并在请求头中配置 Authorization: Bearer <API_KEY>。

  2. 配置画幅与分辨率选用 auto 画幅以原图长宽比指导输出,并选择 720p、1024p 或 1080p 交付规格与 4–20 秒时长。

  3. 提交任务获取 1080p 成片向 /api/generate/submit 提交 prompt、image_urls 与参数配置,依据 task_id 轮询至 finished 提取 MP4 成片。

计费规则

Sora 2 Pro 旗舰图生视频与文生视频保持相同的费率基准:720p 每秒 48 积分(4s=192 积分)、1024p 每秒 80 积分(4s=320 积分,默认档位)、1080p 每秒 112 积分(4s=448 积分)。按 2,000 积分 / 10 美元标准折算,即用即付,无月费门槛,大额积分充值享受更优折算单价。

规格费率说明
720p 档位(4–20 秒)48 积分/秒(4 秒 192 积分起,约 $0.96)快速图生动效验证,适合高频测试主体动作走向。
1024p 档位(4–20 秒,默认)80 积分/秒(4 秒 320 积分起,约 $1.60)默认预选档位,兼顾顶尖纹理画质与流畅渲染效率。
1080p 档位(4–20 秒)112 积分/秒(4 秒 448 积分起,约 $2.24)全高清超清输出,适用于商业成片广告、精品电商动效与大屏展示。

推荐应用场景

  • 高端奢侈品与工业设计动效展示将静物珠宝、名表与汽车静态渲染图赋予 1080p 级真实光影流转与物理折射,精准还原贵重材质的光学质感。

  • 品牌商业平面海报活化配合 auto 原生画幅,直接将海报或 KV 拓展为超清动态视频,以原有版面构图与角色外观为参考。

  • 影视概念设计与故事板动态试拍将高精度概念艺术画作转换为带运镜调度与环境立体声的 1080p 连续镜头,供剧组直观感受成片视觉冲击力。

  • 游戏全高清立绘与角色动画演绎激活游戏静态立绘,赋予角色细腻的发丝随风摆动、眼波流转与待机呼吸,输出带原生音效的超清展示资产。

创作技巧

  • 建议优先使用 aspect_ratio: "auto",这样能够 1:1 继承输入图片的原始长宽比,避免画面主体被裁剪拉伸。
  • 上传图片建议采用无过度锐化与重度压缩的高分辨率源图,有助于 Pro 模型精确提取皮肤微纹理与布光层次。
  • 在提示词中集中描述肢体动作幅度与镜头调度,避免过多重复描述原图中已有的静态色彩与服饰样式。
  • 描述动作伴随的具体声音细节(如丝绸衣物的摩擦声、红酒倒入玻璃杯的声音),能引导模型生成高保真原生音效。

使用说明

  • image_urls 参数必须传入恰好 1 个有效的公网访问图片 URL,支持 JPEG、PNG、WebP,单张大小 ≤ 10MB。
  • aspect_ratio 支持 auto、16:9 与 9:16,其中 auto 仅在提供 image_urls 时有效,以原图比例为参考。
  • 支持可选 resolution 参数(720p, 1024p, 1080p),默认预选为 1024p,输出带原生音轨的 MP4 视频。

Sora 2 Pro Image to Video API — 常见问题

Sora 2 Pro Image to Video API 是什么?

Sora 2 Pro Image to Video 是 OpenAI 研发用于图像生成视频的旗舰模型。它以单张静态参考图为视觉锚点,结合文本指令将静态画面转化为最高 1080p 全高清、包含原生同步音频的电影质感视频。基于 OpenAI 最强多模态扩散架构,它在严格保留原图主体外观、微观肌理与空间光影的同时,赋予画面平滑的三维运镜与物理动力学演变。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。

Sora 2 Pro 图生视频如何使用 auto 自适应画幅?

在参数中将 aspect_ratio 设为 "auto",模型会自动解析上传图片的原始像素宽高比,以原图画幅指导高清视频生成,减少固定横竖屏比例对构图的约束。

Sora 2 Pro 图生视频支持哪些分辨率?

支持 720p、1024p 与 1080p 三档分辨率(体验区默认预设为 1024p)。1080p 选项专为商业级精细化成片打造,能够完整承载高像素原图的毛孔细节、微小反光与自然阴影过渡。

Sora 2 Pro 图生视频能保持角色面部一致吗?

能。Sora 2 Pro 具备更强的人像面部特征提取与空间投影能力。上传正面清晰且光照均匀的参考图,并在提示词中专注于描述动态动作,模型即可在大幅转头、微笑或走动中始终维持角色面容高度一致。

Sora 2 Pro 图生视频能为静止图片生成环境音效吗?

能。模型具备音画协同推理机制,能识别首帧图像中的场景要素(例如壁炉、海滩、森林或车厢),随画面同步合成真实贴合的立体声环境底噪与动作撞击音效,无需额外音频生成步骤。

Sora 2 Pro 图生视频支持上传几张参考图?

目前端点严格支持输入恰好 1 张首帧参考图片。模型将该图片作为视频的第一帧和主体视觉基准向后平滑展开,image_urls 数组中超过 1 张图片将返回校验错误。

Sora 2 Pro 图生视频单次最长支持多少秒?

单次调用支持生成最长 20 秒视频,提供 4、8、12、16 与 20 秒五档精确时长选择(体验区默认预设为 4 秒)。固定时长档位能够帮助团队在提交任务前准确核算积分开销。