Animate the supplied first frame in one continuous three-second underwater macro shot. Keep the same single translucent jellyfish and dark blue water. Its bell contracts once and relaxes, carrying it gently upward while fine tentacles follow smoothly and tiny suspended particles drift independently. Preserve the intricate transparent tissue and soft refracted highlights. Almost stationary camera, subtle underwater ambience, no speech or music. No logos, brands, advertising, captions, subtitles or watermarks.
Happy Horse 1.1 Image to Video API
alibaba/happyhorse-1.1/image-to-videoHappy Horse 1.1 Image to Video 将单张静态图片转化为 3–15 秒 720p 或 1080p 电影级动态视频,支持原生同步音频合成、自然物理动态呈现与丰富肌理细节。它能够在严格保留原图主体面貌、光影氛围与构图基调的同时,呈现逼真的运镜轨迹、人物微表情与环境音效。
图生视频需要恰好一张首帧图片。
生成的视频会显示在这里
填写提示词并添加所需素材,确认设置后点击“运行”。
示例
REST API
快速开始
使用 API 认证,提交首帧图片与可选提示词,通过任务 ID 获取生成的动态视频。
连接到 Vidgo API
创建 API 密钥,仅保存在服务器上,并发送 Authorization: Bearer VIDGO_API_KEY。
- 端点
- POST
https://api.vidgo.ai/api/generate/submit - 认证
- Authorization: Bearer VIDGO_API_KEY
提交一次图生视频任务
按请求示例填写输入,image_urls 中包含 1 张图片地址,model 必须是 alibaba/happyhorse-1.1/image-to-video。
REQUEST_BODY=$(cat <<'JSON'
{
"model": "alibaba/happyhorse-1.1/image-to-video",
"input": {
"prompt": "Animate this first frame as one continuous five-second intimate documentary shot. Preserve this adult ceramic artist, face, clay vessel, hands, clothing and sunlit pottery studio. The wheel rotates gently while both wet hands steadily guide the rim without changing the vessel into another object. The artist glances up and calmly says exactly in Mandarin Chinese, \"慢一点,形就稳了。\" Clearly synchronized lips, natural small hand movements, soft wheel hum and wet-clay rubbing sounds. Very slow camera push-in, no cuts, no music. No logos, brands, advertising, captions, subtitles or watermarks.",
"duration": 5,
"resolution": "1080p",
"seed": 11101,
"image_urls": [
"https://cdn.vidgo.ai/apis/models/alibaba/happyhorse-1.1/image-to-video/v1/01/input-01.png"
]
}
}
JSON
)
RESPONSE=$(curl --silent --show-error --fail-with-body \
--request POST \
--url "https://api.vidgo.ai/api/generate/submit" \
--header "Authorization: Bearer $VIDGO_API_KEY" \
--header "Content-Type: application/json" \
--data "$REQUEST_BODY")
CODE=$(printf '%s' "$RESPONSE" | jq -r '.code // empty')
if [ "$CODE" != "0" ] && [ "$CODE" != "200" ]; then
printf 'API error: %s
' "$RESPONSE" >&2
exit 1
fi
printf '%s
' "$RESPONSE"等待结果
用 task_id 查询,not_started/running 时继续,finished/failed 时停止。成功后读取 data.files[].file_url。
跟踪状态
GET https://api.vidgo.ai/api/generate/status/{task_id}以 2 秒为基准轮询状态,任务较长时加大间隔。仅在 not_started 或 running 时继续,finished 或 failed 时停止。也可以在请求中指定 callback_url 接收 webhook。
not_startedrunningfinishedfailed{
"code": 200,
"data": {
"task_id": "8JNIJZHJGDA8ALKR",
"status": "running",
"created_time": "2026-09-21T17:18:07"
}
}{
"code": 200,
"data": {
"task_id": "task-unified-...",
"status": "finished",
"files": [
{
"file_url": "https://storage.vidgo.ai/generated/video.mp4",
"file_type": "video"
}
],
"created_time": "2026-08-22T10:00:00Z",
"progress": 100,
"error_message": null
}
}完整可运行示例
展开查看包含 HTTP 与业务码检查、task_id 校验、轮询、终态处理和超时边界的完整代码。
set -euo pipefail
: "${VIDGO_API_KEY:?Set VIDGO_API_KEY in your environment}"
REQUEST_BODY=$(cat <<'JSON'
{
"model": "alibaba/happyhorse-1.1/image-to-video",
"input": {
"prompt": "Animate this first frame as one continuous five-second intimate documentary shot. Preserve this adult ceramic artist, face, clay vessel, hands, clothing and sunlit pottery studio. The wheel rotates gently while both wet hands steadily guide the rim without changing the vessel into another object. The artist glances up and calmly says exactly in Mandarin Chinese, \"慢一点,形就稳了。\" Clearly synchronized lips, natural small hand movements, soft wheel hum and wet-clay rubbing sounds. Very slow camera push-in, no cuts, no music. No logos, brands, advertising, captions, subtitles or watermarks.",
"duration": 5,
"resolution": "1080p",
"seed": 11101,
"image_urls": [
"https://cdn.vidgo.ai/apis/models/alibaba/happyhorse-1.1/image-to-video/v1/01/input-01.png"
]
}
}
JSON
)
SUBMIT_RESPONSE=$(curl --silent --show-error --fail-with-body \
--request POST \
--url "https://api.vidgo.ai/api/generate/submit" \
--header "Authorization: Bearer $VIDGO_API_KEY" \
--header "Content-Type: application/json" \
--data "$REQUEST_BODY")
TASK_ID=$(printf '%s' "$SUBMIT_RESPONSE" | jq -r '.data.task_id // .task_id // empty')
BUSINESS_CODE=$(printf '%s' "$SUBMIT_RESPONSE" | jq -r '.code // empty')
if [ "$BUSINESS_CODE" != "0" ] && [ "$BUSINESS_CODE" != "200" ]; then
printf 'Submit failed:
%s
' "$SUBMIT_RESPONSE" >&2
exit 1
fi
if [ -z "$TASK_ID" ]; then
printf 'Submit response did not include task_id:
%s
' "$SUBMIT_RESPONSE" >&2
exit 1
fi
START_TIME=$(date +%s)
POLL_DELAY=2
while true; do
if [ $(( $(date +%s) - START_TIME )) -ge 600 ]; then
printf 'Timed out after 600 seconds
' >&2
exit 1
fi
STATUS_RESPONSE=$(curl --silent --show-error --fail-with-body \
--url "https://api.vidgo.ai/api/generate/status/$TASK_ID" \
--header "Authorization: Bearer $VIDGO_API_KEY")
STATUS=$(printf '%s' "$STATUS_RESPONSE" | jq -r '.data.status // .status // empty')
BUSINESS_CODE=$(printf '%s' "$STATUS_RESPONSE" | jq -r '.code // empty')
if [ "$BUSINESS_CODE" != "0" ] && [ "$BUSINESS_CODE" != "200" ]; then
printf 'Status request failed:
%s
' "$STATUS_RESPONSE" >&2
exit 1
fi
case "$STATUS" in
finished)
printf '%s' "$STATUS_RESPONSE" | jq -r '(.data.files // .files // [])[]?.file_url'
break
;;
failed)
printf '%s' "$STATUS_RESPONSE" | jq -r '.data.error_message // .error_message // "Generation failed"' >&2
exit 1
;;
not_started|running)
sleep "$POLL_DELAY"
if [ "$POLL_DELAY" -lt 10 ]; then POLL_DELAY=$((POLL_DELAY + 1)); fi
;;
*)
printf 'Unexpected task status: %s
' "$STATUS" >&2
exit 1
;;
esac
done输入参数
下表列出可用输入参数、类型和默认值。请求示例还包含顶层 model 字段。
| 字段 | 类型 | 必填 | 默认 | 说明 |
|---|---|---|---|---|
| prompt | string | null | 否 | — | 去除首尾空白后最多 2500 个 Unicode 字符。可省略;null、空字符串或纯空白会被忽略。 |
| image_urls | string[] | 是 | — | 恰好 1 张首帧图片,支持公开 HTTP(S) URL、图片 Data URI 或原始 Base64。 |
| resolution | string | 否 | 1080p | 720p 或 1080p,默认 1080p。 |
| duration | integer | 否 | 5 | 3–15 秒整数,默认 5 秒。 |
| seed | integer | 否 | — | 可选整数,范围 0–2147483647。不指定时省略。 |
| enable_safety_checker | boolean | 否 | — | 可选布尔值;未指定时不发送。 |
响应字段
提交任务返回 task_id;状态查询接口返回生命周期进度和视频资源。
| 字段 | 类型 | 说明 |
|---|---|---|
| code | integer | 业务响应码,成功为 200。 |
| data.task_id | string | 用于轮询进度的唯一任务标识。 |
| data.status | string | 生命周期状态:not_started、running、finished 或 failed。 |
| data.progress | integer | 生成进度百分比 (0–100)。 |
| data.files[].file_url | string | 生成的视频资源公开下载链接。 |
| data.files[].file_type | string | 文件类型标识,例如 video。 |
| data.error_message | string | null | 任务失败时的具体错误说明。 |
任务生命周期
仅在 not_started 或 running 时继续轮询,进入 finished 或 failed 时停止。
not_started任务已在队列中排队,等待执行。
running任务正在生成中,请保持轮询。
finished任务已完成,可从 data.files[].file_url 读取视频地址。
failed任务生成失败,请读取 data.error_message 并停止轮询。
轮询与错误处理
- 认证遇到 401 时,检查 Authorization 中的 Bearer API key,更新凭证后重试。
- 校验遇到 400 时,根据响应检查必填输入、参数值和可用积分,再重新提交。
- 网络和超时状态查询遇到网络错误或超时,保留原 task_id 并重试查询。
- 轮询间隔以 2 秒为基准轮询状态,任务较长时逐步加大间隔。
- 终态仅在 not_started 或 running 时继续。finished 或 failed 立即停止。
- 回调选项可在请求顶层提供 callback_url 接收最终任务对象;投递失败时仍可轮询。
端点限制
| 规格 | 值 | 详情 |
|---|---|---|
| prompt | 2500 | 去除首尾空白后最多 2500 个 Unicode 字符。可省略;null、空字符串或纯空白会被忽略。 |
| image_urls | 1 | 恰好 1 张首帧图片,支持公开 HTTP(S) URL、图片 Data URI 或原始 Base64。 |
| resolution | 1080p | 720p 或 1080p,默认 1080p。 |
| duration | 5 | 3–15 秒整数,默认 5 秒。 |
Happy Horse 1.1 Image to Video
Happy Horse 1.1 Image to Video 能够将单张静止图片赋予逼真的视听生命。传入单张首帧图片地址(支持 HTTP/HTTPS URL、Data URI 或 Base64 编码),并可选择性附带最多 2,500 字符的动作与运镜提示词。模型能够在深度保留输入图像面部特征、服饰质感与构图层次的前提下,完成流畅的物理运动演化,并在单次推理中同步匹配生成环境拟音或对白声音。
核心能力与优势
严格保留首帧主体特征深度锁定原图角色的五官轮廓、服饰细节与商品形态,在动作演进过程中保持高度一致不形变。
自动继承原图画面比例成片画幅自动对齐输入图片的宽高尺寸,无需手动适配比例,杜绝画面拉伸畸变或边缘黑边。
单次推理生成匹配音频画面动效产生的同时原生匹配环境音效、物理拟音与背景旋律,无需额外寻找素材配音。
无提示词自主智能演变支持不写提示词直接生成,模型自主理解静态画面的空间逻辑与氛围,赋予自然的物理动效。
导演级运镜与肢体调度支持通过提示词精准控制镜头推拉摇移、人物微表情与肢体动作,实现预期中的专业影视调度。
支持 7 语口型同步驱动静态人像可结合对白提示词直接转化为开口说话的数字人口播成片,唇形与多国语言精准契合。
参数
| 参数 | 要求 | 说明 |
|---|---|---|
| prompt | 可选 | 去除首尾空白后最多 2500 个 Unicode 字符。可省略;null、空字符串或纯空白会被忽略。 |
| image_urls | 必填 | 恰好 1 张首帧图片,支持公开 HTTP(S) URL、图片 Data URI 或原始 Base64。 |
| resolution | 可选 | 720p 或 1080p,默认 1080p。 |
| duration | 可选 | 3–15 秒整数,默认 5 秒。 |
| seed | 可选 | 可选整数,范围 0–2147483647。不指定时省略。 |
| enable_safety_checker | 可选 | 可选布尔值;未指定时不发送。 |
如何调用 Happy Horse 1.1 Image to Video API
挑选清晰的首帧原图选用主体突出、曝光均匀、轮廓清晰的高质量单张静态摄影或插画素材。
填入图片输入参数将图片地址以单元素数组形式传入 image_urls 字段中。
补充动作与声音提示词(可选)若有特定动作或对白要求,在 prompt 中详细说明镜头轨迹、人物举止或台词内容。
选择生成时长与分辨率设定 3 至 15 秒的目标成片长度,并选定 720p 或 1080p 规格档位。
发起异步任务调用调用 API 提交任务或在控制台体验区点击运行启动生成。
提取并播放完成视频轮询 task_id 状态,待任务显示 finished 后下载内嵌匹配声音的 MP4 视频。
价格
费用 = 输出时长 × 分辨率每秒费率。1 积分 = $0.005;三种模式同价。生成失败全额返还点数。
| 用途 | 费率 | 详情 |
|---|---|---|
| 720p | 22 积分/秒 ($0.11/秒) | 5 秒:110 积分 ($0.55) |
| 1080p | 28 积分/秒 ($0.14/秒) | 5 秒:140 积分 ($0.70) |
适用场景
电商商品动态广告化将普通静物商品照一键转为具备光影流转与高级环境声的动态视频广告,大幅提升点击转化率。
角色肖像与虚拟主播驱动将单张人物插画或员工定妆照转化为包含 7 语口型同步的生动口播成片,赋能知识讲解与品牌播报。
老照片与历史影像生动化为黑白老照片或珍贵档案肖像赋予自然的眼神转动、呼吸微动与年代感环境音效,焕发历史生机。
视觉概念设计动态预演建筑设计效果图、场景插画一键添加微风、光照与镜头漫游,快速向客户汇报空间设计意图。
使用技巧
- 人物肖像生成时,建议加入面带温和微笑,自然眨眼呼吸,镜头缓慢推近等细微动态描写,人物更具生命力。
- 若需要人物开口讲话,可在提示词中用双引号加入台词并注明语种(如角色注视镜头用普通话说:“欢迎大家来到直播间”,背景伴随轻微室内混响)。
- 风景、流水、云层或静物特写可尝试完全留空 prompt,让模型根据画面材质自主推演最为真实的自然运动规律。
- 电商商品展示推荐配合环绕运镜提示(如摄像机缓慢环绕展示手表金属拉丝质感,灯光折射光斑流转),打造商业广告质感。
使用说明
- image_urls 数组中仅允许传入恰好 1 张首帧图片;需要多张参考图融合时请使用 Reference to Video 端点。
- 无须传参 aspect_ratio,模型将自动锁定并继承输入原图的纵横比例。
- 输出文件为带有音频轨道的 MP4 视频,如需纯静音背景可在提示词中写明静音或轻微室内环境音。
- 提示词为可选参数(最多 2,500 字符),可留空由模型自主推演自然物理运动。
相关模型
Happy Horse 1.1 Image to Video API 常见问题
Happy Horse 1.1 Image to Video API 是什么?
Happy Horse 1.1 Image to Video 是阿里巴巴研发的单图生成视频模型。它将单张静态首帧图像转化为 3–15 秒 720p 或 1080p 电影级高保真视频,具备原生同步音频生成、自然物理动态呈现与丰富肌理细节。基于统一的单流自注意力 Transformer 架构,它在严格保留原图主体面貌、构图光影与色彩基调的同时,呈现逼真的运镜轨迹与环境声音。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。
Happy Horse 1.1 Image to Video 如何保持原图中的人物身份一致?
模型直接将输入首帧的深层视觉特征作为时空演化的起点与约束,在动态运动与视角变化中始终锚定角色的面部结构、发型与服饰纹理,避免换脸或五官失真。
Happy Horse 1.1 Image to Video 可以在不写提示词的情况下生成视频吗?
可以。当 prompt 参数留空或未填写时,模型会自动分析画面空间结构与视觉元素,依据常识物理规律推演合理的动态效果与匹配的自然环境声音。
Happy Horse 1.1 Image to Video 生成的视频带有声音吗?
带有声音。模型采用单次前向音画联合生成机制,不仅根据画面生成微风、水流、引擎等环境声,还支持根据提示词中的对白内容生成同步台词与对应口型。
Happy Horse 1.1 Image to Video 生成的视频画幅比例由什么决定?
生成视频的宽高比由上传的首帧输入图片原生比例决定。模型会自动适配原图尺寸,请求时无须传入额外的 aspect_ratio 参数。
哪些图片格式和画质更适合 Happy Horse 1.1 Image to Video?
建议使用主体对焦清晰、光照均匀、无明显压缩伪影的 JPG、PNG 或 WEBP 格式图片。主体轮廓清晰的肖像或景物通常能获得最平稳的动作演化。
如何在 Happy Horse 1.1 Image to Video 中控制镜头运镜?
你可以在提示词中使用影视运镜词汇(例如镜头缓慢推向面部特写、向右平移追踪主体或轻微手持跟随感)。将运镜描述单独写成一句可获得最佳遵循度。
Happy Horse 1.1 Image to Video 的点数如何扣除?
费用按请求生成的整秒数乘以对应画质费率计算:720p 为每秒 22 点数,1080p 为每秒 28 点数。生成失败或异常终止将全额退还扣除点数。















