Happy Horse 1.1 Text to Video API

alibaba/happyhorse-1.1/text-to-video

Happy Horse 1.1 Text to Video 将纯文本提示词转化为 3–15 秒 720p 或 1080p 电影级视频,支持原生单次前向音视频合成、7 种语言高保真口型同步与生动的物理动作表现。它能够在严格遵循复杂场景与分镜描述的同时保持时空连贯性,并在单次推理中同步输出对白、环境音效与配乐。

输入
654/2500
输出
等待运行

生成的视频会显示在这里

填写提示词并添加所需素材,确认设置后点击“运行”。

1080p · 5 秒 × 28 积分/秒 = 140 积分 ($0.700)
继续使用

示例

Three-second continuous side-tracking sports documentary shot at a sunlit concrete skatepark. One adult BMX rider wearing a matte teal helmet performs a single low bunny hop over a painted line and lands both wheels smoothly. Begin already rolling, show the complete small hop and finish rolling away. Plausible bicycle geometry, two wheels stay attached, natural body balance, crisp tire contact and short landing thud, no speech or music. No logos, brands, advertising, captions, subtitles or watermarks.

A three-second handmade stop-motion scene in a miniature rehearsal room, square composition. A charming human-shaped coral-clay drummer wearing a turquoise shirt sits at one small yellow snare drum and practices a short relaxed rhythm using two wooden sticks. Each audible dry drum tap follows a visible stick contact, with small natural head nods and body bounces. The left and right hands remain anatomically coherent and the drum stays in place. Visible clay fingerprints, tactile felt acoustic panels, warm rehearsal-room light, steady frontal camera, consistent character and instrument. Only the natural snare taps and quiet room ambience, no speech or background music. No logos, brands, advertising, captions, subtitles or watermarks.

Happy Horse 1.1 Text to Video

Happy Horse 1.1 Text to Video 能够仅凭文字描述直接生成包含原生同步声音的完整视频。你可以在最多 2,500 字符的提示词中细致描绘环境、角色、运镜调度与声音细节,并自由设定 3 至 15 秒整数时长、720p 或 1080p 分辨率,以及 9 种常用画幅比例。模型采用联合生成机制,单次前向推理即可同步呈现连贯画面、角色对白、环境拟音与背景旋律。

核心能力与优势

  • 音视频单次原生同生视频画面与音频轨道一次前向推理完成,告别后期寻找音效、外挂配音与二次唇形对齐流程。

  • 7 种语言高精口型对齐支持英语、普通话、粤语、日语、韩语、德语与法语的音素级唇形同步,人物说话自然生动。

  • 扎实流畅的物理动态全面优化运动规律与时序连续性,在奔跑、舞蹈、动作戏等快节奏场景中保持画面平稳不抽搐。

  • 灵活的分镜时序控制支持在提示词中通过 0-4s、4-8s 等时间戳标记编排前后动作、镜头推拉与台词节拍。

  • 覆盖 9 种主流构图画幅原生支持从 21:9 宽银幕到 9:16 竖屏短视频等 9 种比例,无须二次拉伸裁剪即可多平台分发。

  • 按秒级透明预估计费严格按生成秒数与分辨率单价计算扣除点数,计费规则清晰可预测,任务异常全额退还。

参数

参数要求说明
prompt必填

去除首尾空白后最多 2500 个 Unicode 字符。必须填写非空提示词。

resolution可选

720p 或 1080p,默认 1080p。

duration可选

3–15 秒整数,默认 5 秒。

aspect_ratio可选

支持 21:9, 16:9, 4:3, 1:1, 3:4, 4:5, 5:4, 9:16, 9:21,默认 16:9。

seed可选

可选整数,范围 0–2147483647。不指定时省略。

enable_safety_checker可选

可选布尔值;未指定时不发送。

如何调用 Happy Horse 1.1 Text to Video API

  1. 构思场景与角色在提示词开头明确场景空间、时代风格、光线质感以及画面核心人物的外观特征。

  2. 编排动作与镜头语言清晰描述角色的肢体动态与镜头调度方式(例如特写推近、平移跟随或低角度仰拍)。

  3. 补充对白与听觉细节用双引号注明角色台词并说明所用语言以激活精准口型,同时补充脚步声、风雨声或背景旋律。

  4. 配置时长与画幅规格设置 3–15 秒目标时长,指定 720p 或 1080p 分辨率,并选定所需的画面比例。

  5. 提交任务并进行计算调用异步生成接口或在上方体验区点击运行按钮发起视频创建任务。

  6. 获取并下载成片轮询任务状态直至完成,读取返回的 MP4 链接查看内嵌高保真声音的视频成果。

价格

费用 = 输出时长 × 分辨率每秒费率。1 积分 = $0.005;三种模式同价。生成失败全额返还点数。

用途费率详情
720p22 积分/秒 ($0.11/秒)5 秒:110 积分 ($0.55)
1080p28 积分/秒 ($0.14/秒)5 秒:140 积分 ($0.70)

适用场景

  • 广告创意与影视预演将编剧脚本与分镜剧本迅速转化为包含对白与配乐的动态概念视频,提升团队提案效率。

  • 社媒竖屏短视频创作为 TikTok、视频号、短剧平台批量创作 9:16 剧情段落,具备口型对齐与自然情绪表达。

  • 游戏过场与概念动画快速生成具备影视质感与环境音效的角色登场、技能演练或故事交代镜头。

  • 跨境营销多语口播生成英语、日语、韩语、法语、德语等多语种原声口型视频,助力品牌本地化海外投放。

使用技巧

  • 建议采用时间区间分段法撰写提示词(例如 0-3秒:侦探在雨夜街道快步前行;3-5秒:镜头推向面部特写,他用普通话说出关键线索),以实现更精准的时序控制。
  • 详细描写声学细节有助于声画模型协同建构,如写清高跟鞋踏在湿漉石板路上的清脆声音与远处的警笛混响,成片声音层次更为丰满。
  • 将人物自身动作与摄像机运动拆分到不同句子中表达,能让画面构图与人物动态各自保持稳定可控。
  • 构思大型场景时,可先以 5 秒 720p 规格快速测试分镜感觉,确认无误后再生成 15 秒 1080p 最终版本。

使用说明

  • 提示词长度须在 1 至 2,500 个字符之间,纯空白字符将在任务提交时被拦截且不扣费。
  • 视频生成为异步任务,提交后使用返回的 task_id 查询任务进度,直到状态变更为 finished 或 failed。
  • 音频由模型在视频合成时原生一并产出,输出的 MP4 文件已内嵌完整音轨,无需额外合并音频文件。
  • 画幅默认为 16:9,提供 9 种原生比例供选择,可直接输出符合不同分发渠道构图的成片。

相关模型

Happy Horse 1.1 Text to Video API 常见问题

Happy Horse 1.1 Text to Video API 是什么?

Happy Horse 1.1 Text to Video 是阿里巴巴研发的文本生成视频模型。它根据文本提示词生成 3–15 秒 720p 或 1080p 电影级高保真视频,具备原生同步音频生成、7 种语言口型对齐以及流畅的物理动作表现能力。基于统一的单流自注意力 Transformer 架构,它在严格遵循提示词细节与多镜头节奏的同时,呈现细腻逼真的动态光影与时空连贯性。你可以通过 API 进行程序化调用,也可以在上方体验区直接在线试用。

Happy Horse 1.1 Text to Video 支持纯文本生成口型对白的视频吗?

支持。只要在提示词中包含用双引号包裹的对白台词并说明语种,模型在生成视频帧的同时会自动合成符合发音节奏的语音,并让画面人物的嘴形肌肉精确匹配对应发音。

Happy Horse 1.1 Text to Video 支持哪些语言的口型同步?

该模型原生支持英语、普通话、粤语、日语、韩语、德语与法语共 7 种语言的高精度口型同步。在提示词中明确指定台词语言即可引导模型展现地道的发音节奏与面部口型。

如何在 Happy Horse 1.1 Text to Video 提示词中控制多镜头时序?

你可以在提示词中使用明确的秒数范围标注(例如 0-4秒 与 4-8秒)。模型能够识别时序分段指示,依次安排前后动作转换、镜头视角切换与人物台词节奏。

Happy Horse 1.1 Text to Video 单次可以生成多长时间和分辨率?

单次任务支持生成 3 至 15 秒之间的任意整数秒时长,默认预设为 5 秒。画面分辨率提供 720p 与 1080p 两种选项供自由选择。

Happy Horse 1.1 Text to Video 支持哪些画面宽高比?

支持 9 种常用画幅比例:21:9、16:9、4:3、1:1、3:4、4:5、5:4、9:16 与 9:21。在请求参数的 aspect_ratio 字段中传入对应比例即可直接获取对应构图成片。

Happy Horse 1.1 Text to Video 的声音是如何生成的?

声音与视频画面在模型单次前向推理过程中一体化生成,并非后期拼接。在提示词中详细描绘材质碰撞声、天气氛围声、脚步声及配乐风格,即可使环境拟音与动作画面深度吻合。

Happy Horse 1.1 Text to Video 如何计算扣除点数?

计费方式为请求视频时长乘以对应分辨率单价:720p 为每秒 22 点数,1080p 为每秒 28 点数。点数在提交任务时扣除,若生成遇到异常将全额自动返还。