阿里巴巴未来生活实验室

HappyHorse 1.0 — 画面与声音一次生成

150 亿参数视频模型,在同一次推理中生成画面、运动与声音。写下场景或放入参考图,即可得到带口型同步对白的电影级短片。

HappyHorse 1.0 创作

文生视频、图生视频、参考生视频,原生音频一并输出。支持 3–15 秒、720p 或 1080p。

0 / 2500

3

3–15 秒

所需积分:150

示例视频

(生成的视频结果将显示在此处)

多数视频模型先出画面再补声音。HappyHorse 1.0 把文本、视频与音频编码进同一条序列——关门声、雨声和对白都属于同一个瞬间。

为什么选择 HappyHorse 1.0

画面与声音一次完成

画面与声音一次完成

150 亿参数 Transformer 同时关注文本、视频与音频。口型与语音在音素级一并生成,而不是事后贴轨。

主体身份更稳

主体身份更稳

人脸、服装与产品在运动中不易漂移。参考生视频最多锁定 9 张视觉锚点,角色或 SKU 全程更一致。

更懂导演语言

更懂导演语言

可描述景别、运镜、时长与声音设计。模型会把「三秒缓推、左侧窗光」当成结构,而不只是氛围词。

盲测排名靠前

盲测排名靠前

在 Artificial Analysis Video Arena,HappyHorse 1.0 在文生视频与图生视频中均位列前列——评委看不到模型名称。

HappyHorse 1.0 是同一骨干上的一组视频工作流。按你已有的素材选择入口。

四种生成方式

面向要交付短视频的人,而不只是试用。核心是人:面孔、说话与必须在时间线上站得住的产品。

谁适合用 HappyHorse 1.0

创作者与电影人

创作者与电影人

预演分镜、试运镜,并生成多语言对白,无需单独配音管线。适合动态分镜、社交媒体短片与视觉探索。

品牌与营销团队

品牌与营销团队

把主视觉静帧做成动态,并在多个版本中保持同一模特或产品。够快做概念,也够锐投放。

电商与产品视频

电商与产品视频

让商品图动起来,用参考图锁定 SKU 外观,并在同一次生成中加入环境声或可配音的音频。

从提示词到可播放成片

HappyHorse 1.0 最高 1080p,时长 3–15 秒,支持 16:9、9:16、1:1、4:3、3:4。在本页直接生成,不必再开音频工具。

立即生成

同一套 150 亿参数系统驱动全部工作流。画面与音频同时生成,并以人物表现为主要设计目标。

HappyHorse 1.0 能力

视频与音频联合生成

画面、运动、语音与环境声来自同一次前向计算。关门与咔哒声是同一个决策,不是两条管线。

音素级口型同步

嘴型跟随语音发音,而不只是词语。适合口播、演讲与人物特写,覆盖六种语言。

图生视频锁定第一帧

你的静帧就是精确开场。运动延续时,体重、视线与产品几何仍然可信。

多参考身份控制

最多 9 张参考图可固定角色、服装与产品,让系列镜头视觉对齐。

分镜级提示词

远景开场、定时推进与声音备注会被解读成分镜结构,更接近导演简报。

可交付的尺寸规格

720p 或 1080p,3–15 秒,横竖构图覆盖信息流、Stories 与主视觉位。

继续了解

在本页生成,对比套餐,或继续使用平台上的其他模型。

HappyHorse 1.0 常见问题

本页汇总 HappyHorse 1.0 公开信息,我们与阿里巴巴无隶属关系。