
创作者与电影人
预演分镜、试运镜,并生成多语言对白,无需单独配音管线。适合动态分镜、社交媒体短片与视觉探索。

阿里巴巴未来生活实验室
150 亿参数视频模型,在同一次推理中生成画面、运动与声音。写下场景或放入参考图,即可得到带口型同步对白的电影级短片。
文生视频、图生视频、参考生视频,原生音频一并输出。支持 3–15 秒、720p 或 1080p。
0 / 2500
3–15 秒
示例视频
(生成的视频结果将显示在此处)

多数视频模型先出画面再补声音。HappyHorse 1.0 把文本、视频与音频编码进同一条序列——关门声、雨声和对白都属于同一个瞬间。

150 亿参数 Transformer 同时关注文本、视频与音频。口型与语音在音素级一并生成,而不是事后贴轨。

人脸、服装与产品在运动中不易漂移。参考生视频最多锁定 9 张视觉锚点,角色或 SKU 全程更一致。

可描述景别、运镜、时长与声音设计。模型会把「三秒缓推、左侧窗光」当成结构,而不只是氛围词。

在 Artificial Analysis Video Arena,HappyHorse 1.0 在文生视频与图生视频中均位列前列——评委看不到模型名称。
面向要交付短视频的人,而不只是试用。核心是人:面孔、说话与必须在时间线上站得住的产品。

预演分镜、试运镜,并生成多语言对白,无需单独配音管线。适合动态分镜、社交媒体短片与视觉探索。

把主视觉静帧做成动态,并在多个版本中保持同一模特或产品。够快做概念,也够锐投放。

让商品图动起来,用参考图锁定 SKU 外观,并在同一次生成中加入环境声或可配音的音频。
同一套 150 亿参数系统驱动全部工作流。画面与音频同时生成,并以人物表现为主要设计目标。
画面、运动、语音与环境声来自同一次前向计算。关门与咔哒声是同一个决策,不是两条管线。
嘴型跟随语音发音,而不只是词语。适合口播、演讲与人物特写,覆盖六种语言。
你的静帧就是精确开场。运动延续时,体重、视线与产品几何仍然可信。
最多 9 张参考图可固定角色、服装与产品,让系列镜头视觉对齐。
远景开场、定时推进与声音备注会被解读成分镜结构,更接近导演简报。
720p 或 1080p,3–15 秒,横竖构图覆盖信息流、Stories 与主视觉位。
四种工作流,同一套架构。用文字、静帧、参考图或声音意图选择入口。
在本页生成,对比套餐,或继续使用平台上的其他模型。
本页汇总 HappyHorse 1.0 公开信息,我们与阿里巴巴无隶属关系。