阿里巴巴未來生活實驗室

HappyHorse 1.0 — 帶有原生音頻的視頻

一個包含 150 億參數的視訊模型,可一次生成圖片、運動和聲音。編寫一個場景,放置一個參考,然後取得帶有口型同步對話的影片片段。

使用 HappyHorse 1.0 建立

文字轉影片、圖像到影片以及影片參考 - 包括原生音訊。產生 720p 或 1080p 的 3-15 秒片段。

0 / 2500

3s

3–15 秒

所需學分:150

範例影片

(產生的影片結果將顯示在此)

大多數視訊模型會先產生圖片,然後再產生聲音。 HappyHorse 1.0 將文字、視訊和音訊編碼在一個串流中,因此一聲開門聲、一場暴雨和一句台詞屬於同一時刻。

為什麼HappyHorse 1.0脫穎而出

影像和聲音一次通過

影像和聲音一次通過

15B 變壓器同時處理文字、視訊和音訊。嘴唇動作和語音是在音素層面上一起創建的,而不是事後縫合的。

所持有的主體身份

所持有的主體身份

臉孔、服裝和產品在運動過程中保持一致。影片參考可以鎖定最多九個視覺錨點,這樣角色或 SKU 就不會在剪輯中漂移。

導演提示語言

導演提示語言

描述鏡頭大小、攝影機移動、時間安排和聲音設計。 HappyHorse 1.0 將「三秒慢推,溫暖窗光」視為結構,而不是情緒。

經過盲目比較證明

經過盲目比較證明

在人工分析影片競技場上,HappyHorse 1.0 在文字轉影片和影像到影片方面均名列前茅(由看不到模型名稱的人來判斷)。

HappyHorse 1.0 是同一主幹上的一系列視訊工作流程。選擇與您已有的資產相符的切入點。

四種生成方式

專為發布短影片的人而打造,而不僅僅是進行實驗。以人為本的表現是焦點:面孔、語音和產品必須符合時間表。

HappyHorse 1.0 適合誰

創作者和電影製作人

創作者和電影製作人

塊鏡頭、嘗試攝影機語言並產生多語言對話,無需單獨的語音管道。對於動畫、社交電影和外觀開發很有用。

品牌和活動團隊

品牌和活動團隊

將靜止的英雄變成動態的,然後在各個變體中保持相同的天賦或產品一致。對於概念輪來說足夠快,對於付費展示來說足夠敏銳。

電子商務和產品視頻

電子商務和產品視頻

對目錄照片進行動畫處理,透過參考鎖定 SKU 外觀,並在同一代中添加環境或旁白音訊。

從提示到可播放剪輯

HappyHorse 1.0 輸出高達 1080p、3-15 秒、16:9、9:16、1:1、4:3 和 3:4。在此頁面上產生 - 無需單獨的音訊工具。

開始生成

一個包含 150 億個參數的系統為每個工作流程提供支援。視覺和音訊一起生成,以人體為主要設計目標。

快樂馬1.0功能

聯合視訊和音訊生成

圖像、動作、語音和氛圍都來自同一個前向傳遞。一扇關閉的門和它發出的咔噠聲是一個決定,而不是兩個管道。

音素級唇形同步

嘴形跟隨語音,而不僅僅是單字。擅長六種語言的主講人和主持人剪輯。

影像到影片第一幀鎖定

您的靜止影像將成為確切的開場框架。重量、視線和產品幾何形狀繼續保持可信的動感。

多參考身份控制

最多九個參考可以固定角色、服裝和產品,以便一系列剪輯在視覺上保持一致。

投籃感知提示

大開場、定時推動和聲音註釋被解釋為鏡頭結構——更接近導演的簡介,而不是一般的情緒提示。

生產就緒的輸出尺寸

720p 或 1080p、3-15 秒、動態、故事和英雄位置的橫向和縱向比例。

繼續探索

在此頁面上產生、比較計劃或繼續平台上的其他模型。

跑馬1.0常見問題解答

本頁總結了有關 HappyHorse 1.0 的公開資訊。我們不隸屬於阿里巴巴。