
創作者和電影製作人
塊鏡頭、嘗試攝影機語言並產生多語言對話,無需單獨的語音管道。對於動畫、社交電影和外觀開發很有用。

阿里巴巴未來生活實驗室
一個包含 150 億參數的視訊模型,可一次生成圖片、運動和聲音。編寫一個場景,放置一個參考,然後取得帶有口型同步對話的影片片段。
文字轉影片、圖像到影片以及影片參考 - 包括原生音訊。產生 720p 或 1080p 的 3-15 秒片段。
0 / 2500
3–15 秒
範例影片
(產生的影片結果將顯示在此)

大多數視訊模型會先產生圖片,然後再產生聲音。 HappyHorse 1.0 將文字、視訊和音訊編碼在一個串流中,因此一聲開門聲、一場暴雨和一句台詞屬於同一時刻。

15B 變壓器同時處理文字、視訊和音訊。嘴唇動作和語音是在音素層面上一起創建的,而不是事後縫合的。

臉孔、服裝和產品在運動過程中保持一致。影片參考可以鎖定最多九個視覺錨點,這樣角色或 SKU 就不會在剪輯中漂移。

描述鏡頭大小、攝影機移動、時間安排和聲音設計。 HappyHorse 1.0 將「三秒慢推,溫暖窗光」視為結構,而不是情緒。

在人工分析影片競技場上,HappyHorse 1.0 在文字轉影片和影像到影片方面均名列前茅(由看不到模型名稱的人來判斷)。
專為發布短影片的人而打造,而不僅僅是進行實驗。以人為本的表現是焦點:面孔、語音和產品必須符合時間表。

塊鏡頭、嘗試攝影機語言並產生多語言對話,無需單獨的語音管道。對於動畫、社交電影和外觀開發很有用。

將靜止的英雄變成動態的,然後在各個變體中保持相同的天賦或產品一致。對於概念輪來說足夠快,對於付費展示來說足夠敏銳。

對目錄照片進行動畫處理,透過參考鎖定 SKU 外觀,並在同一代中添加環境或旁白音訊。
一個包含 150 億個參數的系統為每個工作流程提供支援。視覺和音訊一起生成,以人體為主要設計目標。
圖像、動作、語音和氛圍都來自同一個前向傳遞。一扇關閉的門和它發出的咔噠聲是一個決定,而不是兩個管道。
嘴形跟隨語音,而不僅僅是單字。擅長六種語言的主講人和主持人剪輯。
您的靜止影像將成為確切的開場框架。重量、視線和產品幾何形狀繼續保持可信的動感。
最多九個參考可以固定角色、服裝和產品,以便一系列剪輯在視覺上保持一致。
大開場、定時推動和聲音註釋被解釋為鏡頭結構——更接近導演的簡介,而不是一般的情緒提示。
720p 或 1080p、3-15 秒、動態、故事和英雄位置的橫向和縱向比例。
四種工作流程,一種架構。選擇輸入產生的方式 - 文字、靜止影像、參考或現有剪輯意圖。
在此頁面上產生、比較計劃或繼續平台上的其他模型。
本頁總結了有關 HappyHorse 1.0 的公開資訊。我們不隸屬於阿里巴巴。