
창작자와 영화제작자
별도의 음성 파이프라인 없이 블록 샷을 찍고, 카메라 언어를 사용해 보고, 다국어 대화를 생성해 보세요. 애니메틱스, 소셜 영화, 룩 개발에 유용합니다.

알리바바 미래생활 연구소
단일 패스로 영상, 모션, 사운드를 생성하는 150억 개의 매개변수 비디오 모델입니다. 장면을 작성하고, 참조를 삭제하고, 립싱크 대화가 포함된 영화 클립을 얻으세요.
텍스트를 비디오로, 이미지를 비디오로, 비디오에 대한 참조 - 기본 오디오가 포함됩니다. 720p 또는 1080p에서 3~15초 클립을 생성합니다.
0 / 2500
3~15초
샘플 비디오
(생성된 비디오 결과가 여기에 표시됩니다)

대부분의 비디오 모델은 먼저 사진을 생성하고 나중에 사운드를 추가합니다. HappyHorse 1.0은 텍스트, 비디오 및 오디오를 하나의 스트림으로 인코딩하므로 문 클릭, 폭풍우 및 음성 대사가 동일한 순간에 속합니다.

15B 변압기는 텍스트, 비디오 및 오디오를 함께 처리합니다. 입술 동작과 음성은 음소 수준에서 함께 생성되며 사실 이후에 연결되지 않습니다.

얼굴, 의상, 제품은 모션 전반에 걸쳐 일관성을 유지합니다. 비디오 참조는 최대 9개의 시각적 앵커를 잠글 수 있으므로 캐릭터나 SKU가 클립 중간에 표류하지 않습니다.

샷 크기, 카메라 이동, 타이밍 및 사운드 디자인을 설명합니다. HappyHorse 1.0은 "3초에 걸친 느린 푸시, 따뜻한 창문 조명"을 분위기가 아닌 구조로 취급합니다.

인공 분석 비디오 아레나에서 HappyHorse 1.0은 모델 이름을 볼 수 없는 사람들이 평가한 텍스트-비디오 및 이미지-비디오 모두에서 최고의 비디오 모델 중 하나로 선정되었습니다.
HappyHorse 1.0은 동일한 백본에 있는 비디오 워크플로 제품군입니다. 이미 보유하고 있는 자산과 일치하는 진입점을 선택하세요.
단순한 실험이 아닌 짧은 형식의 비디오를 제공하는 사람들을 위해 제작되었습니다. 인간 중심의 성능이 초점입니다. 즉, 타임라인을 따라야 하는 얼굴, 음성, 제품입니다.

별도의 음성 파이프라인 없이 블록 샷을 찍고, 카메라 언어를 사용해 보고, 다국어 대화를 생성해 보세요. 애니메틱스, 소셜 영화, 룩 개발에 유용합니다.

영웅을 움직이게 만든 다음 변형 전체에 걸쳐 동일한 재능이나 제품을 일관되게 유지하세요. 컨셉 라운드에는 충분히 빠르고, 유료 배치에는 충분히 선명합니다.

카탈로그 사진에 애니메이션을 적용하고, 참조로 SKU 모양을 잠그고, 같은 세대에 주변 오디오 또는 음성 해설 준비 오디오를 추가합니다.
HappyHorse 1.0은 16:9, 9:16, 1:1, 4:3 및 3:4로 최대 1080p, 3~15초를 출력합니다. 이 페이지에서 생성하세요. 별도의 오디오 도구가 필요하지 않습니다.
하나의 150억 매개변수 시스템이 모든 워크플로우를 지원합니다. 인간을 주요 디자인 대상으로 하여 시각 자료와 오디오가 함께 생성됩니다.
그림, 동작, 음성 및 분위기는 동일한 전방향 패스에서 나옵니다. 닫히는 문과 클릭은 하나의 결정이지 두 개의 파이프라인이 아닙니다.
입 모양은 단어뿐만 아니라 음성 소리를 따릅니다. 6개 언어로 진행되는 발언자 및 발표자 클립에 강력합니다.
귀하의 스틸이 정확한 오프닝 프레임이 됩니다. 무게감, 아이라인, 제품 기하학이 그대로 유지되면서 모션이 계속됩니다.
최대 9개의 참조에 캐릭터, 의상, 제품을 고정하여 일련의 클립이 시각적으로 정렬되도록 할 수 있습니다.
넓게 열림, 시간에 맞춰 푸시, 사운드 노트는 샷 구조로 해석됩니다. 일반적인 분위기 프롬프트보다는 감독의 브리핑에 더 가깝습니다.
720p 또는 1080p, 3~15초, 피드, 스토리 및 영웅 배치를 위한 가로 및 세로 비율.
4개의 워크플로우, 하나의 아키텍처. 텍스트, 스틸, 참조, 기존 클립 의도 등 세대 입력 방법을 선택하세요.
이 페이지에서 생성하고 계획을 비교하거나 플랫폼의 다른 모델을 계속 사용하세요.
이 페이지에는 HappyHorse 1.0에 대해 공개적으로 사용 가능한 정보가 요약되어 있습니다. 우리는 알리바바와 제휴하지 않습니다.