Twórcy i filmowcy
Twórz klipy kinowe z natywnym dźwiękiem, wielojęzycznymi dialogami i różnorodnością stylów — od ukrytych nagrań z kamery po animacje. Można łączyć klipy w dłuższe sekwencje składające się z wielu ujęć ze spójnymi znakami.
Laboratoria Czarnego Lasu
Nowy multimodalny model bazowy Black Forest Labs wspólnie uczy się na podstawie obrazów, filmów i dźwięku w ramach ujednoliconej architektury — ponieważ inteligencja wizualna wymaga zrozumienia, w jaki sposób obiekty trzymają się razem, jak się poruszają i jak brzmią zdarzenia.
Generuj obrazy i filmy w jednym miejscu — przełączaj tryby bez opuszczania strony głównej.
0 / 2500
Automatycznie wybiera współczynnik na podstawie podpowiedzi i wejść multimedialnych
5–20 sekund
0 jest najbardziej rygorystyczne; wejścia obrazu i wideo są ograniczone do 2
Przykładowy film
(Tutaj pojawią się wygenerowane wyniki wideo)
FLUX 3 opiera się na technologii Self-Flow — skutecznie dopasowującej generowanie multimodalne i zrozumienie w ramach tej samej architektury — skalowanej jednocześnie w zakresie wideo, obrazów i dźwięku.
Obrazy, filmy i dźwięk to projekcje tego samego świata rejestrowane przez różne czujniki. FLUX 3 uczy się od nich wszystkich na raz, więc dźwięk dopasowuje się do uderzenia, ruch poddaje się masie, a przyszłość wynika z przeszłości.

W oparciu o technologię Self-Flow firma BFL znacznie przeskalowała obliczenia i dane, aby szkolić generowanie i zrozumienie w tym samym modelu bazowym, co poprawia zarówno jakość, jak i wydajność dalszych zadań.
FLUX 3 może generować obrazy i wideo z dźwiękiem łącznie z podpowiedzi tekstowych lub łączyć odniesienia wejściowe, takie jak obrazy i klipy wideo, aby przenosić postacie, style i kontekst do nowych scen.

FLUX 3 to punkt kontrolny misji BFL polegającej na rozwijaniu inteligencji wizualnej w świecie rzeczywistym: modeli, które postrzegają, przewidują i działają w środowiskach fizycznych i cyfrowych.
Black Forest Labs udostępnia możliwości FLUX 3 etapami — każdy zbudowany jest w oparciu o ten sam podstawowy model dopasowywania przepływu multimodalnego, z wcześniejszym dostępem w celu uzyskania informacji zwrotnej i testów bezpieczeństwa.
FLUX 3 jest przeznaczony dla twórców, marketerów, projektantów, zespołów zajmujących się robotyką i każdego, kto potrzebuje inteligentnego partnera kreatywnego — a nie tylko konwertera jednej modalności.
Twórz klipy kinowe z natywnym dźwiękiem, wielojęzycznymi dialogami i różnorodnością stylów — od ukrytych nagrań z kamery po animacje. Można łączyć klipy w dłuższe sekwencje składające się z wielu ujęć ze spójnymi znakami.
Twórz koncepcje kampanii, dopracowane warianty i projekty bogate w typografię, korzystając z rozumowania agentowego. Generuj generacje w referencjach i szybciej iteruj w przepływach pracy związanych z obrazami i wideo.

Wykorzystaj wiedzę o świecie FLUX 3 do przewidywania działań. FLUX-mimic dostraja szkielet wideo pod kątem zręcznej manipulacji przy ograniczonych danych specyficznych dla zadania – łącząc tworzenie treści i fizyczną sztuczną inteligencję.
Od interaktywnej edycji obrazów i wideo po symulacje, wykorzystanie komputera i fizyczną sztuczną inteligencję – FLUX 3 otwiera szerokie granice. Generowanie wideo jest już dostępne we wczesnym dostępie.
Jeden ujednolicony model obsługuje wideo, obraz i akcję — każda modalność czerpie korzyści ze wspólnego rozumienia świata przeszkolonego w oparciu o obrazy, wideo i dźwięk.
Przetwarzanie tekstu na wideo, animacja obrazu na wideo, transfer referencyjny wideo na wideo, generatywna kontynuacja wideo i audio oraz kontrola klatek kluczowych na wideo – wszystko to ze zsynchronizowaną, natywną generacją dźwięku.
Świetnie radzi sobie z uchwyceniem ludzkiej mimiki, kojarzeniem dźwięków ze zdarzeniami fizycznymi i generowaniem wielojęzycznego dialogu — łączeniem możliwości w sekwencje trwające kilka minut.
Obsługuje zarówno utajone nagrania z kamery, jak i animacje i przerywniki filmowe. Silne generowanie typografii i animowane projekty w szerokim zakresie stylów wizualnych i współczynników proporcji.
Połącz pojedyncze klipy w dłuższe sekwencje składające się z wielu ujęć. Odniesienia wizualne pomagają zapewnić spójność postaci we wszystkich scenach w rozbudowanych narracjach.
Syntezuj i edytuj obrazy w szerokiej gamie stylów, proporcji i rozdzielczości. Ulepszone przestrzeganie złożonych komunikatów i dokładne renderowanie tekstu w wielu językach.
Natywne przewidywanie akcji zintegrowane bezpośrednio z FLUX 3 oraz dopracowane wyspecjalizowane modele, takie jak FLUX-mimic – wykorzystujące wstępnie wytrenowany szkielet wideo jako podstawę uwzględniającą dynamikę.
We wstępnych ocenach zamiany tekstu na wideo w rozdzielczości 720p, w bezpośrednich porównaniach preferowano FLUX 3 w stosunku do kilku wiodących modeli – przy czym spodziewano się dalszych ulepszeń podczas wczesnego dostępu.
Wszystkie możliwości opierają się na tym samym podstawowym modelu dopasowywania przepływu multimodalnego — udostępnianego etapami w ramach wczesnego dostępu.
Generowanie i edycja wideo i audio z natywnym dźwiękiem, łączeniem wielu ujęć i przepływami pracy opartymi na referencjach. Dostępne we wczesnym dostępie.

Synteza i edycja obrazu z ulepszoną szybką obsługą, różnorodnością stylów i wielojęzycznym renderowaniem tekstu. Otwarcie wczesnego dostępu w nadchodzących tygodniach.

Multimodalny szkielet o otwartej wadze do tworzenia treści i przewidywania działań — dla badaczy i programistów korzystających z ujednoliconej inteligencji wizualnej.

Model akcji wideo łączący szkielet FLUX 3 z wiedzą z zakresu robotyki w celu zręcznej manipulacji i wdrażania produkcji.
Poznaj FLUX 3 od Black Forest Labs i zacznij tworzyć na naszej platformie.
Ta strona zawiera podsumowanie publicznie dostępnych informacji o FLUX 3 pochodzących z Black Forest Labs. Nie jesteśmy powiązani z BFL.