Laboratoria Czarnego Lasu

FLUX 3 — Modele świata rzeczywistego

Nowy multimodalny model bazowy Black Forest Labs wspólnie uczy się na podstawie obrazów, filmów i dźwięku w ramach ujednoliconej architektury — ponieważ inteligencja wizualna wymaga zrozumienia, w jaki sposób obiekty trzymają się razem, jak się poruszają i jak brzmią zdarzenia.

Twórz za pomocą FLUX 3

Generuj obrazy i filmy w jednym miejscu — przełączaj tryby bez opuszczania strony głównej.

0 / 5000

Wymagane kredyty:50

Sample Image

(Wyniki utworzonego obrazu pojawią się tutaj)

Sample result

FLUX 3 opiera się na technologii Self-Flow — skutecznie dopasowującej generowanie multimodalne i zrozumienie w ramach tej samej architektury — skalowanej jednocześnie w zakresie wideo, obrazów i dźwięku.

Dlaczego FLUX 3 zmienia generację multimodalną

Jeden model, jedna leżąca u podstaw rzeczywistość

Obrazy, filmy i dźwięk to projekcje tego samego świata rejestrowane przez różne czujniki. FLUX 3 uczy się od nich wszystkich na raz, więc dźwięk dopasowuje się do uderzenia, ruch poddaje się masie, a przyszłość wynika z przeszłości.

Architektura Self-Flow

Architektura Self-Flow

W oparciu o technologię Self-Flow firma BFL znacznie przeskalowała obliczenia i dane, aby szkolić generowanie i zrozumienie w tym samym modelu bazowym, co poprawia zarówno jakość, jak i wydajność dalszych zadań.

Swobodnie mieszaj modalności

FLUX 3 może generować obrazy i wideo z dźwiękiem łącznie z podpowiedzi tekstowych lub łączyć odniesienia wejściowe, takie jak obrazy i klipy wideo, aby przenosić postacie, style i kontekst do nowych scen.

W stronę inteligencji wizualnej

W stronę inteligencji wizualnej

FLUX 3 to punkt kontrolny misji BFL polegającej na rozwijaniu inteligencji wizualnej w świecie rzeczywistym: modeli, które postrzegają, przewidują i działają w środowiskach fizycznych i cyfrowych.

Black Forest Labs udostępnia możliwości FLUX 3 etapami — każdy zbudowany jest w oparciu o ten sam podstawowy model dopasowywania przepływu multimodalnego, z wcześniejszym dostępem w celu uzyskania informacji zwrotnej i testów bezpieczeństwa.

Plan uruchomienia FLUX 3

FLUX 3 jest przeznaczony dla twórców, marketerów, projektantów, zespołów zajmujących się robotyką i każdego, kto potrzebuje inteligentnego partnera kreatywnego — a nie tylko konwertera jednej modalności.

Dla kogo przeznaczony jest FLUX 3

Twórcy i filmowcy

Twórz klipy kinowe z natywnym dźwiękiem, wielojęzycznymi dialogami i różnorodnością stylów — od ukrytych nagrań z kamery po animacje. Można łączyć klipy w dłuższe sekwencje składające się z wielu ujęć ze spójnymi znakami.

Marketerzy i zespoły wizualne

Twórz koncepcje kampanii, dopracowane warianty i projekty bogate w typografię, korzystając z rozumowania agentowego. Generuj generacje w referencjach i szybciej iteruj w przepływach pracy związanych z obrazami i wideo.

Fizyczna sztuczna inteligencja i robotyka

Fizyczna sztuczna inteligencja i robotyka

Wykorzystaj wiedzę o świecie FLUX 3 do przewidywania działań. FLUX-mimic dostraja szkielet wideo pod kątem zręcznej manipulacji przy ograniczonych danych specyficznych dla zadania – łącząc tworzenie treści i fizyczną sztuczną inteligencję.

Kolejny szkielet inteligencji wizualnej

Od interaktywnej edycji obrazów i wideo po symulacje, wykorzystanie komputera i fizyczną sztuczną inteligencję – FLUX 3 otwiera szerokie granice. Generowanie wideo jest już dostępne we wczesnym dostępie.

Jeden ujednolicony model obsługuje wideo, obraz i akcję — każda modalność czerpie korzyści ze wspólnego rozumienia świata przeszkolonego w oparciu o obrazy, wideo i dźwięk.

Możliwości FLUX 3

Wideo z natywnym dźwiękiem (do 20 s)

Przetwarzanie tekstu na wideo, animacja obrazu na wideo, transfer referencyjny wideo na wideo, generatywna kontynuacja wideo i audio oraz kontrola klatek kluczowych na wideo – wszystko to ze zsynchronizowaną, natywną generacją dźwięku.

Wielojęzyczny dialog i projektowanie dźwięku

Świetnie radzi sobie z uchwyceniem ludzkiej mimiki, kojarzeniem dźwięków ze zdarzeniami fizycznymi i generowaniem wielojęzycznego dialogu — łączeniem możliwości w sekwencje trwające kilka minut.

Różnorodność stylu i typografia

Obsługuje zarówno utajone nagrania z kamery, jak i animacje i przerywniki filmowe. Silne generowanie typografii i animowane projekty w szerokim zakresie stylów wizualnych i współczynników proporcji.

Agentyczne łączenie wielostrzałowe

Połącz pojedyncze klipy w dłuższe sekwencje składające się z wielu ujęć. Odniesienia wizualne pomagają zapewnić spójność postaci we wszystkich scenach w rozbudowanych narracjach.

Synteza i edycja obrazu

Syntezuj i edytuj obrazy w szerokiej gamie stylów, proporcji i rozdzielczości. Ulepszone przestrzeganie złożonych komunikatów i dokładne renderowanie tekstu w wielu językach.

Przewidywanie działań

Natywne przewidywanie akcji zintegrowane bezpośrednio z FLUX 3 oraz dopracowane wyspecjalizowane modele, takie jak FLUX-mimic – wykorzystujące wstępnie wytrenowany szkielet wideo jako podstawę uwzględniającą dynamikę.

Wczesna wydajność porównawcza

We wstępnych ocenach zamiany tekstu na wideo w rozdzielczości 720p, w bezpośrednich porównaniach preferowano FLUX 3 w stosunku do kilku wiodących modeli – przy czym spodziewano się dalszych ulepszeń podczas wczesnego dostępu.

Często zadawane pytania dotyczące FLUX 3

Ta strona zawiera podsumowanie publicznie dostępnych informacji o FLUX 3 pochodzących z Black Forest Labs. Nie jesteśmy powiązani z BFL.