Laboratori della Foresta Nera

FLUX 3 — Modelli del mondo reale

Il nuovo modello di base multimodale di Black Forest Labs apprende congiuntamente da immagini, video e audio all'interno di un'architettura unificata, perché l'intelligenza visiva richiede la comprensione di come gli oggetti stanno insieme, come si muovono le cose e come suonano gli eventi.

Crea con FLUX 3

Genera immagini e video in un unico posto: cambia modalità senza uscire dalla home page.

0 / 5000

Crediti richiesti:50

Sample Image

(I risultati dell'immagine creata verranno visualizzati qui)

Sample result

FLUX 3 si basa su Self-Flow, allineando in modo efficiente la generazione e la comprensione multimodale all'interno della stessa architettura, adattabile contemporaneamente a video, immagini e audio.

Perché FLUX 3 cambia la generazione multimodale

Un modello, una realtà di fondo

Immagini, video e audio sono proiezioni dello stesso mondo catturate da sensori diversi. FLUX 3 impara da tutti loro contemporaneamente, quindi il suono corrisponde all'impatto, il movimento obbedisce alla massa e il futuro segue dal passato.

Architettura del flusso automatico

Architettura del flusso automatico

Basato su Self-Flow, BFL ha scalato in modo significativo elaborazione e dati per addestrare la generazione e la comprensione nello stesso modello sottostante, migliorando sia la qualità che le prestazioni delle attività a valle.

Mescola liberamente le modalità

FLUX 3 può generare immagini e video con audio insieme da istruzioni di testo o combinare riferimenti di input come immagini e clip video per trasportare personaggi, stili e contesto in nuove scene.

Verso l'intelligenza visiva

Verso l'intelligenza visiva

FLUX 3 è un punto di controllo sulla missione di BFL di sviluppare l'intelligenza visiva del mondo reale: modelli che percepiscono, prevedono e agiscono in ambienti fisici e digitali.

Black Forest Labs sta implementando le funzionalità di FLUX 3 in più fasi, ciascuna costruita dallo stesso modello di corrispondenza del flusso multimodale sottostante, con accesso anticipato per feedback e test di sicurezza.

Piano di lancio di FLUX 3

FLUX 3 è pensato per creatori, esperti di marketing, designer, team di robotica e chiunque desideri un partner creativo intelligente, non solo un convertitore a modalità singola.

Per chi è FLUX 3

Creatori e registi

Genera clip cinematografiche con audio nativo, dialoghi multilingue e diversità di stile, dalle riprese spontanee della videocamera all'animazione. Concatena le clip in sequenze multi-ripresa più lunghe con personaggi coerenti.

Marketer e team visivi

Produci concetti di campagna, varianti raffinate e design ad alto contenuto tipografico con il ragionamento degli agenti. Radica le generazioni nei riferimenti e ripeti più velocemente i flussi di lavoro di immagini e video.

IA fisica e robotica

IA fisica e robotica

Utilizza la comprensione del mondo di FLUX 3 per la previsione delle azioni. FLUX-mimic ottimizza la dorsale video per una manipolazione abile con dati limitati specifici per attività, collegando la creazione di contenuti e l'intelligenza artificiale fisica.

La prossima spina dorsale dell’intelligenza visiva

Dall'editing interattivo di immagini e video alla simulazione, all'uso del computer e all'intelligenza artificiale fisica: FLUX 3 apre un'ampia frontiera. La generazione video è disponibile oggi in accesso anticipato.

Un modello unificato alimenta video, immagini e azioni: ciascuna modalità beneficia della comprensione condivisa del mondo attraverso immagini, video e audio.

Funzionalità di FLUX 3

Video con audio nativo (fino a 20 secondi)

Animazione da testo a video, da immagine a video, trasferimento di riferimenti da video a video, continuazione generativa di video-audio e controllo da fotogramma chiave a video, il tutto con generazione audio nativa sincronizzata.

Dialogo multilingue e sound design

Forte nel catturare le espressioni facciali umane, associare suoni ad eventi fisici e generare dialoghi multilingue, combinando le capacità in sequenze della durata di diversi minuti.

Diversità di stile e tipografia

La gestione spazia dai filmati spontanei della videocamera alle animazioni e ai filmati. Generazione di caratteri tipografici efficaci e design animati in un'ampia gamma di stili visivi e proporzioni.

Concatenamento multi-colpo agentico

Concatena le singole clip in sequenze più lunghe e multi-scatto. I riferimenti visivi aiutano a garantire che i personaggi rimangano coerenti in tutte le scene durante le narrazioni estese.

Sintesi e modifica delle immagini

Sintetizza e modifica le immagini in un'ampia varietà di stili, proporzioni e risoluzioni. Migliorata l'aderenza ai prompt complessi e il rendering del testo ad alta precisione in più lingue.

Previsione dell'azione

Previsione nativa dell'azione integrata direttamente in FLUX 3, oltre a modelli specializzati perfezionati come FLUX-mimic, utilizzando il backbone video preaddestrato come base sensibile alla dinamica.

Prestazioni di riferimento iniziali

Nelle valutazioni preliminari text-to-video a 720p, FLUX 3 è stato preferito rispetto a diversi modelli leader nei confronti testa a testa, con ulteriori miglioramenti attesi durante l'accesso anticipato.

Ulteriori informazioni sull'intelligenza artificiale multimodale

Esplora FLUX 3 di Black Forest Labs e inizia a creare con la nostra piattaforma.

Domande frequenti su FLUX 3

Questa pagina riassume le informazioni disponibili al pubblico su FLUX 3 di Black Forest Labs. Non siamo affiliati con BFL.