Laboratórios da Floresta Negra

FLUX 3 — Modelos do mundo real

O novo modelo de base multimodal do Black Forest Labs aprende em conjunto com imagens, vídeos e áudio dentro de uma arquitetura unificada – porque a inteligência visual requer a compreensão de como os objetos se mantêm unidos, como as coisas se movem e como os eventos soam.

Crie com FLUX 3

Gere imagens e vídeos em um só lugar – alterne os modos sem sair da página inicial.

0 / 5000

Créditos necessários:50

Sample Image

(Os resultados da imagem criada aparecerão aqui)

Sample result

O FLUX 3 é baseado no Self-Flow – alinhando com eficiência a geração e compreensão multimodal dentro da mesma arquitetura – dimensionado para vídeo, imagens e áudio ao mesmo tempo.

Por que o FLUX 3 muda a geração multimodal

Um modelo, uma realidade subjacente

Imagens, vídeos e áudio são projeções do mesmo mundo capturadas por diferentes sensores. O FLUX 3 aprende com todos eles ao mesmo tempo, então o som corresponde ao impacto, o movimento obedece à massa e o futuro segue o passado.

Arquitetura de autofluxo

Arquitetura de autofluxo

Com base no Self-Flow, a BFL dimensionou significativamente a computação e os dados para treinar a geração e a compreensão no mesmo modelo subjacente, melhorando a qualidade e o desempenho das tarefas posteriores.

Misture modalidades livremente

O FLUX 3 pode gerar imagens e vídeos com áudio em conjunto a partir de prompts de texto ou combinar referências de entrada, como imagens e videoclipes, para transportar personagens, estilos e contexto para novas cenas.

Em direção à inteligência visual

Em direção à inteligência visual

FLUX 3 é um ponto de verificação na missão da BFL de desenvolver inteligência visual do mundo real: modelos que percebem, prevêem e agem em ambientes físicos e digitais.

O Black Forest Labs está lançando os recursos do FLUX 3 em fases – cada uma construída a partir do mesmo modelo subjacente de correspondência de fluxo multimodal, com acesso antecipado para feedback e testes de segurança.

Plano de lançamento do FLUX 3

O FLUX 3 foi desenvolvido para criadores, profissionais de marketing, designers, equipes de robótica e qualquer pessoa que queira um parceiro criativo inteligente — não apenas um conversor de modalidade única.

Para quem é o FLUX 3

Criadores e cineastas

Gere clipes cinematográficos com áudio nativo, diálogos multilíngues e diversidade de estilos — desde filmagens espontâneas de filmadoras até animações. Encadeie clipes em sequências múltiplas mais longas com caracteres consistentes.

Profissionais de marketing e equipes visuais

Produza conceitos de campanha, variantes refinadas e designs com muita tipografia com raciocínio de agente. Baseie as gerações em referências e itere mais rapidamente em fluxos de trabalho de imagem e vídeo.

IA física e robótica

IA física e robótica

Use a compreensão mundial do FLUX 3 para previsão de ações. O FLUX-mimic ajusta o backbone de vídeo para uma manipulação hábil com dados específicos de tarefas limitados – unindo a criação de conteúdo e a IA física.

A próxima espinha dorsal da inteligência visual

Da edição interativa de imagens e vídeos à simulação, uso de computador e IA física – o FLUX 3 abre uma ampla fronteira. A geração de vídeo está disponível em acesso antecipado hoje.

Um modelo unificado potencializa vídeo, imagem e ação – cada modalidade se beneficiando da compreensão mundial compartilhada treinada em imagens, vídeos e áudio.

Capacidades do FLUX 3

Vídeo com áudio nativo (até 20s)

Texto para vídeo, animação de imagem para vídeo, transferência de referência de vídeo para vídeo, continuação generativa de vídeo-áudio e controle de quadro-chave para vídeo — tudo com geração de áudio nativa sincronizada.

Diálogo multilíngue e design de som

Forte na captura de expressões faciais humanas, na associação de sons a eventos físicos e na geração de diálogos multilíngues — combinando recursos em sequências que duram vários minutos.

Diversidade de estilo e tipografia

O gerenciamento varia de filmagens espontâneas de filmadoras a animações e cinemáticas. Forte geração de tipografia e designs animados em uma ampla variedade de estilos visuais e proporções.

Encadeamento multi-shot agente

Encadeie clipes individuais em sequências mais longas e com vários disparos. As referências visuais ajudam a garantir que os personagens permaneçam consistentes em todas as cenas ao longo de narrativas estendidas.

Síntese e edição de imagens

Sintetize e edite imagens em uma ampla variedade de estilos, proporções e resoluções. Melhor aderência a prompts complexos e renderização de texto de alta precisão em vários idiomas.

Previsão de ação

Previsão de ação nativa integrada diretamente no FLUX 3, além de modelos especializados aprimorados, como FLUX-mimic — usando o backbone de vídeo pré-treinado como uma base com reconhecimento de dinâmica.

Desempenho inicial de benchmark

Nas avaliações preliminares de texto para vídeo de 720p, o FLUX 3 foi preferido a vários modelos líderes em comparações diretas – com mais melhorias esperadas durante o acesso antecipado.

Perguntas frequentes sobre o FLUX 3

Esta página resume informações publicamente disponíveis sobre o FLUX 3 do Black Forest Labs. Não somos afiliados à BFL.