Laboratorios de la Selva Negra

FLUX 3 — Modelos del mundo real

El nuevo modelo básico multimodal de Black Forest Labs aprende conjuntamente de imágenes, vídeos y audio dentro de una arquitectura unificada, porque la inteligencia visual requiere comprender cómo se mantienen unidos los objetos, cómo se mueven las cosas y cómo suenan los eventos.

Crear con FLUX 3

Genere imágenes y vídeos en un solo lugar: cambie de modo sin salir de la página de inicio.

0 / 5000

Créditos requeridos:50

Sample Image

(Los resultados de la imagen creada aparecerán aquí)

Sample result

FLUX 3 se basa en Self-Flow, que alinea eficientemente la generación y la comprensión multimodal dentro de la misma arquitectura, escalada en video, imágenes y audio al mismo tiempo.

Por qué FLUX 3 cambia la generación multimodal

Un modelo, una realidad subyacente

Imágenes, vídeos y audio son proyecciones de un mismo mundo captadas por diferentes sensores. FLUX 3 aprende de todos ellos a la vez, por lo que el sonido coincide con el impacto, el movimiento obedece a la masa y el futuro surge del pasado.

Arquitectura de flujo propio

Arquitectura de flujo propio

Basado en Self-Flow, BFL escaló significativamente la computación y los datos para entrenar la generación y la comprensión en el mismo modelo subyacente, mejorando tanto la calidad como el desempeño de las tareas posteriores.

Mezclar modalidades libremente

FLUX 3 puede generar imágenes y videos con audio conjuntamente a partir de mensajes de texto, o combinar referencias de entrada como imágenes y videoclips para llevar personajes, estilos y contexto a nuevas escenas.

Hacia la inteligencia visual

Hacia la inteligencia visual

FLUX 3 es un punto de control en la misión de BFL de desarrollar inteligencia visual del mundo real: modelos que perciben, predicen y actúan en entornos físicos y digitales.

Black Forest Labs está implementando las capacidades de FLUX 3 en fases, cada una construida a partir del mismo modelo subyacente de coincidencia de flujo multimodal, con acceso temprano para comentarios y pruebas de seguridad.

Plan de lanzamiento de FLUX 3

FLUX 3 está diseñado para creadores, especialistas en marketing, diseñadores, equipos de robótica y cualquiera que desee un socio creativo inteligente, no solo un conversor de modalidad única.

¿Para quién es FLUX 3?

Creadores y cineastas

Genere clips cinematográficos con audio nativo, diálogos multilingües y diversidad de estilos, desde imágenes espontáneas de videocámara hasta animaciones. Encadene clips en secuencias múltiples más largas con personajes consistentes.

Comercializadores y equipos visuales.

Produzca conceptos de campaña, variantes pulidas y diseños con mucha tipografía con razonamiento agente. Base generaciones en referencias e itere más rápido a través de flujos de trabajo de imágenes y videos.

IA física y robótica

IA física y robótica

Utilice la comprensión mundial de FLUX 3 para predecir acciones. FLUX-mimic ajusta la columna vertebral del vídeo para una manipulación diestra con datos limitados de tareas específicas, uniendo la creación de contenido y la IA física.

La próxima columna vertebral de la inteligencia visual

Desde la edición interactiva de imágenes y videos hasta la simulación, el uso de computadoras y la IA física, FLUX 3 abre una amplia frontera. La generación de vídeo está disponible en acceso anticipado hoy.

Un modelo unificado impulsa el video, la imagen y la acción; cada modalidad se beneficia de una comprensión del mundo compartida entrenada a través de imágenes, videos y audio.

Capacidades de FLUX 3

Vídeo con audio nativo (hasta 20s)

Texto a vídeo, animación de imagen a vídeo, transferencia de referencia de vídeo a vídeo, continuación de audio y vídeo generativo y control de fotograma clave a vídeo, todo con generación de audio nativo sincronizado.

Diálogo multilingüe y diseño de sonido.

Fuerte en capturar expresiones faciales humanas, asociar sonidos con eventos físicos y generar diálogos multilingües, combinando capacidades en secuencias que duran varios minutos.

Diversidad de estilos y tipografía.

El manejo abarca desde imágenes espontáneas de videocámara hasta animaciones y cinemáticas. Fuerte generación de tipografía y diseños animados en una amplia gama de estilos visuales y relaciones de aspecto.

Encadenamiento agente de disparos múltiples

Encadene clips individuales en secuencias más largas de varias tomas. Las referencias visuales ayudan a garantizar que los personajes permanezcan consistentes en todas las escenas a lo largo de narrativas extendidas.

Síntesis y edición de imágenes.

Sintetice y edite imágenes en una amplia variedad de estilos, relaciones de aspecto y resoluciones. Se mejoró el cumplimiento de indicaciones complejas y la representación de texto de alta precisión en varios idiomas.

Predicción de acción

Predicción de acciones nativas integrada directamente en FLUX 3, además de modelos especializados ajustados como FLUX-mimic, utilizando la red troncal de video previamente entrenada como base consciente de la dinámica.

Rendimiento de referencia temprano

En evaluaciones preliminares de texto a video de 720p, se prefirió FLUX 3 a varios modelos líderes en comparaciones directas, y se esperan mejoras adicionales durante el acceso temprano.

Preguntas frecuentes sobre FLUX 3

Esta página resume la información disponible públicamente sobre FLUX 3 de Black Forest Labs. No estamos afiliados a BFL.