Black Forest Labs (BFL) presentó FLUX 3, un modelo base multimodal que aprende de imágenes, videos y audio dentro de una misma arquitectura. Es la primera versión de la familia FLUX capaz de generar video, audio y predicción de acciones —los movimientos que ejecutaría un robot— a partir de un único conjunto de pesos, según el anuncio oficial de la compañía.

La propuesta rompe con el enfoque habitual de la industria, donde cada tarea suele tener su propio modelo especializado: uno para crear imágenes, otro para clips de video, otro para sintetizar voz. El equipo de investigación de BFL sostiene que ninguna modalidad por separado ofrece una comprensión completa del mundo, y que entrenar sobre varias a la vez produce un sistema más versátil.

De la imagen a la acción física

Un conjunto de pesos es el resultado del entrenamiento: los valores numéricos que el modelo ajusta para aprender patrones. Que un mismo conjunto sirva para tareas tan distintas como pintar una escena y anticipar el gesto de un brazo robótico es lo que distingue a FLUX 3 de sus antecesores, centrados en la generación de imágenes.

La inclusión de la predicción de acciones acerca a Black Forest Labs al terreno de la llamada IA física, donde los modelos no solo describen el mundo sino que proponen cómo interactuar con él. Es la misma frontera que exploran otros laboratorios interesados en entrenar robots con nuevas fuentes de datos.

Detrás de FLUX 3 hay un método que BFL denomina Self-Flow, descrito en un paper publicado en arXiv. La compañía acompañó la investigación con una implementación de referencia en GitHub, un gesto que facilita a otros investigadores reproducir y auditar la técnica.

Quién es Black Forest Labs

BFL se hizo conocida por la familia de generadores de imágenes FLUX, valorados por la calidad de sus resultados y su disponibilidad abierta. El laboratorio, con raíces en el equipo original que desarrolló Stable Diffusion, se consolidó como uno de los referentes europeos en generación visual. Con FLUX 3 amplía su ambición más allá de la imagen estática.

El movimiento llega en un momento de intensa competencia en generación multimodal. Modelos como los que comparamos en nuestra guía de generadores de imágenes dominaron la conversación durante los últimos años, pero el foco se desplaza hacia sistemas capaces de manejar varias modalidades a la vez.

Qué falta por verse

BFL no detalló públicamente todas las cifras de rendimiento ni las condiciones de licencia y disponibilidad para cada modalidad, por lo que resta comprobar cómo se comporta FLUX 3 frente a modelos especializados en cada tarea. La generación de video y audio de calidad sigue siendo exigente en cómputo, y la predicción de acciones para robótica plantea desafíos de seguridad y precisión que la generación de imágenes no enfrenta.

Aun con esas incógnitas, la apuesta por un único modelo que abarque percepción visual, sonora y acción marca una dirección que varios laboratorios están explorando en paralelo. Si el enfoque unificado demuestra ventajas concretas frente a los sistemas fragmentados, podría reordenar la forma en que se construyen los modelos generativos.