Inteligência artificial, sem ruído.
Modelos e LLMs3 min

Black Forest Labs lança FLUX 3: modelo multimodal que gera imagem, vídeo, áudio e prevê ações robóticas

Black Forest Labs lança o FLUX 3, seu primeiro modelo multimodal com vídeo, áudio e previsão de ações robóticas em uma única arquitetura. Veja os benchmarks.

Black Forest Labs lança FLUX 3: modelo multimodal que gera imagem, vídeo, áudio e prevê ações robóticas

Black Forest Labs lança FLUX 3: um modelo multimodal que gera imagem, vídeo, áudio e prevê ações robóticas

A Black Forest Labs (BFL) acaba de lançar o FLUX 3, seu primeiro modelo de fundação multimodal que aprende com imagens, vídeos e áudio dentro de uma única arquitetura. É também o primeiro modelo da família FLUX a entregar geração de vídeo, áudio e previsão de ações robóticas a partir de um único conjunto de pesos.

A equipe de pesquisa da BFL argumenta que nenhuma modalidade isolada descreve o mundo de forma completa. Imagens capturam estrutura espacial em um instante. Vídeo restaura o tempo e expõe dinâmicas físicas. Áudio revela relações causais entre eventos mecânicos e som. Cada uma dessas modalidades é tratada como uma projeção com perdas da mesma realidade subjacente.

Ao treinar todas ao mesmo tempo, as modalidades se restringem mutuamente: o som precisa corresponder ao impacto, o movimento precisa obedecer à massa. A equipe chama o FLUX 3 de seu primeiro modelo construído inteiramente sobre esse princípio.

O método por trás: Self-Flow

O FLUX 3 é construído sobre o Self-Flow, método da BFL para alinhar geração e compreensão multimodal em uma única arquitetura. O Self-Flow combina o objetivo de flow matching com um objetivo de reconstrução de características auto-supervisionado. A implementação de referência no GitHub é Apache 2.0 e usa SiT-XL/2 com condicionamento de timestep por token, treinando com 25% de máscara por token e auto-destilação de um professor EMA na camada 20 para um estudante na camada 8.

Esse checkpoint público é um modelo de pesquisa ImageNet 256×256, não o FLUX 3. A BFL afirma que “escalou significativamente os recursos de computação e dados” sobre a mesma abordagem para treinar o FLUX 3 em vídeo, imagens e áudio simultaneamente. O Self-Flow foi introduzido em março de 2026 — o que é novo neste lançamento é a escala.

O que o FLUX 3 Video faz

O FLUX 3 Video gera clipes de até 20 segundos em uma única geração, com áudio nativo. Os modos suportados cobrem texto-para-vídeo, imagem-para-vídeo, vídeo-para-vídeo a partir de um clipe de referência, keyframe-para-vídeo para transições controladas e continuação generativa de vídeo-áudio a partir de entrada de vídeo e áudio.

A BFL também lista diálogo multilíngue, encadeamento agentivo de clipes em sequências multi-shot e forte geração de tipografia com designs animados. A equipe relata força particular em expressões faciais humanas e na associação de sons com eventos físicos.

Performance

A BFL publicou resultados preliminares de preferência humana. O teste foi configurado com clipes de texto-para-vídeo de 10 segundos em 720p com áudio. O FLUX 3 foi preferido em relação ao Luma Ray 3.2 em 93% das comparações e sobre o Runway Gen-4.5 em 77%. Contra o Grok Imagine Video o número chega a 69%, seguido por Kling v3 Pro (60%), Happy Horse v1 (59%) e Happy Horse 1.1 (57%). Contra Seedance 2.0 e Gemini Omni Flash o resultado é 52%, praticamente um cara ou coroa.

Principais conclusões

  • O FLUX 3 é uma única arquitetura de flow matching treinada conjuntamente em imagem, vídeo e áudio.
  • O FLUX 3 Video gera até 20 segundos com áudio nativo em uma única geração.
  • A previsão de vídeo consome mais de 95% do poder computacional de treinamento; o áudio representa menos de 0,5% dos tokens.
  • A mesma arquitetura alimenta o FLUX-mimic, uma política robótica que roda em menos de 80 ms em uma RTX 5090.
  • O acesso é faseado: Vídeo e Ação estão em acesso antecipado, Imagem vem em seguida, e pesos abertos vêm por último.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.