Inteligência artificial, sem ruído.
Modelos e LLMs4 min

MiniMax lança MiniMax-Music3: modelo de música com pesos abertos que gera canções completas de 5 minutos

MiniMax lança o MiniMax-Music3, modelo de música com pesos abertos que gera canções completas de até 5 minutos a partir de letra e legenda estruturada.

MiniMax lança MiniMax-Music3: modelo de música com pesos abertos que gera canções completas de 5 minutos

O que é o MiniMax-Music3

A MiniMax, uma das principais empresas chinesas de inteligência artificial, liberou no dia 13 de agosto de 2026 o MiniMax-Music3: um modelo de geração de música com pesos abertos (open-weights) capaz de criar uma canção completa de até cinco minutos em uma única geração, em formato WAV estéreo de 32 kHz e 16 bits. O modelo aceita duas entradas separadas: a letra, com marcadores de seção, e uma legenda estruturada que descreve o estilo musical desejado.

Diferentemente de muitos lançamentos que chegam como “preview de pesquisa” sem utilidade prática, o MiniMax-Music3 já nasceu implantável: a empresa publicou os pesos, o código de inferência e três caminhos documentados de execução no mesmo dia do anúncio.

Como funciona a arquitetura

O modelo combina uma pilha autoregressiva hierárquica com um caminho de síntese contínua. O tokenizador de treinamento usa oito camadas de quantização vetorial residual (RVQ): o primeiro codebook, o “semântico”, tem 16.384 entradas e carrega a estrutura musical central, enquanto os sete codebooks acústicos restantes (1.024 entradas cada) codificam os detalhes residuais do áudio.

O coração do sistema é um Hybrid-LM que divide o problema de modelagem em duas partes:

  • LLM Global de 8B: prevê o primeiro codebook RVQ quadro a quadro e mantém a estrutura de longo prazo da música;
  • LLM Local de 0,6B: prevê os codebooks restantes dentro de cada quadro.

Segundo o cartão do modelo e a licença, o LLM Global foi inicializado a partir do Qwen3-8B — embora a postagem de pesquisa da MiniMax cite o Qwen3.5-8B, um detalhe que a comunidade ainda trata como não resolvido.

A etapa de síntese é a escolha de design mais interessante. Em vez de decodificar a partir dos tokens RVQ discretos, a MiniMax funde os estados ocultos finais dos dois LLMs e condiciona um módulo de flow matching de 2,4B, que mapeia para um espaço latente decodificado por um Flow-VAE de 123M herdado do MiniMax Speech. Na inferência, o decodificador do tokenizador discreto nem sequer é carregado.

Controle em duas entradas

A letra carrega as palavras e as tags de seção em linhas próprias: [Intro], [Verse], [Pre-Chorus], [Chorus], [Post-Chorus], [Bridge], [Instrumental], [Solo] e [Outro]. A legenda estruturada, por sua vez, carrega metadados globais, detalhes vocais e o arranjo. A MiniMax também lançou um agente de reescrita de legendas musicais que expande uma descrição curta para esse formato de três partes de forma offline.

Onde rodar

Há três caminhos documentados de execução:

  • SGLang-Omni: servidor de referência, com duas GPUs CUDA — a GPU 0 roda o Qwen3 e a geração autoregressiva RVQ, e a GPU 1 roda o flow matching e a decodificação DAV;
  • diffusers: pipeline modular que cabe em menos de 24 GB de VRAM em precisão total, cerca de 22 GB com offload automático de CPU e até 8 GB com offloading de grupo em nível de folha;
  • ComfyUI: template nativo de “Text to Music” usando pesos repackados FP16/INT8 da Comfy-Org.

Licença e uso comercial

A Licença Comunitária MiniMax-Music3 permite uso comercial, mas com condições claras: é obrigatório exibir o nome “MiniMax-Music3” de forma proeminente na interface do produto, e qualquer organização cuja receita anual agregada desses produtos ultrapasse US$ 20 milhões precisa obter autorização prévia por escrito da MiniMax. Quem hospeda geração para terceiros também deve implementar salvaguardas contra saídas que infrinjam direitos autorais.

Por que isso importa agora

O MiniMax-Music3 chega em um momento em que a geração de música por IA está saindo dos laboratórios para produtos reais — trilhas de fundo para vídeos de UGC, música adaptativa em jogos, jingles localizados para publicidade, demos para compositores e geração em lote offline onde o custo por música em APIs é o fator limitante. Para criadores solo, estúdios independentes e equipes de médio porte no Brasil, um modelo de pesos abertos com licença comercial representa uma alternativa concreta às APIs fechadas de geração de música, com a vantagem adicional de poder rodar localmente.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.