Inteligência artificial, sem ruído.
Modelos e LLMs3 min

MiniMax lança H3: modelo que gera vídeo 2K com áudio estéreo nativo em uma única etapa

Novo modelo multimodal chinês unifica texto, imagem, vídeo e áudio em um único pipeline com saída 2K e preço até 3x menor que concorrentes.

MiniMax lança H3: modelo que gera vídeo 2K com áudio estéreo nativo em uma única etapa

MiniMax lança H3: modelo que gera vídeo 2K com áudio estéreo nativo em uma única etapa

A chinesa MiniMax acaba de lançar o MiniMax H3, um modelo multimodal que unifica geração de vídeo, áudio e imagem em uma única arquitetura. Diferente das abordagens tradicionais que separam texto-para-vídeo, imagem-para-vídeo e edição em modelos especializados, o H3 lê texto, imagens, vídeo e áudio como um contexto unificado e devolve clipes com som estéreo nativo.

Os números impressionam: saída em 2K, clipes de 4 a 15 segundos com durações inteiras. O modelo já está disponível via API sob o ID MiniMax-H3 e no aplicativo de consumo Hailuo AI.

O que muda na prática

Até agora, produzir um vídeo com referência visual, movimento de câmera específico e trilha sonora exigia múltiplas ferramentas. O H3 faz tudo em um único pipeline. Um exemplo citado pela empresa: “use o movimento de câmera do Vídeo 1, faça o personagem da Imagem 2 cantar, combine com os vocais do Áudio 3”.

Isso é possível graças a quatro inovações técnicas:

  • Contextual Omni Representation: um sistema de legendagem que descreve a relação entre contexto e vídeo-alvo, não apenas o alvo. Cada material fonte gera cerca de 100K tokens de inferência, destilados para aproximadamente 4K tokens.
  • H3-VAE: um tokenizador redesenhado com taxa de compressão 4× maior, que é a tecnologia habilitadora da saída nativa em 2K.
  • H3-Omni Transformer: arquitetura que separa cargas de trabalho de compreensão e geração, resultando em um ganho de quase 30% na taxa de transferência de treinamento.
  • In-Context Regeneration: em vez de um módulo de super-resolução externo, o modelo regenera sua própria saída de baixa resolução no contexto, recuperando textos pequenos e detalhes finos que upscalers convencionais apenas “adivinham”.

Preço e posicionamento

A MiniMax afirma que o preço por segundo do H3 em 2K é menos de um terço dos principais modelos concorrentes. Em 768p, o custo é menos da metade do preço de modelos 720p tradicionais. Coberturas de terceiros apontam um valor de aproximadamente US$ 0,13 por segundo no modelo pay-as-you-go — cerca de US$ 1,95 por um clipe de 15 segundos.

Os limites da API merecem atenção: até 9 imagens de referência, 3 clipes de vídeo (2-15s cada, máximo 15s total), 3 clipes de áudio, limite de 12 arquivos por requisição e prompt de até 7.000 caracteres. O corpo da requisição não pode exceder 64 MB.

Por que isso importa

O H3 representa uma mudança de paradigma na geração de vídeo por IA. Em vez de evoluir incrementalmente os modelos de texto-para-vídeo, a MiniMax apostou em uma arquitetura omni-modal desde o início — e conseguiu. Para criadores de conteúdo, agências de publicidade e equipes de e-commerce, isso significa menos ferramentas, menos etapas e custo menor para produzir vídeos de alta qualidade com som sincronizado.

O modelo está disponível desde 31 de julho de 2026 na API da plataforma MiniMax.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.