Inteligência artificial, sem ruído.
Tutoriais4 min

Pipeline de Geração de Vídeo e Áudio com MiniMax-H3 Usando APIs do ComfyUI

Tutorial prático: monte um pipeline completo de geração multimodal com MiniMax-H3 via APIs HTTP/WebSocket do ComfyUI, sem interface gráfica.

Pipeline de Geração de Vídeo e Áudio com MiniMax-H3 Usando APIs do ComfyUI

O que este tutorial entrega?

Este guia mostra como construir um pipeline completo de geração de vídeo e áudio multimodal usando o MiniMax-H3 com as APIs do ComfyUI como backend de inferência headless — sem interface gráfica. O fluxo cobre desde a configuração do ambiente (GPU, VRAM, disco) até a decodificação conjunta de vídeo e áudio, passando por seleção automática de perfil de pesos, montagem do grafo de execução direto em Python e comunicação via HTTP/WebSocket com o servidor ComfyUI.

O MiniMax-H3 é um modelo de difusão multimodal da Comfy-Org disponível no Hugging Face, capaz de gerar vídeos com áudio sincronizado a partir de descrições textuais. O modelo suporta três modos: texto-para-vídeo (t2v), geração condicionada por primeiro e último frame, e geração com imagens de referência.

Pré-requisitos de hardware

Requisitos de hardware para execução do MiniMax-H3.
ComponenteMínimoRecomendadoIdeal
GPU VRAM20 GB (perfil squeeze)38 GB (perfil balanced)70+ GB (perfil quality, A100)
Disco livre45 GB60 GB100+ GB
Suporte bf16Obrigatório — GPUs T4/K80 não funcionam
AmbienteGoogle Colab com runtime GPU (A100/L4/H100)

O pipeline seleciona automaticamente o perfil de pesos mais adequado com base na VRAM disponível: quality (≥70 GB, bf16), balanced (≥38 GB, int8) ou squeeze (≥20 GB, fp8 escalado).

Passo a passo do pipeline

1. Instalação e lançamento do ComfyUI

O script clona o repositório do ComfyUI, instala as dependências e faz o download dos pesos do Hugging Face — incluindo o UNet de fluxo (fl2va), o UNet de referência (ref2va), o text encoder baseado em Qwen3-VL 32B e ambos os VAEs (vídeo fp16 e áudio fp32). O servidor é lançado em localhost:8188 com flags de memória adequadas ao perfil selecionado.

2. Construção do grafo de execução

Diferente do uso interativo do ComfyUI, este tutorial monta o grafo de nós programaticamente em Python. Cada nó é validado contra o endpoint /object_info do servidor, garantindo compatibilidade de esquema antes do envio. O grafo inclui:

  • CLIPTextEncode: codificação do prompt textual
  • MiniMax_H3_Loader: carregamento do UNet, text encoder e VAEs
  • MiniMax_H3_Sampler: amostragem com parâmetros configuráveis (steps, sampler, scheduler, sigma shift)
  • VAEDecode (vídeo + áudio): decodificação conjunta dos latentes
  • Nós condicionais: para first-frame, last-frame e imagens de referência

3. Geração de vídeo com áudio sincronizado

O MiniMax-H3 gera vídeo e áudio em uma única passada. O prompt aceita direção cinematográfica detalhada: movimentos de câmera, cortes, marcações de tempo ([0s-2s]) e descrições de áudio ambiente. O tutorial inclui um exemplo completo de 5 segundos com plano aberto, plano médio e close-up, com som de tempestade e violoncelo.

O modelo consome frames em uma grade 17k+5 — o script calcula automaticamente o número de frames alinhado a essa restrição a partir da duração em segundos (a 24 fps).

4. Modos avançados de geração

Além do texto-para-vídeo básico, o pipeline suporta:

  • First/Last Frame: forneça imagens para o primeiro e último frame; o modelo interpola a transição
  • Reference Images: condicionamento visual com preservação de identidade e estilo
  • Turbo LoRA: modo rápido com apenas 8 passos (sampler Euler, scheduler Beta) para iterações ágeis

Desempenho dos perfis

Perfis de peso do MiniMax-H3 e requisitos de VRAM.
PerfilUNetText EncoderVRAMFlags
qualitybf16int8 (convrot)≥70 GB–normalvram
balancedint8 (convrot)nvfp4 (AWQ)≥38 GB–normalvram –cache-none
squeezefp8 scalednvfp4 (AWQ)≥20 GB–lowvram –cache-none –disable-smart-memory

Por que isso importa?

Em agosto de 2026, a geração de vídeo por IA está saindo dos serviços cloud proprietários (Runway, Pika, Kling) e chegando ao open-source executável localmente. O MiniMax-H3 é um dos primeiros modelos a oferecer geração conjunta de vídeo e áudio com qualidade cinematográfica, acessível via APIs padrão do ComfyUI. Para desenvolvedores brasileiros, isso significa poder construir pipelines de produção de vídeo automatizados sem depender de APIs pagas com latência de rede.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.