O que este tutorial entrega?
Este guia mostra como construir um pipeline completo de geração de vídeo e áudio multimodal usando o MiniMax-H3 com as APIs do ComfyUI como backend de inferência headless — sem interface gráfica. O fluxo cobre desde a configuração do ambiente (GPU, VRAM, disco) até a decodificação conjunta de vídeo e áudio, passando por seleção automática de perfil de pesos, montagem do grafo de execução direto em Python e comunicação via HTTP/WebSocket com o servidor ComfyUI.
O MiniMax-H3 é um modelo de difusão multimodal da Comfy-Org disponível no Hugging Face, capaz de gerar vídeos com áudio sincronizado a partir de descrições textuais. O modelo suporta três modos: texto-para-vídeo (t2v), geração condicionada por primeiro e último frame, e geração com imagens de referência.
Pré-requisitos de hardware
| Componente | Mínimo | Recomendado | Ideal |
|---|---|---|---|
| GPU VRAM | 20 GB (perfil squeeze) | 38 GB (perfil balanced) | 70+ GB (perfil quality, A100) |
| Disco livre | 45 GB | 60 GB | 100+ GB |
| Suporte bf16 | Obrigatório — GPUs T4/K80 não funcionam | ||
| Ambiente | Google Colab com runtime GPU (A100/L4/H100) | ||
O pipeline seleciona automaticamente o perfil de pesos mais adequado com base na VRAM disponível: quality (≥70 GB, bf16), balanced (≥38 GB, int8) ou squeeze (≥20 GB, fp8 escalado).
Passo a passo do pipeline
1. Instalação e lançamento do ComfyUI
O script clona o repositório do ComfyUI, instala as dependências e faz o download dos pesos do Hugging Face — incluindo o UNet de fluxo (fl2va), o UNet de referência (ref2va), o text encoder baseado em Qwen3-VL 32B e ambos os VAEs (vídeo fp16 e áudio fp32). O servidor é lançado em localhost:8188 com flags de memória adequadas ao perfil selecionado.
2. Construção do grafo de execução
Diferente do uso interativo do ComfyUI, este tutorial monta o grafo de nós programaticamente em Python. Cada nó é validado contra o endpoint /object_info do servidor, garantindo compatibilidade de esquema antes do envio. O grafo inclui:
- CLIPTextEncode: codificação do prompt textual
- MiniMax_H3_Loader: carregamento do UNet, text encoder e VAEs
- MiniMax_H3_Sampler: amostragem com parâmetros configuráveis (steps, sampler, scheduler, sigma shift)
- VAEDecode (vídeo + áudio): decodificação conjunta dos latentes
- Nós condicionais: para first-frame, last-frame e imagens de referência
3. Geração de vídeo com áudio sincronizado
O MiniMax-H3 gera vídeo e áudio em uma única passada. O prompt aceita direção cinematográfica detalhada: movimentos de câmera, cortes, marcações de tempo ([0s-2s]) e descrições de áudio ambiente. O tutorial inclui um exemplo completo de 5 segundos com plano aberto, plano médio e close-up, com som de tempestade e violoncelo.
O modelo consome frames em uma grade 17k+5 — o script calcula automaticamente o número de frames alinhado a essa restrição a partir da duração em segundos (a 24 fps).
4. Modos avançados de geração
Além do texto-para-vídeo básico, o pipeline suporta:
- First/Last Frame: forneça imagens para o primeiro e último frame; o modelo interpola a transição
- Reference Images: condicionamento visual com preservação de identidade e estilo
- Turbo LoRA: modo rápido com apenas 8 passos (sampler Euler, scheduler Beta) para iterações ágeis
Desempenho dos perfis
| Perfil | UNet | Text Encoder | VRAM | Flags |
|---|---|---|---|---|
| quality | bf16 | int8 (convrot) | ≥70 GB | –normalvram |
| balanced | int8 (convrot) | nvfp4 (AWQ) | ≥38 GB | –normalvram –cache-none |
| squeeze | fp8 scaled | nvfp4 (AWQ) | ≥20 GB | –lowvram –cache-none –disable-smart-memory |
Por que isso importa?
Em agosto de 2026, a geração de vídeo por IA está saindo dos serviços cloud proprietários (Runway, Pika, Kling) e chegando ao open-source executável localmente. O MiniMax-H3 é um dos primeiros modelos a oferecer geração conjunta de vídeo e áudio com qualidade cinematográfica, acessível via APIs padrão do ComfyUI. Para desenvolvedores brasileiros, isso significa poder construir pipelines de produção de vídeo automatizados sem depender de APIs pagas com latência de rede.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



