A Outpost VFX, estúdio de efeitos visuais com operações no Reino Unido, Canadá e Índia, conseguiu reduzir o tempo de treinamento de seus modelos de substituição de rosto de 1-2 semanas para apenas 2 dias. A melhoria de 8x foi obtida ao migrar de GPUs locais para instâncias Amazon EC2 P5 com múltiplas GPUs NVIDIA H100, em parceria com o AWS Generative AI Innovation Center.
O gargalo: treinamento com GPU única
No fluxo tradicional de substituição de rosto em VFX, a etapa de aprovação inicial de diretores exigia mais de 5 dias de composição ou suporte especializado. A Outpost já havia desenvolvido um modelo de IA para acelerar esse processo, mas o treinamento era limitado a uma única GPU (RTX 3090), resultando em ciclos de 1 a 2 semanas por ajuste fino. Isso criava gargalos críticos no cronograma de produção.
Arquitetura: paralelização com PyTorch DDP em instâncias P5
Para superar as limitações, a Outpost trabalhou com a equipe do AWS Generative AI Innovation Center durante 6 semanas. O código do modelo foi adaptado para usar a estratégia de treinamento distribuído PyTorch Distributed Data Parallel (DDP), que copia os pesos do modelo para cada GPU e permite processar mais imagens por lote de treinamento.
As instâncias EC2 P5 utilizam GPUs NVIDIA H100 com 14.592 núcleos CUDA e 80 GB de memória HBM3, além de interconexão NVLink para sincronização de gradientes em alta largura de banda — fator crítico para treinamento multi-GPU. A infraestrutura foi implantada em ambiente segregado e seguro, alinhado aos requisitos de segurança da Outpost para dados sensíveis de produção.
Resultados mensuráveis
- 8x mais rápido no treinamento do modelo de substituição de rosto (mesmo dataset, mesmos hiperparâmetros, mesmo limiar de perda).
- Redução de 1-2 semanas para 2 dias na entrega da versão v001 para revisão do diretor.
- Possibilidade de usar imagens de maior resolução e datasets maiores, melhorando a qualidade da saída.
Próximos passos e potencial futuro
A Outpost planeja aumentar ainda mais a resolução das imagens de entrada e explorar serviços como Amazon SageMaker AI para treinamento gerenciado, versionamento de modelos e inferência hospedada. A empresa também vê potencial em novas gerações de instâncias P5 com mais VRAM.
“O que mais me empolga é que esses modelos não são mais experimentos de pesquisa; estão se tornando parte integrante do pipeline moderno de VFX”, afirma Dheeraj Bhadani, Arquiteto de Software Líder da Outpost VFX.
Como aplicar essa abordagem no seu projeto
- Avalie sua utilização atual de GPU: identifique se gargalos de GPU única estão limitando o treinamento.
- Explore arquiteturas multi-GPU: instâncias EC2 P5 oferecem computação escalável para treinamento distribuído.
- Engaje o AWS Generative AI Innovation Center: a mesma equipe que ajudou a Outpost pode auxiliar na paralelização do seu workflow.
Links úteis
- Saiba mais sobre o AWS Generative AI Innovation Center
- Instâncias Amazon EC2 P5
- Documentação do PyTorch Distributed Data Parallel
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



