Inteligência artificial, sem ruído.
Infraestrutura3 min

Outpost VFX acelera treinamento de IA para efeitos visuais com AWS e alcança ganho de 8x

A Outpost VFX, estúdio de efeitos visuais com operações no Reino Unido, Canadá e Índia, conseguiu reduzir o tempo de treinamento de seus modelos de…

Outpost VFX acelera treinamento de IA para efeitos visuais com AWS e alcança ganho de 8x
Imagem de apoio. Fonte: AWS ML Blog.

A Outpost VFX, estúdio de efeitos visuais com operações no Reino Unido, Canadá e Índia, conseguiu reduzir o tempo de treinamento de seus modelos de substituição de rosto de 1-2 semanas para apenas 2 dias. A melhoria de 8x foi obtida ao migrar de GPUs locais para instâncias Amazon EC2 P5 com múltiplas GPUs NVIDIA H100, em parceria com o AWS Generative AI Innovation Center.

O gargalo: treinamento com GPU única

No fluxo tradicional de substituição de rosto em VFX, a etapa de aprovação inicial de diretores exigia mais de 5 dias de composição ou suporte especializado. A Outpost já havia desenvolvido um modelo de IA para acelerar esse processo, mas o treinamento era limitado a uma única GPU (RTX 3090), resultando em ciclos de 1 a 2 semanas por ajuste fino. Isso criava gargalos críticos no cronograma de produção.

Arquitetura: paralelização com PyTorch DDP em instâncias P5

Para superar as limitações, a Outpost trabalhou com a equipe do AWS Generative AI Innovation Center durante 6 semanas. O código do modelo foi adaptado para usar a estratégia de treinamento distribuído PyTorch Distributed Data Parallel (DDP), que copia os pesos do modelo para cada GPU e permite processar mais imagens por lote de treinamento.

As instâncias EC2 P5 utilizam GPUs NVIDIA H100 com 14.592 núcleos CUDA e 80 GB de memória HBM3, além de interconexão NVLink para sincronização de gradientes em alta largura de banda — fator crítico para treinamento multi-GPU. A infraestrutura foi implantada em ambiente segregado e seguro, alinhado aos requisitos de segurança da Outpost para dados sensíveis de produção.

Resultados mensuráveis

  • 8x mais rápido no treinamento do modelo de substituição de rosto (mesmo dataset, mesmos hiperparâmetros, mesmo limiar de perda).
  • Redução de 1-2 semanas para 2 dias na entrega da versão v001 para revisão do diretor.
  • Possibilidade de usar imagens de maior resolução e datasets maiores, melhorando a qualidade da saída.

Próximos passos e potencial futuro

A Outpost planeja aumentar ainda mais a resolução das imagens de entrada e explorar serviços como Amazon SageMaker AI para treinamento gerenciado, versionamento de modelos e inferência hospedada. A empresa também vê potencial em novas gerações de instâncias P5 com mais VRAM.

“O que mais me empolga é que esses modelos não são mais experimentos de pesquisa; estão se tornando parte integrante do pipeline moderno de VFX”, afirma Dheeraj Bhadani, Arquiteto de Software Líder da Outpost VFX.

Como aplicar essa abordagem no seu projeto

  1. Avalie sua utilização atual de GPU: identifique se gargalos de GPU única estão limitando o treinamento.
  2. Explore arquiteturas multi-GPU: instâncias EC2 P5 oferecem computação escalável para treinamento distribuído.
  3. Engaje o AWS Generative AI Innovation Center: a mesma equipe que ajudou a Outpost pode auxiliar na paralelização do seu workflow.

Links úteis


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.