Inteligência artificial, sem ruído.
Infraestrutura2 min

Salesforce garante alta disponibilidade multi-AZ em modelos de IA com SageMaker

Novo algoritmo distribui cópias de modelos entre zonas de disponibilidade no SageMaker, eliminando pontos únicos de falha.

Salesforce garante alta disponibilidade multi-AZ em modelos de IA com SageMaker

Alta disponibilidade virou requisito

Quando modelos de IA sustentam workloads de negócio críticos, uma falha em uma única instância ou em uma zona de disponibilidade inteira não pode derrubar o serviço. A Salesforce enfrentou exatamente esse desafio ao servir modelos do Agentforce no Amazon SageMaker e encontrou a resposta nos SageMaker Inference Components (ICs) com o novo recurso de posicionamento por zona de disponibilidade.

O problema: cópias concentradas em uma única zona

Mesmo com um endpoint multi-AZ, as cópias de um modelo podem acabar concentradas em uma única zona sem controles explícitos de posicionamento. Isso significa que a queda de uma zona inteira pode derrubar todas as cópias de um modelo ao mesmo tempo.

Os três pilares do novo algoritmo de posicionamento

O novo algoritmo introduziu três melhorias que atendem diretamente aos requisitos de alta disponibilidade da Salesforce:

  • Distribuição final equilibrada: considera o equilíbrio da distribuição final, e não apenas a necessidade imediata de posicionamento.
  • Distribuição ciente de disponibilidade: espalha cópias de forma uniforme entre zonas, com melhor esforço, e persiste o posicionamento multi-AZ durante atualizações de modelo.
  • Otimização dentro da zona: dentro de cada zona, a estratégia controla a distribuição por instância — BINPACK empacota para maximizar uso de GPU, enquanto SPREAD espalha cópias para máximo isolamento de falhas.

A Salesforce escolheu o SPREAD, priorizando isolamento de falhas sobre densidade de empacotamento.

Como configurar

O controle se dá pelo SchedulingConfig, com PlacementStrategy (SPREAD/BINPACK) e AvailabilityZoneBalance. Com MaxImbalance: 0, o algoritmo mira exatamente uma cópia por zona, mantendo o modelo disponível mesmo se uma zona inteira falhar. Modelos que precisam de vários GPUs por cópia seguem a mesma lógica.

Resultados

Com o recurso, a equipe de IA da Salesforce alcançou conformidade multi-AZ em todos os modelos da frota, eliminou pontos únicos de falha e preservou a eficiência de custo do co-hospedamento de múltiplos modelos. Operações de escala e atualizações de modelo deixaram de correr o risco de quebrar o equilíbrio entre zonas.

Para equipes de IA em empresas, a lição central é clara: alta disponibilidade precisa ser desenhada no nível do componente de inferência, com reserva de capacidade antecipada e monitoramento contínuo da distribuição entre zonas.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.