Alta disponibilidade virou requisito
Quando modelos de IA sustentam workloads de negócio críticos, uma falha em uma única instância ou em uma zona de disponibilidade inteira não pode derrubar o serviço. A Salesforce enfrentou exatamente esse desafio ao servir modelos do Agentforce no Amazon SageMaker e encontrou a resposta nos SageMaker Inference Components (ICs) com o novo recurso de posicionamento por zona de disponibilidade.
O problema: cópias concentradas em uma única zona
Mesmo com um endpoint multi-AZ, as cópias de um modelo podem acabar concentradas em uma única zona sem controles explícitos de posicionamento. Isso significa que a queda de uma zona inteira pode derrubar todas as cópias de um modelo ao mesmo tempo.
Os três pilares do novo algoritmo de posicionamento
O novo algoritmo introduziu três melhorias que atendem diretamente aos requisitos de alta disponibilidade da Salesforce:
- Distribuição final equilibrada: considera o equilíbrio da distribuição final, e não apenas a necessidade imediata de posicionamento.
- Distribuição ciente de disponibilidade: espalha cópias de forma uniforme entre zonas, com melhor esforço, e persiste o posicionamento multi-AZ durante atualizações de modelo.
- Otimização dentro da zona: dentro de cada zona, a estratégia controla a distribuição por instância —
BINPACKempacota para maximizar uso de GPU, enquantoSPREADespalha cópias para máximo isolamento de falhas.
A Salesforce escolheu o SPREAD, priorizando isolamento de falhas sobre densidade de empacotamento.
Como configurar
O controle se dá pelo SchedulingConfig, com PlacementStrategy (SPREAD/BINPACK) e AvailabilityZoneBalance. Com MaxImbalance: 0, o algoritmo mira exatamente uma cópia por zona, mantendo o modelo disponível mesmo se uma zona inteira falhar. Modelos que precisam de vários GPUs por cópia seguem a mesma lógica.
Resultados
Com o recurso, a equipe de IA da Salesforce alcançou conformidade multi-AZ em todos os modelos da frota, eliminou pontos únicos de falha e preservou a eficiência de custo do co-hospedamento de múltiplos modelos. Operações de escala e atualizações de modelo deixaram de correr o risco de quebrar o equilíbrio entre zonas.
Para equipes de IA em empresas, a lição central é clara: alta disponibilidade precisa ser desenhada no nível do componente de inferência, com reserva de capacidade antecipada e monitoramento contínuo da distribuição entre zonas.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



