Inteligência artificial, sem ruído.
Infraestrutura7 min

Ai2 troca prioridades por orçamento de GPU e reduz intervenção em reparos

Ai2 detalha como orçamento de tempo, fair-share e preempção tornaram a fila de GPUs mais justa e reduziram trabalho operacional.

Ai2 troca prioridades por orçamento de GPU e reduz intervenção em reparos

A Allen Institute for AI (Ai2) substituiu um modelo de prioridades por um sistema que distribui orçamento de tempo de GPU, aplica compartilhamento justo hierárquico e permite preempção após um período mínimo declarado. Segundo a organização, a mudança reduziu em 74% as intervenções humanas necessárias para reparos de hosts e tornou visível uma disputa que costuma ficar escondida em laboratórios de IA: quem deve usar capacidade escassa, por quanto tempo e sob quais regras.

O problema: prioridade vira corrida para o topo

Treinar modelos de linguagem, visão e robótica depende de grupos de GPUs caros e disputados. No Ai2, os clusters descritos no relato usam GPUs NVIDIA H100, B200 e B300 em grupos de 88 a 1.024 unidades, atendendo cerca de 150 pesquisadores. A demanda declarada varia entre duas e três vezes a capacidade disponível. Nesse cenário, uma fila convencional com níveis de prioridade pode se degradar rapidamente: se todos marcam seus trabalhos como urgentes, “alta prioridade” deixa de diferenciar qualquer coisa.

Foi o que a equipe relata ter observado. Havia inflação de prioridade, tarefas protegidas contra interrupção e até workloads sem trabalho útil mantidos em execução para reservar lugar no cluster. O efeito não é apenas desperdício de hardware. Ele transfere a decisão sobre investimento científico para quem consegue dominar a fila ou negociar uma exceção operacional, em vez de para quem tem o projeto mais relevante.

Orçamento de tempo em vez de posse de GPU

A solução adotada pelo Ai2 troca a ideia de entregar GPUs fixas a cada grupo pela alocação de uma parcela de tempo de GPU. Lideranças definem antecipadamente o orçamento dos programas e projetos; o escalonador usa esses pesos para escolher quais tarefas recebem capacidade. A organização chama isso de tratar gestores como investidores: em vez de tentar prever exatamente quais experiências surgirão, define-se quanto da capacidade total cada frente pode consumir de acordo com a estratégia de pesquisa.

Na prática, cada trabalho protegido precisa ser financiado por um orçamento. Uma tarefa que ocupa recursos sem produzir resultado passa a consumir o próprio orçamento da equipe, reduzindo o incentivo para “guardar” GPUs. Isso não cria mais capacidade física, mas muda os incentivos: o custo de usar tempo improdutivamente aparece para quem toma a decisão.

Como funciona o compartilhamento justo

O mecanismo de fila usa fair-share hierárquico. O algoritmo acompanha, em uma janela móvel de sete dias por padrão, quanto cada alocação já utilizou e favorece as que ficaram abaixo da parcela prevista. A técnica tem precedentes em sistemas como Hadoop Fair Scheduler, SLURM Fair Tree e YARN; o diferencial do caso do Ai2 está em ligar os pesos à estrutura real dos programas de pesquisa e a orçamentos definidos por gestores.

O relato separa dois estados de ocupação. A ocupação alocada é cobrada do orçamento e recebe proteção contra preempção durante a janela mínima de execução. A ocupação não alocada não é cobrada, pode ser interrompida a qualquer momento e serve para aproveitar GPUs que ficariam ociosas. A combinação busca evitar dois extremos comuns: hardware parado por uma reserva rígida e fila travada por tarefas que nunca cedem espaço.

O contrato de execução e a preempção

Treinamentos distribuídos podem durar dias ou semanas. Sem um limite, uma tarefa que começou em condições favoráveis pode bloquear o reequilíbrio da fila por tempo indefinido. Por isso, o sistema exige que cada workload declare seu tempo mínimo de execução e se pode ser retomado. Durante esse período, recebe proteção. Depois, pode continuar se seu orçamento ainda justificar prioridade ou ser interrompido, recolocado na fila e retomado mais tarde.

O Ai2 limitou o tempo mínimo protegido a oito horas. O objetivo não é interromper trabalhos aleatoriamente: é dar ao escalonador pontos regulares para reequilibrar recursos e permitir manutenção de máquinas sem negociações manuais longas. A organização afirma que esse contrato reduziu em 74% os reparos que precisavam de participação humana.

O que melhorou — e o que ficou pior

  • Menos barganha operacional: orçamento e prioridade passam a ser discutidos antes da execução, não durante incidentes.
  • Maior uso de capacidade: tarefas sem orçamento podem aproveitar ciclos ociosos, mas cedem quando há demanda protegida.
  • Manutenção mais automatizável: hosts podem drenar workloads ao término de uma janela mínima.
  • Mais previsibilidade coletiva: projetos com demanda sustentada podem receber sua fatia de tempo na janela observada.

Há custos. Sessões interativas de desenvolvimento, especialmente as que mantêm estado local por horas, sofreram com a preempção. O Ai2 reconhece que pesquisadores dependiam desse estado mais do que previa e planeja oferecer capacidade de CPU próxima do armazenamento local e sessões restauráveis. Também há risco de fragmentação: muitos trabalhos protegidos podem dificultar a abertura simultânea de GPUs para um treinamento muito grande. A equipe ainda investiga esse efeito com simulações e dados de produção.

Por que isso importa para empresas e laboratórios brasileiros

O debate vale para qualquer operação que compartilha GPUs entre treinamento, inferência, prototipagem e análise. No Brasil, onde a capacidade própria tende a ser menor e o custo de nuvem precisa ser controlado de perto, deixar a alocação depender de mensagens em canais internos ou de quem inicia uma tarefa primeiro é uma forma cara de governança. Mesmo equipes que usam serviços gerenciados podem aplicar os mesmos princípios: orçamento por projeto, limites de concorrência, checkpoints frequentes, filas separadas para tarefas interativas e métricas de utilização que não incentivem desperdício.

Também é importante não confundir ocupação com produtividade. Um cluster em 100% de uso pode estar rodando experiências mal dimensionadas, tarefas duplicadas ou processos à espera de dados. O caso do Ai2 sugere que a pergunta certa não é apenas “quantas GPUs estão ativas?”, mas “qual projeto está consumindo esta hora de GPU e por quê?”.

Análise do NoticIA: capacidade de IA é também um problema de governança

Na análise do NoticIA, a lição mais útil não é copiar um algoritmo de fila, mas reconhecer que escassez de computação é uma decisão organizacional. Prioridade sem custo vira prioridade para todos; reserva sem prazo vira posse; e uma métrica isolada de utilização pode estimular comportamentos que reduzem o resultado global. Ao converter capacidade em orçamento explícito, o Ai2 tornou o conflito mensurável e contestável.

O modelo exige maturidade: checkpoints confiáveis, workloads que sobrevivam à retomada, dados de fila e líderes capazes de justificar prioridades. Para uma empresa que ainda não tem isso, a primeira etapa não é instalar um novo escalonador. É catalogar workloads, medir tempo de espera, identificar processos que não toleram interrupção e estabelecer uma regra transparente para aprovar exceções.

Checklist para começar

  1. Meça a demanda real, o tempo de espera e as horas de GPU desperdiçadas.
  2. Classifique tarefas em interativas, tolerantes a preempção e críticas.
  3. Exija checkpointing antes de liberar longas execuções preemptíveis.
  4. Defina orçamento e responsável por projeto, com revisão periódica.
  5. Monitore fragmentação e reserve mecanismos específicos para grandes jobs distribuídos.

O estudo de caso mostra que aumentar o valor entregue por um cluster não depende exclusivamente de comprar mais aceleradores. Regras claras de alocação, preempção recuperável e dados de uso podem liberar capacidade operacional e reduzir o custo humano de manter a infraestrutura funcionando.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.