Um pré-print datado de 26 de agosto de 2026 descreve um sistema em FPGA para prever o tempo de execução de jobs em computação de alto desempenho (HPC). A comparação principal reporta até 63,85% menos erro absoluto médio (MAE) em relação às estimativas feitas pelos próprios usuários e até 71,88% menos MAE diante de um modelo estático. Em um benchmark de ponta a ponta, o sistema alcançou aceleração média de 17 vezes sobre uma linha de base em AVX e processou até 1.711 jobs por segundo.
Como a previsão funciona
O estudo se pergunta se um ensemble de software pode ser adaptado a hardware de ponto fixo sem estouro de valor, prevendo o runtime de jobs a partir de parâmetros conhecidos no momento da submissão. Para a análise final, o preditor usou seis campos disponíveis na submissão: NODE_TYPE, QUEUE_NAME, NODES_REQUESTED, CORES_REQUESTED, GPUS_REQUESTED e REQUESTED_CORE_HOURS.
Os dados históricos vieram do Argonne Leadership Computing Facility (ALCF), do MIT Supercloud e do UIUC Blue Waters. O ALCF, sozinho, contribuiu com cerca de 4 milhões de jobs brutos e quase 4 milhões de jobs retidos após a limpeza. O sistema também removeu linhas com runtime zero ou negativo e descartou telemetria pós-submissão para evitar viés e vazamento temporal.
Hardware e resultados
O hardware usou duas FPGAs AMD Alveo U55C: uma cuidou da inferência do modelo Conifer-FPU (a etapa de previsão) e a outra rodou o escalonador STANNIC. Em testes de mudança sintética de comportamento, o modelo aditivo — chamado ADD — partiu de um modelo base com 64 árvores e adicionou outras 64 treinadas em um lote recente de jobs com comportamento deslocado.
Nos cenários de mudança construídos a partir dos dados do ALCF, o modelo ADD apresentou MAE menor que o modelo base em todas as 10 configurações, com redução média de 33,8%. A avaliação usou validação cruzada de cinco dobras com amostragem estratificada.
O trabalho mostra que aceleradores reconfiguráveis como FPGA conseguem assumir parte da carga de previsão e escalonamento em data centers de HPC com ganhos expressivos de vazão e precisão — um avanço relevante para quem opera clusters científicos em larga escala.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.


