Um novo sistema de geração de código com IA, chamado MACGen, reportou ganhos significativos em segurança usando uma arquitetura de quatro agentes colaborativos. Em comparação com o prompting direto, o MACGen elevou a métrica combinada F&S@1 em 19,61 pontos percentuais no CWEval e em 10,57 pontos percentuais no BaxBench.
O que as métricas mostram
O trabalho acompanha três medidas principais: Func@1 para funcionalidade, Sec@1 para segurança e uma medida combinada. O resultado mais revelador é a troca entre elas: no CWEval, o Func@1 caiu 0,56 ponto percentual, enquanto o Sec@1 subiu 23,82 pontos percentuais. Ou seja, o sistema sacrifica uma fração mínima de funcionalidade para ganhar uma melhora expressiva em segurança.
Por que múltiplos agentes ajudam
A divisão do trabalho entre agentes especializados — um para gerar, outro para revisar segurança, outro para testar funcionalidade, por exemplo — permite que cada etapa seja verificada por um ponto de vista dedicado. É a mesma lógica de um code review humano com múltiplos revisores, só que automatizada.
Contexto e limitações
Os resultados vêm de um preprint, ainda sem revisão por pares, e de benchmarks específicos de segurança de código. O ganho em segurança não elimina a necessidade de revisão humana em código crítico — mas sugere uma direção promissora para reduzir vulnerabilidades em código gerado por IA.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



