Inteligência artificial, sem ruído.
Agentes de IA2 min

SkillShield insere skill de segurança no prompt para defender agentes de IA que programam

Defesa baseada em prompt reduziu ataques de agentes de codificação em benchmarks; taxa de sucesso de execução maliciosa caiu de 66,2% para 43,6%.

SkillShield insere skill de segurança no prompt para defender agentes de IA que programam

O risco dos agentes que programam

Agentes de IA que escrevem e executam código já são usados para tarefas reais de desenvolvimento, mas também podem ser induzidos a executar ações maliciosas ou gerar malware por meio de instruções enganosas. Um pré-print do arXiv propõe uma defesa simples e barata: embutir uma “skill” de segurança diretamente no prompt do sistema do agente.

Como funciona a SkillShield

A SkillShield é uma defesa de “espaço de prompt”: uma skill de segurança completa é colocada no prompt do sistema antes do início da sessão, garantindo cobertura desde o primeiro passo. A geração da skill usou um orçamento de 10.000 caracteres (cerca de 2.500 tokens), com refinamento em blocos de 2.000 caracteres.

O estudo testou três formas de provisionamento — “todas as classes”, “por pacote” e “por classe” — definidas antes das requisições, sem seleção adaptativa em tempo de execução. As execuções dos agentes foram limitadas a 10 passos, com custo máximo de US$ 0,10 e timeout de 600 segundos em contêineres Docker isolados.

Os números

Nos testes limpos do benchmark RedCode, a configuração proativa “todas as classes” registrou 43,6% de taxa média de sucesso de ataque na execução e 0,58 de pontuação de geração de malware, contra 66,2% e 3,28 sem defesa. O Llama Guard 3, usado como comparação, registrou 42,7% e 1,40. As médias foram calculadas sobre seis LLMs, então descrevem o grupo testado, não todo agente de codificação.

O benchmark RedCode-Exec continha 27 grupos de tarefas com 30 casos-base cada (810 casos), e o RedCode-Gen tinha 160 casos em oito famílias de malware. O escopo importa: a provisão “por classe” teve 6,0% de sucesso de ataque dentro do escopo, contra 34,1% de “todas as classes” — e o agente sem defesa chegou a 79% em uma classe não vista.

O que ainda falta provar

Os testes de jailbreak usaram reformulações fixas e não adaptativas, e a defesa depende de o modelo continuar seguindo as instruções do prompt do sistema — não é uma barreira independente de aplicação de ações. Os resultados vêm de benchmarks controlados, não de implantação em produção. Ainda assim, é uma evidência de que segurança pode ser adicionada a agentes de codificação com custo computacional baixo, algo relevante para times que já usam agentes em pipelines de desenvolvimento.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.