Inteligência artificial, sem ruído.
Agentes de IA7 min

AutoSynthData: como a ServiceNow transforma falhas de agentes em dados de treinamento

AutoSynthData usa falhas verificáveis para gerar tarefas sintéticas e melhorar agentes empresariais em testes controlados.

AutoSynthData: como a ServiceNow transforma falhas de agentes em dados de treinamento

AutoSynthData, projeto da ServiceNow CoreAI publicado em 2 de outubro de 2026, propõe um caminho pragmático para melhorar agentes empresariais: transformar falhas observadas em tarefas sintéticas que podem ser executadas, verificadas e usadas para treinamento. Em dois ambientes controlados do benchmark EnterpriseOps Gym, a equipe relata ganhos de Pass@1 após ajuste supervisionado do modelo Gemma-4-26B-A4B-it. O resultado é relevante porque ataca um gargalo real de agentes: o problema não é apenas gerar mais exemplos, mas gerar exemplos que correspondam às ferramentas, regras e estados de um sistema corporativo.

Em resumo

  • AutoSynthData parte de lacunas de capacidade do modelo-alvo e produz tarefas com especificação do sistema, pedido do usuário e verificador.
  • Em um domínio híbrido do EnterpriseOps Gym, a ServiceNow reporta aumento de 7,2 pontos percentuais no Pass@1, de 63,01% para 68,55% no sucesso do verificador.
  • Em ITSM, o Pass@1 médio subiu de 18,77% para 27,18%, segundo a publicação.
  • Os números são de um ambiente de benchmark da própria iniciativa; não demonstram, por si só, ganho em produção, segurança ou retorno financeiro.

O que a ServiceNow chama de AutoSynthData

Um agente corporativo atua em um ambiente com permissões, APIs, bases de conhecimento e estados que mudam. Um pedido como “reclassifique este incidente e avise a equipe responsável” só é uma boa amostra de treinamento se puder ser realizado naquele ambiente, obedecer às regras e tiver uma forma objetiva de conferir o efeito final.

A proposta da ServiceNow organiza cada tarefa em três partes: especificação do sistema, que descreve ferramentas, políticas e estado inicial; tarefa voltada ao agente, isto é, o pedido e suas restrições; e verificador, que checa se a trajetória realmente produziu o estado esperado. Essa última camada é central: sem ela, uma resposta bem redigida pode parecer correta mesmo quando o agente não alterou o registro, usou a ferramenta errada ou violou uma política.

O processo começa ao identificar capacidades nas quais o modelo-alvo falha. Um modelo mais forte atua como professor para gerar demonstrações em torno dessas lacunas. As tarefas candidatas passam por testes de viabilidade, realismo e dificuldade, além de críticas e reparos quando alguma condição falha. Há ainda uma revisão por lote para evitar que o conjunto fique dominado por tarefas fáceis ou repetitivas.

Por que dados sintéticos para agentes são mais difíceis do que texto sintético

Em geração de texto, uma amostra pode ser julgada principalmente pelo conteúdo. Em agentes, a qualidade depende da sequência de ações e do mundo em que ela é executada. Uma instrução pode estar gramaticalmente perfeita e ainda ser impossível porque exige uma API inexistente, acesso que o agente não possui ou uma transição de estado proibida.

Por isso, a abordagem procura fechar um ciclo: falha do modelo, geração de um novo problema que explora a capacidade ausente, execução com verificação, treinamento e nova medição. Conforme o modelo melhora, tarefas já dominadas perdem valor e o gerador deve se concentrar nas dificuldades restantes. A ideia se aproxima de um currículo adaptativo, mas condicionado às regras concretas do ambiente corporativo.

Os resultados divulgados no EnterpriseOps Gym

A avaliação usa o EnterpriseOps Gym, conjunto publicado pela equipe para simular cenários empresariais com estado e ferramentas. No domínio Hybrid, a equipe usou Gemma-4-26B-A4B-it como modelo-alvo e Qwen3.8-27B como professor. Foram geradas 2.000 amostras em cerca de 18 horas e o melhor checkpoint foi o da quinta época de treinamento.

AmbienteModelo professorDados sintéticos aceitosResultado reportado
HybridQwen3.8-27B2.000Pass@1 +7,2 p.p.; sucesso do verificador de 63,01% para 68,55%
ITSMDeepSeek-V4.1-Flash1.994Pass@1 médio de 18,77% para 27,18%
Resultados relatados pela ServiceNow no EnterpriseOps Gym; não são uma validação independente em produção.

No domínio Hybrid, a publicação descreve melhora relativa de 35% no Pass@1 e afirma que o ajuste fechou 59% da diferença inicial para o modelo de referência. No domínio ITSM, a geração levou 66 horas — mais tempo, segundo os autores, pelo uso de um professor maior e por ocorrer antes de otimizações do pipeline. Esses detalhes importam: a disponibilidade de uma técnica não elimina o custo de gerar, executar, revisar e treinar milhares de trajetórias.

O que os números permitem — e não permitem — concluir

Os testes são promissores porque as tarefas de treinamento foram geradas a partir de especificações de capacidade, sem receber as tarefas originais de avaliação. Isso reduz um risco óbvio de decorar o benchmark. Também é positivo que a fonte explicite o papel do verificador, em vez de equiparar uma resposta textual a uma ação concluída.

Mas a evidência permanece limitada ao EnterpriseOps Gym e aos modelos, professores e configurações descritos. A publicação não comprova que um agente treinado assim reduzirá incidentes, obedecerá a políticas internas mais complexas ou resistirá a instruções maliciosas em uma empresa real. O ganho no benchmark também não substitui avaliação de segurança, auditoria de dados, teste de regressão e aprovação humana para ações com impacto financeiro, jurídico ou operacional.

Impacto prático para equipes no Brasil

Para organizações brasileiras que usam IA em atendimento, operações de TI, RH ou back office, a lição aplicável não é “gerar mais dados”. É tratar o ambiente operacional como parte do produto de IA. Antes de pensar em ajuste fino, vale inventariar ações permitidas, estados verificáveis, exceções de negócio, fontes de verdade e trilhas de auditoria. Um agente que apenas redige uma solução não é equivalente a um agente que atualiza um sistema com permissão e deixa evidência verificável.

Em muitos casos, um conjunto menor de tarefas reais, com verificadores confiáveis, será mais útil que uma grande coleção de instruções genéricas. Também convém separar os papéis: o modelo pode propor e executar dentro de limites; regras determinísticas e leituras de volta devem confirmar o efeito; e pessoas devem aprovar mudanças sensíveis. Esse desenho reduz a tendência de tratar a confiança verbal do modelo como prova de execução.

Diagramas e materiais de apoio da publicação original

Diagrama do AutoSynthData publicado pela ServiceNow
Material visual da publicação original da ServiceNow.
Fluxo de geração e verificação de tarefas do AutoSynthData
Fluxo de geração e validação de tarefas.
Ilustração do ambiente de agentes empresariais
Ilustração incluída pela fonte.
Etapa de verificação do AutoSynthData
Etapa de verificação no material original.
Revisão de lote de tarefas sintéticas
Revisão por lote de tarefas sintéticas.
Resultados do AutoSynthData no ambiente Hybrid
Resultado no ambiente Hybrid, conforme a fonte.
Resultados do AutoSynthData no ambiente ITSM
Resultado no ambiente ITSM, conforme a fonte.
Comparação de modelos no experimento AutoSynthData
Comparação visual presente na publicação.
Ciclo de melhoria de dados sintéticos para agentes
Ciclo de melhoria descrito pela fonte.

Análise do NoticIA

A contribuição mais útil do AutoSynthData não é a promessa de um professor mais forte gerar exemplos para um modelo menor — essa receita já é comum. O ponto mais sólido é elevar o verificador ao mesmo nível da instrução e da demonstração. Em fluxos corporativos, o ativo difícil de construir não costuma ser o prompt; é a representação de uma ação válida e a prova de que ela produziu o efeito correto.

Isso muda a prioridade de implantação. Empresas que não conseguem definir estado inicial, permissão, efeito esperado e leitura de volta dificilmente obterão confiança adicional apenas com fine-tuning. Já equipes que constroem esses componentes podem usar dados sintéticos como amplificador de cobertura, não como substituto de governança. O próximo teste relevante será reproduzir os ganhos em ambientes heterogêneos, com integrações reais e métricas de custo, falha e segurança publicadas de forma independente.

Fonte e transparência

A fonte primária é o artigo “AutoSynthData: Generating Training Data for Enterprise Agents”, publicado pela ServiceNow CoreAI no Hugging Face em 2 de outubro de 2026. Os resultados numéricos citados foram reportados pelos próprios autores no EnterpriseOps Gym.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.