Inteligência artificial, sem ruído.
Agentes de IA7 min

DeskForge: pesquisa treina agentes de IA para agir em desktops complexos

DeskForge cria desktops anotados para treinar agentes de IA. O estudo relata ganhos em localização de controles e tarefas de várias etapas.

DeskForge: pesquisa treina agentes de IA para agir em desktops complexos

DeskForge é um ambiente de treinamento para agentes que operam computadores por interface gráfica. O projeto, apresentado em 1º de outubro de 2026, monta desktops Linux com aplicativos reais, janelas sobrepostas, temas e resoluções variadas; em seguida, registra a tela, a árvore de acessibilidade, a geometria dos elementos e o resultado de cada clique. A proposta ataca uma falha concreta dos agentes de “computer use”: saber qual botão, campo ou janela deve receber uma ação quando a tela está cheia de distrações.

Os autores também apresentam o DeskForge-1M, conjunto com 1.207.368 observações anotadas, 159.723.780 instâncias de elementos de interface e 917 mil transições de clique. Em testes reportados pelos próprios pesquisadores, o ajuste fino com uma fração do material elevou a precisão de localização do Qwen3.5-4B em benchmarks externos e melhorou a conclusão de tarefas longas sem trocar o planejador do agente.

Resumo: o que o trabalho propõe

  • Cria cenas de desktop executáveis, em vez de apenas coletar capturas estáticas de tela.
  • Combina screenshot, árvore de acessibilidade e geometria das janelas para rotular elementos visíveis e parcialmente encobertos.
  • Registra ações e o estado posterior, permitindo associar um clique à consequência observada.
  • Testa se esse treinamento melhora tanto o “onde clicar” quanto a execução de tarefas com várias etapas.

O gargalo que DeskForge tenta resolver

Um agente de computador normalmente divide o trabalho em duas partes. O planejador interpreta o objetivo e decide uma etapa, como “abrir a planilha e localizar o filtro”. O modelo de ação precisa então localizar na imagem da tela o alvo correto e executar o gesto. A segunda parte parece simples quando há uma única janela, mas muda de natureza com diálogos, painéis sobrepostos, botões visualmente parecidos, barras de ferramentas e elementos parcialmente ocultos.

Dados de treinamento existentes costumam cobrir uma aplicação isolada ou um alvo por captura. Segundo o artigo, isso deixa pouco espaço para aprender a lidar com concorrência visual entre aplicativos e com oclusão — exatamente as situações que aparecem no trabalho diário com navegador, editor, e-mail e gerenciador de arquivos abertos ao mesmo tempo. DeskForge tenta transformar essas variáveis em parâmetros controláveis.

Como o ambiente monta e anota os desktops

O ambiente inicia aplicações reais em sessões Linux isoladas e define, por especificação, quais programas aparecem, quais conteúdos são carregados, o arranjo e a sobreposição das janelas, o tema visual e a resolução. O conjunto publicado descreve 19 aplicações, sete configurações de aparência e sete resoluções. Assim, o mesmo editor ou navegador pode aparecer ao lado de outros programas, em uma posição diferente e com informações diferentes na tela.

A anotação não depende apenas da árvore de acessibilidade. Essa árvore ajuda a identificar papéis e nomes, mas não informa por si só o que está de fato visível quando uma janela cobre outra. DeskForge reconcilia a árvore, a captura renderizada e a geometria das janelas. Para cada elemento, preserva tipo, texto, região visível, relação hierárquica, aplicativo proprietário, estado de oclusão e propriedades de interação. Os autores afirmam que uma auditoria humana encontrou 99,8% de correção em uma amostra das anotações; esse número é uma medição do projeto, não uma validação independente.

O formato ScreenTag serializa essa estrutura em uma representação compacta. Em vez de marcar apenas um retângulo-alvo, ele pode representar fragmentos visíveis de um campo coberto, sinalizar texto oculto e manter a relação com a janela. Cada clique registrado liga a tela anterior, a coordenada de ação e a tela seguinte. Um modelo de visão e linguagem converte essas mudanças em instruções de um passo para criar supervisão de grounding.

O que os resultados mostram — e o que não mostram

Os pesquisadores ajustaram quatro modelos visão-linguagem com 200 mil exemplos de grounding: Qwen3.5-4B, Gemma4-E4B, InternVL3.5-8B e UI-R1-3B. No caso do Qwen3.5-4B, a precisão média nas quatro condições retidas pelo estudo passou de 76,26% para 87,54%. Em benchmarks externos, o artigo informa ganhos de 11,51 pontos percentuais no ScreenSpot-Pro e de 10,11 pontos no OSWorld-G.

O teste mais útil para avaliar a conexão com agentes completos mantém fixo um planejador Qwen3.6-27B e altera apenas o modelo responsável por apontar a ação. No painel WebArena-Infinity usado pelos autores, o Qwen3.5-4B passou de 31 para 50 tarefas resolvidas entre 119; no OpenApps, de 3 para 15 em 100. Esses resultados sugerem que erros de localização podem limitar a tarefa inteira, mesmo quando o plano textual é o mesmo.

Há limites importantes. O trabalho é um preprint no arXiv, ainda sem revisão por pares. As avaliações, os conjuntos e a configuração de planejamento foram definidos pelos autores; portanto, os números não equivalem a uma garantia de desempenho em sistemas comerciais, ambientes Windows corporativos ou fluxos com dados sensíveis. A página do projeto informa que framework, dados e modelos serão liberados, mas organizações interessadas devem conferir licença, documentação e requisitos antes de incorporar qualquer artefato.

Comparação com o que já existia

AbordagemFoco predominanteLimitação que DeskForge procura endereçar
Capturas e benchmarks de telaLocalizar elementos em imagens ou páginas isoladasPouca variação controlada de janelas e pouca execução após a ação
Ambientes de tarefas como WebArenaAvaliar se o agente termina uma tarefaNão foram criados para fornecer anotação densa de todos os elementos
DeskForgeGerar cenas executáveis, anotações densas e transiçõesAinda precisa demonstrar generalização fora dos benchmarks e cenários do estudo
Comparação conceitual baseada na descrição e na tabela de recursos do projeto DeskForge.

Impacto prático para equipes no Brasil

Para empresas brasileiras que avaliam agentes para atendimento interno, conferência de documentos, cadastro em sistemas legados ou automação de backoffice, o resultado reforça uma decisão de arquitetura: não basta escolher um modelo que planeje bem em texto. É necessário medir separadamente a capacidade de interpretar a interface, localizar o alvo e recuperar-se quando o ambiente muda. Uma automação que clica no botão errado pode produzir dano operacional mesmo quando a instrução em linguagem natural parece correta.

O caminho imediato não é substituir RPA por um agente treinado com DeskForge. O material é de pesquisa e os ganhos divulgados ocorrem em uma configuração experimental. Mas há uma consequência prática: avaliações internas deveriam incluir layouts alterados, janelas sobrepostas, resoluções diferentes, diálogos inesperados e permissões explícitas antes de ações irreversíveis. Logs de tela, confirmação humana em etapas de risco e limites de acesso continuam necessários.

Análise do NoticIA: o valor está em separar visão e decisão

Na análise do NoticIA, a contribuição mais relevante não é apenas o volume de 159,7 milhões de elementos anotados. É tratar o desktop como um ambiente composto e mutável, em que “ver” inclui entender o que está tapado, a qual aplicativo um controle pertence e se uma ação realmente mudou o estado. Essa separação entre planejamento e grounding também torna o diagnóstico mais objetivo: uma falha pode estar no raciocínio sobre a tarefa ou na percepção da interface, e cada uma exige correção diferente.

Ao mesmo tempo, a escala não resolve o problema de confiança. Interfaces reais incluem políticas corporativas, pop-ups de autenticação, dados privados e exceções que não aparecem em um conjunto curado. O próximo teste relevante será verificar se os ganhos persistem em fluxos heterogêneos, com governança e custo operacional compatíveis com uso fora do laboratório.

O que acompanhar a seguir

O projeto merece acompanhamento quando seus artefatos forem efetivamente disponibilizados: documentação de reprodução, licença, composição dos dados, requisitos de infraestrutura e avaliações independentes serão mais informativos do que uma nova tabela de benchmark. Para quem constrói agentes, a pergunta adequada não é “o modelo consegue clicar?”, mas “ele consegue justificar o alvo, perceber mudanças e falhar de forma segura?”. DeskForge oferece uma base de pesquisa para medir essa diferença.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.