DeskForge é um ambiente de treinamento para agentes que operam computadores por interface gráfica. O projeto, apresentado em 1º de outubro de 2026, monta desktops Linux com aplicativos reais, janelas sobrepostas, temas e resoluções variadas; em seguida, registra a tela, a árvore de acessibilidade, a geometria dos elementos e o resultado de cada clique. A proposta ataca uma falha concreta dos agentes de “computer use”: saber qual botão, campo ou janela deve receber uma ação quando a tela está cheia de distrações.
Os autores também apresentam o DeskForge-1M, conjunto com 1.207.368 observações anotadas, 159.723.780 instâncias de elementos de interface e 917 mil transições de clique. Em testes reportados pelos próprios pesquisadores, o ajuste fino com uma fração do material elevou a precisão de localização do Qwen3.5-4B em benchmarks externos e melhorou a conclusão de tarefas longas sem trocar o planejador do agente.
Resumo: o que o trabalho propõe
- Cria cenas de desktop executáveis, em vez de apenas coletar capturas estáticas de tela.
- Combina screenshot, árvore de acessibilidade e geometria das janelas para rotular elementos visíveis e parcialmente encobertos.
- Registra ações e o estado posterior, permitindo associar um clique à consequência observada.
- Testa se esse treinamento melhora tanto o “onde clicar” quanto a execução de tarefas com várias etapas.
O gargalo que DeskForge tenta resolver
Um agente de computador normalmente divide o trabalho em duas partes. O planejador interpreta o objetivo e decide uma etapa, como “abrir a planilha e localizar o filtro”. O modelo de ação precisa então localizar na imagem da tela o alvo correto e executar o gesto. A segunda parte parece simples quando há uma única janela, mas muda de natureza com diálogos, painéis sobrepostos, botões visualmente parecidos, barras de ferramentas e elementos parcialmente ocultos.
Dados de treinamento existentes costumam cobrir uma aplicação isolada ou um alvo por captura. Segundo o artigo, isso deixa pouco espaço para aprender a lidar com concorrência visual entre aplicativos e com oclusão — exatamente as situações que aparecem no trabalho diário com navegador, editor, e-mail e gerenciador de arquivos abertos ao mesmo tempo. DeskForge tenta transformar essas variáveis em parâmetros controláveis.
Como o ambiente monta e anota os desktops
O ambiente inicia aplicações reais em sessões Linux isoladas e define, por especificação, quais programas aparecem, quais conteúdos são carregados, o arranjo e a sobreposição das janelas, o tema visual e a resolução. O conjunto publicado descreve 19 aplicações, sete configurações de aparência e sete resoluções. Assim, o mesmo editor ou navegador pode aparecer ao lado de outros programas, em uma posição diferente e com informações diferentes na tela.
A anotação não depende apenas da árvore de acessibilidade. Essa árvore ajuda a identificar papéis e nomes, mas não informa por si só o que está de fato visível quando uma janela cobre outra. DeskForge reconcilia a árvore, a captura renderizada e a geometria das janelas. Para cada elemento, preserva tipo, texto, região visível, relação hierárquica, aplicativo proprietário, estado de oclusão e propriedades de interação. Os autores afirmam que uma auditoria humana encontrou 99,8% de correção em uma amostra das anotações; esse número é uma medição do projeto, não uma validação independente.
O formato ScreenTag serializa essa estrutura em uma representação compacta. Em vez de marcar apenas um retângulo-alvo, ele pode representar fragmentos visíveis de um campo coberto, sinalizar texto oculto e manter a relação com a janela. Cada clique registrado liga a tela anterior, a coordenada de ação e a tela seguinte. Um modelo de visão e linguagem converte essas mudanças em instruções de um passo para criar supervisão de grounding.
O que os resultados mostram — e o que não mostram
Os pesquisadores ajustaram quatro modelos visão-linguagem com 200 mil exemplos de grounding: Qwen3.5-4B, Gemma4-E4B, InternVL3.5-8B e UI-R1-3B. No caso do Qwen3.5-4B, a precisão média nas quatro condições retidas pelo estudo passou de 76,26% para 87,54%. Em benchmarks externos, o artigo informa ganhos de 11,51 pontos percentuais no ScreenSpot-Pro e de 10,11 pontos no OSWorld-G.
O teste mais útil para avaliar a conexão com agentes completos mantém fixo um planejador Qwen3.6-27B e altera apenas o modelo responsável por apontar a ação. No painel WebArena-Infinity usado pelos autores, o Qwen3.5-4B passou de 31 para 50 tarefas resolvidas entre 119; no OpenApps, de 3 para 15 em 100. Esses resultados sugerem que erros de localização podem limitar a tarefa inteira, mesmo quando o plano textual é o mesmo.
Há limites importantes. O trabalho é um preprint no arXiv, ainda sem revisão por pares. As avaliações, os conjuntos e a configuração de planejamento foram definidos pelos autores; portanto, os números não equivalem a uma garantia de desempenho em sistemas comerciais, ambientes Windows corporativos ou fluxos com dados sensíveis. A página do projeto informa que framework, dados e modelos serão liberados, mas organizações interessadas devem conferir licença, documentação e requisitos antes de incorporar qualquer artefato.
Comparação com o que já existia
| Abordagem | Foco predominante | Limitação que DeskForge procura endereçar |
|---|---|---|
| Capturas e benchmarks de tela | Localizar elementos em imagens ou páginas isoladas | Pouca variação controlada de janelas e pouca execução após a ação |
| Ambientes de tarefas como WebArena | Avaliar se o agente termina uma tarefa | Não foram criados para fornecer anotação densa de todos os elementos |
| DeskForge | Gerar cenas executáveis, anotações densas e transições | Ainda precisa demonstrar generalização fora dos benchmarks e cenários do estudo |
Impacto prático para equipes no Brasil
Para empresas brasileiras que avaliam agentes para atendimento interno, conferência de documentos, cadastro em sistemas legados ou automação de backoffice, o resultado reforça uma decisão de arquitetura: não basta escolher um modelo que planeje bem em texto. É necessário medir separadamente a capacidade de interpretar a interface, localizar o alvo e recuperar-se quando o ambiente muda. Uma automação que clica no botão errado pode produzir dano operacional mesmo quando a instrução em linguagem natural parece correta.
O caminho imediato não é substituir RPA por um agente treinado com DeskForge. O material é de pesquisa e os ganhos divulgados ocorrem em uma configuração experimental. Mas há uma consequência prática: avaliações internas deveriam incluir layouts alterados, janelas sobrepostas, resoluções diferentes, diálogos inesperados e permissões explícitas antes de ações irreversíveis. Logs de tela, confirmação humana em etapas de risco e limites de acesso continuam necessários.
Análise do NoticIA: o valor está em separar visão e decisão
Na análise do NoticIA, a contribuição mais relevante não é apenas o volume de 159,7 milhões de elementos anotados. É tratar o desktop como um ambiente composto e mutável, em que “ver” inclui entender o que está tapado, a qual aplicativo um controle pertence e se uma ação realmente mudou o estado. Essa separação entre planejamento e grounding também torna o diagnóstico mais objetivo: uma falha pode estar no raciocínio sobre a tarefa ou na percepção da interface, e cada uma exige correção diferente.
Ao mesmo tempo, a escala não resolve o problema de confiança. Interfaces reais incluem políticas corporativas, pop-ups de autenticação, dados privados e exceções que não aparecem em um conjunto curado. O próximo teste relevante será verificar se os ganhos persistem em fluxos heterogêneos, com governança e custo operacional compatíveis com uso fora do laboratório.
O que acompanhar a seguir
O projeto merece acompanhamento quando seus artefatos forem efetivamente disponibilizados: documentação de reprodução, licença, composição dos dados, requisitos de infraestrutura e avaliações independentes serão mais informativos do que uma nova tabela de benchmark. Para quem constrói agentes, a pergunta adequada não é “o modelo consegue clicar?”, mas “ele consegue justificar o alvo, perceber mudanças e falhar de forma segura?”. DeskForge oferece uma base de pesquisa para medir essa diferença.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



