Inteligência artificial, sem ruído.
Agentes de IA7 min

Asana diz ter cortado em 76 vezes o custo de agente de navegador com gestão de contexto

A Asana relata ter reduzido em 76 vezes o custo de um agente de navegador. Veja o que o estudo mediu e como testar gestão de contexto.

Asana diz ter cortado em 76 vezes o custo de agente de navegador com gestão de contexto

A Asana afirma ter reduzido em 76 vezes o custo estimado de um fluxo de agente de navegador e encurtado sua execução em cinco vezes ao combinar mudanças no gerenciamento de contexto com testes conduzidos pelo GPT-6 Astra em Codex. Segundo o estudo publicado em 9 de outubro de 2026 pela OpenAI e pela Asana, a configuração otimizada com GPT-6.1 Sol custou em média US$ 0,47 por execução e levou cerca de quatro minutos. O resultado é relevante porque aponta para uma variável frequentemente subestimada em agentes: não basta trocar de modelo; é preciso controlar o histórico, os anexos e o modo como cada chamada reutiliza contexto.

O que o estudo mediu — e o que ele não prova

O caso analisou um agente de navegador usado no StackAI, plataforma adquirida pela Asana para automação de fluxos entre aplicações. A tarefa do experimento era coletar seis campos para cada um de 32 livros em um catálogo público de demonstração. Foram comparadas quatro opções de modelos, identificadas parcialmente como Modelos A, B e C, além do GPT-6.1 Sol. Cada configuração foi rodada três vezes.

O número de 76 vezes compara o fluxo otimizado no GPT-6.1 Sol com uma configuração original de produção que usava o Modelo B. A própria fonte ressalva que algumas execuções da base chegaram ao limite de etapas antes de concluir; portanto, o custo médio de pelo menos US$ 36,21 para a linha de base é um piso, não uma medição completa. O resultado de US$ 0,47 não deve ser lido como preço universal de agentes de navegador: ele depende de uma tarefa específica, do desenho de ferramentas, de preços dos modelos e da política de contexto usada no teste.

Essa ressalva é central. Estudos de caso de fornecedores são evidência útil sobre um sistema concreto, mas não substituem avaliação independente nem garantem a mesma economia em sites dinâmicos, processos com login, compras, atendimento ou coleta de dados sensíveis.

Onde o dinheiro estava sendo gasto

A equipe descobriu que o agente já armazenava em cache instruções fixas e definições de ferramentas, mas reenviava a cada chamada todo o histórico crescente de texto de páginas e capturas de tela. Como o navegador acumulava observações, essa parte variável se transformava rapidamente no maior componente de entrada.

Havia um segundo problema: o sistema removia telas antigas e reduzia texto quase a cada etapa. Embora pareça uma economia intuitiva, essa edição recorrente alterava o histórico. Um cache depende de estabilidade para reaproveitar conteúdo; ao modificar continuamente a conversa, o sistema perdia a chance de reutilizar o contexto e também descartava informações que poderiam evitar visitas repetidas à mesma página.

O ajuste não foi simplesmente “guardar mais memória”. A Asana testou dois orçamentos de histórico — 120 mil e 480 mil caracteres — e seis políticas de cache e de descarte de imagens. A política escolhida deixava capturas se acumularem até 20 antes de reduzi-las para a mais recente. Ao manter trechos do histórico inalterados por períodos maiores, ela aumentava a fração de entrada atendida pelo cache.

Os números divulgados pela Asana

MétricaConfiguração original (Modelo B)Fluxo otimizado no GPT-6.1 SolObservação
Custo estimado por execuçãoPelo menos US$ 36,21US$ 0,47A base inclui execuções limitadas antes da conclusão.
Tempo por execuçãoPelo menos 22,5 minutosCerca de 4 minutosComparação reportada para o fluxo estudado.
Redução no custo—76xComparação entre os dois extremos acima.
Taxa de cache na entradaNão divulgada para a base89%A fonte afirma que entrada em cache custou 5% do preço não cacheado.
Dados divulgados pela OpenAI e pela Asana; não representam uma garantia para outros agentes ou tarefas.

Em uma comparação dentro do próprio GPT-6.1 Sol, o conjunto de contexto maior e a nova política reduziram o custo de US$ 1,97 para US$ 0,47 por execução — cerca de quatro vezes. A empresa relatou ainda que, no orçamento menor, apenas três de 18 execuções produziram resposta; com o orçamento maior, as 18 produziram respostas corretas para a tarefa avaliada. Isso sugere que cortar contexto cedo demais pode ser uma falsa economia: reduz tokens em uma chamada, mas aumenta falhas, repetições e tempo total.

Como transformar esse caso em uma avaliação útil

Empresas não precisam reproduzir o ambiente da Asana para aplicar a lição. O primeiro passo é instrumentar o agente. Registre por etapa: tokens de entrada e saída, proporção de cache, número de capturas, tamanho do histórico, chamadas de ferramenta, custo, duração, taxa de sucesso e motivo de falha. Sem essa telemetria, trocar modelos ou reduzir contexto vira tentativa e erro.

Depois, defina um conjunto de tarefas representativas e estáveis. Cada tarefa deve ter critério objetivo de conclusão e uma forma de verificar a resposta. Só então compare políticas de memória e modelos. A métrica correta não é o menor custo por chamada, mas o custo por tarefa concluída corretamente, somado ao tempo e à necessidade de intervenção humana.

  • Contexto estável: mantenha instruções e definições de ferramentas idênticas sempre que possível para aumentar o reaproveitamento de cache.
  • Resumos com disciplina: resuma apenas quando houver perda de valor no histórico, preservando identificadores, dados coletados e decisões tomadas.
  • Imagens com política explícita: telas são caras, mas removê-las a cada passo pode destruir continuidade. Teste limites e gatilhos.
  • Eval antes de produção: compare precisão, custo e duração com dados de teste; não use apenas uma demonstração bem-sucedida.
  • Guardrails operacionais: velocidade não substitui revisão humana em ações externas, formulários sensíveis ou operações irreversíveis.

Impacto prático para equipes no Brasil

Para companhias brasileiras que usam agentes em atendimento, back office, pesquisa ou operações de e-commerce, o caso reforça que a principal alavanca financeira pode estar na engenharia do fluxo, não somente no contrato com o provedor de modelo. Em workloads repetitivos, enviar novamente páginas, PDFs, imagens e diálogos inteiros pode tornar um piloto inviável antes mesmo de a qualidade do modelo ser o problema.

Mas a economia precisa ser acompanhada de governança. Um agente mais rápido que navega em sistemas internos, coleta informações ou preenche formulários tem mais capacidade de causar dano se sua permissão for ampla. Custos, qualidade, segurança e auditabilidade devem ser medidos juntos. Em especial sob a LGPD, logs e históricos devem ser desenhados para minimizar dados pessoais e ter retenção compatível com a finalidade.

Análise do NoticIA: cache é produto, não detalhe de infraestrutura

Na análise do NoticIA, o aprendizado mais sólido do estudo não é a promessa de uma redução fixa de 76 vezes. É a demonstração de que a memória de trabalho de um agente é parte do produto. Uma política de contexto define simultaneamente qualidade, latência e custo. Quando ela é tratada como um limite arbitrário de tokens, equipes tendem a alternar entre dois erros: guardar tudo e pagar caro, ou cortar agressivamente e obrigar o agente a redescobrir o que já sabia.

O teste também ilustra uma mudança no processo de engenharia: agentes de programação podem acelerar a criação de experimentos, refatorações e a inspeção de rastros. Isso não elimina a necessidade de desenho experimental. A amostra divulgada tem três repetições por configuração, modelos parcialmente não identificados e uma tarefa delimitada. O uso responsável é tirar hipóteses do caso e validá-las em ambiente próprio, não copiar o número para uma previsão de orçamento.

Limitações e próximos passos

O material não divulga valores brutos de todas as execuções nem desvios-padrão completos; os gráficos apresentados são descritos como reconstruções aproximadas a partir de imagens. Também não detalha como os resultados se comportam em tarefas longas com autenticação, mudanças de layout, bloqueios anti-automação ou conteúdo confidencial. A Asana informou que colocou as alterações de navegação em produção no StackAI e planeja integrar testes semelhantes às avaliações da plataforma.

Para quem compra ou constrói agentes, a pergunta útil passa a ser: qual é a taxa de sucesso e o custo por resultado correto no meu fluxo, e como eles mudam quando o agente precisa conservar contexto? A resposta exige benchmark próprio, mas o estudo fornece um bom roteiro para começá-lo.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.