O teto era baixo
Pesquisadores testaram o quanto a evicção de cache de atenção (KV cache) poderia melhorar e descobriram que a resposta, na maioria das vezes, era: pouco. Em oito famílias de modelos e nos orçamentos examinados, a fatia mediana do intervalo restante que um subconjunto melhor mantido poderia fechar ficou entre 2,1% e 4,7%. A seleção por top-mass — a regra que mantém as chaves com o maior peso de atenção original — já empatava exatamente com a referência ESpool em 39% dos casos com s = 4, e 21% com s = 8.
O resultado vem do preprint “Trust the Mass: Forced Weights in KV-Cache Eviction”, de Jack Shi e Jerry Gu, publicado como v1 no arXiv em 25 de agosto de 2026. O estudo responde a uma pergunta estreita: com os pesos de atenção do modelo fixos, um seletor mantém algumas chaves, renormaliza os pesos e devolve a média ponderada. A disputa é sobre quais chaves sobrevivem, não sobre reaprender os pesos. Sob esse setup de pesos forçados, os autores interpretam o teto baixo como evidência de que o top-mass está perto do melhor subconjunto atingível nos dados testados.
Uma busca grande, com limite embutido
O painel principal de “frozen-head” continha 111.744 instâncias de query-linha. Seis braços adicionais levaram a análise a dez modelos, incluindo um braço de 56.448 instâncias no Qwen2.5-7B e uma rodada de diversidade de conteúdo com 72.576 instâncias. Para estimar o teto, os pesquisadores enumeraram exaustivamente um conjunto restrito de subconjuntos candidatos e os verificaram com um solver de factibilidade cônico de segunda ordem de inteiros mistos, com 120 segundos por caso em um manifesto de 960 instâncias (21 casos estouraram limite de memória).
Como a busca foi restrita a esse conjunto de candidatos, o resultado é uma estimativa da melhoria disponível dentro do espaço de busca testado, não uma garantia de que nenhum outro subconjunto poderia ir melhor. A massa descartada pela seleção top-mass previu erro não nulo com AUC (área sob a curva ROC) de 0,76 a 0,85 em quatro famílias principais, e de 0,76 a 0,89 nos dez braços.
Quando os bytes contam, o quadro muda
Os testes de implantação cobriram Llama-3.1-8B-Instruct, Qwen2.5-7B-Instruct, Qwen3-8B e Qwen3-14B, com contextos de 4.096 a 32.768 tokens, rodando RULER e LongBench pelo pipeline oficial kvpress da NVIDIA e comparando quatorze baselines de biblioteca (nove de seleção uniforme e cinco por cabeça).
Isso expôs uma distinção prática entre selecionar menos e armazenar menos. Nos testes de needle, os nove métodos de seleção uniforme mantinham de 0,24% a 4,3% do cache total; os cinco métodos por cabeça (incluindo o KVzip) mantinham o cache inteiro, porque suas escolhas eram representadas como uma máscara sobre um tensor de slots iguais. O ContourKV mantinha de 0,15% a 5,3% quando seu orçamento era de fato aplicado. Em outras palavras, um orçamento de seleção reportado não significava automaticamente que o pipeline usava menos cache.
O custo de aplicar um orçamento nominal foi grande mesmo quando o ranking não mudava: pontuações foram menores em 140 de 157 condições (e maiores em nenhuma), com diferença média de 14,1 pontos no LongBench com s = 32 e de 62,2 pontos no RULER com s = 128.
Visibilidade da pergunta importa
Um segundo alerta veio da recuperação. Em oito condições de documentos pareados no Llama-3.1-8B (s = 64 e 128), restringir o ranking às linhas do documento mudou o hit rate em −88,2 pontos; mover a evicção para a fronteira do documento produziu −87,6 pontos. A diferença entre as duas condições foi de apenas 0,6 ponto. Como os rankings foram computados depois que as linhas da pergunta ficaram visíveis, os resultados quase idênticos sugerem que boa parte da margem aparente de recuperação coincidia com a visibilidade da pergunta, e não com a alocação em si.
O preprint não é revisado por pares e não reporta financiamento. A conclusão ampla, porém, é clara: os ganhos de seleção foram pequenos, e os detalhes de implementação podem ser grandes — um recado direto para quem está otimizando inferência de modelos grandes na prática.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



