Por que isso importa agora
Agentes de IA que operam por longos períodos transformaram a inferência de grandes modelos de linguagem em um problema de memória. Contextos de milhões de tokens criam caches KV que pressionam a memória HBM, o SSD e a largura de banda. Foi exatamente nesse gargalo que a DeepSeek concentrou o seu mais novo lançamento: o DeepSeek-V4.1-Flash.
O modelo é uma mistura de especialistas (MoE) multimodal com 552 bilhões de parâmetros no backbone e 196 bilhões adicionais no módulo de memória condicional Engram. Ele suporta uma janela de contexto de 1 milhão de tokens e ativa apenas 8 bilhões de parâmetros por token durante o prefill e 16 bilhões durante a decodificação.
O número que chama atenção
A pegada global de cache KV caiu para 890 bytes por token — cerca de um quarto do DeepSeek-V4-Flash e 437 vezes menor que a do DeepSeek-V1. Na prática, isso significa que dá para servir contextos muito longos sem esgotar a memória do servidor, reduzindo o custo de rodar agentes de longo horizonte.
Os pesos abertos são distribuídos sob licença MIT, com suporte a vLLM, SGLang e Transformers no Hugging Face. A DeepSeek também descreve uma API pública com níveis de raciocínio baixo, alto e máximo.
Arquitetura CED e atenção esparsa CSA2
O backbone de 40 camadas é dividido em um codificador causal de 20 camadas e um decodificador de 20 camadas, inspirado no YOCO. Como o decodificador não calcula o próprio KV global — ele o deriva da camada final do codificador — o custo de prefill praticamente cai pela metade.
A atenção esparsa CSA2 ataca o tamanho do cache ao longo do eixo das camadas, dividindo cada uma em três modos (Full, Reindex e Reuse) que compartilham o KV principal e os índices Top-K. O cache KV principal é quantizado para FP4 (E2M1), quase metade do armazenamento do FP8 usado na geração anterior.
Resultados e benchmarks
O treinamento cobriu 45 trilhões de tokens multimodais (proporção 7:1 texto-multimodal), com atenção esparsa treinada do zero em sequências de 64K e contexto estendido para 1M. Nos benchmarks de esforço máximo, o modelo supera o Opus-5 e o GPT-5.6 Sol no Terminal-Bench 2.1 (90,6) e no DeepSWE v1.1 (74,2), além de marcar 90,9 no GPQA Diamond e rating 3471 no Codeforces.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



