Inteligência artificial, sem ruído.
Modelos e LLMs2 min

DeepSeek lança V4.1-Flash: contexto de 1M de tokens e cache KV 437 vezes menor

Modelo multimodal de 552B parâmetros usa atenção esparsa CSA2 e quantização FP4 para cortar o custo de servir agentes de longo horizonte. Pesos abertos sob licença MIT.

DeepSeek lança V4.1-Flash: contexto de 1M de tokens e cache KV 437 vezes menor

Por que isso importa agora

Agentes de IA que operam por longos períodos transformaram a inferência de grandes modelos de linguagem em um problema de memória. Contextos de milhões de tokens criam caches KV que pressionam a memória HBM, o SSD e a largura de banda. Foi exatamente nesse gargalo que a DeepSeek concentrou o seu mais novo lançamento: o DeepSeek-V4.1-Flash.

O modelo é uma mistura de especialistas (MoE) multimodal com 552 bilhões de parâmetros no backbone e 196 bilhões adicionais no módulo de memória condicional Engram. Ele suporta uma janela de contexto de 1 milhão de tokens e ativa apenas 8 bilhões de parâmetros por token durante o prefill e 16 bilhões durante a decodificação.

O número que chama atenção

A pegada global de cache KV caiu para 890 bytes por token — cerca de um quarto do DeepSeek-V4-Flash e 437 vezes menor que a do DeepSeek-V1. Na prática, isso significa que dá para servir contextos muito longos sem esgotar a memória do servidor, reduzindo o custo de rodar agentes de longo horizonte.

Os pesos abertos são distribuídos sob licença MIT, com suporte a vLLM, SGLang e Transformers no Hugging Face. A DeepSeek também descreve uma API pública com níveis de raciocínio baixo, alto e máximo.

Arquitetura CED e atenção esparsa CSA2

O backbone de 40 camadas é dividido em um codificador causal de 20 camadas e um decodificador de 20 camadas, inspirado no YOCO. Como o decodificador não calcula o próprio KV global — ele o deriva da camada final do codificador — o custo de prefill praticamente cai pela metade.

A atenção esparsa CSA2 ataca o tamanho do cache ao longo do eixo das camadas, dividindo cada uma em três modos (Full, Reindex e Reuse) que compartilham o KV principal e os índices Top-K. O cache KV principal é quantizado para FP4 (E2M1), quase metade do armazenamento do FP8 usado na geração anterior.

Resultados e benchmarks

O treinamento cobriu 45 trilhões de tokens multimodais (proporção 7:1 texto-multimodal), com atenção esparsa treinada do zero em sequências de 64K e contexto estendido para 1M. Nos benchmarks de esforço máximo, o modelo supera o Opus-5 e o GPT-5.6 Sol no Terminal-Bench 2.1 (90,6) e no DeepSWE v1.1 (74,2), além de marcar 90,9 no GPQA Diamond e rating 3471 no Codeforces.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.