O que mudou no modelo flash da DeepSeek
A DeepSeek publicou no Hugging Face a versão DeepSeek-V4-Flash-0731 em 31 de julho de 2026, substituindo oficialmente o preview anterior. A arquitetura permanece a mesma — 284 bilhões de parâmetros no total, com 13 bilhões ativados por token —, mas o ganho de desempenho vem de um novo pós-treinamento, e não de um redesenho estrutural.
O checkpoint inclui o módulo de decodificação especulativa DSpark, elevando o total de parâmetros reportados no Hugging Face para 304 bilhões (284B base + 20B do módulo draft). Na API, o endpoint deepseek-v4-flash agora suporta nativamente o formato Responses API e está adaptado para o Codex CLI da OpenAI.
Preço: um terço do V4-Pro
A precificação oficial coloca o V4-Flash em US$ 0,14 por 1M de tokens de entrada (cache miss), US$ 0,0028 em cache hit, e US$ 0,28 por 1M de tokens de saída — cerca de um terço do V4-Pro, que custa US$ 0,87 na saída. O limite de concorrência é de 2.500 requisições simultâneas. Para startups, desenvolvedores independentes e times internos, rodar loops agênticos nesse preço dispensa orçamento de GPU.
Para self-hosting, os pesos têm licença MIT e estão disponíveis sem restrições. Mas cada expert fica residente em memória: o build 8-bit lossless da Unsloth ocupa 162 GB, e o de 3 bits, 103 GB, exigindo cerca de 110 GB combinados de RAM mais VRAM. O exemplo oficial da DeepSeek com vLLM usa um nó 4×GB300.
Arquitetura: MoE com atenção híbrida
O V4-Flash é um MoE (Mixture of Experts) com janela de contexto de 1 milhão de tokens. Cada camada MoE tem 1 expert compartilhado e 256 experts roteados (dimensão intermediária 2048), com 6 experts disparados por token. As três primeiras camadas usam hash routing. A profundidade de multi-token prediction é 1.
A atenção é híbrida: Compressed Sparse Attention (CSA) atende blocos selecionados, enquanto Heavily Compressed Attention (HCA) atende um resumo comprimido. As conexões residuais convencionais são substituídas por Manifold-Constrained Hyper-Connections (mHC), com fator de expansão 4 e 20 iterações Sinkhorn-Knopp. O pré-treinamento usou mais de 32 trilhões de tokens com o otimizador Muon.
A eficiência relatada no paper do V4 — 27% dos FLOPs de inferência single-token e 10% do cache KV em relação ao DeepSeek-V3.2 em contexto de 1M tokens — é do V4-Pro, não do Flash.
Benchmarks: supera o V4-Pro em tarefas agênticas
Todos os números abaixo são reportados pela DeepSeek no model card 0731:
| Benchmark | V4-Flash-0731 | V4-Flash (Preview) | V4-Pro (Preview) | GLM-5.2 | Opus-4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82,7 | 61,8 | 72,1 | 81,0 | 85,0 |
| NL2Repo | 54,2 | 39,4 | 38,5 | 48,9 | 69,7 |
| Cybergym | 76,7 | 38,7 | 52,7 | — | 83,1 |
| DeepSWE | 54,4 | 7,3 | 12,8 | 46,2 | 58,0 |
| Toolathlon-Verified | 70,3 | 49,7 | 55,9 | 59,9 | 76,2 |
| Agents’ Last Exam | 25,2 | 15,8 | 16,5 | 23,8 | 25,7 |
| AutomationBench Public | 25,1 | 10,8 | 12,8 | 12,9 | 27,2 |
O salto é expressivo: no DeepSWE, o Flash saiu de 7,3 para 54,4; no Cybergym, de 38,7 para 76,7. Em todos os benchmarks agênticos listados, o V4-Flash-0731 supera o V4-Pro (Preview), custando um terço do preço de saída.
Duas ressalvas importantes: os testes de código foram rodados com o modo mínimo do DeepSeek Harness, que não foi liberado publicamente. DSBench-FullStack (68,7) e DSBench-Hard (59,6) são conjuntos internos. Scores agênticos são sensíveis ao harness — execuções independentes podem divergir.
Como servir o modelo
O DSpark é ativado com uma flag no vLLM:
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'O paper do DSpark reporta 60–85% de aceleração na geração por usuário em relação ao baseline MTP-1, com throughput agregado equivalente.
Não há template Jinja de chat. A DeepSeek fornece uma pasta encoding/ com funções encode_messages e parse_message_from_completion_text. O parâmetro reasoning_effort aceita low, high ou max. A recomendação oficial é temperature = 1.0 e top_p = 0.95 para uso agêntico, com até 384K tokens de saída nos modos high e max.
Por que isso importa
O V4-Flash-0731 mostra que pós-treinamento bem executado pode mais que triplicar a performance agêntica sem mudar um único parâmetro da arquitetura. Para o ecossistema brasileiro de desenvolvimento, isso significa que modelos com licença MIT e preço acessível (US$ 0,28/1M tokens de saída) já competem em tarefas de código e agentes com modelos proprietários muito mais caros. Equipes que usam Codex CLI, Cline ou Aider podem testar o endpoint deepseek-v4-flash como alternativa de custo.
O código está disponível no Hugging Face com licença MIT e pesos sem restrição de acesso.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



