Inteligência artificial, sem ruído.
Modelos e LLMs4 min

DeepSeek Lança V4-Flash-0731: Pós-Treinamento Eleva Desempenho Agêntico e de Código Acima do V4-Pro

DeepSeek publicou o V4-Flash-0731 com novos benchmarks que superam o V4-Pro em tarefas de agentes e código, mantendo a arquitetura de 284B e custando um terço do preço.

DeepSeek Lança V4-Flash-0731: Pós-Treinamento Eleva Desempenho Agêntico e de Código Acima do V4-Pro

O que mudou no modelo flash da DeepSeek

A DeepSeek publicou no Hugging Face a versão DeepSeek-V4-Flash-0731 em 31 de julho de 2026, substituindo oficialmente o preview anterior. A arquitetura permanece a mesma — 284 bilhões de parâmetros no total, com 13 bilhões ativados por token —, mas o ganho de desempenho vem de um novo pós-treinamento, e não de um redesenho estrutural.

O checkpoint inclui o módulo de decodificação especulativa DSpark, elevando o total de parâmetros reportados no Hugging Face para 304 bilhões (284B base + 20B do módulo draft). Na API, o endpoint deepseek-v4-flash agora suporta nativamente o formato Responses API e está adaptado para o Codex CLI da OpenAI.

Preço: um terço do V4-Pro

A precificação oficial coloca o V4-Flash em US$ 0,14 por 1M de tokens de entrada (cache miss), US$ 0,0028 em cache hit, e US$ 0,28 por 1M de tokens de saída — cerca de um terço do V4-Pro, que custa US$ 0,87 na saída. O limite de concorrência é de 2.500 requisições simultâneas. Para startups, desenvolvedores independentes e times internos, rodar loops agênticos nesse preço dispensa orçamento de GPU.

Para self-hosting, os pesos têm licença MIT e estão disponíveis sem restrições. Mas cada expert fica residente em memória: o build 8-bit lossless da Unsloth ocupa 162 GB, e o de 3 bits, 103 GB, exigindo cerca de 110 GB combinados de RAM mais VRAM. O exemplo oficial da DeepSeek com vLLM usa um nó 4×GB300.

Arquitetura: MoE com atenção híbrida

O V4-Flash é um MoE (Mixture of Experts) com janela de contexto de 1 milhão de tokens. Cada camada MoE tem 1 expert compartilhado e 256 experts roteados (dimensão intermediária 2048), com 6 experts disparados por token. As três primeiras camadas usam hash routing. A profundidade de multi-token prediction é 1.

A atenção é híbrida: Compressed Sparse Attention (CSA) atende blocos selecionados, enquanto Heavily Compressed Attention (HCA) atende um resumo comprimido. As conexões residuais convencionais são substituídas por Manifold-Constrained Hyper-Connections (mHC), com fator de expansão 4 e 20 iterações Sinkhorn-Knopp. O pré-treinamento usou mais de 32 trilhões de tokens com o otimizador Muon.

A eficiência relatada no paper do V4 — 27% dos FLOPs de inferência single-token e 10% do cache KV em relação ao DeepSeek-V3.2 em contexto de 1M tokens — é do V4-Pro, não do Flash.

Benchmarks: supera o V4-Pro em tarefas agênticas

Todos os números abaixo são reportados pela DeepSeek no model card 0731:

BenchmarkV4-Flash-0731V4-Flash (Preview)V4-Pro (Preview)GLM-5.2Opus-4.8
Terminal Bench 2.182,761,872,181,085,0
NL2Repo54,239,438,548,969,7
Cybergym76,738,752,783,1
DeepSWE54,47,312,846,258,0
Toolathlon-Verified70,349,755,959,976,2
Agents’ Last Exam25,215,816,523,825,7
AutomationBench Public25,110,812,812,927,2
Benchmarks reportados pela DeepSeek no model card 0731

O salto é expressivo: no DeepSWE, o Flash saiu de 7,3 para 54,4; no Cybergym, de 38,7 para 76,7. Em todos os benchmarks agênticos listados, o V4-Flash-0731 supera o V4-Pro (Preview), custando um terço do preço de saída.

Duas ressalvas importantes: os testes de código foram rodados com o modo mínimo do DeepSeek Harness, que não foi liberado publicamente. DSBench-FullStack (68,7) e DSBench-Hard (59,6) são conjuntos internos. Scores agênticos são sensíveis ao harness — execuções independentes podem divergir.

Como servir o modelo

O DSpark é ativado com uma flag no vLLM:

--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

O paper do DSpark reporta 60–85% de aceleração na geração por usuário em relação ao baseline MTP-1, com throughput agregado equivalente.

Não há template Jinja de chat. A DeepSeek fornece uma pasta encoding/ com funções encode_messages e parse_message_from_completion_text. O parâmetro reasoning_effort aceita low, high ou max. A recomendação oficial é temperature = 1.0 e top_p = 0.95 para uso agêntico, com até 384K tokens de saída nos modos high e max.

Por que isso importa

O V4-Flash-0731 mostra que pós-treinamento bem executado pode mais que triplicar a performance agêntica sem mudar um único parâmetro da arquitetura. Para o ecossistema brasileiro de desenvolvimento, isso significa que modelos com licença MIT e preço acessível (US$ 0,28/1M tokens de saída) já competem em tarefas de código e agentes com modelos proprietários muito mais caros. Equipes que usam Codex CLI, Cline ou Aider podem testar o endpoint deepseek-v4-flash como alternativa de custo.

O código está disponível no Hugging Face com licença MIT e pesos sem restrição de acesso.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.