A DeepSeek enviou nesta segunda-feira (29) um e-mail aos usuários de sua API confirmando que a versão oficial do DeepSeek V4 será lançada em meados de julho e, junto com ela, virá uma mudança significativa na estratégia de precificação: a introdução de um mecanismo de preços dinâmicos baseado em variações de pico e vale.
Preços dobram nos horários de pico
Com o novo modelo, os preços atuais passam a valer como tarifa normal, enquanto os horários de pico — definidos como 1h–4h e 6h–10h em UTC (equivalente a 9h–12h e 14h–18h no fuso de Pequim, UTC+8) — terão valores exatamente duas vezes maiores.
As duas variantes da API são afetadas:
DeepSeek V4 Pro
| Item | Preço normal | Preço em horário de pico |
|---|---|---|
| 1M tokens de entrada (cache hit) | $0,003625 | $0,00725 |
| 1M tokens de entrada (cache miss) | $0,435 | $0,87 |
| 1M tokens de saída | $0,87 | $1,74 |
DeepSeek V4 Flash
| Item | Preço normal | Preço em horário de pico |
|---|---|---|
| 1M tokens de entrada (cache hit) | $0,0028 | $0,0056 |
| 1M tokens de entrada (cache miss) | $0,14 | $0,28 |
| 1M tokens de saída | $0,28 | $0,56 |
Na prática, uma chamada ao V4 Pro com 100 mil tokens de entrada (sem cache) e 10 mil tokens de saída em horário de pico custará cerca de US$ 0,104 — contra US$ 0,052 no horário normal. Para o V4 Flash, o mesmo cenário sai por US$ 0,034 no pico e US$ 0,017 no vale.
A DeepSeek informou que enviará notificações por e-mail com 24 horas de antecedência da data exata da atualização de preços. O uso continuado dos serviços após o ajuste será considerado aceitação dos novos termos de faturamento, com opção de cancelamento e reembolso para quem não concordar.
O que o DeepSeek V4 entrega
A versão preview do DeepSeek V4 foi lançada recentemente e já está disponível via API, aplicativo e interface web. O modelo foi open source e está publicado no Hugging Face e ModelScope, com artigo técnico no arXiv (2606.19348).
Entre os principais avanços da nova geração:
- Contexto de 1 milhão de tokens como padrão em todos os serviços oficiais, viabilizado por um novo mecanismo de atenção com compressão na dimensão de tokens combinada com atenção esparsa (DeepSeek Sparse Attention).
- Agentes significativamente melhores: em coding agentic, o V4 Pro já é o melhor modelo open source disponível. A própria DeepSeek relata que o utiliza internamente como modelo de coding, com desempenho superior ao Claude Sonnet 4.5 e qualidade de entregas próxima ao Opus 4.6 em modo não-pensante.
- Raciocínio de classe mundial: nos benchmarks de matemática, STEM e código competitivo, o V4 Pro supera todos os modelos open source já avaliados publicamente e compete com os melhores modelos fechados.
- Modo de pensamento (thinking mode) com parâmetro
reasoning_effortajustável em high ou max, recomendado para tarefas complexas de agentes. - Duas interfaces de API: compatível com os formatos OpenAI ChatCompletions e Anthropic.
A variante Flash sacrifica um pouco de conhecimento de mundo em favor de custo e velocidade, mas mantém desempenho de raciocínio próximo ao V4 Pro em tarefas mais simples.
Mudanças para quem já usa a API
Os nomes de modelo legados deepseek-chat e deepseek-reasoner serão descontinuados em 24 de julho de 2026 — três meses após o lançamento da preview. Até lá, eles apontam respectivamente para o V4 Flash em modo não-pensante e modo pensante. Para acessar os novos modelos diretamente, os usuários devem usar deepseek-v4-pro ou deepseek-v4-flash como valor do parâmetro model, mantendo a mesma URL base.
O que muda no mercado
O preço dinâmico por faixa horária é uma estratégia incomum entre provedores de API de IA. OpenAI, Anthropic e Google mantêm tabelas fixas independentemente do horário. A justificativa da DeepSeek — “melhor alocar recursos e aprimorar a estabilidade do serviço” — indica que a empresa está sentindo pressão de capacidade em determinadas janelas, possivelmente relacionada à adoção massiva após o lançamento da preview.
A precificação por pico também funciona como um sinal econômico para redistribuir demanda: clientes sensíveis a custo tenderão a agendar workloads pesados para os horários de vale, liberando capacidade nos picos para casos de uso de baixa latência ou tempo real.
Mesmo com a duplicação nos horários de pico, os preços permanecem competitivos. O V4 Flash em horário de vale custa US$ 0,14 por milhão de tokens de entrada — mais barato que o GPT-4o Mini (US$ 0,15) e significativamente mais barato que o Claude 3.5 Haiku (US$ 0,80). No pico, sobe para US$ 0,28, ainda abaixo do Haiku.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



