Inteligência artificial, sem ruído.
Modelos e LLMs4 min

DeepSeek V4 chega em julho com preço dinâmico: API dobra de valor em horários de pico

DeepSeek confirma lançamento oficial do V4 para meados de julho e introduz precificação dinâmica: preços dobram nos horários de pico (9h-12h e 14h-18h no fuso chinês). Modelo open source já está disponível em preview com contexto de 1M de tokens.

DeepSeek V4 chega em julho com preço dinâmico: API dobra de valor em horários de pico
Imagem de apoio. Fonte: DeepSeek (comunicado por e-mail + WeChat oficial).

A DeepSeek enviou nesta segunda-feira (29) um e-mail aos usuários de sua API confirmando que a versão oficial do DeepSeek V4 será lançada em meados de julho e, junto com ela, virá uma mudança significativa na estratégia de precificação: a introdução de um mecanismo de preços dinâmicos baseado em variações de pico e vale.

Preços dobram nos horários de pico

Com o novo modelo, os preços atuais passam a valer como tarifa normal, enquanto os horários de pico — definidos como 1h–4h e 6h–10h em UTC (equivalente a 9h–12h e 14h–18h no fuso de Pequim, UTC+8) — terão valores exatamente duas vezes maiores.

As duas variantes da API são afetadas:

DeepSeek V4 Pro

ItemPreço normalPreço em horário de pico
1M tokens de entrada (cache hit)$0,003625$0,00725
1M tokens de entrada (cache miss)$0,435$0,87
1M tokens de saída$0,87$1,74

DeepSeek V4 Flash

ItemPreço normalPreço em horário de pico
1M tokens de entrada (cache hit)$0,0028$0,0056
1M tokens de entrada (cache miss)$0,14$0,28
1M tokens de saída$0,28$0,56

Na prática, uma chamada ao V4 Pro com 100 mil tokens de entrada (sem cache) e 10 mil tokens de saída em horário de pico custará cerca de US$ 0,104 — contra US$ 0,052 no horário normal. Para o V4 Flash, o mesmo cenário sai por US$ 0,034 no pico e US$ 0,017 no vale.

A DeepSeek informou que enviará notificações por e-mail com 24 horas de antecedência da data exata da atualização de preços. O uso continuado dos serviços após o ajuste será considerado aceitação dos novos termos de faturamento, com opção de cancelamento e reembolso para quem não concordar.

O que o DeepSeek V4 entrega

A versão preview do DeepSeek V4 foi lançada recentemente e já está disponível via API, aplicativo e interface web. O modelo foi open source e está publicado no Hugging Face e ModelScope, com artigo técnico no arXiv (2606.19348).

Entre os principais avanços da nova geração:

  • Contexto de 1 milhão de tokens como padrão em todos os serviços oficiais, viabilizado por um novo mecanismo de atenção com compressão na dimensão de tokens combinada com atenção esparsa (DeepSeek Sparse Attention).
  • Agentes significativamente melhores: em coding agentic, o V4 Pro já é o melhor modelo open source disponível. A própria DeepSeek relata que o utiliza internamente como modelo de coding, com desempenho superior ao Claude Sonnet 4.5 e qualidade de entregas próxima ao Opus 4.6 em modo não-pensante.
  • Raciocínio de classe mundial: nos benchmarks de matemática, STEM e código competitivo, o V4 Pro supera todos os modelos open source já avaliados publicamente e compete com os melhores modelos fechados.
  • Modo de pensamento (thinking mode) com parâmetro reasoning_effort ajustável em high ou max, recomendado para tarefas complexas de agentes.
  • Duas interfaces de API: compatível com os formatos OpenAI ChatCompletions e Anthropic.

A variante Flash sacrifica um pouco de conhecimento de mundo em favor de custo e velocidade, mas mantém desempenho de raciocínio próximo ao V4 Pro em tarefas mais simples.

Mudanças para quem já usa a API

Os nomes de modelo legados deepseek-chat e deepseek-reasoner serão descontinuados em 24 de julho de 2026 — três meses após o lançamento da preview. Até lá, eles apontam respectivamente para o V4 Flash em modo não-pensante e modo pensante. Para acessar os novos modelos diretamente, os usuários devem usar deepseek-v4-pro ou deepseek-v4-flash como valor do parâmetro model, mantendo a mesma URL base.

O que muda no mercado

O preço dinâmico por faixa horária é uma estratégia incomum entre provedores de API de IA. OpenAI, Anthropic e Google mantêm tabelas fixas independentemente do horário. A justificativa da DeepSeek — “melhor alocar recursos e aprimorar a estabilidade do serviço” — indica que a empresa está sentindo pressão de capacidade em determinadas janelas, possivelmente relacionada à adoção massiva após o lançamento da preview.

A precificação por pico também funciona como um sinal econômico para redistribuir demanda: clientes sensíveis a custo tenderão a agendar workloads pesados para os horários de vale, liberando capacidade nos picos para casos de uso de baixa latência ou tempo real.

Mesmo com a duplicação nos horários de pico, os preços permanecem competitivos. O V4 Flash em horário de vale custa US$ 0,14 por milhão de tokens de entrada — mais barato que o GPT-4o Mini (US$ 0,15) e significativamente mais barato que o Claude 3.5 Haiku (US$ 0,80). No pico, sobe para US$ 0,28, ainda abaixo do Haiku.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.