DeepSeek-V4-Flash no Novita AI: Raciocínio Rápido a Menor Custo

DeepSeek-V4-Flash no Novita AI: Raciocínio Rápido a Menor Custo

A maioria dos modelos de código aberto com capacidades de raciocínio impõe um trade-off: janelas de contexto pequenas, throughput lento ou preços que sobem acima de US$ 1/M de tokens no momento em que você ativa o pensamento estendido. O DeepSeek-V4-Flash ainda evita esse trade-off na atualização de 31 de julho de 2026: o mesmo design Mixture-of-Experts de 284B de parâmetros com apenas 13B ativados por inferência, a mesma janela de contexto nativa de 1.048.576 tokens e o mesmo preço de US$ 0,14/M de entrada no Novita AI.

Em resumo: o DeepSeek-V4-Flash continua sendo a mesma família de modelos no Novita AI após a revisão de pós-treinamento 0731. A atualização é importante porque renova a versão de serviço sem forçar os desenvolvedores a trocar IDs de modelo, reescrever prompts ou recalcular premissas de custo.

Abra o DeepSeek-V4-Flash no console de modelos do Novita AI

O que é o DeepSeek-V4-Flash?

O DeepSeek-V4-Flash é um modelo de linguagem Mixture-of-Experts (MoE) da DeepSeek AI, lançado como parte da série DeepSeek-V4 junto com o maior DeepSeek-V4-Pro. O modelo tem 284B de parâmetros no total, com 13B ativados na inferência — mantendo o custo computacional por token baixo e preservando a capacidade paramétrica de um modelo muito maior.

Principais capacidades em resumo:

  • 284B total / 13B ativados — arquitetura MoE, baixo custo de inferência
  • Janela de contexto de 1.048.576 tokens (1M de tokens) — habilitada pela Arquitetura de Atenção Híbrida
  • Três modos de raciocínio: Non-think (rápido), Think (passo a passo), Think Max (orçamento máximo de raciocínio)
  • Suporte a function calling — uso de ferramentas, saídas estruturadas, modo JSON
  • Treinado com mais de 32T de tokens com pós-treinamento em múltiplos estágios (SFT, RL com GRPO, destilação on-policy)
  • Licença MIT — pesos disponíveis para download no HuggingFace; uso comercial permitido
  • Precisão mista FP4 + FP8 — pesos dos especialistas MoE em FP4, demais camadas em FP8

O que há de novo na atualização de 31 de julho de 2026?

A versão curta: esta é uma atualização de revisão, não um lançamento separado.

A atualização de pós-treinamento do final de julho da DeepSeek mantém a mesma identidade pública do produto no Novita AI:

  • Mesmo ID do modelo: deepseek/deepseek-v4-flash
  • Mesma arquitetura: 284B de parâmetros no total, 13B ativados por inferência
  • Mesma janela de contexto: 1.048.576 tokens
  • Mesmo preço no Novita AI: US$ 0,14/M de entrada, US$ 0,28/M de saída, US$ 0,028/M de leituras de cache

Isso significa que as integrações existentes não precisam de mudanças de endpoint, reescrita de tabelas de preços ou migrações de formato de prompt. Se você já roteava tráfego para o DeepSeek-V4-Flash, a atualização 0731 é melhor entendida como uma atualização de capacidades e pós-treinamento nos bastidores, e não como um SKU totalmente novo.

Para desenvolvedores, essa distinção importa. Uma atualização de revisão normalmente significa que você pode testar novamente o modelo com seus próprios prompts, conjuntos de avaliação e tarefas de agente, mantendo o mesmo contrato de implantação: mesmo nome, mesmo caminho de API, mesmo orçamento de contexto e mesma economia de tokens.

Principais recursos: por que o DeepSeek-V4-Flash se destaca

Profundidade de raciocínio selecionável sem trocar de modelo

A maioria dos modelos limita você a um único modo de inferência: raciocínio ligado ou desligado. O DeepSeek-V4-Flash oferece três modos de operação distintos no mesmo endpoint de API:

Modo Características Ideal para
Non-think Rápido, sem chain-of-thought Tarefas de alto volume, chat, sumarização
Think Raciocínio passo a passo, equilibrado Perguntas e respostas complexas, geração de código, análise
Think Max Orçamento máximo de raciocínio Competições de matemática, tarefas difíceis de codificação, benchmarks

A diferença entre os modos é significativa: no GPQA Diamond, o V4-Flash Non-think marca 71,2 contra 87,4 do Think e 88,1 do Think Max. No LiveCodeBench, o Think Max chega a 91,6 contra 55,2 do Non-think. Você escolhe custo versus qualidade por requisição — sem necessidade de mudança de infraestrutura.

Arquitetura de Atenção Híbrida para contexto de 1M de tokens

Contexto nativo de um milhão de tokens é mais difícil do que parece. O DeepSeek-V4-Flash alcança isso por meio de uma Hybrid Attention Architecture (Arquitetura de Atenção Híbrida) projetada especificamente para combinar dois mecanismos:

  • Compressed Sparse Attention (CSA) — reduz drasticamente o orçamento computacional de atenção para sequências longas
  • Heavily Compressed Attention (HCA) — comprime o footprint do cache KV para inferência com contexto de 1M

O resultado: inferência sobre entradas de 1M de tokens com custo gerenciável de FLOPs e memória. Para cargas de trabalho como análise de codebase, revisão de documentos legais ou agentes de sessão longa, essa arquitetura faz a diferença entre viável e proibitivo.

Eficiência MoE: 13B ativados na escala de 284B

A proporção de ativação 284B/13B é de onde vem a eficiência de custo. Apenas 13B de parâmetros ficam ativos por forward pass, mantendo a latência e o custo por token próximos aos de um modelo denso de 13B — enquanto o pool total de 284B de parâmetros fornece capacidade de conhecimento comparável a uma rede densa muito maior. A precisão mista FP4 + FP8 reduz ainda mais a pressão de largura de banda de memória nos pesos dos especialistas.

Pipeline de pós-treinamento robusto

O DeepSeek-V4-Flash segue um processo de pós-treinamento em duas etapas: primeiro, cultivo de especialistas específicos de domínio via SFT e aprendizado por reforço com GRPO; depois, consolidação unificada do modelo por meio de destilação on-policy. Isso produz um único modelo com perfis de capacidade diferenciados em codificação, raciocínio e conhecimento geral — não um seguidor genérico de instruções.

Performance em benchmarks

A história de benchmarks do DeepSeek-V4-Flash é sobre a seleção do modo de raciocínio. No modo Non-think, ele se comporta como um modelo eficiente com 13B ativados. Suba para o Think Max e ele alcança um patamar totalmente diferente.

Gráfico de comparação de benchmarks do DeepSeek-V4-Flash mostrando o desempenho entre modos de raciocínio

Desempenho do DeepSeek-V4-Flash entre os modos versus modelos de fronteira [Fonte: DeepSeek AI / HuggingFace]

Desempenho entre os modos de raciocínio

Abaixo estão as pontuações do V4-Flash nos principais benchmarks, comparando os três modos de operação:

Benchmark V4-Flash Non-Think V4-Flash Think V4-Flash Think Max
LiveCodeBench (Pass@1) 55,2 88,4 91,6
GPQA Diamond (Pass@1) 71,2 87,4 88,1
HMMT 2026 Feb (Pass@1) 40,8 91,9 94,8
IMOAnswerBench (Pass@1) 41,9 85,1 88,4
Codeforces Rating 2816 3052
SWE Verified (Resolved) 73,7 78,6 79,0
MRCR 1M (MMR) 37,5 76,9 78,7
MCPAtlas (Pass@1) 64,0 67,4 69,0
MMLU-Pro (EM) 83,0 86,4 86,2

Última verificação: 2026-04-27. Fonte: relatório técnico DeepSeek-V4 e model card do HuggingFace.

Como o V4-Flash se compara aos concorrentes

O V4-Flash Think Max (79,0 em SWE Verified, 91,6 em LiveCodeBench) compete com modelos que operam com custo por token muito mais alto. Ele não lidera todos os leaderboards — o V4-Pro Max lidera na maioria dos benchmarks de fronteira — mas para desenvolvedores que olham o custo por tarefa em vez do desempenho máximo bruto, o trade-off é favorável:

Se você está escolhendo entre as duas APIs DeepSeek V4 para roteamento em produção, use o guia de preços e roteamento DeepSeek V4 Pro vs Flash para comparar quando o Flash deve lidar com o tráfego de base e quando o Pro vale o preço mais alto por token.

Benchmark V4-Flash Max V4-Pro Max Claude Opus 4.6 Max Gemini 3.1 Pro High
LiveCodeBench (Pass@1) 91,6 93,5 88,8 91,7
GPQA Diamond (Pass@1) 88,1 90,1 91,3 94,3
SWE Verified (Resolved) 79,0 80,6 80,8 80,6
HMMT 2026 Feb (Pass@1) 94,8 95,2 96,2 94,7
MRCR 1M (MMR) 78,7 83,5 92,9 76,3

Última verificação: 2026-04-27. Os números do Claude Opus 4.6 Max e do Gemini 3.1 Pro High foram obtidos do relatório técnico DeepSeek-V4 (tabela de comparação de fronteira do V4-Pro). Essas pontuações não foram medidas frente a frente com o V4-Flash nesse relatório.

Notavelmente, o V4-Flash Think Max no MRCR 1M (78,7) supera o Gemini 3.1 Pro High (76,3) na tarefa de recuperação de contexto longo — o benchmark que mais diretamente se relaciona aos casos de uso de contexto de 1M. No SWE Verified, os quatro modelos ficam entre 79 e 81, o que torna o V4-Flash competitivo na categoria de agentes de codificação do mundo real por uma fração do preço dos modelos fechados.

Como usar o DeepSeek-V4-Flash via Novita AI

Opção 1: Playground (sem código)

Teste o modelo diretamente no navegador no console de modelos do Novita AI. Nenhuma chave de API é necessária para começar — alterne entre os modos Non-think, Think e Think Max pela interface de chat.

Opção 2: API (Python)

O DeepSeek-V4-Flash usa a API compatível com OpenAI. Use o ID de modelo deepseek/deepseek-v4-flash com a URL base da Novita:

from openai import OpenAI

client = OpenAI(
    base_url="https://api.novita.ai/v3/openai",
    api_key="YOUR_NOVITA_API_KEY",
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4-flash",
    messages=[{"role": "user", "content": "Your prompt here"}]
)
print(response.choices[0].message.content)

Para habilitar o modo Think ou Think Max, passe o parâmetro reasoning no corpo da requisição:

from openai import OpenAI

client = OpenAI(
    base_url="https://api.novita.ai/v3/openai",
    api_key="YOUR_NOVITA_API_KEY",
)

# Think Max mode — maximum reasoning budget
response = client.chat.completions.create(
    model="deepseek/deepseek-v4-flash",
    messages=[{"role": "user", "content": "Solve: x^4 - 5x^2 + 4 = 0"}],
    extra_body={"reasoning": {"effort": "high"}}  # "low" = Think, "high" = Think Max
)
print(response.choices[0].message.content)

Obtenha sua chave de API em novita.ai/settings.

Opção 3: Ferramentas de terceiros

Como o Novita AI expõe um endpoint compatível com OpenAI, o DeepSeek-V4-Flash funciona de forma nativa com:

  • LangChain / LlamaIndex — use ChatOpenAI com base_url="https://api.novita.ai/v3/openai"
  • OpenWebUI — adicione como endpoint personalizado compatível com OpenAI
  • Continue.dev / Cursor — configure como modelo personalizado com a URL base do Novita

Preços do DeepSeek-V4-Flash

O preço do DeepSeek-V4-Flash no Novita AI não mudou na atualização de 31 de julho de 2026. Todos os valores abaixo são por milhão de tokens, última verificação em 2026-08-03:

Provedor Entrada (US$/M) Saída (US$/M) Leitura de cache (US$/M) Contexto máximo
Novita AI US$ 0,14 US$ 0,28 US$ 0,028 1.048.576 tokens
DeepSeek Official US$ 0,14 US$ 0,28 US$ 0,028 131.072 tokens
SiliconFlow US$ 0,14 US$ 0,28 US$ 0,028 65.536 tokens
DeepInfra US$ 0,14 US$ 0,28 16.384 tokens

A taxa por token permanece a mesma após a atualização 0731 — mas o contexto máximo ainda varia significativamente por provedor. O Novita AI oferece a janela de contexto completa de 1M de tokens. O DeepInfra limita a 16.384 tokens. Se sua carga de trabalho envolve documentos longos, codebases ou agentes multi-turno, o Novita é a escolha prática.

Casos de uso recomendados

Agentes autônomos de codificação

A janela de contexto de 1M do V4-Flash significa que um agente pode carregar um codebase inteiro no contexto sem dividi-lo em partes. Combinado com 79,0 em SWE Verified no modo Think Max, ele lida com refatorações multiarquivo e depuração sem perder o estado entre as etapas.

QA de documentos longos e RAG

MRCR 1M (Multi-Round Context Retrieval) com 78,7% no Think Max — o benchmark mede a precisão da recuperação em uma janela real de 1M de tokens. Para indexar documentos legais, artigos acadêmicos ou especificações técnicas longas, o V4-Flash recupera com precisão onde a maioria dos modelos degrada após 32K tokens.

Raciocínio matemático e científico

94,8% no HMMT de fevereiro de 2026 (matemática competitiva) com Think Max. O modo budget-thinking permite ajustar custo versus precisão — use Think para problemas padrão e Think Max para os difíceis. Uma única requisição não consome um orçamento computacional fixo; você escolhe.

APIs de produção com cache

Com US$ 0,028/M em leituras de cache, prompts de sistema repetidos e schemas de ferramentas praticamente não custam nada em escala. Produtos de chatbot e wrappers de API que reinjetam o mesmo contexto em todas as chamadas se beneficiam do preço de leitura de cache em vez do preço de entrada bruto.

Para uma configuração de modelos mistos, mantenha o Flash como padrão para chamadas de produção repetidas e escale prompts difíceis de contexto longo ou de agentes de codificação para o Pro. O guia de contexto longo do DeepSeek V4 Pro mostra como configurar o ID do modelo Pro, a URL base, o formato da requisição e os controles de custo para esses caminhos de maior dificuldade.

Comece a usar o DeepSeek-V4-Flash hoje

O DeepSeek-V4-Flash continua disponível via Novita AI após a atualização de 31 de julho, com a janela completa de contexto de 1M, os mesmos preços competitivos e zero sobrecarga de infraestrutura. Você escolhe o modo de raciocínio; a Novita cuida do resto.

Experimente o DeepSeek-V4-Flash com o Novita AI

Documentação da API LLM do Novita AI

FAQ

O que mudou na revisão 0731 do DeepSeek-V4-Flash?

No Novita AI, o contrato de implantação visível permanece o mesmo: o ID do modelo continua deepseek/deepseek-v4-flash, o preço continua em US$ 0,14/M de entrada e US$ 0,28/M de saída, e a janela completa de contexto de 1.048.576 tokens ainda está disponível. A atualização 0731 é uma renovação da revisão de serviço, não uma família de modelos separada.

O que é o DeepSeek-V4-Flash?

O DeepSeek-V4-Flash é um modelo de linguagem Mixture-of-Experts de 284B de parâmetros desenvolvido pela DeepSeek AI, lançado em 23/04/2026. Ele ativa apenas 13B de parâmetros por forward pass, tornando-o significativamente mais rápido e barato do que modelos densos de capacidade comparável. Ele suporta uma janela de contexto de 1.048.576 tokens e três modos de raciocínio: Non-thinking (rápido), Budget Thinking e Extended Thinking (Think Max).

Como o DeepSeek-V4-Flash é diferente do DeepSeek-V4-Pro?

O V4-Flash é a variante mais leve e rápida, otimizada para velocidade e custo. O V4-Pro é o modelo principal, com pontuações máximas mais altas em benchmarks (por exemplo, 93,5 contra 91,6 no LiveCodeBench Think Max). O V4-Flash “alcança desempenho de raciocínio comparável ao da versão Pro quando recebe um orçamento de pensamento maior” — na prática, o V4-Flash Think Max elimina a maior parte da diferença em relação ao V4-Pro Think Max a um custo por token menor.

Se você precisa de uma regra de roteamento em produção, compare os dois modelos no guia de decisão de API DeepSeek V4 Pro vs Flash antes de mover todo o tráfego para um único modelo.

O que “Flash” significa no nome do modelo?

Flash indica uma variante otimizada para velocidade, consistente com a forma como o Google usa o termo para o Gemini Flash. O DeepSeek-V4-Flash prioriza menor latência e custo em vez da precisão máxima bruta, com os modos de pensamento disponíveis quando você precisa reduzir a diferença de desempenho.

O DeepSeek-V4-Flash suporta uma janela de contexto de 1M com o Novita AI?

Sim. O Novita AI expõe a janela completa de contexto de 1.048.576 tokens — a maior disponível entre todos os provedores atuais para este modelo. O máximo de tokens de conclusão no Novita é 393.216.

Como alterno os modos de raciocínio via API?

Passe o parâmetro extra_body={"reasoning": {"effort": "low"}} para Budget Thinking, ou "effort": "high" para Think Max. Omita o parâmetro completamente para o modo Non-thinking (rápido). A API é compatível com OpenAI — nenhuma alteração de SDK é necessária.

Qual é o preço do DeepSeek-V4-Flash com o Novita AI?

Em 03/08/2026: US$ 0,14/M de tokens de entrada, US$ 0,28/M de tokens de saída, US$ 0,028/M de tokens de leitura de cache. Isso corresponde ao preço oficial da DeepSeek e é consistente entre os provedores — o diferencial no Novita é a janela completa de 1M de contexto e o uptime confiável.

O DeepSeek-V4-Flash é open source?

Sim. Os pesos do modelo estão disponíveis no HuggingFace sob a Licença MIT — confirmado no repositório oficial do DeepSeek-V4. Auto-hospedagem e uso comercial são permitidos nos termos do MIT. Usá-lo via API do Novita AI não exige nenhuma auto-hospedagem.

Artigos recomendados