- Por Que Usar o DeepSeek V4 Flash no Claude Code
- O Que é o DeepSeek V4 Flash
- Obtendo Sua Chave de API da Novita AI
- Instalando o Claude Code
- Configurando as Variáveis de Ambiente
- Iniciando o Claude Code
- Trabalhando com Bases de Código Grandes
- Selecionando Modos de Raciocínio por Sessão
- Conclusão
- FAQ
- Artigos Recomendados
DeepSeek V4 Flash é um modelo MoE de 284B com janela de contexto de 1 milhão de tokens, disponível através do endpoint compatível com Anthropic da Novita AI — o que significa que o Claude Code pode usá-lo diretamente com uma alteração de três linhas nas variáveis de ambiente. A $0,14/M tokens de entrada contra $3/M do Claude Sonnet, a diferença de custo é significativa para equipes que executam sessões contínuas de codificação com agente.
Por Que Usar o DeepSeek V4 Flash no Claude Code
A economia é o motivo mais imediato. O Claude Code usa como padrão o Claude Sonnet, que custa $3/M tokens de entrada e $15/M tokens de saída. O DeepSeek V4 Flash na Novita AI custa $0,14/M tokens de entrada e $0,28/M tokens de saída — aproximadamente uma redução de 20× na entrada e 50× na saída. Para uma equipe usando Claude Code durante um dia de trabalho de oito horas, essa diferença se acumula rapidamente.
Além do custo, o V4 Flash traz duas capacidades que importam especificamente para codificação com agente:
- Janela de contexto de 1M de tokens — O Claude Code pode carregar uma base de código inteira no contexto sem dividir em partes. Refatorações em vários arquivos, depuração entre repositórios e longos históricos de conversa permanecem coerentes sem gerenciamento manual de contexto.
- Modos de raciocínio selecionáveis — O modo sem pensamento (non-think) oferece respostas rápidas para tarefas rotineiras; os modos Think e Think Max permitem raciocínio passo a passo para decisões complexas de arquitetura ou sessões difíceis de depuração. Você escolhe por sessão sem trocar de modelo.
A Novita AI expõe um endpoint compatível com Anthropic (/anthropic), então o Claude Code o trata como um substituto direto. Sem alterações no SDK, sem plugins necessários — apenas variáveis de ambiente.
O Que é o DeepSeek V4 Flash
O DeepSeek V4 Flash é um modelo Mixture-of-Experts (MoE) da DeepSeek AI. Ele tem 284B parâmetros totais, mas ativa apenas 13B por passagem direta, o que mantém a latência e o custo por token próximos a um modelo denso de 13B, enquanto retém a capacidade de conhecimento de uma rede muito maior.
Especificações-chave em resumo:
| Especificação | Valor |
|---|---|
| ID do modelo | deepseek/deepseek-v4-flash |
| Parâmetros totais | 284B (13B ativados por inferência) |
| Janela de contexto | 1.048.576 tokens |
| Máx. tokens de saída | 393.216 |
| Preço de entrada (Novita AI) | $0,14/M tokens |
| Preço de saída (Novita AI) | $0,28/M tokens |
| Preço de leitura de cache | $0,028/M tokens |
| Modos de raciocínio | Non-think, Think, Think Max |
| Chamada de função | Sim |
| Saídas estruturadas | Sim |
| Licença | MIT |
Os três modos de raciocínio permitem ajustar o custo em relação à qualidade por sessão. O modo Non-think é rápido e barato — ideal para criação repetitiva de código padrão ou geração de boilerplate. O modo Think adiciona raciocínio passo a passo para revisão de código, trabalho de arquitetura e depuração. O Think Max usa o orçamento máximo de raciocínio e corresponde ao V4 Pro na maioria dos benchmarks de codificação.
A Novita AI fornece a janela de contexto completa de 1M de tokens e tempo de atividade confiável, o que a torna uma escolha prática para cargas de trabalho agênticas em produção.
Obtendo Sua Chave de API da Novita AI
Crie uma conta na Novita AI para receber créditos de teste gratuitos. Após fazer login, vá para a página de Gerenciamento de Chaves e clique em Criar Nova Chave.
Copie a chave imediatamente — ela não será mostrada novamente. Mantenha-a em um gerenciador de senhas ou cofre de segredos; você precisará dela no próximo passo.
Instalando o Claude Code
O Claude Code requer Node.js 18 ou superior. Verifique sua versão primeiro:
node --version
Se o Node estiver abaixo de 18, atualize a partir do nodejs.org antes de continuar.
Windows
Abra o Prompt de Comando e execute:
npm install -g @anthropic-ai/claude-code
Mac e Linux
Abra o Terminal e execute:
npm install -g @anthropic-ai/claude-code
A instalação global torna o comando claude disponível a partir de qualquer diretório.
Configurando as Variáveis de Ambiente
Estas quatro variáveis redirecionam o Claude Code para o endpoint compatível com Anthropic da Novita AI com o DeepSeek V4 Flash como modelo ativo.
Windows
set ANTHROPIC_BASE_URL=https://api.novita.ai/anthropic
set ANTHROPIC_AUTH_TOKEN=<Sua Chave de API da Novita>
set ANTHROPIC_MODEL=deepseek/deepseek-v4-flash
set ANTHROPIC_SMALL_FAST_MODEL=deepseek/deepseek-v4-flash
Estas persistem apenas na sessão atual do Prompt de Comando. Para torná-las permanentes, defina-as através de Propriedades do Sistema → Variáveis de Ambiente.
Mac e Linux
export ANTHROPIC_BASE_URL="https://api.novita.ai/anthropic"
export ANTHROPIC_AUTH_TOKEN="<Sua Chave de API da Novita>"
export ANTHROPIC_MODEL="deepseek/deepseek-v4-flash"
export ANTHROPIC_SMALL_FAST_MODEL="deepseek/deepseek-v4-flash"
Para persistir entre sessões, adicione estas linhas ao seu ~/.bashrc, ~/.zshrc ou perfil de shell equivalente.
ANTHROPIC_SMALL_FAST_MODEL controla o modelo leve que o Claude Code usa para tarefas internas rápidas, como buscas de arquivos e resumos. Definir para o mesmo ID de modelo mantém todo o tráfego em uma única linha de faturamento e evita chamadas inesperadas à API da Anthropic.
Iniciando o Claude Code
Navegue até o diretório do seu projeto e inicie o Claude Code:
cd <seu-diretório-do-projeto>
claude .
O Claude Code abre uma sessão interativa no diretório atual. Você verá o prompt aparecer assim que a conexão com o endpoint da Novita AI for estabelecida. A partir daqui, descreva sua tarefa em linguagem natural — o Claude Code lerá seus arquivos, proporá alterações e as aplicará com sua aprovação.
Trabalhando com Bases de Código Grandes
A janela de contexto de 1M de tokens é a vantagem mais prática do V4 Flash em relação a alternativas de contexto menor. Uma base de código de produção de tamanho médio típica tem entre 100K e 300K tokens quando achatada. O V4 Flash pode conter tudo isso no contexto sem nenhuma estratégia de divisão.
Alguns fluxos de trabalho que se beneficiam diretamente:
Refatorações em vários arquivos — Peça ao Claude Code para renomear um modelo de dados, alterar um contrato de API ou refatorar uma interface de serviço em todos os arquivos que a referenciam. Com uma janela de contexto completa, ele vê todas as dependências simultaneamente, em vez de arquivo por arquivo.
Sessões longas de depuração — À medida que uma sessão de depuração acumula chamadas de ferramentas, leituras de arquivos e traços de raciocínio, janelas de contexto menores truncam o histórico inicial. O V4 Flash retém a sessão completa, para que o modelo possa raciocinar sobre padrões que viu há 200 chamadas de ferramentas.
Revisões em todo o repositório — Alimente toda a base de código para o modo Think ou Think Max do V4 Flash e peça uma revisão de segurança, avaliação de arquitetura ou análise de código morto. Isso esgotaria rapidamente um modelo de 128K; cabe confortavelmente na janela do V4 Flash.
Sobrecarga de prompt de sistema — O Claude Code usa um prompt de sistema detalhado que pode ter de 10K a 20K tokens. Em um modelo de 128K, essa sobrecarga importa. Em uma janela de 1M, é insignificante, deixando quase todo o orçamento de contexto para o código real.
Para controle de custos em sessões longas, o modo Non-think lida com a maior parte das edições rotineiras de arquivos com o menor custo. Mude para o modo Think quando a tarefa exigir raciocínio de design, e para Think Max em problemas algorítmicos difíceis ou de depuração. O preço de leitura de cache da Novita ($0,028/M) significa que injeções repetidas de prompt de sistema custam muito pouco em escala.
Selecionando Modos de Raciocínio por Sessão
O DeepSeek V4 Flash oferece suporte a três modos de raciocínio que você pode controlar por sessão. O modo Non-think retorna conclusões rápidas e diretas — ideal para geração de boilerplate, edições rotineiras e consultas rápidas. O modo Think permite raciocínio passo a passo para revisão de código, refatorações e decisões de arquitetura. O Think Max aloca o orçamento máximo de raciocínio e corresponde ao V4 Pro na maioria dos benchmarks de codificação.
A maneira mais simples de direcionar o Claude Code para um raciocínio mais profundo é um prompt de sistema personalizado:
claude --system "Use pensamento estendido para decisões de arquitetura e depuração complexa."
Para controle programático, o endpoint da Novita AI aceita o parâmetro budget_tokens. Definir como 0 desabilita completamente o pensamento; qualquer valor positivo habilita o pensamento até esse orçamento de tokens. Isso é útil em pipelines agênticos onde apenas etapas específicas precisam de raciocínio profundo:
import anthropic
client = anthropic.Anthropic(
base_url="https://api.novita.ai/anthropic",
api_key="<Sua Chave de API da Novita>",
)
# Think Max — orçamento máximo de raciocínio para problemas difíceis
response = client.messages.create(
model="deepseek/deepseek-v4-flash",
max_tokens=16000,
thinking={"type": "enabled", "budget_tokens": 10000},
messages=[{"role": "user", "content": "Revise esta função em busca de bugs sutis de concorrência."}],
)
Para sessões com foco em custo, comece no modo Non-think e mude para Think somente quando encontrar um problema que o exija. Como o preço de leitura de cache da Novita é $0,028/M tokens, injeções repetidas de prompt de sistema permanecem baratas mesmo em sessões longas de várias etapas.
Conclusão
O DeepSeek V4 Flash na Novita AI oferece ao Claude Code uma base capaz e econômica — 1M de contexto, raciocínio selecionável e chamada de função por uma fração do preço do Claude Sonnet. A configuração leva menos de cinco minutos. Depois que as variáveis de ambiente estão no lugar, seu fluxo de trabalho existente do Claude Code funciona inalterado.
Experimente o DeepSeek V4 Flash na Novita AI e veja a documentação da API LLM da Novita AI para mais opções de configuração.
FAQ
O Claude Code precisa de algum plugin ou extensão para usar a Novita AI?
Não. O Claude Code lê a variável de ambiente ANTHROPIC_BASE_URL na inicialização e roteia todas as chamadas de API para lá. Nenhum plugin, extensão ou alteração de código é necessária — a troca é inteiramente através de variáveis de ambiente.
Serei cobrado pela Anthropic ao usar a Novita AI?
Não. Quando ANTHROPIC_BASE_URL aponta para a Novita AI, todo o tráfego e faturamento passam pela sua conta Novita AI. Sua conta Anthropic não é utilizada.
Posso voltar para o Claude Sonnet sem reinstalar?
Sim. Remova as variáveis ANTHROPIC_BASE_URL e ANTHROPIC_MODEL — ou abra um novo shell sem essas exportações — e o Claude Code reverte para o endpoint padrão da Anthropic com o Claude Sonnet.
O V4 Flash é adequado para pipelines de CI automatizados?
O V4 Flash suporta chamada de função e saídas estruturadas, que são as duas capacidades nas quais o Claude Code mais confia. É uma escolha prática para pipelines de codificação automatizados, integrações de CI e sessões agênticas longas onde a continuidade do contexto e a previsibilidade de custo são importantes.
O que acontece se a janela de contexto encher?
Com 1.048.576 tokens, a janela de contexto do V4 Flash é grande o suficiente para que a maioria das sessões não a preencha. Se você estiver executando uma sessão extremamente longa — dias de histórico acumulado, repositórios muito grandes — o Claude Code começará a truncar as mensagens mais antigas. Na prática, iniciar uma nova sessão para uma nova tarefa é a maneira mais simples de ficar bem dentro do limite.
Novita AI é uma plataforma de nuvem de IA que oferece aos desenvolvedores uma maneira fácil de implantar modelos de IA usando nossa API simples, além de fornecer GPU em nuvem acessível e confiável para construir e escalar.
