Como Usar Kimi K2.7 Code no Claude Code via Novita AI

Como Usar Kimi K2.7 Code no Claude Code via Novita AI

Kimi K2.7 Code é um modelo MoE especializado em codificação da MoonshotAI com uma janela de contexto de 256K, pensamento intercalado e chamada de ferramentas em múltiplas etapas. Através do endpoint compatível com Anthropic da Novita AI, você pode conectá-lo diretamente ao Claude Code — mantendo seu fluxo de trabalho existente enquanto troca para um modelo construído especificamente para codificação agêntica a uma fração do preço do Claude Sonnet.

Este guia orienta cada etapa: obter sua chave de API, configurar variáveis de ambiente e iniciar o Claude Code com moonshotai/kimi-k2.7-code como modelo.

Por que Usar Kimi K2.7 Code no Claude Code?

O Claude Code usa o SDK da Anthropic internamente, então precisa de um endpoint compatível com Anthropic — não um compatível com OpenAI. A Novita AI expõe exatamente isso em https://api.novita.ai/anthropic, tornando o Kimi K2.7 Code um modelo plug-and-play para o Claude Code sem bibliotecas wrapper ou ferramentas extras. Para a configuração da API compatível com OpenAI, veja o Kimi K2.7 Code API quick start.

O caso prático se resume a três coisas:

Custo. A US$ 0,95 por milhão de tokens de entrada e US$ 4,00 por milhão de tokens de saída na Novita AI (verificado em junho de 2026), o Kimi K2.7 Code é aproximadamente 68% mais barato na entrada e 73% mais barato na saída do que o Claude Sonnet 4.5 (US$ 3,00/US$ 15,00 por milhão de tokens). Para equipes que executam centenas de tarefas de codificação por dia, essa diferença é significativa.

Contexto. A janela de contexto de 256K tokens significa que você pode enviar um contexto substancial do repositório — vários arquivos, saída de testes, anotações de arquitetura — sem encontrar um limite no meio da sessão. A maioria dos agentes de codificação do dia a dia funciona bem dentro de 32K–64K tokens; ter 256K significa que você raramente precisa podar o contexto.

Especialização em codificação. O Kimi K2.7 Code é construído especificamente para codificação e fluxos de trabalho agênticos, não um modelo de propósito geral. Sua arquitetura de pensamento intercalado gera aproximadamente 30% menos tokens de pensamento do que o Kimi K2.6, o que se traduz em respostas mais rápidas em tarefas de codificação de várias etapas.

Especificações do Kimi K2.7 Code em Resumo

Campo Valor
ID do Modelo moonshotai/kimi-k2.7-code
Arquitetura Mistura de Especialistas (MoE)
Parâmetros totais 1T
Parâmetros ativados 32B por token
Janela de contexto 262.144 tokens (~256K)
Máx. tokens de saída 262.144 tokens
Modalidades de entrada Texto, imagem, vídeo
Modalidade de saída Texto
Recursos Chamada de funções, saídas estruturadas, raciocínio (pensamento intercalado)
Endpoints na Novita AI chat/completions, anthropic

Para o Claude Code, use a família de endpoints anthropic — é o que o SDK da Anthropic espera.

Quanto Custa o Kimi K2.7 Code na Novita AI?

Tipo de token Preço Novita AI Preço Claude Sonnet 4.5
Entrada $0,95 / 1M $3,00 / 1M
Entrada de leitura de cache $0,19 / 1M
Saída $4,00 / 1M $15,00 / 1M

Preços baseados na página do modelo Kimi K2.7 Code na Novita AI em junho de 2026. A Novita AI também lista preços de leitura de cache, o que é importante para fluxos de trabalho com contexto repetido, como agentes que reutilizam o mesmo prompt de sistema e esquema de ferramentas em várias chamadas.

Passo 1: Obtenha Sua Chave de API da Novita AI

Crie uma conta na Novita AI — novas contas recebem créditos de teste gratuitos.

Após fazer login:

  1. Vá para Gerenciamento de Chaves no seu painel.
  2. Clique em Criar Nova Chave.
  3. Copie a chave imediatamente e guarde em um local seguro — ela é exibida apenas uma vez.

Você usará esta chave como ANTHROPIC_AUTH_TOKEN na próxima etapa.

Passo 2: Instale o Claude Code

O Claude Code requer Node.js 18 ou superior. Verifique sua versão primeiro:

node --version

Instale o Claude Code globalmente:

npm install -g @anthropic-ai/claude-code

Verifique a instalação:

claude --version

Passo 3: Configure as Variáveis de Ambiente

O Claude Code lê quatro variáveis de ambiente para saber qual endpoint, chave de API e modelo usar. Defina todas as quatro — ANTHROPIC_SMALL_FAST_MODEL controla qual modelo o Claude Code usa para subtarefas leves, como resumos e edições rápidas.

Mac e Linux

export ANTHROPIC_BASE_URL="https://api.novita.ai/anthropic"
export ANTHROPIC_AUTH_TOKEN="YOUR_NOVITA_API_KEY"
export ANTHROPIC_MODEL="moonshotai/kimi-k2.7-code"
export ANTHROPIC_SMALL_FAST_MODEL="moonshotai/kimi-k2.7-code"

Para tornar isso permanente, adicione as quatro linhas ao ~/.zshrc ou ~/.bashrc e execute source ~/.zshrc (ou ~/.bashrc).

Windows (Prompt de Comando)

set ANTHROPIC_BASE_URL=https://api.novita.ai/anthropic
set ANTHROPIC_AUTH_TOKEN=YOUR_NOVITA_API_KEY
set ANTHROPIC_MODEL=moonshotai/kimi-k2.7-code
set ANTHROPIC_SMALL_FAST_MODEL=moonshotai/kimi-k2.7-code

Essas variáveis de ambiente duram apenas na sessão atual. Para configuração permanente no Windows, adicione-as através de Propriedades do Sistema → Variáveis de Ambiente.

O que cada variável faz

Variável Valor Propósito
ANTHROPIC_BASE_URL https://api.novita.ai/anthropic Aponta o Claude Code para o endpoint compatível com Anthropic da Novita AI
ANTHROPIC_AUTH_TOKEN Sua chave API da Novita Autentica suas requisições
ANTHROPIC_MODEL moonshotai/kimi-k2.7-code Define o modelo principal para tarefas de codificação
ANTHROPIC_SMALL_FAST_MODEL moonshotai/kimi-k2.7-code Define o modelo para subtarefas leves

Passo 4: Inicie o Claude Code

Navegue até o diretório do seu projeto e inicie uma sessão:

cd your-project-directory
claude .

O Claude Code abre um prompt interativo. Agora você pode descrever tarefas em inglês simples — implementar um recurso, corrigir um bug, refatorar um módulo, escrever testes — e o Kimi K2.7 Code lida com o raciocínio e a geração de código através do endpoint da Novita AI.

Para verificar se o modelo está roteando corretamente, execute /status dentro da sessão do Claude Code. Deve mostrar a URL base e o modelo configurados.

Dicas Práticas de Fluxo de Trabalho de Codificação

Envie mais contexto antecipadamente. Com 256K tokens disponíveis, você pode incluir o conteúdo completo de arquivos relevantes em vez de apenas trechos. O Claude Code pode referenciar o código real em vez de raciocinar a partir de resumos, o que reduz a alucinação em detalhes de implementação.

Use pensamento intercalado para tarefas complexas. O Kimi K2.7 Code raciocina passo a passo antes de gerar código. Para refatorações de vários arquivos ou decisões de arquitetura, forneça ao modelo contexto suficiente para ver o quadro completo — ele planejará antes de escrever, reduzindo correções posteriores.

Depuração multimodal. O Kimi K2.7 Code aceita imagens e vídeos como entrada. Se seu fluxo de trabalho incluir relatórios de bugs baseados em capturas de tela ou tarefas de revisão de interface, você pode enviá-los diretamente para a sessão. As respostas são sempre texto, então a saída é código, planos ou análise.

Prompts de sistema com cache intensivo. Se você usa um prompt de sistema consistente em várias sessões — padrões de codificação, convenções de projeto, notas de arquitetura — o preço de leitura de cache da Novita AI a US$ 0,19 por milhão de tokens é aplicado em conteúdo repetido. Para equipes com prompts de sistema longos e estáveis, isso reduz significativamente o custo por tarefa.

Mantenha-se em um modelo para consistência. Definir tanto ANTHROPIC_MODEL quanto ANTHROPIC_SMALL_FAST_MODEL como moonshotai/kimi-k2.7-code mantém o comportamento consistente entre a tarefa principal e as subtarefas. Se depois você quiser um modelo mais leve para subtarefas para economizar custo, pode trocar apenas ANTHROPIC_SMALL_FAST_MODEL.

Solução de Problemas

401 Não Autorizado

Sua chave de API está incorreta ou expirou. Verifique a chave em Novita AI Key Management. Verifique se há espaços extras ou quebras de linha ao copiar a chave.

Modelo não encontrado / 404

Confirme se o ID do modelo é exatamente moonshotai/kimi-k2.7-code — sem espaços extras, capitalização correta. Você pode verificar na página do modelo Kimi K2.7 Code.

Respostas lentas em prompts longos

Ative o streaming por padrão no Claude Code — a maioria das configurações faz isso automaticamente. Para entradas de contexto muito longo (100K+ tokens), a latência da resposta inicial aumenta. Considere cortar o contexto de baixa prioridade primeiro.

Variáveis de ambiente não reconhecidas

No Mac/Linux, confirme que você carregou o arquivo de perfil após editá-lo (source ~/.zshrc). No Windows, as variáveis de ambiente definidas via set duram apenas na sessão atual do Prompt de Comando — use o painel Propriedades do Sistema para variáveis persistentes.

Perguntas Frequentes

O Kimi K2.7 Code funciona com o uso de ferramentas e integrações MCP do Claude Code?

Sim. O Kimi K2.7 Code suporta chamada de funções através do endpoint compatível com Anthropic da Novita AI, que é o que o Claude Code usa para chamadas de ferramentas e integrações MCP.

Por que usar o endpoint Anthropic em vez de um compatível com OpenAI?

O Claude Code é construído no SDK da Anthropic. Ele se comunica usando o formato de mensagem da Anthropic, não o da OpenAI. O endpoint https://api.novita.ai/anthropic da Novita AI traduz esse formato, então o Claude Code funciona sem qualquer modificação.

Como o Kimi K2.7 Code se compara ao Kimi K2.5 para o Claude Code?

O Kimi K2.7 Code gera aproximadamente 30% menos tokens de pensamento do que o K2.6 (e melhora a eficiência em relação ao K2.5), mantendo a qualidade de codificação. Para sessões do Claude Code com tarefas repetitivas de várias etapas, menos tokens de pensamento significam respostas mais rápidas e menor custo de token por tarefa.

Posso usar esta configuração no VS Code ou Cursor?

Sim. O Claude Code se integra ao VS Code e ao Cursor através de plugins e do terminal. A mesma configuração de variáveis de ambiente se aplica — uma vez configurada, tanto as integrações IDE quanto o terminal autônomo usam o modelo configurado.

Novita AI é uma plataforma de nuvem de IA que oferece aos desenvolvedores uma maneira fácil de acessar modelos de última geração através de uma API simples, com infraestrutura GPU acessível e confiável.


Artigos Recomendados