O Kimi K3 está disponível na Novita AI como o modelo principal da Moonshot AI, com 2,8 trilhões de parâmetros no total, uma janela de contexto de 1.048.576 tokens e entrada de texto, imagem e vídeo. Escolha o K3 quando sua aplicação precisar de um contexto muito grande ou raciocínio multimodal; escolha uma variante do Kimi K2 quando o custo por token mais baixo, uma janela de contexto menor ou uma integração já estabelecida com o K2 forem mais importantes. O preço atual do K3 na Novita é de $3 por milhão de tokens de entrada, $15 por milhão de tokens de saída e $0,30 por milhão de tokens de leitura de cache, verificado em 22 de julho de 2026.
Principais Conclusões
- O Kimi K3 está disponível na Novita AI com o ID de modelo exato
moonshotai/kimi-k3. - A página do modelo lista um contexto de 1M tokens e saída máxima de 1M, além de capacidades de entrada de texto, imagem e vídeo.
- O preço serverless atual é de $3/M de entrada, $15/M de saída e $0,30/M de leitura de cache. Os preços podem mudar; confirme na página do modelo antes de fazer o orçamento.
- O K3 é a melhor escolha Kimi para repositórios grandes, pacotes de pesquisa longos, trabalho multimodal de conhecimento e fluxos de trabalho que precisam do modelo principal mais recente.
- O K2.5 ou o K2 Instruct podem ser a escolha mais sensata para cargas de trabalho sensíveis a custo, somente texto ou já integradas.
O Que é o Kimi K3?
O Kimi K3 é o modelo Kimi mais recente da Moonshot AI e o mais capaz listado na linha Kimi da Novita AI. Sua principal diferença é a escala: a página do modelo na Novita descreve um modelo de 2,8 trilhões de parâmetros construído com Kimi Delta Attention e Attention Residuals, com compreensão visual nativa e uma janela de contexto de 1M tokens.
Esse tamanho de contexto muda a questão prática de “O modelo consegue responder a este prompt?” para “Posso fornecer ao modelo o conjunto de trabalho completo?”. Um agente de codificação pode manter mais de um repositório no contexto. Um assistente de pesquisa pode trabalhar a partir de uma grande coleção de documentos sem a necessidade de fragmentação agressiva. Um fluxo de trabalho multimodal pode combinar texto com imagens ou vídeo em vez de dividir essas entradas em etapas separadas.
A contrapartida é o custo. O preço de saída do K3 é materialmente maior do que os preços listados para endpoints Kimi mais antigos na Novita, portanto, uma janela de contexto maior é mais útil quando remove complexidade real da aplicação ou melhora a qualidade da resposta. Não é motivo para enviar todas as solicitações de chat curtas para o modelo principal.
Especificações e Preços do Kimi K3
Os valores a seguir vêm da página do modelo Kimi K3 na Novita AI, verificada em 22 de julho de 2026.
| Campo | Detalhes do Kimi K3 |
|---|---|
| Publicador | Moonshot AI |
| ID do modelo | moonshotai/kimi-k3 |
| Nota de arquitetura | 2,8T parâmetros; Kimi Delta Attention e Attention Residuals |
| Janela de contexto | 1.048.576 tokens (1M) |
| Saída máxima | 1.048.576 tokens |
| Entrada | Texto, imagem, vídeo |
| Saída | Texto |
| Preço de entrada | $3 por milhão de tokens |
| Preço de leitura de cache | $0,30 por milhão de tokens |
| Preço de saída | $15 por milhão de tokens |
| Disponibilidade Novita | API serverless |
| Estilos de API | Endpoints compatíveis com OpenAI e Anthropic |
A tabela de preços é baseada em uso: você paga pelos tokens processados, em vez de provisionar uma GPU dedicada. Para uma estimativa aproximada, 10 milhões de tokens de entrada e 1 milhão de tokens de saída custariam $45 antes de quaisquer outros encargos de conta ou alterações nas taxas listadas. Sua própria combinação de tráfego é mais importante do que o preço de saída principal, especialmente se os prompts são longos e as respostas são curtas.
O K3 também lista o preço de leitura de cache. Reutilizar instruções de sistema estáveis, definições de ferramentas ou material de referência grande pode reduzir o custo de solicitações repetidas quando sua aplicação e padrão de solicitação suportam cache. Trate o comportamento de cache como uma otimização a ser medida, não como uma garantia de que todo prompt repetido será cobrado pela taxa de leitura de cache.
Kimi K3 vs. a Família Kimi K2
O K2 não é um único endpoint. A família inclui variantes mais antigas do K2 Instruct e lançamentos mais recentes do K2.5 e K2.6, cada um com seu próprio perfil de capacidade e preço. A comparação correta, portanto, é baseada na carga de trabalho, em vez de uma afirmação genérica de que toda resposta do K3 é melhor.
| Fator de decisão | Kimi K3 | Família Kimi K2 |
|---|---|---|
| Posicionamento | Modelo principal mais recente na linha Kimi da Novita | Variantes anteriores com diferentes compensações de custo e capacidade |
| Contexto | 1M tokens | Varia por modelo; verifique o endpoint selecionado |
| Modalidades de entrada | Texto, imagem, vídeo | Varia por modelo; K2.5 suporta entrada multimodal |
| Preço atual do K3 na Novita | $3/M entrada, $15/M saída, $0,30/M leitura de cache | Varia por versão; verifique a página do modelo antes de comparar |
| Melhor razão para escolher | Conjuntos de trabalho muito grandes e fluxos multimodais de ponta | Menor custo, comportamento conhecido ou integração existente |
| Risco de migração | Novo ID de modelo e nova linha de base de produção | Prompts, avaliações e esquemas de ferramentas existentes já podem estar ajustados |
K3 Comparado com K2.5
O K2.5 continua sendo uma escolha razoável para aplicações multimodais que não precisam de um contexto de um milhão de tokens. Ele pode lidar com texto, imagens e vídeo, e sua página de modelo na Novita lista uma janela de contexto menor e taxas de token atuais mais baixas que o K3. Use o K2.5 quando seus prompts couberem confortavelmente dentro de seus limites e sua prioridade for manter o gasto de inferência previsível.
Mude para o K3 quando o contexto maior remover um gargalo real: recuperação repetida, sumarização de repositório em muitos arquivos, análise de vídeo ou documento longo, ou execuções de agente que perdem estado importante durante a compactação. Se a carga de trabalho consiste principalmente de conversas curtas ou perguntas comuns de codificação, o K2.5 pode oferecer uma melhor relação custo-latência.
K3 Comparado com K2 Instruct
O K2 Instruct é a opção de valor mais simples para chat baseado em texto e uso de ferramentas agênticas. Sua postagem mais antiga na Novita lista uma janela de contexto de 128K e preços mais baixos que o K3. Isso ainda pode ser suficiente para agentes de suporte, extração estruturada, assistência de codificação em repositórios pequenos e aplicações que já dependem do comportamento de prompt do K2 Instruct.
O K3 é uma escolha melhor quando 128K não é suficiente, quando entradas visuais fazem parte do fluxo de trabalho principal, ou quando você deseja avaliar o principal modelo atual da Moonshot AI em vez de preservar uma linha de base mais antiga. Não migre apenas porque o K3 tem mais parâmetros: teste seus prompts, chamadas de ferramenta, formato de saída e latência com tráfego representativo.
Quando Usar o Kimi K3
O K3 justifica seu preço mais alto quando uma ou mais destas condições se aplicam:
Repositórios grandes e agentes de codificação de longa duração
Use o K3 para tarefas que exigem uma visão ampla de um código: refatorações entre pacotes, mapeamento de arquitetura, migrações de dependências ou depuração que abrange logs, testes e arquivos de implementação. Um contexto de 1M tokens não torna automaticamente um agente confiável, mas dá à sua camada de orquestração mais espaço antes que ela precise resumir ou descartar estado.
Trabalho multimodal de conhecimento
O K3 aceita entrada de texto, imagem e vídeo. Isso o torna um candidato para fluxos de trabalho como revisão de capturas de tela de produtos com requisitos, análise de demonstrações gravadas junto com documentação, ou extração de decisões de mídia mista. Mantenha o contrato de saída estreito e valide campos extraídos se o resultado alimentar um sistema automatizado.
Pesquisa longa e síntese de documentos
Quando uma pergunta depende de muitos documentos primários, o K3 pode reduzir a quantidade de código de recuperação e costura necessário para montar um contexto de trabalho. Isso é mais útil para perguntas de comparação, síntese e entre documentos; não elimina a necessidade de identificar fontes autoritativas ou verificar citações.
Avaliação do modelo principal
Se você está avaliando a geração atual de Kimi para um novo produto, o K3 é o primeiro endpoint natural para benchmark. Comece com um pequeno conjunto de testes representativo e compare qualidade, latência, comprimento de saída e custo total com o K2.5 ou K2 Instruct antes de alterar seu padrão de produção.
Quando o K2 é a Melhor Escolha
O K3 não é a resposta padrão para toda solicitação. Permaneça com um endpoint K2 quando:
- Seus prompts são curtos e apenas texto, então o contexto de 1M não oferece benefício prático.
- Sua aplicação é altamente sensível a preço e os tokens de saída dominam a conta.
- Você já tem um prompt K2 estável, esquema de ferramentas ou avaliador de saída estruturada em produção.
- Você precisa de uma latência conhecida e ainda não testou o K3 sob seu perfil de taxa e concorrência.
- Sua carga de trabalho se encaixa na janela de contexto do K2 selecionado sem truncamento ou sumarização frequentes.
Um padrão de roteamento útil é manter o K2.5 ou K2 Instruct como o caminho rápido e enviar apenas tarefas de contexto grande, multimodais ou difíceis para o K3. Isso permite avaliar o K3 nas solicitações onde seu contexto e capacidade adicionais podem se pagar.
Como Aceitar o Kimi K3 na Novita AI
A págna do Kimi K3 inclui acesso ao Playground, documentção do modelo e detahes da API serverless. Para um clente compatível com OpnAI, use a URL base da Novita e o ID exato do modelo:
Se você qiser a primeira solicitação, veficações de preço e fluxo de solução de probemas em um só lugar, comece com o guia rápdo da API do Kimi K3.
from openai import OpenAI
client = OpenAI(
api_key="<NOVITA_API_KEY>",
base_url="https://api.novita.ai/openai",
)
response = client.chat.completios.create(
model="moonshotai/kimi-k3",
messages=[
{"role": "user", "content": "Resuma os principais riscos neste design."}
],
)
print(response.choices[0].message.content)
Mantenha o primeiro teste de produção pequeno. Registre tokens de prompt, tokens de completção, uso de cache, tempo até o primeio token, latência total e succsso da tarefa. Depois repita a mesma avaliação com o endpoint K2 que você usaria de outra forma. A págna do modelo também lista acesso compatível com Anthropic, que pode ser útil se sua aplicação existente já usa esse formato de clente.
Conclusão
Escolha o Kimi K3 na Novita AI quando o trabalho for genuinamente pesado em contexto ou multimodal e você qiser avaliar o modelo principal mais recente da Moonshot AI através de uma API serverless. Seu contexto de 1M tokens, entada visual e posicionamento atual de modelo principal o tornam um forte canddato para agentes de codificação de longo horizonte, pesquisa pesada em documentos e fluxos de trabalho de mídia mista.
Escolha o K2.5 ou K2 Instruct quando a carga de trabalho for menor, apenas texto, sensível a custo ou já ajustada em torno de um endpoint K2. A melhor configuração de produção pode ser um roteador em vez de um único vencedor: reserve o K3 para solicitações que precisam de seu conjunto de trabalho maior e mantenha um caminho K2 de menor custo para tráfego rotineiro.
FAQ
O Kimi K3 está disonível na Novita AI?
Sim. A Novita lista o Kimi K3 como um modelo serverless com o ID de modelo moonshotai/kimi-k3. A disonibilidade e preços podem mudar, então confime a págna do modelo ao vivo antes da implementação.
Quanto custa o Kimi K3 na Novita AI?
Conforme verifcado em 22 de julho de 2026, as taxas listadas são $3 por milhão de tokens de entrada, $15 por milhão de tokens de saída e $0,30 por milhão de tokens de leitura de cache. Verifique a págna do modelo para a taxa atual antes de estmar gastos em produção.
O Kimi K3 suporta imagens e vídeo?
Sim. A págna do modelo da Novita lista texto, imagem e vídeo como modalidades de entrada, com saída de texto.
Devo migrar do Kimi K2.5 para o K3?
Migre quando sua carga de trabalho se benefiar do contexto de 1M tokens do K3, do novo posicionamento de modelo principal ou do fluxo multimodal. Se o K2.5 já lida com seus prompts e sua priordade é menor custo, faça benchmark antes de mudar.
Qual é o ID do modelo Kimi K3?
Use moonshotai/kimi-k3 na configuração da API Novita.
