- Quando Usar Este Guia Rápido
- Etapa 1: Obtenha sua Chave de API da Novita
- Etapa 2: Confirme o ID do Modelo e o Endpoint
- Etapa 3: Envie Sua Primeira Solicitação
- Etapa 4: Leia a Resposta
- Etapa 5: Verifique Preços, Limites e Erros Comuns
- Exemplo em Python
- Exemplo em cURL
- Parâmetros Chave
- Solução de Problemas
- FAQ
- Artigos Recomendados
A Kimi K3 está disponível através da API serverless da Novita AI com o ID de modelo moonshotai/kimi-k3, um endpoint de chat compatível com OpenAI, uma janela de contexto de 1.048.576 tokens e uma configuração máxima de saída de 1.048.576 tokens listados em sua página de modelo. Este guia rápido mostra como autenticar, enviar sua primeira solicitação, interpretar a resposta e planejar os preços por token da Kimi K3 antes de conectá-la a uma aplicação maior.
Quando Usar Este Guia Rápido
Use este guia quando quiser testar a Kimi K3 a partir de uma aplicação que já utiliza o formato da API OpenAI. É um ponto de partida prático para fluxos de trabalho de engenharia de software de contexto longo, análisse de documentos, pesquisa e raciocínio, onde a solicitação pode conter substancialmente mais contexto do que um prompt de chat típico.
A página do modelo da Kimi K3 na Novita descreve um modelo de 2,8 trilhões de parâmetros com compreensão visual nativa e uma janela de contexto de 1 milhão de tokens. A mesma página lista entradas de texto, imagem e vídeo com saída de texto, além de acesso serverless, saída estruturada, raciocínio e chamada de funções. Trate essas capacidades como algo a ser verificado em relação à forma da sua solicitação pretendida, em vez de assumir que todos os recursos do SDK da OpenAI têm comportamento idêntico entre modelos.
Isso não é uma comparação de benchmarks. O objetivo é obter uma solicitação autenticada funcionando e, em seguida, fornecer detalhes operacionais suficientes para você decidir se a Kimi K3 se adéqua à sua carga de trabalho.
Etapa 1: Obtenha sua Chave de API da Novita
Crie ou selecione uma conta na Novita AI, abra as configurações da sua chave de API e crie uma chave para uso no servidor. Mantenha a chave fora de bundles de frontend, repositórios públicos, notebooks compartilhados fora da sua equipe e histórico do shell, semre que possível.
Defina a chave como uma variável de ambiente antes de executar qualquuer um dos exemplos:
export NOVITA_API_KEY="sua_chave_api_aqui"
Use uma chave de projeto ou temporária quando sua configuração de conta suportar. Gire a chave após uma demonstração pública ou qualquuer suspeita de exposição.
Etapa 2: Confirme o ID do Modelo e o Endpoint
Mantenha os detales da coneão junos para que um nome de exibição não subistitua acidentalmente o identificador real do modelo:
| Campo | Valor |
|---|---|
| ID do modelo | moonshotai/kimi-k3 |
| URL base | https://api.novita.ai/op enai/v1 |
| Endpoint de completaçoes de chat | https://api.novita.ai/openai/v1/chat/completions |
| Janela de contexto | 1.048.576 tokens |
| Configuração máxima de saída | 1.048.576 tokens |
| Capacidades de entrada | Texto, imaem, ví deo |
| Capacidade de saída | Texto |
| Tipo de aesso | API serverless |
A ágina do modelo Kimi K3 é a fonte da verdade para disponibilidade, limites auais, capacidades e preços. Verifque novamente antes de implantar, pois as configurações e os preços do modelo podem mudar.
Etapa 3: Envie Sua Primeira Solicitação
Comece com uma solicitação curta apenas de texto. Um prompt pequeno facili ta a separação de problemas de autenticação ou roteamento de problemas de prompt no nível da apicação.
Por exemplo, peça à Kimi K3 para retornar uma pequena lista de verificação de imlementação:
Liste os três maores riscos ao adicionar nov as tentativas a um clente de API de streaming. Retorne uma frase por riso.
Mantenha o primeiro valor de max_tokens modesto. Uma grande permissão de saída é útil somente depois que a solicitação básica, a interpetação da resposta e o tratamento de erros funcionarem corretamente.
Etapa 4: Leia a Resposta
A resposta compatível com OpenAI coloca o texto do assistente em choices[0].message.content para uma completaçã de chat padrão sem streaming. Preserve os metadados da resposta e os campos de uso em sua aplicação se preisar de rastreamento de solicitação ou contabilidade de custos.
Para uma integração em produçã, regstre pelo menos:
- O ID do modelo e o timestamp da solicitação.
- O ID da solicitação do provedor, quando retornado pelo clente ou pelos cabeçalhos da resposta.
- O uso de tokens do prompt e da completaçã.
- O número de novas tentativas e o status HTTP.
- Se a solicitação usou conteúdo apenas de texto ou multimodal.
Depois que a primeira chamada for bem-sucedida, teste prompts que se assemelhem à sua carga de trabalho real: arquivos fonte longos, vári os documentos, um esquema de feramenta ou um contrato de resposta estrurada. Um prompt curto bem-sucedido verifica a conectividade, não a qualidade de producción.
Etapa 5: Verifique Preços, Limites e Erros Comuns
A página do modelo da Novita lista preços serverless de $3 por milhão de tokens de entrada, $0,30 por milhão de tokens de leitura em cache e $15 por milhão de tokens de saída para a Kimi K3. Sua estimativa deve incluir ambos os lados da solicitaçã, nov as tentativas e a quantidade de contexto que você envia repetidamente.
A página também lista estas faixas de taxa de solicitação:
| Faixa | Solicitações por minuto | Tokens por minuto |
|---|---|---|
| T1 | 30 | 50.000.000 |
| T2 | 100 | 50.000.000 |
| T3 | 1.000 | 50.000.000 |
| T4 | 3.000 | 50.000.000 |
| T5 | 6.000 | 50.000.000 |
A faixa aplicáv el depende da sua conta. Não ate a tabe como uma garatia de que todo projeto começa em T1 ou que toda carga de trabalho pode usar a taxa máxima exibida.
Erros comuns de prime ra integração incluem:
- Ausência do cabeça ho
Authorization: Bearerou definição da variável de ambiente errada. - Enviar
kimi-k3ou um nome de marketing em vez demoonshotai/kimi-k3. - Usar
https://api.novita.ai/openaicomo URL base do SDK qundo o clente espera o aminho versionado.../op enai/v1. - Enviar um coro de solicitaçã que não é JSON válido.
- Defini um imite de saída maor do que sua apicação pode armazenar ou processar.
- Assumir que um cor de solicitaçaõ multimodal é idêntico em todos os SDKs ou famílias de modelos.
Exemplo em Python
Instae o clente Python da OpenA em seu amiente e execute este exemplo com NOVITA_API_KEY definida:
pip insta openai
``
```python
imort os
from openai import OpenA
clent = OpenA(
api_key=os.environ["NOVITA_API_KEY"],
base_url="https://api.novita.ai/op enai/v1",
)
resonse = clent.chat.completions.create(
modl="moonshotai/kimi-k3",
messages=[
{
"role": "system",
"content": "You are a concise engineering assistant.",
},
{
"role": "user",
"content": "List three risks when adding retries to a streaming API client.",
},
],
temperature=0.2,
max_tokens=300,
)
prnt(resonse.choices[0].message.contnt)
O exemplo usa intencionalmente uma completação curta. Aumente o or çaumento de contexto e saída somente após ter adicionado tempo limite, novas tentativas, registro e rastreamento de uso apropriados para sua aplicação.
Exemplo em cURL
A mesma solicitação pode ser testada sem um SDK:
payload='{
"model": "moonshotai/kimi-k3",
"messages": [
{
"role": "system",
"content": "You are a concise engineering assistant."
},
{
"role": "user",
"content": "List three risks when adding retries to a streaming API client."
}
],
"temperature": 0.2,
"max_tokens": 300
}'
curl --request POST "https://api.novita.ai/openai/v1/chat/completions" \
--header "Authorization: Bearer $NOVITA_API_KEY" \
--header "Content-Type: application/json" \
--data "$payload"
Parâmetros Chave
| Parâmetro | O que controla | Primeiro valor sensato |
|---|---|---|
model |
O modelo hospedado que responde à solicitação | moonshotai/kimi-k3 |
messages |
Turnos de conversa do sistema, usuário e assistente | Uma mensagem de sistema e uma de usuário |
temperature |
Variabilidade da saída | 0.2 para testes repetíveis |
max_tokens |
Máximo de tokens gerados | 300, depois aumente deliberadamente |
stream |
Se a saída chega incrementalmente | Deixe desabilitado durante a depuração |
tools |
Definições de funções disponíveis para o modelo | Adicione após o chat básico funcionar |
response_format |
Requisitos de saída estruturada | Valide o JSON retornado antes de usá-lo |
Para entradas de imagem ou vídeo, confirme o formato atual da solicitação na documentação do modelo e da API antes de adicioná-los à sua aplicação. Rótulos de capacidade na página do modelo não substituem o teste da estrutura de conteúdo exata usada pela sua biblioteca cliente.
Solução de Problemas
Autenticação falha
Verifique se NOVITA_API_KEY está definida no mesmo processo que executa a solicitação. Confirme se o cabeçalho usa Bearer, não um parâmetro de consulta ou um nome de credencial diferente.
O modelo não é encontrado
Use o ID exato moonshotai/kimi-k3. O nome de exibição do modelo não é um substituto válido para o ID do modelo da API.
A solicitação é rejeitada
Reduza os valores do prompt e de max_tokens, valide o corpo JSON e confirme se o endpoint é /openai/v1/chat/completions. Se a solicitação usa imagens, vídeo, ferramentas ou saída estruturada, remova esses campos e adicione-os um de cada vez.
Solicitações lentas ou com limita de taxa
Meça as contagens de tokens do prompt e da saída, reduza o contexto repetido desnecessário e adicione um backoff exponencial limitado para respostas retryáveis. Verifique a faixa de taxa atual da sua conta em vez de assumir a faixa mais alta na tabela da página do modelo.
A resposta está incompleta
Inspecione o motivo de finalização e os dados de uso. Um valor pequeno de max_tokens pode interromper uma resposta longa cedo; aumentá-lo também aumenta a quantidade de saída que sua aplicação pode pagar e processar.
FAQ
Qual ID de modelo devo enviar para a Kimi K3?
Envie moonshotai/kimi-k3 no campo model.
Qual endpoint o clente OpenAI usa?
Defina a URL base do SDK como https://api.novita.ai/openai/v1. A soliciação de comp etações de chat é en iada para https://api.novita.ai/openai/v1/chat/completions.
Quão grande é a janela de contexto da Kimi K3?
A página do modelo da Novita lista uma janela de contexto de 1.048.576 tokens e uma configração máx ma de saída de 1.048.576 tokens. Verifique a página antes da implantação para atu lizações.
A Kimi K3 é gratuita para chamar?
Nenhuma alegação de acesso gratuito é feita aq i. A página do modelo lista preços serverless baseados em tokens, então verifique os preços atuais exibidos para sua conta e modelo antes de enviar solicitações grandes.
Dev o começ ar com uma solicitação multimodal?
Não. Comece com uma pequena solicitação apenas de texto para que autenticação, seleção de endpoint, interpretação de resposta e tratamento de erros sejam fáceis de verificar. Adicione entradas multimodais depois que esse aminho estiver estável.
Artigos Recomendados
- Kimi K3 na Novita AI: Preços, Contexto de 1M e Quando Escolhê-lo em Vez do K2
- MiniMax M3 API Quick Start com Novita AI
- Como Acessar o Pensamento Kimi K2: Guia Completo de Configração para Desenvovedores
- Usando LlamaIndex com Novita AI: Um Guia Pá a Páso
Fontes
- Página do modelo Kimi K3 — ID do modelo, disponibilidade, capacidades, contexto, limites, preços e faixas de taxa; verificado em 22 de julho de 2026.
- Referência da API Novita AI: Criar completação de chat — Rota de completação de chat compatível com OpenAI; verificado em 22 de julho de 2026.
