- Quando Usar Este Início Rápido
- Etapa 1: Obtenha sua Chave de API da Novita
- Etapa 2: Confirme o ID do Modelo e o Endpoint
- Etapa 3: Envie Sua Primeira Solicitação
- Etapa 4: Leia a Resposta
- Etapa 5: Verifique Precificação, Limites e Erros Comuns
- Exemplo em Python
- Exemplo com cURL
- Parâmetros Principais
- Solução de Problemas
- Perguntas Frequentes (FAQ)
- Artigos Recomendados
O Kimi K3 está disponível através da API serverless da Novita AI com o ID do modelo moonshotai/kimi-k3, um endpoint de chat compatível com OpenAI, uma janela de contexto de 1,048,576 tokens e uma configuração de saída máxima de 1,048,576 tokens listada em sua página de modelo. Este início rápido mostra como autenticar, enviar uma primeira solicitação, analisar a resposta e planejar a precificação de tokens do Kimi K3 antes de conectá-lo a uma aplicação maior.
Quando Usar Este Início Rápido
Use este guia quando quiser testar o Kimi K3 a partir de uma aplicação que já utiliza o formato da API OpenAI. É um ponto de partida prático para fluxos de trabalho de engenharia de software com contexto longo, análise de documentos, pesquisa e raciocínio, onde a solicitação pode conter substancialmente mais contexto do que um prompt de chat típico.
A página do modelo Kimi K3 na Novita descreve um modelo de 2,8 trilhões de parâmetros com compreensão visual nativa e uma janela de contexto de 1M tokens. A mesma página lista entradas de texto, imagem e vídeo com saída de texto, além de acesso serverless, saída estruturada, raciocínio e chamada de função. Trate esses recursos como capacidades a serem verificadas em relação ao formato pretendido da sua solicitação, em vez de assumir que cada recurso do SDK OpenAI tem comportamento idêntico entre modelos.
Isso não é uma comparação de benchmark. O objetivo é conseguir que uma solicitação autenticada funcione e, em seguida, fornecer detalhes operacionais suficientes para você decidir se o Kimi K3 se adequa à sua carga de trabalho.
Etapa 1: Obtenha sua Chave de API da Novita
Crie ou selecione uma conta na Novita AI, abra as configurações da sua chave de API e crie uma chave para uso no lado do servidor. Mantenha a chave fora de bundles frontend, repositórios públicos, notebooks compartilhados fora da sua equipe e histórico do shell sempre que possível.
Defina a chave como uma variável de ambiente antes de executar qualquer um dos exemplos:
export NOVITA_API_KEY="your_api_key_here"
Use uma chave de projeto ou temporária quando a configuração da sua conta suportar. Rotacione a chave após uma demonstração pública ou qualquer suspeita de exposição.
Etapa 2: Confirme o ID do Modelo e o Endpoint
Mantenha os detalhes de conexão juntos para que um nome de exibição não substitua acidentalmente o identificador real do modelo:
| Campo | Valor |
|---|---|
| ID do modelo | moonshotai/kimi-k3 |
| URL base | https://api.novita.ai/openai/v1 |
| Endpoint de completações de chat | https://api.novita.ai/openai/v1/chat/completions |
| Janela de contexto | 1,048,576 tokens |
| Configuração de saída máxima | 1,048,576 tokens |
| Capacidades de entrada | Texto, imagem, vídeo |
| Capacidade de saída | Texto |
| Tipo de acesso | API serverless |
A página do modelo Kimi K3 é a fonte da verdade sobre disponibilidade, limites atuais, capacidades e preços. Verifique-a novamente antes de colocar em produção, pois as configurações e preços do modelo podem mudar.
Etapa 3: Envie Sua Primeira Solicitação
Comece com uma solicitação curta de apenas texto. Um prompt pequeno facilita a separação de problemas de autenticação ou roteamento de problemas de prompt no nível da aplicação.
Por exemplo, peça ao Kimi K3 para retornar uma pequena lista de verificação de implementação:
Liste os três maiores riscos ao adicionar tentativas a um cliente de API de streaming. Retorne uma frase por risco.
Mantenha o primeiro valor de max_tokens modesto. Uma grande permissão de saída é útil somente depois que a solicitação básica, a análise da resposta e o tratamento de erros funcionarem corretamente.
Etapa 4: Leia a Resposta
A resposta compatível com OpenAI coloca o texto do assistente em choices[0].message.content para uma completação de chat padrão sem streaming. Preserve os metadados da resposta e os campos de uso na sua aplicação se precisar de rastreamento de solicitação ou contabilidade de custos.
Para uma integração em produção, registre pelo menos:
- O ID do modelo e o timestamp da solicitação.
- O ID da solicitação do provedor, quando retornado pelo cliente ou pelos cabeçalhos da resposta.
- O uso de tokens de prompt e completação.
- O número de tentativas e o status HTTP.
- Se a solicitação usou conteúdo apenas de texto ou multimodal.
Assim que a primeira chamada for bem-sucedida, teste prompts que se assemelhem à sua carga de trabalho real: arquivos de origem longos, vários documentos, um esquema de ferramenta ou um contrato de resposta estruturada. Um prompt curto bem-sucedido verifica a conectividade, não a qualidade de produção.
Etapa 5: Verifique Precificação, Limites e Erros Comuns
A página do modelo Novita lista preços serverless de US$ 3 por milhão de tokens de entrada, US$ 0,30 por milhão de tokens de leitura em cache e US$ 15 por milhão de tokens de saída para o Kimi K3. Sua estimativa deve incluir ambos os lados da solicitação, tentativas e a quantidade de contexto que você envia repetidamente.
A página também lista estas camadas de taxa de solicitação:
| Camada | Solicitações por minuto | Tokens por minuto |
|---|---|---|
| T1 | 30 | 50.000.000 |
| T2 | 100 | 50.000.000 |
| T3 | 1.000 | 50.000.000 |
| T4 | 3.000 | 50.000.000 |
| T5 | 6.000 | 50.000.000 |
A camada aplicável depende da sua conta. Não trate a tabela como uma promessa de que todo projeto começa na T1 ou que toda carga de trabalho pode usar a taxa máxima exibida.
Erros comuns na primeira integração incluem:
- Faltar o cabeçalho
Authorization: Bearerou definir a variável de ambiente errada. - Enviar
kimi-k3ou um nome de marketing em vez demoonshotai/kimi-k3. - Usar
https://api.novita.ai/openaicomo URL base do SDK quando o cliente espera o caminho versionado.../openai/v1. - Enviar um corpo de solicitação que não seja JSON válido.
- Definir um limite de saída maior do que sua aplicação pode armazenar ou processar.
- Assumir que um corpo de solicitação multimodal é idêntico em todos os SDKs ou famílias de modelo.
Exemplo em Python
Instale o cliente Python OpenAI no seu ambiente e execute este exemplo com NOVITA_API_KEY definida:
pip install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["NOVITA_API_KEY"],
base_url="https://api.novita.ai/openai/v1",
)
response = client.chat.completions.create(
model="moonshotai/kimi-k3",
messages=[
{
"role": "system",
"content": "Você é um assistente de engenharia conciso.",
},
{
"role": "user",
"content": "Liste três riscos ao adicionar tentativas a um cliente de API de streaming.",
},
],
temperature=0.2,
max_tokens=300,
)
print(response.choices[0].message.content)
O exemplo usa intencionalmente uma completação curta. Aumente os orçamentos de contexto e saída somente depois de adicionar timeout, tentativas, registro em log e rastreamento de uso adequados à sua aplicação.
Exemplo com cURL
A mesma solicitação pode ser testada sem um SDK:
payload='{
"model": "moonshotai/kimi-k3",
"messages": [
{
"role": "system",
"content": "Você é um assistente de engenharia conciso."
},
{
"role": "user",
"content": "Liste três riscos ao adicionar tentativas a um cliente de API de streaming."
}
],
"temperature": 0.2,
"max_tokens": 300
}'
curl --request POST "https://api.novita.ai/openai/v1/chat/completions" \
--header "Authorization: Bearer $NOVITA_API_KEY" \
--header "Content-Type: application/json" \
--data "$payload"
Parâmetros Principais
| Parâmetro | O que controla | Primeiro valor sensato |
|---|---|---|
model |
O modelo hospedado que responde à solicitação | moonshotai/kimi-k3 |
messages |
Turnos de conversa do sistema, usuário e assistente | Uma mensagem do sistema e uma do usuário |
temperature |
Variabilidade da saída | 0.2 para testes repetíveis |
max_tokens |
Saída gerada máxima | 300, depois aumente deliberadamente |
stream |
Se a saída chega incrementalmente | Deixe desabilitado durante a depuração |
tools |
Definições de funções disponíveis para o modelo | Adicione após o chat básico funcionar |
response_format |
Requisitos de saída estruturada | Valide o JSON retornado antes de usá-lo |
Para entradas de imagem ou vídeo, confirme o formato atual da solicitação na documentação do modelo e da API antes de adicioná-los à sua aplicação. Rótulos de capacidade em uma página de modelo não substituem o teste da estrutura de conteúdo exata usada pela sua biblioteca cliente.
Solução de Problemas
A autenticação falha
Verifique se NOVITA_API_KEY está definida no mesmo processo que executa a solicitação. Confirme que o cabeçalho usa Bearer, não um parâmetro de consulta ou um nome de credencial diferente.
O modelo não é encontrado
Use o ID exato moonshotai/kimi-k3. O nome de exibição do modelo não é um substituto válido para o ID do modelo na API.
A solicitação é rejeitada
Reduza os valores de prompt e max_tokens, valide o corpo JSON e confirme que o endpoint é /openai/v1/chat/completions. Se a solicitação usar imagens, vídeo, ferramentas ou saída estruturada, remova esses campos e adicione-os um de cada vez.
As solicitações estão lentas ou com limite de taxa
Meça as contagens de tokens de prompt e saída, reduza o contexto repetido desnecessário e adicione backoff exponencial limitado para respostas que podem ser repetidas. Verifique a camada de taxa atual da sua conta em vez de assumir a camada mais alta da tabela da página do modelo.
A resposta está incompleta
Inspecione o motivo de finalização e os dados de uso. Um valor pequeno de max_tokens pode interromper uma resposta longa precocemente; aumentá-lo também aumenta a quantidade de saída que sua aplicação pode pagar e processar.
Perguntas Frequentes (FAQ)
Qual ID de modelo devo enviar para o Kimi K3?
Envie moonshotai/kimi-k3 no campo model.
Qual endpoint o cliente OpenAI usa?
Defina a URL base do SDK como https://api.novita.ai/openai/v1. A solicitação de completação de chat é enviada para https://api.novita.ai/openai/v1/chat/completions.
Qual é o tamanho da janela de contexto do Kimi K3?
A página do modelo Novita lista uma janela de contexto de 1,048,576 tokens e uma configuração de saída máxima de 1,048,576 tokens. Verifique a página antes da implantação para obter atualizações.
A chamada ao Kimi K3 é gratuita?
Nenhuma alegação de acesso gratuito é feita aqui. A página do modelo lista preços serverless baseados em tokens; portanto, verifique os preços atuais exibidos para sua conta e modelo antes de enviar solicitações grandes.
Devo começar com uma solicitação multimodal?
Não. Comece com uma pequena solicitação apenas de texto para que a autenticação, a seleção de endpoint, a análise da resposta e o tratamento de erros sejam fáceis de verificar. Adicione entradas multimodais depois que esse caminho estiver estável.
Artigos Recomendados
- Início Rápido da API MiniMax M3 com Novita AI
- Como Acessar o Pensamento do Kimi K2: Guia de Configuração Completo para Desenvolvedores
- Usando LlamaIndex com Novita AI: Um Guia Passo a Passo
Fontes
- Página do modelo Kimi K3 — ID do modelo, disponibilidade, capacidades, contexto, limites, preços e camadas de taxa; verificado em 22 de julho de 2026.
- Referência da API Novita AI: Criar completação de chat — rota de completação de chat compatível com OpenAI; verificado em 22 de julho de 2026.
