Início Rápido do Kimi K3 para Fluxos de Trabalho de API de Contexto Longo

Início Rápido do Kimi K3 para Fluxos de Trabalho de API de Contexto Longo

O Kimi K3 está disponível através da API serverless da Novita AI com o ID do modelo moonshotai/kimi-k3, um endpoint de chat compatível com OpenAI, uma janela de contexto de 1,048,576 tokens e uma configuração de saída máxima de 1,048,576 tokens listada em sua página de modelo. Este início rápido mostra como autenticar, enviar uma primeira solicitação, analisar a resposta e planejar a precificação de tokens do Kimi K3 antes de conectá-lo a uma aplicação maior.

Quando Usar Este Início Rápido

Use este guia quando quiser testar o Kimi K3 a partir de uma aplicação que já utiliza o formato da API OpenAI. É um ponto de partida prático para fluxos de trabalho de engenharia de software com contexto longo, análise de documentos, pesquisa e raciocínio, onde a solicitação pode conter substancialmente mais contexto do que um prompt de chat típico.

A página do modelo Kimi K3 na Novita descreve um modelo de 2,8 trilhões de parâmetros com compreensão visual nativa e uma janela de contexto de 1M tokens. A mesma página lista entradas de texto, imagem e vídeo com saída de texto, além de acesso serverless, saída estruturada, raciocínio e chamada de função. Trate esses recursos como capacidades a serem verificadas em relação ao formato pretendido da sua solicitação, em vez de assumir que cada recurso do SDK OpenAI tem comportamento idêntico entre modelos.

Isso não é uma comparação de benchmark. O objetivo é conseguir que uma solicitação autenticada funcione e, em seguida, fornecer detalhes operacionais suficientes para você decidir se o Kimi K3 se adequa à sua carga de trabalho.

Etapa 1: Obtenha sua Chave de API da Novita

Crie ou selecione uma conta na Novita AI, abra as configurações da sua chave de API e crie uma chave para uso no lado do servidor. Mantenha a chave fora de bundles frontend, repositórios públicos, notebooks compartilhados fora da sua equipe e histórico do shell sempre que possível.

Defina a chave como uma variável de ambiente antes de executar qualquer um dos exemplos:

export NOVITA_API_KEY="your_api_key_here"

Use uma chave de projeto ou temporária quando a configuração da sua conta suportar. Rotacione a chave após uma demonstração pública ou qualquer suspeita de exposição.

Etapa 2: Confirme o ID do Modelo e o Endpoint

Mantenha os detalhes de conexão juntos para que um nome de exibição não substitua acidentalmente o identificador real do modelo:

Campo Valor
ID do modelo moonshotai/kimi-k3
URL base https://api.novita.ai/openai/v1
Endpoint de completações de chat https://api.novita.ai/openai/v1/chat/completions
Janela de contexto 1,048,576 tokens
Configuração de saída máxima 1,048,576 tokens
Capacidades de entrada Texto, imagem, vídeo
Capacidade de saída Texto
Tipo de acesso API serverless

A página do modelo Kimi K3 é a fonte da verdade sobre disponibilidade, limites atuais, capacidades e preços. Verifique-a novamente antes de colocar em produção, pois as configurações e preços do modelo podem mudar.

Etapa 3: Envie Sua Primeira Solicitação

Comece com uma solicitação curta de apenas texto. Um prompt pequeno facilita a separação de problemas de autenticação ou roteamento de problemas de prompt no nível da aplicação.

Por exemplo, peça ao Kimi K3 para retornar uma pequena lista de verificação de implementação:

Liste os três maiores riscos ao adicionar tentativas a um cliente de API de streaming. Retorne uma frase por risco.

Mantenha o primeiro valor de max_tokens modesto. Uma grande permissão de saída é útil somente depois que a solicitação básica, a análise da resposta e o tratamento de erros funcionarem corretamente.

Etapa 4: Leia a Resposta

A resposta compatível com OpenAI coloca o texto do assistente em choices[0].message.content para uma completação de chat padrão sem streaming. Preserve os metadados da resposta e os campos de uso na sua aplicação se precisar de rastreamento de solicitação ou contabilidade de custos.

Para uma integração em produção, registre pelo menos:

  • O ID do modelo e o timestamp da solicitação.
  • O ID da solicitação do provedor, quando retornado pelo cliente ou pelos cabeçalhos da resposta.
  • O uso de tokens de prompt e completação.
  • O número de tentativas e o status HTTP.
  • Se a solicitação usou conteúdo apenas de texto ou multimodal.

Assim que a primeira chamada for bem-sucedida, teste prompts que se assemelhem à sua carga de trabalho real: arquivos de origem longos, vários documentos, um esquema de ferramenta ou um contrato de resposta estruturada. Um prompt curto bem-sucedido verifica a conectividade, não a qualidade de produção.

Etapa 5: Verifique Precificação, Limites e Erros Comuns

A página do modelo Novita lista preços serverless de US$ 3 por milhão de tokens de entrada, US$ 0,30 por milhão de tokens de leitura em cache e US$ 15 por milhão de tokens de saída para o Kimi K3. Sua estimativa deve incluir ambos os lados da solicitação, tentativas e a quantidade de contexto que você envia repetidamente.

A página também lista estas camadas de taxa de solicitação:

Camada Solicitações por minuto Tokens por minuto
T1 30 50.000.000
T2 100 50.000.000
T3 1.000 50.000.000
T4 3.000 50.000.000
T5 6.000 50.000.000

A camada aplicável depende da sua conta. Não trate a tabela como uma promessa de que todo projeto começa na T1 ou que toda carga de trabalho pode usar a taxa máxima exibida.

Erros comuns na primeira integração incluem:

  • Faltar o cabeçalho Authorization: Bearer ou definir a variável de ambiente errada.
  • Enviar kimi-k3 ou um nome de marketing em vez de moonshotai/kimi-k3.
  • Usar https://api.novita.ai/openai como URL base do SDK quando o cliente espera o caminho versionado .../openai/v1.
  • Enviar um corpo de solicitação que não seja JSON válido.
  • Definir um limite de saída maior do que sua aplicação pode armazenar ou processar.
  • Assumir que um corpo de solicitação multimodal é idêntico em todos os SDKs ou famílias de modelo.

Exemplo em Python

Instale o cliente Python OpenAI no seu ambiente e execute este exemplo com NOVITA_API_KEY definida:

pip install openai
import os

from openai import OpenAI


client = OpenAI(
    api_key=os.environ["NOVITA_API_KEY"],
    base_url="https://api.novita.ai/openai/v1",
)

response = client.chat.completions.create(
    model="moonshotai/kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "Você é um assistente de engenharia conciso.",
        },
        {
            "role": "user",
            "content": "Liste três riscos ao adicionar tentativas a um cliente de API de streaming.",
        },
    ],
    temperature=0.2,
    max_tokens=300,
)

print(response.choices[0].message.content)

O exemplo usa intencionalmente uma completação curta. Aumente os orçamentos de contexto e saída somente depois de adicionar timeout, tentativas, registro em log e rastreamento de uso adequados à sua aplicação.

Exemplo com cURL

A mesma solicitação pode ser testada sem um SDK:

payload='{
  "model": "moonshotai/kimi-k3",
  "messages": [
    {
      "role": "system",
      "content": "Você é um assistente de engenharia conciso."
    },
    {
      "role": "user",
      "content": "Liste três riscos ao adicionar tentativas a um cliente de API de streaming."
    }
  ],
  "temperature": 0.2,
  "max_tokens": 300
}'

curl --request POST "https://api.novita.ai/openai/v1/chat/completions" \
  --header "Authorization: Bearer $NOVITA_API_KEY" \
  --header "Content-Type: application/json" \
  --data "$payload"

Parâmetros Principais

Parâmetro O que controla Primeiro valor sensato
model O modelo hospedado que responde à solicitação moonshotai/kimi-k3
messages Turnos de conversa do sistema, usuário e assistente Uma mensagem do sistema e uma do usuário
temperature Variabilidade da saída 0.2 para testes repetíveis
max_tokens Saída gerada máxima 300, depois aumente deliberadamente
stream Se a saída chega incrementalmente Deixe desabilitado durante a depuração
tools Definições de funções disponíveis para o modelo Adicione após o chat básico funcionar
response_format Requisitos de saída estruturada Valide o JSON retornado antes de usá-lo

Para entradas de imagem ou vídeo, confirme o formato atual da solicitação na documentação do modelo e da API antes de adicioná-los à sua aplicação. Rótulos de capacidade em uma página de modelo não substituem o teste da estrutura de conteúdo exata usada pela sua biblioteca cliente.

Solução de Problemas

A autenticação falha

Verifique se NOVITA_API_KEY está definida no mesmo processo que executa a solicitação. Confirme que o cabeçalho usa Bearer, não um parâmetro de consulta ou um nome de credencial diferente.

O modelo não é encontrado

Use o ID exato moonshotai/kimi-k3. O nome de exibição do modelo não é um substituto válido para o ID do modelo na API.

A solicitação é rejeitada

Reduza os valores de prompt e max_tokens, valide o corpo JSON e confirme que o endpoint é /openai/v1/chat/completions. Se a solicitação usar imagens, vídeo, ferramentas ou saída estruturada, remova esses campos e adicione-os um de cada vez.

As solicitações estão lentas ou com limite de taxa

Meça as contagens de tokens de prompt e saída, reduza o contexto repetido desnecessário e adicione backoff exponencial limitado para respostas que podem ser repetidas. Verifique a camada de taxa atual da sua conta em vez de assumir a camada mais alta da tabela da página do modelo.

A resposta está incompleta

Inspecione o motivo de finalização e os dados de uso. Um valor pequeno de max_tokens pode interromper uma resposta longa precocemente; aumentá-lo também aumenta a quantidade de saída que sua aplicação pode pagar e processar.

Perguntas Frequentes (FAQ)

Qual ID de modelo devo enviar para o Kimi K3?

Envie moonshotai/kimi-k3 no campo model.

Qual endpoint o cliente OpenAI usa?

Defina a URL base do SDK como https://api.novita.ai/openai/v1. A solicitação de completação de chat é enviada para https://api.novita.ai/openai/v1/chat/completions.

Qual é o tamanho da janela de contexto do Kimi K3?

A página do modelo Novita lista uma janela de contexto de 1,048,576 tokens e uma configuração de saída máxima de 1,048,576 tokens. Verifique a página antes da implantação para obter atualizações.

A chamada ao Kimi K3 é gratuita?

Nenhuma alegação de acesso gratuito é feita aqui. A página do modelo lista preços serverless baseados em tokens; portanto, verifique os preços atuais exibidos para sua conta e modelo antes de enviar solicitações grandes.

Devo começar com uma solicitação multimodal?

Não. Comece com uma pequena solicitação apenas de texto para que a autenticação, a seleção de endpoint, a análise da resposta e o tratamento de erros sejam fáceis de verificar. Adicione entradas multimodais depois que esse caminho estiver estável.

Artigos Recomendados

Fontes