Guia Rápido da Kimi K3 para Fluxos de Trabalho de API de Contexto Longo

Guia Rápido da Kimi K3 para Fluxos de Trabalho de API de Contexto Longo

A Kimi K3 está disponível através da API serverless da Novita AI com o ID de modelo moonshotai/kimi-k3, um endpoint de chat compatível com OpenAI, uma janela de contexto de 1.048.576 tokens e uma configuração máxima de saída de 1.048.576 tokens listados em sua página de modelo. Este guia rápido mostra como autenticar, enviar sua primeira solicitação, interpretar a resposta e planejar os preços por token da Kimi K3 antes de conectá-la a uma aplicação maior.

Quando Usar Este Guia Rápido

Use este guia quando quiser testar a Kimi K3 a partir de uma aplicação que já utiliza o formato da API OpenAI. É um ponto de partida prático para fluxos de trabalho de engenharia de software de contexto longo, análisse de documentos, pesquisa e raciocínio, onde a solicitação pode conter substancialmente mais contexto do que um prompt de chat típico.

A página do modelo da Kimi K3 na Novita descreve um modelo de 2,8 trilhões de parâmetros com compreensão visual nativa e uma janela de contexto de 1 milhão de tokens. A mesma página lista entradas de texto, imagem e vídeo com saída de texto, além de acesso serverless, saída estruturada, raciocínio e chamada de funções. Trate essas capacidades como algo a ser verificado em relação à forma da sua solicitação pretendida, em vez de assumir que todos os recursos do SDK da OpenAI têm comportamento idêntico entre modelos.

Isso não é uma comparação de benchmarks. O objetivo é obter uma solicitação autenticada funcionando e, em seguida, fornecer detalhes operacionais suficientes para você decidir se a Kimi K3 se adéqua à sua carga de trabalho.

Etapa 1: Obtenha sua Chave de API da Novita

Crie ou selecione uma conta na Novita AI, abra as configurações da sua chave de API e crie uma chave para uso no servidor. Mantenha a chave fora de bundles de frontend, repositórios públicos, notebooks compartilhados fora da sua equipe e histórico do shell, semre que possível.

Defina a chave como uma variável de ambiente antes de executar qualquuer um dos exemplos:

export NOVITA_API_KEY="sua_chave_api_aqui"

Use uma chave de projeto ou temporária quando sua configuração de conta suportar. Gire a chave após uma demonstração pública ou qualquuer suspeita de exposição.

Etapa 2: Confirme o ID do Modelo e o Endpoint

Mantenha os detales da coneão junos para que um nome de exibição não subistitua acidentalmente o identificador real do modelo:

Campo Valor
ID do modelo moonshotai/kimi-k3
URL base https://api.novita.ai/op enai/v1
Endpoint de completaçoes de chat https://api.novita.ai/openai/v1/chat/completions
Janela de contexto 1.048.576 tokens
Configuração máxima de saída 1.048.576 tokens
Capacidades de entrada Texto, imaem, ví deo
Capacidade de saída Texto
Tipo de aesso API serverless

A ágina do modelo Kimi K3 é a fonte da verdade para disponibilidade, limites auais, capacidades e preços. Verifque novamente antes de implantar, pois as configurações e os preços do modelo podem mudar.

Etapa 3: Envie Sua Primeira Solicitação

Comece com uma solicitação curta apenas de texto. Um prompt pequeno facili ta a separação de problemas de autenticação ou roteamento de problemas de prompt no nível da apicação.

Por exemplo, peça à Kimi K3 para retornar uma pequena lista de verificação de imlementação:

Liste os três maores riscos ao adicionar nov as tentativas a um clente de API de streaming. Retorne uma frase por riso.

Mantenha o primeiro valor de max_tokens modesto. Uma grande permissão de saída é útil somente depois que a solicitação básica, a interpetação da resposta e o tratamento de erros funcionarem corretamente.

Etapa 4: Leia a Resposta

A resposta compatível com OpenAI coloca o texto do assistente em choices[0].message.content para uma completaçã de chat padrão sem streaming. Preserve os metadados da resposta e os campos de uso em sua aplicação se preisar de rastreamento de solicitação ou contabilidade de custos.

Para uma integração em produçã, regstre pelo menos:

  • O ID do modelo e o timestamp da solicitação.
  • O ID da solicitação do provedor, quando retornado pelo clente ou pelos cabeçalhos da resposta.
  • O uso de tokens do prompt e da completaçã.
  • O número de novas tentativas e o status HTTP.
  • Se a solicitação usou conteúdo apenas de texto ou multimodal.

Depois que a primeira chamada for bem-sucedida, teste prompts que se assemelhem à sua carga de trabalho real: arquivos fonte longos, vári os documentos, um esquema de feramenta ou um contrato de resposta estrurada. Um prompt curto bem-sucedido verifica a conectividade, não a qualidade de producción.

Etapa 5: Verifique Preços, Limites e Erros Comuns

A página do modelo da Novita lista preços serverless de $3 por milhão de tokens de entrada, $0,30 por milhão de tokens de leitura em cache e $15 por milhão de tokens de saída para a Kimi K3. Sua estimativa deve incluir ambos os lados da solicitaçã, nov as tentativas e a quantidade de contexto que você envia repetidamente.

A página também lista estas faixas de taxa de solicitação:

Faixa Solicitações por minuto Tokens por minuto
T1 30 50.000.000
T2 100 50.000.000
T3 1.000 50.000.000
T4 3.000 50.000.000
T5 6.000 50.000.000

A faixa aplicáv el depende da sua conta. Não ate a tabe como uma garatia de que todo projeto começa em T1 ou que toda carga de trabalho pode usar a taxa máxima exibida.

Erros comuns de prime ra integração incluem:

  • Ausência do cabeça ho Authorization: Bearer ou definição da variável de ambiente errada.
  • Enviar kimi-k3 ou um nome de marketing em vez de moonshotai/kimi-k3.
  • Usar https://api.novita.ai/openai como URL base do SDK qundo o clente espera o aminho versionado .../op enai/v1.
  • Enviar um coro de solicitaçã que não é JSON válido.
  • Defini um imite de saída maor do que sua apicação pode armazenar ou processar.
  • Assumir que um cor de solicitaçaõ multimodal é idêntico em todos os SDKs ou famílias de modelos.

Exemplo em Python

Instae o clente Python da OpenA em seu amiente e execute este exemplo com NOVITA_API_KEY definida:

pip insta openai
``

```python
imort os

from openai import OpenA

clent = OpenA(
    api_key=os.environ["NOVITA_API_KEY"],
    base_url="https://api.novita.ai/op enai/v1",
)

resonse = clent.chat.completions.create(
    modl="moonshotai/kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "You are a concise engineering assistant.",
        },
        {
            "role": "user",
            "content": "List three risks when adding retries to a streaming API client.",
        },
    ],
    temperature=0.2,
    max_tokens=300,
)

prnt(resonse.choices[0].message.contnt)

O exemplo usa intencionalmente uma completação curta. Aumente o or çaumento de contexto e saída somente após ter adicionado tempo limite, novas tentativas, registro e rastreamento de uso apropriados para sua aplicação.

Exemplo em cURL

A mesma solicitação pode ser testada sem um SDK:

payload='{
  "model": "moonshotai/kimi-k3",
  "messages": [
    {
      "role": "system",
      "content": "You are a concise engineering assistant."
    },
    {
      "role": "user",
      "content": "List three risks when adding retries to a streaming API client."
    }
  ],
  "temperature": 0.2,
  "max_tokens": 300
}'

curl --request POST "https://api.novita.ai/openai/v1/chat/completions" \
  --header "Authorization: Bearer $NOVITA_API_KEY" \
  --header "Content-Type: application/json" \
  --data "$payload"

Parâmetros Chave

Parâmetro O que controla Primeiro valor sensato
model O modelo hospedado que responde à solicitação moonshotai/kimi-k3
messages Turnos de conversa do sistema, usuário e assistente Uma mensagem de sistema e uma de usuário
temperature Variabilidade da saída 0.2 para testes repetíveis
max_tokens Máximo de tokens gerados 300, depois aumente deliberadamente
stream Se a saída chega incrementalmente Deixe desabilitado durante a depuração
tools Definições de funções disponíveis para o modelo Adicione após o chat básico funcionar
response_format Requisitos de saída estruturada Valide o JSON retornado antes de usá-lo

Para entradas de imagem ou vídeo, confirme o formato atual da solicitação na documentação do modelo e da API antes de adicioná-los à sua aplicação. Rótulos de capacidade na página do modelo não substituem o teste da estrutura de conteúdo exata usada pela sua biblioteca cliente.

Solução de Problemas

Autenticação falha

Verifique se NOVITA_API_KEY está definida no mesmo processo que executa a solicitação. Confirme se o cabeçalho usa Bearer, não um parâmetro de consulta ou um nome de credencial diferente.

O modelo não é encontrado

Use o ID exato moonshotai/kimi-k3. O nome de exibição do modelo não é um substituto válido para o ID do modelo da API.

A solicitação é rejeitada

Reduza os valores do prompt e de max_tokens, valide o corpo JSON e confirme se o endpoint é /openai/v1/chat/completions. Se a solicitação usa imagens, vídeo, ferramentas ou saída estruturada, remova esses campos e adicione-os um de cada vez.

Solicitações lentas ou com limita de taxa

Meça as contagens de tokens do prompt e da saída, reduza o contexto repetido desnecessário e adicione um backoff exponencial limitado para respostas retryáveis. Verifique a faixa de taxa atual da sua conta em vez de assumir a faixa mais alta na tabela da página do modelo.

A resposta está incompleta

Inspecione o motivo de finalização e os dados de uso. Um valor pequeno de max_tokens pode interromper uma resposta longa cedo; aumentá-lo também aumenta a quantidade de saída que sua aplicação pode pagar e processar.

FAQ

Qual ID de modelo devo enviar para a Kimi K3?

Envie moonshotai/kimi-k3 no campo model.

Qual endpoint o clente OpenAI usa?

Defina a URL base do SDK como https://api.novita.ai/openai/v1. A soliciação de comp etações de chat é en iada para https://api.novita.ai/openai/v1/chat/completions.

Quão grande é a janela de contexto da Kimi K3?

A página do modelo da Novita lista uma janela de contexto de 1.048.576 tokens e uma configração máx ma de saída de 1.048.576 tokens. Verifique a página antes da implantação para atu lizações.

A Kimi K3 é gratuita para chamar?

Nenhuma alegação de acesso gratuito é feita aq i. A página do modelo lista preços serverless baseados em tokens, então verifique os preços atuais exibidos para sua conta e modelo antes de enviar solicitações grandes.

Dev o começ ar com uma solicitação multimodal?

Não. Comece com uma pequena solicitação apenas de texto para que autenticação, seleção de endpoint, interpretação de resposta e tratamento de erros sejam fáceis de verificar. Adicione entradas multimodais depois que esse aminho estiver estável.

Artigos Recomendados

Fontes