Novita AI LLM

Guia Rápido da Kimi K3 para Fluxos de Trabalho de API de Contexto Longo

Guia Rápido da Kimi K3 para Fluxos de Trabalho de API de Contexto Longo

A Kimi K3 está disponível através da API serverless da Novita AI com o ID de modelo moonshotai/kimi-k3, um endpoint de chat compatível com OpenAI, uma janela de contexto de 1.048.576 tokens e uma configuração máxima de saída de 1.048.576 tokens listados em sua página de modelo. Este guia rápido mostra como autenticar, enviar sua primeira solicitação, interpretar a resposta e planejar os preços por token da Kimi K3 antes de conectá-la a uma aplicação maior.

Quando Usar Este Guia Rápido

Use este guia quando quiser testar a Kimi K3 a partir de uma aplicação que já utiliza o formato da API OpenAI. É um ponto de partida prático para fluxos de trabalho de engenharia de software de contexto longo, análisse de documentos, pesquisa e raciocínio, onde a solicitação pode conter substancialmente mais contexto do que um prompt de chat típico.

A página do modelo da Kimi K3 na Novita descreve um modelo de 2,8 trilhões de parâmetros com compreensão visual nativa e uma janela de contexto de 1 milhão de tokens. A mesma página lista entradas de texto, imagem e vídeo com saída de texto, além de acesso serverless, saída estruturada, raciocínio e chamada de funções. Trate essas capacidades como algo a ser verificado em relação à forma da sua solicitação pretendida, em vez de assumir que todos os recursos do SDK da OpenAI têm comportamento idêntico entre modelos.

Isso não é uma comparação de benchmarks. O objetivo é obter uma solicitação autenticada funcionando e, em seguida, fornecer detalhes operacionais suficientes para você decidir se a Kimi K3 se adéqua à sua carga de trabalho.

Etapa 1: Obtenha sua Chave de API da Novita

Crie ou selecione uma conta na Novita AI, abra as configurações da sua chave de API e crie uma chave para uso no servidor. Mantenha a chave fora de bundles de frontend, repositórios públicos, notebooks compartilhados fora da sua equipe e histórico do shell, semre que possível.

Defina a chave como uma variável de ambiente antes de executar qualquuer um dos exemplos:

export NOVITA_API_KEY="sua_chave_api_aqui"

Use uma chave de projeto ou temporária quando sua configuração de conta suportar. Gire a chave após uma demonstração pública ou qualquuer suspeita de exposição.

Etapa 2: Confirme o ID do Modelo e o Endpoint

Mantenha os detales da coneão junos para que um nome de exibição não subistitua acidentalmente o identificador real do modelo:

Campo Valor
ID do modelo moonshotai/kimi-k3
URL base https://api.novita.ai/op enai/v1
Endpoint de completaçoes de chat https://api.novita.ai/openai/v1/chat/completions
Janela de contexto 1.048.576 tokens
Configuração máxima de saída 1.048.576 tokens
Capacidades de entrada Texto, imaem, ví deo
Capacidade de saída Texto
Tipo de aesso API serverless

A ágina do modelo Kimi K3 é a fonte da verdade para disponibilidade, limites auais, capacidades e preços. Verifque novamente antes de implantar, pois as configurações e os preços do modelo podem mudar.

Etapa 3: Envie Sua Primeira Solicitação

Comece com uma solicitação curta apenas de texto. Um prompt pequeno facili ta a separação de problemas de autenticação ou roteamento de problemas de prompt no nível da apicação.

Por exemplo, peça à Kimi K3 para retornar uma pequena lista de verificação de imlementação:

Liste os três maores riscos ao adicionar nov as tentativas a um clente de API de streaming. Retorne uma frase por riso.

Mantenha o primeiro valor de max_tokens modesto. Uma grande permissão de saída é útil somente depois que a solicitação básica, a interpetação da resposta e o tratamento de erros funcionarem corretamente.

Etapa 4: Leia a Resposta

A resposta compatível com OpenAI coloca o texto do assistente em choices[0].message.content para uma completaçã de chat padrão sem streaming. Preserve os metadados da resposta e os campos de uso em sua aplicação se preisar de rastreamento de solicitação ou contabilidade de custos.

Para uma integração em produçã, regstre pelo menos:

  • O ID do modelo e o timestamp da solicitação.
  • O ID da solicitação do provedor, quando retornado pelo clente ou pelos cabeçalhos da resposta.
  • O uso de tokens do prompt e da completaçã.
  • O número de novas tentativas e o status HTTP.
  • Se a solicitação usou conteúdo apenas de texto ou multimodal.

Depois que a primeira chamada for bem-sucedida, teste prompts que se assemelhem à sua carga de trabalho real: arquivos fonte longos, vári os documentos, um esquema de feramenta ou um contrato de resposta estrurada. Um prompt curto bem-sucedido verifica a conectividade, não a qualidade de producción.

Etapa 5: Verifique Preços, Limites e Erros Comuns

A página do modelo da Novita lista preços serverless de $3 por milhão de tokens de entrada, $0,30 por milhão de tokens de leitura em cache e $15 por milhão de tokens de saída para a Kimi K3. Sua estimativa deve incluir ambos os lados da solicitaçã, nov as tentativas e a quantidade de contexto que você envia repetidamente.

A página também lista estas faixas de taxa de solicitação:

Faixa Solicitações por minuto Tokens por minuto
T1 30 50.000.000
T2 100 50.000.000
T3 1.000 50.000.000
T4 3.000 50.000.000
T5 6.000 50.000.000

A faixa aplicáv el depende da sua conta. Não ate a tabe como uma garatia de que todo projeto começa em T1 ou que toda carga de trabalho pode usar a taxa máxima exibida.

Erros comuns de prime ra integração incluem:

  • Ausência do cabeça ho Authorization: Bearer ou definição da variável de ambiente errada.
  • Enviar kimi-k3 ou um nome de marketing em vez de moonshotai/kimi-k3.
  • Usar https://api.novita.ai/openai como URL base do SDK qundo o clente espera o aminho versionado .../op enai/v1.
  • Enviar um coro de solicitaçã que não é JSON válido.
  • Defini um imite de saída maor do que sua apicação pode armazenar ou processar.
  • Assumir que um cor de solicitaçaõ multimodal é idêntico em todos os SDKs ou famílias de modelos.

Exemplo em Python

Instae o clente Python da OpenA em seu amiente e execute este exemplo com NOVITA_API_KEY definida:

pip insta openai
``

```python
imort os

from openai import OpenA

clent = OpenA(
    api_key=os.environ["NOVITA_API_KEY"],
    base_url="https://api.novita.ai/op enai/v1",
)

resonse = clent.chat.completions.create(
    modl="moonshotai/kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "You are a concise engineering assistant.",
        },
        {
            "role": "user",
            "content": "List three risks when adding retries to a streaming API client.",
        },
    ],
    temperature=0.2,
    max_tokens=300,
)

prnt(resonse.choices[0].message.contnt)

O exemplo usa intencionalmente uma completação curta. Aumente o or çaumento de contexto e saída somente após ter adicionado tempo limite, novas tentativas, registro e rastreamento de uso apropriados para sua aplicação.

Exemplo em cURL

A mesma solicitação pode ser testada sem um SDK:

payload='{
  "model": "moonshotai/kimi-k3",
  "messages": [
    {
      "role": "system",
      "content": "You are a concise engineering assistant."
    },
    {
      "role": "user",
      "content": "List three risks when adding retries to a streaming API client."
    }
  ],
  "temperature": 0.2,
  "max_tokens": 300
}'

curl --request POST "https://api.novita.ai/openai/v1/chat/completions" \
  --header "Authorization: Bearer $NOVITA_API_KEY" \
  --header "Content-Type: application/json" \
  --data "$payload"

Parâmetros Chave

Parâmetro O que controla Primeiro valor sensato
model O modelo hospedado que responde à solicitação moonshotai/kimi-k3
messages Turnos de conversa do sistema, usuário e assistente Uma mensagem de sistema e uma de usuário
temperature Variabilidade da saída 0.2 para testes repetíveis
max_tokens Máximo de tokens gerados 300, depois aumente deliberadamente
stream Se a saída chega incrementalmente Deixe desabilitado durante a depuração
tools Definições de funções disponíveis para o modelo Adicione após o chat básico funcionar
response_format Requisitos de saída estruturada Valide o JSON retornado antes de usá-lo

Para entradas de imagem ou vídeo, confirme o formato atual da solicitação na documentação do modelo e da API antes de adicioná-los à sua aplicação. Rótulos de capacidade na página do modelo não substituem o teste da estrutura de conteúdo exata usada pela sua biblioteca cliente.

Solução de Problemas

Autenticação falha

Verifique se NOVITA_API_KEY está definida no mesmo processo que executa a solicitação. Confirme se o cabeçalho usa Bearer, não um parâmetro de consulta ou um nome de credencial diferente.

O modelo não é encontrado

Use o ID exato moonshotai/kimi-k3. O nome de exibição do modelo não é um substituto válido para o ID do modelo da API.

A solicitação é rejeitada

Reduza os valores do prompt e de max_tokens, valide o corpo JSON e confirme se o endpoint é /openai/v1/chat/completions. Se a solicitação usa imagens, vídeo, ferramentas ou saída estruturada, remova esses campos e adicione-os um de cada vez.

Solicitações lentas ou com limita de taxa

Meça as contagens de tokens do prompt e da saída, reduza o contexto repetido desnecessário e adicione um backoff exponencial limitado para respostas retryáveis. Verifique a faixa de taxa atual da sua conta em vez de assumir a faixa mais alta na tabela da página do modelo.

A resposta está incompleta

Inspecione o motivo de finalização e os dados de uso. Um valor pequeno de max_tokens pode interromper uma resposta longa cedo; aumentá-lo também aumenta a quantidade de saída que sua aplicação pode pagar e processar.

FAQ

Qual ID de modelo devo enviar para a Kimi K3?

Envie moonshotai/kimi-k3 no campo model.

Qual endpoint o clente OpenAI usa?

Defina a URL base do SDK como https://api.novita.ai/openai/v1. A soliciação de comp etações de chat é en iada para https://api.novita.ai/openai/v1/chat/completions.

Quão grande é a janela de contexto da Kimi K3?

A página do modelo da Novita lista uma janela de contexto de 1.048.576 tokens e uma configração máx ma de saída de 1.048.576 tokens. Verifique a página antes da implantação para atu lizações.

A Kimi K3 é gratuita para chamar?

Nenhuma alegação de acesso gratuito é feita aq i. A página do modelo lista preços serverless baseados em tokens, então verifique os preços atuais exibidos para sua conta e modelo antes de enviar solicitações grandes.

Dev o começ ar com uma solicitação multimodal?

Não. Comece com uma pequena solicitação apenas de texto para que autenticação, seleção de endpoint, interpretação de resposta e tratamento de erros sejam fáceis de verificar. Adicione entradas multimodais depois que esse aminho estiver estável.

Artigos Recomendados

Fontes

Posts relacionados