Démarrage rapide avec Kimi K3 pour les workflows d'API à long contexte

Démarrage rapide avec Kimi K3 pour les workflows d'API à long contexte

Kimi K3 est disponible via l’API sans serveur de Novita AI avec l’ID de modèle moonshotai/kimi-k3, un endpoint de chat compatible OpenAI, une fenêtre de contexte de 1 048 576 tokens et un paramètre de sortie maximale de 1 048 576 tokens indiqué sur sa page modèle. Ce guide de démarrage rapide montre comment s’authentifier, envoyer une première requête, analyser la réponse et planifier la tarification au token de Kimi K3 avant de le connecter à une application plus vaste.

Quand utiliser ce guide de démarrage rapide

Utilisez ce guide lorsque vous souhaitez tester Kimi K3 à partir d’une application qui utilise déjà le format d’API OpenAI. C’est un point de départ pratique pour les workflows d’ingénierie logicielle à long contexte, d’analyse de documents, de recherche et de raisonnement où la requête peut contenir beaucoup plus de contexte qu’une invite de chat typique.

La page modèle de Kimi K3 sur Novita décrit un modèle de 2,8 billions de paramètres avec compréhension visuelle native et une fenêtre de contexte d’un million de tokens. La même page répertorie les entrées texte, image et vidéo avec sortie texte, ainsi que l’accès sans serveur, la sortie structurée, le raisonnement et l’appel de fonctions. Considérez ces capacités comme des éléments à vérifier par rapport à la forme de votre requête prévue, plutôt que de supposer que chaque fonctionnalité du SDK OpenAI se comporte de manière identique selon les modèles.

Ce n’est pas une comparaison de benchmarks. L’objectif est d’obtenir une requête authentifiée fonctionnelle, puis de vous donner suffisamment de détails opérationnels pour décider si Kimi K3 correspond à votre charge de travail.

Étape 1 : Obtenez votre clé API Novita

Créez ou sélectionnez un compte Novita AI, ouvrez les paramètres de votre clé API et créez une clé pour une utilisation côté serveur. Gardez la clé hors des bundles frontend, des dépôts publics, des notebooks partagés en dehors de votre équipe et de l’historique du shell dans la mesure du possible.

Définissez la clé comme variable d’environnement avant d’exécuter l’un des exemples :

export NOVITA_API_KEY="votre_cle_api_ici"

Utilisez une clé de projet ou temporaire lorsque la configuration de votre compte le permet. Changez la clé après une démonstration publique ou toute suspicion d’exposition.

Étape 2 : Confirmez l’ID du modèle et l’endpoint

Gardez les détails de connexion ensemble afin qu’un nom d’affichage ne remplace pas accidentellement l’identifiant réel du modèle :

Champ Valeur
ID du modèle moonshotai/kimi-k3
URL de base https://api.novita.ai/openai/v1
Endpoint de complétion de chat https://api.novita.ai/openai/v1/chat/completions
Fenêtre de contexte 1 048 576 tokens
Paramètre de sortie maximale 1 048 576 tokens
Capacités d’entrée Texte, image, vidéo
Capacité de sortie Texte
Type d’accès API sans serveur

La page modèle de Kimi K3 est la source de vérité concernant la disponibilité, les limites actuelles, les capacités et la tarification. Vérifiez-la à nouveau avant le déploiement, car les configurations et les prix des modèles peuvent changer.

Étape 3 : Envoyez votre première requête

Commencez par une requête courte ne contenant que du texte. Une petite invite facilite la distinction entre les problèmes d’authentification ou de routage et les problèmes d’invite au niveau applicatif.

Par exemple, demandez à Kimi K3 de renvoyer une courte liste de vérification d’implémentation :

Listez les trois risques les plus importants lors de l'ajout de tentatives à un client d'API en streaming. Renvoyez une phrase par risque.

Gardez la première valeur de max_tokens modeste. Une grande allocation de sortie n’est utile qu’une fois que la requête de base, l’analyse de la réponse et la gestion des erreurs fonctionnent correctement.

Étape 4 : Lisez la réponse

La réponse compatible OpenAI place le texte de l’assistant dans choices[0].message.content pour une complétion de chat standard non diffusée en continu. Conservez les métadonnées de réponse et les champs d’utilisation dans votre application si vous avez besoin de traçabilité des requêtes ou de comptabilité des coûts.

Pour une intégration de production, enregistrez au moins :

  • L’ID du modèle et l’horodatage de la requête.
  • L’ID de requête du fournisseur, lorsqu’il est renvoyé par le client ou les en-têtes de réponse.
  • L’utilisation des tokens de l’invite et de la complétion.
  • Le nombre de tentatives et le statut HTTP.
  • Si la requête utilisait du texte seul ou un contenu multimodal.

Une fois que le premier appel a réussi, testez des invites qui ressemblent à votre charge de travail réelle : longs fichiers source, plusieurs documents, un schéma d’outil, ou un contrat de réponse structuré. Une invite courte réussie vérifie la connectivité, pas la qualité de production.

Étape 5 : Vérifiez la tarification, les limites et les erreurs courantes

La page modèled e Novita list la tarification sans serveur de 3 $ par million de tokens d’entrée, 0,30 $ par million de tokens de lecture en cache et 15 $ par million de tokens de sortie pour Kimi K3. Votre estimation doit inclure les deux côté s de la requête, les tentatives et la quantité de contexte que vous envoyez répétitivement.

La page liste également ces niveaux de taux de requêtes :

Niveau Requêtes par minute Tokens par minute
N1 30 50 000 000
N2 100 50 000 000
N3 1 000 50 000 000
N4 3 000 50 000 000
N5 6 000 50 000 000

Le niveau applicable dépend de votre compte. Ne considérez pas le tableau comme une promesse que chaque projet commence au nivea u N1 ou que chaque charge de travail peut utiliser le taux max imal affiché.

Les err eurs courantes en première intégration incluent :

  • Absence de l’en-tête Authorization : Bearer ou définition de la mauvaise variable d’environnement.
  • Envoi de kimi-k3 ou d’un nom marketinf au lie u de moonshotai/kimi-k3.
  • Utilisation de https://api.novita.ai/openai comme URL de base du SDK lorsque le client attend le chemin versionné .../openai/v1.
  • Envoi d’un corps de requête qui n’est pas du JSON valide.
  • D éfinition d’une limite de sortie plus grande que ce que votre application peut stocker ou traiter.
  • Suppose que le corps d’une requête multimodale est identique à travers chaque famille de SDK ou de modèle.

Exemple Python

Insallez le client Python OpenAI dans votre environnment, puis exéqutez cet exemple avec NOVITA_API_KEY définie :

pip install openai
import os

from openai import OpenAI

client = OpenAI(
    api_key=os.environ["NOVITA_API_KEY"],
    base_url="https://api.novita.ai/openai/v1",
)

response = client.chat.completions.create(
    model="moonshotai/kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "Vous êtes un assistant ingénieur concis.",
        },
        {
            "role": "user",
            "content": "Listez trois risques lors de l'ajout de tentatives à un client d'API en streaming.",
        },
    ],
    temperature=0.2,
    max_tokens=300,
)

print(response.choices[0].message.content)

L’exemple utilise intentionnellement une complétion courte. Augmentez les budgets de contexte et de sortie uniquement après avoir ajouté la gestion des délais d’attente, des tentatives, de la journalisation et du suivi d’utilisation appropriés à votre application.

Exemple cURL

La même requête peut être testée sans SDK :

payload='{
  "model": "moonshotai/kimi-k3",
  "messages": [
    {
      "role": "system",
      "content": "Vous êtes un assistant ingénieur concis."
    },
    {
      "role": "user",
      "content": "Listez trois risques lors de l'ajout de tentatives à un client d'API en streaming."
    }
  ],
  "temperature": 0.2,
  "max_tokens": 300
}'

curl --request POST "https://api.novita.ai/openai/v1/chat/completions" \
  --header "Authorization: Bearer $NOVITA_API_KEY" \
  --header "Content-Type: application/json" \
  --data "$payload"

Paramètres clés

Paramètre Ce qu’il contrôle Première valeur raisonnable
model Le modèle hébergé qui répond à la requête moonshotai/kimi-k3
messages Tours de conversation système, utilisateur et assistant Un message système et un message utilisateur
temperature Variabilité de la sortie 0.2 pour des tests reproductibles
max_tokens Sortie générée maximale 300, puis augmentez délibérément
stream Si la sortie arrive de manière incrémentielle Laissez désactivé pendant le débogage
tools Définitions de fonctions disponibles pour le modèle Ajoutez après que le chat de base fonctionne
response_format Exigences de sortie structurée Validez le JSON renvoyé avant de l’utiliser

Pour des entrées image ou vidéo, confirmez le format actuel de la requête dans la documentation du modèle et de l’API avant de les ajouter à votre application. Les étiquettes de capacité sur une page de modèle ne remplacent pas les tests de la structure de contenu exacte utilisée par votre bibliothèque cliente.

Dépannage

L’authentification échoue

Vérifiez que NOVITA_API_KEY est définie dans le même processus qui exécute la requête. Confirmez que l’en-tête utilise Bearer, et non un paramètre de requête ou un nom d’identifiant différent.

Le modèle n’est pas trouvé

Utilisez l’ID exact moonshotai/kimi-k3. Le nom d’affichage du modèle n’est pas un substitut valide pour l’ID de modèle API.

La requête est rejetée

Réduisez les valeurs de l’invite et de max_tokens, validez le corps JSON et confirmez que l’endpoint est /openai/v1/chat/completions. Si la requête utilise des images, des vidéos, des outils ou une sortie structurée, supprimez ces champs et ajoutez-les un par un.

Les requêtes sont lentes ou limitées en débit

Mesurez le nombre de tokens de l’invite et de la sortie, réduisez le contexte répété inutile et ajoutez un backoff exponentiel borné pour les réponses réessayables. Vérifiez le niveau de débit actuel de votre compte plutôt que de supposer le niveau le plus élevé dans le tableau de la page du modèle.

La réponse est incomplète

Inspectez la raison de fin et les données d’utilisation. Une petite valeur de max_tokens peut arrêter une réponse longue prématurément ; l’augmenter augmente également la quantité de sortie que votre application peut payer et traiter.

FAQ

Quel ID de modèle dois-je envoyer pour Kimi K3 ?

Envoyez moonshotai/kimi-k3 dans le champ model.

Quel endpoint le client OpenAI utilise-t-il ?

Définissez l’URL de base du SDK sur https://api.novita.ai/openai/v1. La requête de complétion de chat est envoyée à https://api.novita.ai/openai/v1/chat/completions.

Quelle est la taille de la fenêtre de contexte de Kimi K3 ?

La page modèle de Novita liste une fenêtre de contexte de 1 048 576 tokens et un paramètre de sortie maximale de 1 048 576 tokens. Vérifiez la page avant le déploiement pour les mises à jour.

Kimi K3 est-il gratuit à appeler ?

Aucune revendication d’accès gratuit n’est faite ici. La page du modèle liste une tarification sans serveur basée sur les tokens, donc vérifiez la tarification actuelle affichée pour votre compte et modèle avant d’envo yer de grandes requêtes.

Dois-je commencer par une requête multimodale ?

Non. Commencez par une petite requête texte uniquement afin que l’authentification, la sélection de l’endpoint, l’analyse de la réponse et la gestion des erreurs soient faciles à vérifier. Ajoutez les entrées multimodales après que ce chemin est stable.

Articles recommandés

Sources