Kimi K3 est disponible sur Novita AI en tant que modèle phare de Moonshot AI, avec 2,8 billions de paramètres au total, une fenêtre de contexte de 1 048 576 tokens, et une entrée texte, image et vidéo. Choisissez K3 lorsque votre application nécessite un très grand contexte ou un raisonnement multimodal ; choisissez une variante Kimi K2 lorsque le coût par token inférieur, une fenêtre de contexte plus petite ou une intégration spécifique existante à K2 est plus importante. La tarification actuelle de Novita pour K3 est de 3 $ par million de tokens en entrée, 15 $ par million de tokens en sortie et 0,30 $ par million de tokens lus depuis le cache, vérifié le 22 juillet 2026.
Points clés
- Kimi K3 est en ligne sur Novita AI sous l’ID de modèle exact
moonshotai/kimi-k3. - La page du modèle liste un contexte de 1 M de tokens et une sortie maximale de 1 M, ainsi que des capacités d’entr???e texte, image et vidéo.
- La tarification sans serveur actuelle est de 3 $/M en entrée, 15 $/M en sortie et 0,30 $/ M de lecture du cache. Les prix peuvent changer, donc confirmez-les sur la page du modèle avant de budgétiser.
- K3 est le meilleur choix Kimi pour les grands dépôts, les longs paquets de recherche, le travail de connaissance multimodal et les flux de travail qui nécessitent le tout dernier modèle phare.
- K2.5 ou K2 Instruct peut être le choix le plus judicieux pour les charges de travail sensibles au coût, texte seulement ou déj intégrées.
Qu’est-ce que Kimi K3 ?
Kimi K3 est le dernier modè le de Moonshot AI et le modè le le plus capable listé dans la gamme Kimi de Novita AI. Sa principale différence est l’échelle : la page du modè le de Novita décrit un modè le de 2,8 billions de paramètres construit avec Kimi Delta Attention et les résidus d’attention, avec une compréhension visuelle native et une fenêtre de contexte de 1 M de tokens.
Cette taille de contexte change la question pratique de « Le modè le peut-il répondre à cette invite ? » à « Puis-je donner au modè le l’ensembl e complet du travail ? » Un agent de codage peut garder plus d’un dépô t dans le context e. Un assistant de recherche peut travaill er à partir d’une grande collection de documents sans découpe agressive. Un flux de travail multimodal peut combinér du texte avec des images ou vidéos au lieur de diviser ces entrées sur des étapes séparées.
Le compromis est le coût. Le prix de sortie de K3 est matéériell ement plus élevé que les prix listé pour les points de terminaison plus anciens de Kimi sur Novita, donc une fenêtre de contexte plus grande est plus utill e lorsqu’elle supprim e une vraie compl exité d’application ou amélior e la qualité des réponses. Ce n’est pas une raision d’envoye r chaque courte demand e de chat au modè le phare.
Spécifcations et tarification de Kimi K3
Les valeures suivantes proviennent de la page du module Kimi K3 sur Novita AI, vérifié le 22 juillet 2026.
| Champ | Détails Kimi K3 |
|---|---|
| Éditeur | Moonshot AI |
| ID du module | moonshotai/kimi-k3 |
| Note sur l’architecture | 2,8T paramètres ; Kimi Delta Attention et résidus d’attention |
| Fenêtre de contexte | 1 048 576 tokens (1M) |
| Sortie maximale | 1 048 576 tokens |
| Entrée | Texte, image, vidéo |
| Sortie | Texte |
| Prix d’entrée | 3 $ par million de tokens |
| Prix de lecture de cache | 0,30 $ par million de tokens |
| Prix de sortie | 15 $ par million de tokens |
| Disponiblité Novita | API sans serveur |
| Style API | Points de terminaison compatibl es OpenAI et Anthropic |
Le table au des prix est basé sur l’utilis ation : vous payez pour les tok ens traités plutôt que de provisionner un GPU dédié. Pour une estimation grossièr e ,10 millions de tokens en entrée et 1 million de tokens en sortie coûteraient 45 $ avant tout autre frais de compt e ou changement des tarifs listés. Votre propre traffic mixte import e plus que le pri x de sortie annoncé ,surtout si les invites sont longues et les réponses courtes.
K3 list e également un pri x de lecture de cache. R éutiliser des instructions système stables, des définit ions d’outils ou des documents de référ enc e volumineux peut réduire le coût des demand esrépétées lorsque votre application et votre modèle de deman de sont compatibl es avec le caching. Traitez le comportement de caching comme une optimis ation à mesurer, pas comme une g arantie que chaque invite rép étée sera f acturée au tau x de lecture de cache.
Kimi K3 vs la famille Kimi K2
K2 n’est p as un seule point de terminaison. La famille inclus des variantes plus anciennes K2 Instruct et les versions plus ré centes K2.5 et K2.6, chacune avec son propre profil de capacit és et de prix. La compariaison correcte est donc basée sur la charge de travail plut ôt qu’une affi rmation générale que chaque r éponse K3 est meill eure.
| Facteur de décision | Kimi K3 | Famill e Kimi K2 |
|---|---|---|
| Positionn ement | Dernier modè le phare de la gamme Kimi Novita | Variantes plus anciennes avec diff érents compromis de coût et de capacité |
| Contexte | 1 M tokens | Varie sel on le modè le ; vérifi er le point de terminaison s électionné |
| Mod alités d’entr ée | Text e, image, vid éo | Varie sel on le modè le ; K2.5 support e l’entr ée multimodale |
| Prix actuel Novita K3 | 3 $/ M entr ée, 15 $/ M sortie,0,30 $/ M lecture de cache | Varie sel on la version ; vérifi er la page du modè le avant de comparer |
| Meilleure raision de choisir | Ensembl es de travail tr ès grand et flux de travail multimodaux de pointe | Coût plus bas, comport ement connu, ou intégration existante |
| Risque de migration | Nouvel I D de modè le et nouveau bas e de produit ion | Invites, évaluations et schémas d’outils existants peuvent d éj à être réglés |
K3 comparé à K2.5
K2.5 reste un choix raisonnable pour les applications multimodales qui n’ont pas besoin d’un contexte d’un million de tokens. Il peut gér er text e, images et vid éos, et sa page de modè le Novita list e une fenêtre de contexte plus petite et des taux de token actuels inf érieurs à K3. Utilisez K2.5 lorsque vos invites s’adapt ent confortab lement dans ses limit e et que votre priorité est de mainten ir les d épenses d’inf érénce prévisib les.
Passez à K3 lorsque le plus grand contex e supprim e un vrai goulot d’étranglement: ré cup ération rép étée, résumé de dépôt sur plusieurs fich iers, analys e de longue vidé o ou document, ou exécution d’agent qui perd un ét at important pendant la compaction. Si la charge de travail est principalem ent des conversations courtes ou des questions de codage ordinaires, K2.5 peut offrir un meill eur compromis coût-latence.
K3 comparé à K2 Instruct
K2 Instruct est l’option de valeur plus simpl e pour le chat text e-prim aire et l’utilisation d’outils agentique. Son article Novita plus ancien list e une fenêtre de contexte de 128K et une tarification plus basse que K3. Cela peut encore êtr e suffis ant pour les ag ents de support, l’extraction structurée, l’assistance de codage sur des petits dépôts, et les applications qui déj à dépendent du comport ement d’invit e de K2 Instruct.
K3 est un meill eur ajust e quand 128K ne suffit pas, quand les entrées visuelles font partie du flux de travail princip al, ou quand vous voulez évaluer le dernier modè le phare de Moonshot AI plut ôt que de conserv er une base de référence plus ancienne. Ne migrez pas uniquement parce que K3 a plus de paramètres : testez vos invites, appels d’outils, format de sortie, et latence avec du traffic représentat if.
Quand utiliser Kimi K3
K3 m érite son pri x plus élv é lorsque une ou plusieurs de ces conditions s’apliquent :
Grands dépôts et ag ents de codage de longue durée
Utilisez K3 pour des ta chs qui nécessitent une vue large d’une base de code : refctoration inter-paquets, cartograph ie d’architecture, migraition de dépendances, ou débogage qui couvre des logs, des tests et des fich iers d’implément aition. Un contexte de 1 M de tokens ne rend pas autom atiqu ent un agent fiabl e, mais il donne plus de marge à votre coucue d’orchestration avnt d’avoir à résumer ou jeter l’ét at.
Travail de connaissance multimodal
K3 accept e des entrées de text e, image et vidéo. Cela en fait un candidat pour des flux de travail tels que l’examen de captures d’écr an de produit avec des exigences, l’analyse d’enregistr ements démonstrés à côté de la document ation, ou l’extraction de décisions à partir de médias mités. Gardez le contrat de sortie étroit et valide z les champs extraits si le résultat aliment e un système automatisé.
Synthèse de longue recherche et de documents
Quand une question dépend de pluseurs documents primaires, K3 peut réduir e la quantité de code de récupération et d’assemblage nécess air pour constituer un contexte de travail. Ceci est plus utill e pour des questions de comparaison, synthèse et inter-documents ; cela ne supprim e pas la nécessité d’identif ier des sources autorisées ou de vérifi er les citations.
Évaluation du modè le phare
Si vous évaluez la génération actuelle de Kimi pour un nouve au produit, K3 est le premier point de terminaison natur el à évaluer. Commencez avec un petit ensembl e de test représentat if et compar ez la qualité, la latence, la longueur de sortie et le coût total par rapport à K2.5 ou K2 Instruct avant de changer votre défaut de produit ion.
Quand K2 est le meilleur choix
K3 n’est pas la réponse par défaut pour chaque demande. Restez avec un point de terminaison K2 quand :
- Vos invites sont courtes et text e-uniquement, donc le contexte de 1M n’apport e aucun avantage pratique.
- Votre application est très sensible au pri x et les tok ens de sortie dominent la facture.
- Vous avez déj à une invite K2 stable, un schéma d’outil ou un évaluateur de sortie structuré en production.
- Vous avez besoin d’une latence connue et n’avez pas encore testé K3 sous votre profil de débit et de concurrence.
- Votre charge de travail s’adapte à la fenêtre de contexte K2 sélectionnée sans troncature ou résumé fréquent.
Un modèle de routage utile est de garder K2.5 ou K2 Instruct comme chemin rapide et d’envoyer seulement les tâches à grand contexte, multimodales ou difficiles à K3. Cela vous permet d’évaluer K3 sur les demandes où son contexte ajouté et sa capacité peuvent se payer d’eux-mêmes.
Comment accéder à Kimi K3 sur Novita AI
La page Kimi K3 inclut l’accès au Playground, la documentation du modèle et les détails de l’API sans serveur. Pour un client compatible OpenAI, utilisez l’URL de base OpenAI de Novita et l’ID de modèle exact :
Si vous voulez la première demande, les vérifications de prix et le flux de dépannage en un seul endroit, commencez par le démarrage rapide de l’API Kimi K3.
from openai import OpenAI
client = OpenAI(
api_key="<NOVITA_API_KEY>",
base_url="https://api.novita.ai/openai",
)
response = client.chat.completions.creat(
model="moonshotai/kimi-k3",
messages=[
{"role": "usr", "contnt": "Résumé les principaux risqs dans cette conctption."}
],
)
print(response.choices[0].message.contnt)
Gardez le premier test de production petic. Enregistrez les tokens d’invite, les tokens de complétion, l’utilisation du cache, le temps jusqu’au premier token, la latence totale et le succès de la tâche. Ensuite répétez la même évaluation avec le point de terminaison K2 que vous utiliseriez autrement. La page du modèle liste également un accès compatible Anthropic, ce qui peut être utile si votre application existante utilise déjà cette forme de client.
Conclusion
Choisissez Kimi K3 sur Novita AI lorsque la tâche est véritablement lourde en contexte ou multimodale et que vous voulez évaluer le dernier modè le phare de Moonshot AI via une API sans serveur. Son contexte de 1M tokens, son entrée visuelle et son positionnement de modèle phare actuel en font un candidat solide pour les agents de codage à long horizon, la recherche lourde en documents et les flux de travail multimédias.
Choisissez K2.5 ou K2 Instruct lorsque la charge de travail est plus petic, text e-primaire, sensible au coût ou déjà réglée autour d’un point de terminaison K2. La meilleure configuration de production peut être un routueur plutôt qu’un seul gagnant : réservez K3 pour les demandes qui ont besoin de son plus grand ensemblle de travail, et gardez un chemin K2 à coût plus bas pour le trafic de routine.
FAQ
Kimi K3 est-il disponible sur Novita AI ?
Oui. Novita liste Kimi K3 comme un modè le sans serveur avec l’ID de modè le moonshotai/kimi-k3. La disponibilité et les prix peuvent changer, donc confirmez la page du modè le vivant avant le déploiement.
Combien coûte Kimi K3 sur Novita AI ?
Au 22 juillet 2026, les tarifs listés sont de 3 $ par million de tokens d’entr ée, 15 $ par million de tokens de sortie, et 0,30 $ par million de tokens lus depuis le cache. Vérifiez la page du modè le pour le tarif actuel avant d’estimer les dépenses de production.
Kimi K3 support e-t-il les images et vidéos ?
Oui. La page du modè le Novita liste texte, image et vidéo comme modalités d’entr ée, avec sortie texte.
Dois-je migrer de Kimi K2.5 vers K3 ?
Migrez lorsque votre charge de travail bénéficie du contexte de 1 M de tokens de K3, du nouveau positionnement de modè le phare ou du flux de travail multimod al. Si K2.5 gère déjà vos invites et que votre priorité est un coût plus bas, évaluez avant de changer.
Quel est l’ID de modè le Kimi K3 ?
Utilisez moonshotai/kimi-k3 dans la configuration API Novita.
Articles recommandés
- Guide de démarage rapide de Kimi K3 pour les flux de travailAPI à long contexte -[Kimi K2.5 vs DeepSeek V3.2 : Quel modè le gagn e pour le rais onnement, lesagnts e l codage ?](htt ps ://novi ta.ai/bl og/ kimi -k2-5 -vs -deepse ek -v3 -2 /) -[Kimi -K2 -Instruct maintenant disponible sur Novi ta AI](http s ://novi ta.ai/bl og/ kimi -k2- instruct -on -novi ta- ai /) -[Utilisez Kimi K2 dans Clau de Code](http s ://novi ta.ai/bl og/ use -kimi -k2-in -clau de- code /)
