- Configuration de l'API Qwen3.8-Max
- Tarification, limites et fonctionnalités de Qwen3.8-Max
- Première requête cURL
- Exemple en Python
- Modèle de workflow de chat
- Modèle de workflow d'agent
- Modèle de workflow de codage
- Entrée multimodale
- Erreurs courantes
- Liste de vérification pour la production
- FAQ
- Articles recommandés
Qwen3.8-Max est disponible sur Novita AI avec l’ID de modèle qwen/qwen3.8-max, un accès compatible OpenAI via https://api.novita.ai/openai, une fenêtre de contexte de 1 000 000 tokens, et une limite de sortie maximale de 131 072 tokens. Si vous voulez une réponse rapide : utilisez-le lorsque votre workflow de chat, d’agent ou de codage bénéficie réellement d’un contexte retenu très large, puis commencez par une petite requête textuelle avant de passer à des prompts longs, à l’utilisation d’outils ou à une entrée multimodale. Pour une vue d’ensemble de la disponibilité et de la tarification, consultez Qwen3.8-Max sur Novita AI : 2,4T MoE, 1M de contexte et tarification de lancement. Si vous hésitez encore sur le choix du modèle, comparez-le aux alternatives dans le Classement des LLM open source pour agents de codage en 2026.
Configuration de l’API Qwen3.8-Max
Commencez par quatre éléments de configuration :
| Élément | Valeur |
|---|---|
| Clé API | Stockez une clé API Novita AI dans NOVITA_API_KEY |
| URL de base compatible OpenAI | https://api.novita.ai/openai |
| Point de terminaison des complétions de chat | POST https://api.novita.ai/openai/v1/chat/completions |
| ID du modèle | qwen/qwen3.8-max |
Exportez la clé dans votre terminal :
export NOVITA_API_KEY="votre_cle_api"
Si vous utilisez déjà le SDK OpenAI, le changement d’intégration est minime : conservez votre code client, pointez l’URL de base vers Novita AI et changez le modèle pour qwen/qwen3.8-max.
Tarification, limites et fonctionnalités de Qwen3.8-Max
Utilisez l’ID de modèle exact dans le code. Dans les textes destinés aux utilisateurs, utilisez le nom d’affichage « Qwen3.8 Max ».
| Champ | Valeur actuelle chez Novita |
|---|---|
| Nom d’affichage | Qwen3.8 Max |
| ID du modèle API | qwen/qwen3.8-max |
| Famille de modèles | Qwen |
| Description sur la page du modèle | MoE phare de 2,4T paramètres pour le codage et le travail cognitif |
| Familles de points de terminaison | chat/completions, anthropic, responses |
| Modalités d’entrée | Texte, image, vidéo |
| Modalité de sortie | Texte |
| Fenêtre de contexte | 1 000 000 tokens |
| Tokens de sortie max. | 131 072 |
| Fonctionnalités | API sans serveur, raisonnement, sorties structurées, appel de fonctions |
| Niveaux de débit affichés | T1 30 RPM / 50 000 000 TPM jusqu’à T5 6000 RPM / 50 000 000 TPM |
Vérifiés le 5 août 2026, Novita indique ces prix pour qwen/qwen3.8-max :
| Type de token | Prix indiqué |
|---|---|
| Tokens d’entrée | 2 $ par million de tokens |
| Tokens d’entrée lus en cache | 0,25 $ par million de tokens |
| Tokens de sortie | 6 $ par million de tokens |
Ces chiffres sont suffisants pour la planification, mais pas pour un budget aveugle. Un modèle avec 1M de contexte peut devenir rapidement coûteux si vous renvoyez à plusieurs reprises des prompts surdimensionnés ou laissez les complétions s’étendre. Revérifiez la page du modèle Qwen3.8 Max et la page de tarification Novita AI avant tout lancement en production ou tout engagement financier envers un client.
Première requête cURL
Commencez par une courte requête textuelle. Cela confirme l’authentification, le routage et l’analyse de la réponse avant d’impliquer des appels d’outils, des images ou des prompts longs.
curl "https://api.novita.ai/openai/v1/chat/completions" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${NOVITA_API_KEY}" \
-d '{
"model": "qwen/qwen3.8-max",
"messages": [
{
"role": "system",
"content": "Vous êtes un assistant technique concis."
},
{
"role": "user",
"content": "Résumez les principaux risques d'une migration d'API multi-dépôts en 5 points."
}
],
"temperature": 0.2,
"max_tokens": 400
}'
Une réponse réussie renvoie la structure standard des complétions de chat, incluant choices, message.content et usage.
Utilisez ce test de vérification pour confirmer :
- la clé API est valide
- l’ID du modèle est accepté
- votre client lit
choices[0].message.content - vous enregistrez l’utilisation des tokens dès le début
Exemple en Python
Le SDK Python OpenAI fonctionne avec Novita AI lorsque vous définissez l’URL de base de Novita :
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["NOVITA_API_KEY"],
base_url="https://api.novita.ai/openai",
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max",
messages=[
{"role": "system", "content": "Vous êtes un assistant technique concis."},
{
"role": "user",
"content": "Examinez ce plan de déploiement et indiquez les trois premiers risques opérationnels à tester."
},
],
temperature=0.2,
max_tokens=400,
)
print(response.choices[0].message.content)
print(response.usage)
Gardez max_tokens explicite en production. Qwen3.8-Max peut générer des réponses très longues, ce qui est utile pour les tâches difficiles mais facile à dépenser excessivement si vous laissez les complétions sans contrainte.
Modèle de workflow de chat
Pour les produits de chat, Qwen3.8-Max est le plus utile lorsque l’historique de la conversation est vraiment volumineux ou lorsque l’assistant doit conserver plusieurs documents longs en mémoire de travail. Si votre charge de travail est constituée de questions-réponses courtes ou d’un support léger, un modèle plus petit peut être moins cher et plus facile à ajuster.
Un modèle pratique de déploiement de chat ressemble à ceci :
- Commencez par des prompts textuels et un plafond
max_tokensmodeste. - Ajoutez votre véritable prompt système et votre texte de politique.
- Testez des conversations longues qui reflètent votre produit réel, pas le maximum théorique de 1M.
- Mesurez la latence, le comportement de troncature et la longueur moyenne des complétions avant d’étendre l’utilisation.
L’erreur clé à éviter est de traiter la fenêtre de contexte de 1M comme un objectif plutôt que comme un plafond de capacité. Un grand contexte est utile lorsqu’il évite la perte d’information. Il n’est pas automatiquement efficace.
Modèle de workflow d’agent
Novita indique que l’appel de fonctions et les sorties structurées sont des fonctionnalités prises en charge, ce qui fait de Qwen3.8-Max un candidat raisonnable pour les workflows d’agents nécessitant la sélection d’outils et un état retenu important.
Utilisez l’appel de fonctions lorsque le modèle doit choisir une action plutôt que répondre en prose :
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["NOVITA_API_KEY"],
base_url="https://api.novita.ai/openai",
)
tools = [
{
"type": "function",
"function": {
"name": "search_repo",
"description": "Recherchez un fichier ou un symbole dans un dépôt.",
"parameters": {
"type": "object",
"properties": {
"query": {"type": "string"},
"path": {"type": "string"}
},
"required": ["query"]
}
}
}
]
response = client.chat.completions.create(
model="qwen/qwen3.8-max",
messages=[
{"role": "system", "content": "Vous êtes un agent d'analyse de dépôt."},
{
"role": "user",
"content": "Trouvez où la logique de réessai avec backoff est implémentée et identifiez toute valeur de sommeil en dur."
},
],
tools=tools,
tool_choice="auto",
temperature=0.1,
)
message = response.choices[0].message
print(message.tool_calls or message.content)
Qwen3.8-Max n’est pas le bon choix par défaut pour chaque agent. Il est particulièrement adapté lorsque l’agent doit conserver en contexte de longs fils de discussion, des notes de conception, des résumés de dépôt ou de longues traces d’outils. Si l’agent traite principalement des tâches courtes avec une boucle d’outils serrée, testez un modèle moins cher en parallèle.
Modèle de workflow de codage
Pour les tâches de codage, Qwen3.8-Max est mieux traité comme un spécialiste du long contexte plutôt que comme un choix par défaut universel. Il a le plus de sens lorsque l’échelle du dépôt, les notes d’architecture, les correctifs précédents et les échecs de test doivent tous être visibles en même temps.
Utilisez-le pour des charges de travail comme :
- la planification de refactorisation à l’échelle du dépôt
- la révision et le résumé de grandes PR
- le débogage à travers de nombreux fichiers
- l’analyse de migration avec de longs documents de conception
- les tâches de génération de code qui dépendent de beaucoup de contexte environnant
Un prompt de codage simple pour commencer :
Examinez ce changement de limite de service, identifiez les risques de rupture d'API et proposez la plus petite séquence de correctifs sécurisée avant d'écrire du code.
Si vous souhaitez une configuration d’agent en terminal plutôt que des appels API bruts, associez ce modèle au Guide de configuration complet : Comment utiliser Codex avec les modèles Novita AI. Pour une comparaison des points de terminaison de codage axés sur Qwen, consultez API Qwen3 Coder Next sur Novita AI pour les agents de codage.
Entrée multimodale
Novita indique que le texte, l’image et la vidéo sont des modalités d’entrée prises en charge pour Qwen3.8-Max. Cela signifie que vous pouvez tester des workflows tels que la révision de captures d’écran, la compréhension de documents ou l’analyse vidéo via la même famille de modèles.
Un exemple de base d’entrée d’image utilisant le format de message compatible OpenAI :
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["NOVITA_API_KEY"],
base_url="https://api.novita.ai/openai",
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max",
messages=[
{"role": "system", "content": "Vous êtes un assistant de révision d'interface utilisateur."},
{
"role": "user",
"content": [
{
"type": "text",
"text": "Décrivez les problèmes d'utilisabilité les plus évidents dans cette capture d'écran du tableau de bord."
},
{
"type": "image_url",
"image_url": {"url": "https://example.com/dashboard.png"}
}
]
}
],
max_tokens=500,
)
print(response.choices[0].message.content)
Testez les entrées multimodales séparément de votre base de référence textuelle. La prise en charge des charges utiles peut varier selon la famille de points de terminaison et la version de la bibliothèque cliente, donc validez la forme exacte de la requête que vous prévoyez d’expédier.
Erreurs courantes
Les erreurs de configuration les plus fréquentes sont simples :
- utiliser le nom d’affichage au lieu de
qwen/qwen3.8-max - pointer le SDK vers la mauvaise URL de base
- envoyer des prompts énormes avant de confirmer qu’une petite requête fonctionne
- laisser
max_tokenssans contrainte sur un modèle à long contexte - supposer que la limite de contexte affichée signifie que chaque tâche doit utiliser un contexte proche du maximum
La cinquième erreur est généralement celle qui fait le plus mal en production. Une grande fenêtre vous permet de conserver un contexte important. Elle ne supprime pas le besoin de budgétisation des prompts.
Liste de vérification pour la production
Avant d’acheminer un trafic significatif vers Qwen3.8-Max, testez ces cas :
- prompts textuels courts pour l’authentification et la latence de base
- prompts longs à votre taille de travail réelle
- prompts d’appel de fonctions où la réponse correcte est un appel d’outil
- prompts multimodaux si votre produit utilise une entrée image ou vidéo
- cas d’échec comme une clé invalide, un délai d’attente, ou une requête surdimensionnée
Suivez également :
- tokens moyens des prompts
- tokens moyens des complétions
- utilisation de la lecture de cache si vous réutilisez des prompts longs et stables
- latence à votre niveau de concurrence attendu
- qualité des réponses sur votre propre workflow, pas seulement sur des benchmarks synthétiques
FAQ
Qwen3.8-Max est-il disponible via Novita AI ?
Oui. Vérifié le 5 août 2026, Novita liste Qwen3.8-Max comme un modèle sans serveur avec l’ID de modèle API qwen/qwen3.8-max.
Quel point de terminaison dois-je utiliser en premier ?
Commencez par POST https://api.novita.ai/openai/v1/chat/completions. C’est le chemin le plus simple pour une première requête et correspond au flux standard du client de style OpenAI.
Qwen3.8-Max prend-il en charge l’utilisation d’outils ?
Oui. Novita liste l’appel de fonctions et les sorties structurées comme fonctionnalités prises en charge sur la page du modèle.
Qwen3.8-Max est-il le meilleur choix par défaut pour chaque tâche de codage ?
Non. Il est le plus performant lorsque le workflow nécessite un contexte retenu très large. Pour les tâches de codage plus petites, vous devriez le comparer à des modèles moins chers au lieu de supposer que l’option phare est automatiquement le meilleur choix opérationnel.
Articles recommandés
- Qwen3.8-Max sur Novita AI : 2,4T MoE, 1M de contexte et tarification de lancement
- API Qwen3 Coder Next sur Novita AI pour les agents de codage
- Guide de configuration complet : Comment utiliser Codex avec les modèles Novita AI
Sources vérifiées le 5 août 2026 : Page du modèle Qwen3.8 Max, Référence API des complétions de chat Novita, Index de la documentation Novita
