Qwen3.8-Max est disponible sur Novita AI avec l’ID de modèle qwen/qwen3.8-max, un accès compatible OpenAI via https://api.novita.ai/openai, une fenêtre de contexte de 1 000 000 tokens et une limite de sortie maximale de 131 072 tokens. Si vous voulez une réponse rapide pour démarrer : utilisez-le lorsque votre workflow de chat, d’agent ou de codage bénéficie réellement d’un très grand contexte retenu, puis commencez par une petite requête textuelle avant de passer à des prompts longs, à l’utilisation d’outils ou à une entrée multimodale. Pour une vue d’ensemble de la disponibilité et des tarifs, consultez Qwen3.8-Max sur Novita AI : 2,4T MoE, 1M de contexte et tarifs de lancement.
Configuration de l’API Qwen3.8-Max
Commencez par quatre éléments de configuration :
| Élément | Valeur |
|---|---|
| Clé API | Stockez une clé API Novita AI dans NOVITA_API_KEY |
| URL de base compatible OpenAI | https://api.novita.ai/openai |
| Endpoint de chat completions | POST https://api.novita.ai/openai/v1/chat/completions |
| ID du modèle | qwen/qwen3.8-max |
Exportez la clé dans votre terminal :
export NOVITA_API_KEY="your_api_key"
Si vous utilisez déjà le SDK OpenAI, le changement d’intégration est minime : conservez votre code client, pointez l’URL de base vers Novita AI et remplacez le modèle par qwen/qwen3.8-max.
Tarifs, limites et fonctionnalités de Qwen3.8-Max
Utilisez l’ID de modèle exact dans le code. Dans les textes destinés aux utilisateurs, utilisez le nom d’affichage « Qwen3.8 Max ».
| Champ | Valeur actuelle Novita |
|---|---|
| Nom d’affichage | Qwen3.8 Max |
| ID de modèle API | qwen/qwen3.8-max |
| Famille de modèles | Qwen |
| Description sur la page du modèle | Modèle phare MoE de 2,4T paramètres pour le codage et le travail de connaissances |
| Familles d’endpoints | chat/completions, anthropic, responses |
| Modalités d’entrée | Texte, image, vidéo |
| Modalité de sortie | Texte |
| Fenêtre de contexte | 1 000 000 tokens |
| Tokens de sortie max | 131 072 |
| Fonctionnalités | API sans serveur, raisonnement, sorties structurées, appel de fonction |
| Niveaux de débit affichés | T1 30 RPM / 50 000 000 TPM jusqu’à T5 6000 RPM / 50 000 000 TPM |
Vérifié le 5 août 2026, Novita liste ces prix pour qwen/qwen3.8-max :
| Type de token | Prix indiqué |
|---|---|
| Tokens d’entrée | 2 $ par million de tokens |
| Tokens d’entrée lus depuis le cache | 0,25 $ par million de tokens |
| Tokens de sortie | 6 $ par million de tokens |
Ces chiffres sont suffisants pour la planification, mais pas pour un budget aveugle. Un modèle avec 1M de contexte peut devenir rapidement coûteux si vous renvoyez à plusieurs reprises des prompts surdimensionnés ou si vous laissez les complétions s’étendre longtemps. Revérifiez la page du modèle Qwen3.8 Max et la page de tarifs Novita AI avant tout lancement en production ou tout engagement de coût envers les clients.
Première requête cURL
Commencez par une petite requête textuelle uniquement. Cela confirme l’authentification, le routage et l’analyse de la réponse avant d’impliquer des appels d’outils, des images ou des prompts longs.
curl "https://api.novita.ai/openai/v1/chat/completions" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${NOVITA_API_KEY}" \
-d '{
"model": "qwen/qwen3.8-max",
"messages": [
{
"role": "system",
"content": "You are a concise engineering assistant."
},
{
"role": "user",
"content": "Summarize the main risks in a multi-repository API migration in 5 bullet points."
}
],
"temperature": 0.2,
"max_tokens": 400
}'
Une réponse réussie renvoie la forme standard des chat completions, incluant choices, message.content et usage.
Utilisez ce test de validation pour vérifier :
- que la clé API est valide
- que l’ID du modèle est accepté
- que votre client lit
choices[0].message.content - que vous enregistrez l’utilisation des tokens dès le début
Exemple Python
Le SDK Python OpenAI fonctionne avec Novita AI lorsque vous définissez l’URL de base de Novita :
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["NOVITA_API_KEY"],
base_url="https://api.novita.ai/openai",
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max",
messages=[
{"role": "system", "content": "You are a concise engineering assistant."},
{
"role": "user",
"content": "Review this rollout plan and point out the first three operational risks to test."
},
],
temperature=0.2,
max_tokens=400,
)
print(response.choices[0].message.content)
print(response.usage)
Gardez max_tokens explicite en production. Qwen3.8-Max peut générer des réponses très longues, ce qui est utile pour les tâches difficiles mais facile à dépenser trop si vous laissez les complétions sans contrainte.
Modèle de workflow de chat
Pour les produits de chat, Qwen3.8-Max est le plus utile lorsque l’historique de la conversation est réellement volumineux ou lorsque l’assistant doit conserver plusieurs longs documents en mémoire de travail. Si votre charge de travail consiste en questions-réponses courtes ou en support léger, un modèle plus petit peut être moins cher et plus facile à ajuster.
Un modèle pratique de déploiement de chat ressemble à ceci :
- Commencez avec des prompts textuels uniquement et une limite
max_tokensmodeste. - Ajoutez votre vrai prompt système et votre texte de politique.
- Testez des conversations avec un long historique qui reflètent votre produit réel, et non le maximum théorique de 1M.
- Mesurez la latence, le comportement de troncature et la longueur moyenne des complétions avant d’étendre l’utilisation.
L’erreur clé à éviter est de traiter la fenêtre de contexte de 1M comme un objectif plutôt que comme un plafond de capacité. Un grand contexte est utile lorsqu’il empêche la perte d’informations. Il n’est pas automatiquement efficace.
Modèle de workflow d’agent
Novita liste l’appel de fonction et les sorties structurées comme fonctionnalités prises en charge, ce qui fait de Qwen3.8-Max un candidat raisonnable pour les workflows d’agent qui ont besoin de sélection d’outils et d’un état retenu important.
Utilisez l’appel de fonction lorsque le modèle doit choisir une action au lieu de répondre en prose :
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["NOVITA_API_KEY"],
base_url="https://api.novita.ai/openai",
)
tools = [
{
"type": "function",
"function": {
"name": "search_repo",
"description": "Search a repository for files or symbols.",
"parameters": {
"type": "object",
"properties": {
"query": {"type": "string"},
"path": {"type": "string"}
},
"required": ["query"]
}
}
}
]
response = client.chat.completions.create(
model="qwen/qwen3.8-max",
messages=[
{"role": "system", "content": "You are a repository analysis agent."},
{
"role": "user",
"content": "Find where retry backoff is implemented and identify any hard-coded sleep values."
},
],
tools=tools,
tool_choice="auto",
temperature=0.1,
)
message = response.choices[0].message
print(message.tool_calls or message.content)
Qwen3.8-Max n’est pas le bon choix par défaut pour chaque agent. C’est un bon choix lorsque l’agent doit conserver en contexte de longs fils de discussion, des notes de conception, des résumés de dépôt ou de longues traces d’outils. Si l’agent gère principalement des tâches courtes avec une boucle d’outils serrée, testez un modèle moins cher en parallèle.
Modèle de workflow de codage
Pour les tâches de codage, Qwen3.8-Max est mieux traité comme un spécialiste du long contexte plutôt que comme un choix par défaut universel. Il est le plus pertinent lorsque l’échelle du dépôt, les notes d’architecture, les correctifs précédents et les échecs de test doivent tous être visibles en même temps.
Utilisez-le pour des charges de travail comme :
- la planification de refactorisation à l’échelle du dépôt
- la révision et le résumé de grandes PR
- le débogage sur plusieurs fichiers
- l’analyse de migration avec de longs documents de conception
- les tâches de génération de code qui dépendent de beaucoup de contexte environnant
Un prompt de codage simple pour commencer :
Review this service boundary change, identify the breaking API risks, and propose the smallest safe patch sequence before writing code.
Si vous voulez une configuration d’agent en terminal plutôt que des appels API bruts, associez ce modèle au Guide de configuration complet pour utiliser Codex avec les modèles Novita AI. Pour une comparaison d’endpoints de codage axée sur Qwen, consultez API Qwen3 Coder Next sur Novita AI pour les agents de codage.
Entrée multimodale
Novita liste le texte, l’image et la vidéo comme modalités d’entrée prises en charge pour Qwen3.8-Max. Cela signifie que vous pouvez tester des workflows tels que la révision de captures d’écran, la compréhension de documents ou l’analyse vidéo via la même famille de modèles.
Un exemple de base d’entrée d’image utilisant le format de message compatible OpenAI :
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["NOVITA_API_KEY"],
base_url="https://api.novita.ai/openai",
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max",
messages=[
{"role": "system", "content": "You are a UI review assistant."},
{
"role": "user",
"content": [
{
"type": "text",
"text": "Describe the most obvious usability issues in this dashboard screenshot."
},
{
"type": "image_url",
"image_url": {"url": "https://example.com/dashboard.png"}
}
]
}
],
max_tokens=500,
)
print(response.choices[0].message.content)
Testez les entrées multimodales séparément de votre base textuelle. La prise en charge des charges utiles peut varier selon la famille d’endpoints et la version de la bibliothèque client, alors validez la forme exacte de la requête que vous prévoyez d’utiliser.
Erreurs courantes
Les erreurs de configuration les plus courantes sont simples :
- utiliser le nom d’affichage au lieu de
qwen/qwen3.8-max - pointer le SDK vers la mauvaise URL de base
- envoyer des prompts énormes avant de confirmer qu’une petite requête fonctionne
- laisser
max_tokenssans contrainte sur un modèle à long contexte - supposer que la limite de contexte publiée signifie que chaque tâche doit utiliser un contexte proche du maximum
La cinquième erreur est généralement celle qui coûte le plus cher en production. Une grande fenêtre vous permet de conserver un contexte important. Elle ne supprime pas le besoin de budgétisation des prompts.
Liste de contrôle pour la production
Avant d’acheminer un trafic significatif vers Qwen3.8-Max, testez ces cas :
- prompts textuels courts pour l’authentification et la latence de base
- prompts à long contexte à votre taille de travail réelle
- prompts d’appel de fonction où la bonne réponse est un appel d’outil
- prompts multimodaux si votre produit utilise une entrée image ou vidéo
- cas d’échec tels que clé invalide, timeout ou requête surdimensionnée
Suivez également :
- les tokens moyens des prompts
- les tokens moyens des complétions
- l’utilisation de la lecture du cache si vous réutilisez des prompts longs stables
- la latence à votre niveau de concurrence attendu
- la qualité des réponses sur votre propre workflow, pas seulement sur des benchmarks synthétiques
FAQ
Qwen3.8-Max est-il disponible via Novita AI ?
Oui. Vérifié le 5 août 2026, Novita liste Qwen3.8-Max comme un modèle sans serveur avec l’ID de modèle API qwen/qwen3.8-max.
Quel endpoint dois-je utiliser en premier ?
Commencez par POST https://api.novita.ai/openai/v1/chat/completions. C’est le chemin le plus simple pour une première requête et il correspond au flux client standard de type OpenAI.
Qwen3.8-Max prend-il en charge l’utilisation d’outils ?
Oui. Novita liste l’appel de fonction et les sorties structurées comme fonctionnalités prises en charge sur la page du modèle.
Qwen3.8-Max est-il le meilleur choix par défaut pour chaque tâche de codage ?
Non. Il est le plus performant lorsque le workflow a besoin d’un très grand contexte retenu. Pour les tâches de codage plus petites, vous devriez le comparer à des modèles moins chers au lieu de supposer que l’option phare est automatiquement le meilleur choix opérationnel.
Articles recommandés
- Qwen3.8-Max sur Novita AI : 2,4T MoE, 1M de contexte et tarifs de lancement
- API Qwen3 Coder Next sur Novita AI pour les agents de codage
- Comment utiliser Codex avec les modèles Novita AI : Guide de configuration complet
Sources vérifiées le 5 août 2026 : page du modèle Qwen3.8 Max, référence API chat completions Novita, index de la documentation Novita
