- Pourquoi utiliser DeepSeek V4 Flash dans Claude Code
- Qu'est-ce que DeepSeek V4 Flash
- Obtenir votre clé API Novita AI
- Installer Claude Code
- Configuration des variables d'environnement
- Démarrer Claude Code
- Travailler avec de grandes bases de code
- Sélectionner les modes de raisonnement par session
- Conclusion
- FAQ
- Articles recommandés
DeepSeek V4 Flash est un modèle MoE de 284B avec une fenêtre de contexte d’un million de tokens, disponible via le point d’accès compatible Anthropic de Novita AI — ce qui signifie que Claude Code peut l’utiliser directement avec un changement de trois lignes de variables d’environnement. À 0,14 $/M tokens d’entrée contre 3 $/M pour Claude Sonnet, la différence de coût est significative pour les équipes qui travaillent en continu sur des sessions de codage agentique.
Pourquoi utiliser DeepSeek V4 Flash dans Claude Code
Les aspects économiques sont la raison la plus immédiate. Claude Code utilise par défaut Claude Sonnet, qui coûte 3 $/M tokens d’entrée et 15 $/M tokens de sortie. DeepSeek V4 Flash sur Novita AI coûte 0,14 $/M tokens d’entrée et 0,28 $/M tokens de sortie — soit une réduction d’environ 20× sur l’entrée et 50× sur la sortie. Pour une équipe utilisant Claude Code sur une journée de travail de huit heures, cette différence s’accumule rapidement.
Au-delà du coût, V4 Flash apporte deux capacités importantes pour le codage agentique :
- Fenêtre de contexte d’un million de tokens — Claude Code peut charger l’intégralité d’une base de code dans le contexte sans découpage. Le refactor multi-fichiers, le débogage cross-repo et les longs historiques de conversation restent cohérents sans gestion manuelle du contexte.
- Modes de raisonnement sélectionnables — Le mode Non-think donne des réponses rapides pour les tâches de boilerplate ; les modes Think et Think Max permettent un raisonnement étape par étape pour les décisions architecturales complexes ou les sessions de débogage difficiles. Vous choisissez par session sans changer de modèle.
Novita AI expose un point d’accès compatible Anthropic (/anthropic), donc Claude Code le traite comme un remplacement direct. Aucun changement de SDK, aucun plugin nécessaire — seulement des variables d’environnement.
Qu’est-ce que DeepSeek V4 Flash
DeepSeek V4 Flash est un modèle Mixture-of-Experts (MoE) de DeepSeek AI. Il possède 284B paramètres au total mais n’en active que 13B par passage avant, ce qui maintient la latence et le coût par token proches d’un modèle dense de 13B tout en conservant la capacité de connaissance d’un réseau beaucoup plus grand.
Principales spécifications en un coup d’œil :
| Spécification | Valeur |
|---|---|
| ID du modèle | deepseek/deepseek-v4-flash |
| Paramètres totaux | 284B (13B activés par inférence) |
| Fenêtre de contexte | 1 048 576 tokens |
| Tokens de sortie max | 393 216 |
| Prix d’entrée (Novita AI) | 0,14 $/M tokens |
| Prix de sortie (Novita AI) | 0,28 $/M tokens |
| Prix de lecture du cache | 0,028 $/M tokens |
| Modes de raisonnement | Non-think, Think, Think Max |
| Appel de fonctions | Oui |
| Sorties structurées | Oui |
| Licence | MIT |
Les trois modes de raisonnement vous permettent d’ajuster le coût par rapport à la qualité par session. Le mode Non-think est rapide et bon marché — idéal pour le scaffolding répétitif ou la génération de boilerplate. Le mode Think ajoute un raisonnement étape par étape pour la revue de code, le refactoring et le débogage. Think Max utilise le budget de raisonnement maximum et égalise V4 Pro sur la plupart des benchmarks de codage.
Novita AI fournit la fenêtre de contexte complète d’un million de tokens et une disponibilité fiable, ce qui en fait un choix pratique pour les charges de travail agentiques en production.
Obtenir votre clé API Novita AI
Inscrivez-vous pour un compte Novita AI afin de recevoir des crédits d’essai gratuits. Après vous être connecté, accédez à la page Key Management et cliquez sur Créer une nouvelle clé.
Copiez la clé immédiatement — elle ne sera plus affichée. Conservez-la dans un gestionnaire de mots de passe ou un coffre de secrets ; vous en aurez besoin à l’étape suivante.
Installer Claude Code
Claude Code nécessite Node.js 18 ou supérieur. Vérifiez d’abord votre version :
node --version
Si Node est inférieur à 18, mettez-le à jour depuis nodejs.org avant de continuer.
Windows
Ouvrez l’invite de commandes et exécutez :
npm install -g @anthropic-ai/claude-code
Mac et Linux
Ouvrez le Terminal et exécutez :
npm install -g @anthropic-ai/claude-code
L’installation globale rend claude disponible depuis n’importe quel répertoire.
Configuration des variables d’environnement
Ces quatre variables redirigent Claude Code vers le point d’accès compatible Anthropic de Novita AI avec DeepSeek V4 Flash comme modèle actif.
Windows
set ANTHROPIC_BASE_URL=https://api.novita.ai/anthropic
set ANTHROPIC_AUTH_TOKEN=<Your Novita API Key>
set ANTHROPIC_MODEL=deepseek/deepseek-v4-flash
set ANTHROPIC_SMALL_FAST_MODEL=deepseek/deepseek-v4-flash
Ces variables persistent pour la session actuelle de l’invite de commandes. Pour les rendre permanentes, définissez-les via Propriétés système → Variables d’environnement.
Mac et Linux
export ANTHROPIC_BASE_URL="https://api.novita.ai/anthropic"
export ANTHROPIC_AUTH_TOKEN="<Your Novita API Key>"
export ANTHROPIC_MODEL="deepseek/deepseek-v4-flash"
export ANTHROPIC_SMALL_FAST_MODEL="deepseek/deepseek-v4-flash"
Pour les conserver entre les sessions, ajoutez ces lignes à votre ~/.bashrc, ~/.zshrc, ou profil shell équivalent.
ANTHROPIC_SMALL_FAST_MODEL contrôle le modèle léger que Claude Code utilise pour les tâches internes rapides comme les recherches de fichiers et les résumés. Le définir sur le même ID de modèle maintient tout le trafic sur une seule ligne de facturation et évite les appels API inattendus à Anthropic.
Démarrer Claude Code
Accédez à votre répertoire de projet et lancez Claude Code :
cd <your-project-directory>
claude .
Claude Code ouvre une session interactive dans le répertoire courant. Vous verrez l’invite apparaître une fois la connexion au point d’accès de Novita AI établie. À partir de là, décrivez votre tâche en langage naturel — Claude Code lira vos fichiers, proposera des modifications et les appliquera avec votre approbation.
Travailler avec de grandes bases de code
La fenêtre de contexte d’un million de tokens est l’avantage le plus pratique de V4 Flash par rapport aux alternatives à contexte plus petit. Une base de code de production de taille moyenne typique utilise 100K à 300K tokens une fois aplatée. V4 Flash peut contenir l’intégralité de celle-ci dans le contexte sans aucune stratégie de découpage.
Quelques flux de travail qui en bénéficient directement :
- Refactorisations multi-fichiers — Demandez à Claude Code de renommer un modèle de données, de modifier un contrat d’API ou de refactoriser une interface de service dans tous les fichiers qui y font référence. Avec une fenêtre de contexte complète, il voit toutes les dépendances simultanément plutôt que fichier par fichier.
- Longues sessions de débogage — Au fur et à mesure qu’une session de débogage accumule les appels d’outils, les lectures de fichiers et les traces de raisonnement, les fenêtres de contexte plus petites tronquent l’historique ancien. V4 Flash conserve la session complète, de sorte que le modèle peut raisonner sur des motifs qu’il a vus il y a 200 appels d’outils.
- Revues à l’échelle du dépôt — Alimentez l’intégralité de la base de code au mode Think ou Think Max de V4 Flash et demandez une revue de sécurité, une évaluation d’architecture ou une analyse de code mort. Cela épuiserait rapidement un modèle de 128K ; cela tient confortablement dans la fenêtre de V4 Flash.
- Surcharge du prompt système — Claude Code utilise un prompt système détaillé qui peut atteindre 10K à 20K tokens. Sur un modèle de 128K, cette surcharge a de l’importance. Sur une fenêtre de 1M, elle est négligeable, laissant presque tout le budget de contexte pour le code réel.
Pour le contrôle des coûts sur les longues sessions, le mode Non-think gère la majorité des modifications de fichiers de routine au coût le plus bas. Passez en mode Think lorsque la tâche nécessite un raisonnement de conception, et Think Max pour les problèmes algorithmiques ou de débogage difficiles. Le prix de lecture du cache Novita (0,028 $/M tokens) signifie que les injections répétées du prompt système coûtent très peu à grande échelle.
Sélectionner les modes de raisonnement par session
DeepSeek V4 Flash prend en charge trois modes de raisonnement que vous pouvez contrôler par session. Le mode Non-think renvoie des complétions rapides et directes — idéal pour la génération de boilerplate, les modifications de routine et les recherches rapides. Le mode Think permet un raisonnement étape par étape pour la revue de code, les refactorisations et les décisions architecturales. Think Max alloue le budget de raisonnement maximum et égalise V4 Pro sur la plupart des benchmarks de codage.
La façon la plus simple d’orienter Claude Code vers un raisonnement plus approfondi est un prompt système personnalisé :
claude --system "Use extended thinking for architecture decisions and complex debugging."
Pour un contrôle programmatique, le point d’accès de Novita AI accepte le paramètre budget_tokens. Le définir sur 0 désactive complètement la réflexion ; toute valeur positive active la réflexion jusqu’à ce budget de tokens. Ceci est utile dans les pipelines agentiques où seules certaines étapes nécessitent un raisonnement approfondi :
import anthropic
client = anthropic.Anthropic(
base_url="https://api.novita.ai/anthropic",
api_key="<Your Novita API Key>",
)
# Think Max — maximum reasoning budget for hard problems
response = client.messages.create(
model="deepseek/deepseek-v4-flash",
max_tokens=16000,
thinking={"type": "enabled", "budget_tokens": 10000},
messages=[{"role": "user", "content": "Review this function for subtle concurrency bugs."}],
)
Pour les sessions soucieuses des coûts, commencez en mode Non-think et passez en mode Think uniquement lorsque vous rencontrez un problème qui l’exige. Étant donné que le prix de lecture du cache Novita est de 0,028 $/M tokens, les injections répétées du prompt système restent peu coûteuses même sur de longues sessions multi-étapes.
Conclusion
DeepSeek V4 Flash sur Novita AI offre à Claude Code une base capable et économique — 1M de contexte, raisonnement sélectionnable et appel de fonctions à une fraction du prix de Claude Sonnet. La configuration prend moins de cinq minutes. Une fois les variables d’environnement en place, votre flux de travail existant avec Claude Code fonctionne sans changement.
Essayez DeepSeek V4 Flash sur Novita AI et consultez la documentation de l’API LLM Novita AI pour plus d’options de configuration.
FAQ
Claude Code a-t-il besoin d’un plugin ou d’une extension pour utiliser Novita AI ?
Non. Claude Code lit la variable d’environnement ANTHROPIC_BASE_URL au démarrage et achemine tous les appels API vers celle-ci. Aucun plugin, extension ou modification de code n’est nécessaire — le changement se fait entièrement via les variables d’environnement.
Serai-je facturé par Anthropic lors de l’utilisation de Novita AI ?
Non. Lorsque ANTHROPIC_BASE_URL pointe vers Novita AI, tout le trafic et la facturation passent par votre compte Novita AI. Votre compte Anthropic n’est pas utilisé.
Puis-je revenir à Claude Sonnet sans réinstaller ?
Oui. Désactivez ANTHROPIC_BASE_URL et ANTHROPIC_MODEL — ou ouvrez un nouveau shell sans ces exports — et Claude Code revient au point d’accès Anthropic par défaut avec Claude Sonnet.
V4 Flash est-il adapté aux pipelines CI automatisés ?
V4 Flash prend en charge l’appel de fonctions et les sorties structurées, qui sont les deux capacités sur lesquelles Claude Code s’appuie le plus. C’est un choix pratique pour les pipelines de codage automatisés, les intégrations CI et les longues sessions agentiques où la continuité du contexte et la prévisibilité des coûts sont importantes.
Que se passe-t-il si la fenêtre de contexte se remplit ?
À 1 048 576 tokens, la fenêtre de contexte de V4 Flash est suffisamment grande pour que la plupart des sessions ne la remplissent pas. Si vous exécutez une session extrêmement longue — des jours d’historique accumulé, de très grands dépôts — Claude Code commencera à tronquer les messages les plus anciens. En pratique, démarrer une nouvelle session pour une nouvelle tâche est le moyen le plus simple de rester bien dans la limite.
Novita AI est une plateforme cloud IA qui offre aux développeurs un moyen simple de déployer des modèles d’IA via notre API simple, tout en fournissant un cloud GPU abordable et fiable pour créer et faire évoluer.
