- Qu'est-ce que DeepSeek-V4-Flash ?
- Quoi de neuf dans la mise à jour du 31 juillet 2026 ?
- Fonctionnalités clés : pourquoi DeepSeek-V4-Flash se démarque
- Performances de référence
- Comment utiliser DeepSeek-V4-Flash via Novita AI
- Tarification de DeepSeek-V4-Flash
- Cas d'utilisation recommandés
- Commencez à utiliser DeepSeek-V4-Flash dès aujourd'hui
- FAQ
- Articles recommandés
La plupart des modèles open source dotés de capacités de raisonnement imposent un compromis : fenêtres de contexte réduites, débit lent, ou prix dépassant 1 $/M de tokens dès que la réflexion approfondie est activée. DeepSeek-V4-Flash évite toujours ce compromis dans sa mise à jour du 31 juillet 2026 : même conception de mélange d’experts (MoE) à 284 milliards de paramètres, avec seulement 13B activés par inférence, même fenêtre de contexte native de 1 048 576 tokens, et même tarification d’entrée à 0,14 $/M sur Novita AI.
En résumé : DeepSeek-V4-Flash reste la même famille de modèles sur Novita AI après la révision de ré-entraînement du 0731. Cette mise à jour est importante car elle actualise la version de service sans obliger les développeurs à changer d’ID de modèle, à réécrire les prompts ou à recalculer leurs hypothèses de coûts.
Ouvrir DeepSeek-V4-Flash dans la console de modèles Novita AI
Qu’est-ce que DeepSeek-V4-Flash ?
DeepSeek-V4-Flash est un modèle de langage à mélange d’experts (MoE) développé par DeepSeek AI, faisant partie de la série DeepSeek-V4 aux côtés du modèle plus grand DeepSeek-V4-Pro. Le modèle compte 284B paramètres au total, dont 13B activés lors de l’inférence, ce qui maintient un faible coût de calcul par token tout en conservant la capacité paramétrique d’un modèle beaucoup plus grand.
Principales capacités en un coup d’œil :
- 284B total / 13B paramètres activés — architecture MoE, faible coût d’inférence
- Fenêtre de contexte de 1 048 576 tokens (1M de tokens) — rendue possible par l’architecture d’attention hybride
- Trois modes de raisonnement : Non-think (rapide), Think (pas à pas), Think Max (budget de raisonnement maximal)
- Prise en charge des appels de fonction — utilisation d’outils, sorties structurées, mode JSON
- Entraîné sur plus de 32 000 milliards de tokens avec post-entraînement multi-étapes (SFT, RL avec GRPO, distillation sur politique)
- Licence MIT — poids disponibles en téléchargement sur HuggingFace ; utilisation commerciale autorisée
- Précision mixte FP4 + FP8 — poids des experts MoE en FP4, couches restantes en FP8
Quoi de neuf dans la mise à jour du 31 juillet 2026 ?
En résumé : il s’agit d’une mise à jour de révision, pas d’un lancement séparé.
La mise à jour de ré-entraînement de fin juillet de DeepSeek conserve la même identité publique de produit sur Novita AI :
- Même ID de modèle :
deepseek/deepseek-v4-flash - Même architecture : 284B paramètres au total, 13B activés par inférence
- Même fenêtre de contexte : 1 048 576 tokens
- Même tarification Novita AI : 0,14 $/M d’entrée, 0,28 $/M de sortie, 0,028 $/M de lecture de cache
Cela signifie que les intégrations existantes ne nécessitent pas de modification des points de terminaison, de réécriture des tableaux de prix ou de migration des formats de prompt. Si vous avez déjà routé le trafic vers DeepSeek-V4-Flash, la mise à jour 0731 doit être considérée comme une mise à jour des capacités en arrière-plan et du post-entraînement, plutôt que comme une nouvelle SKU.
Pour les développeurs, cette distinction a son importance. Une mise à jour de révision signifie généralement que vous pouvez retester le modèle sur vos propres prompts, jeux d’évaluation et tâches d’agents, tout en conservant le même contrat de déploiement : même nom, même chemin API, même budget de contexte et même économie de jetons.
Fonctionnalités clés : pourquoi DeepSeek-V4-Flash se démarque
Profondeur de raisonnement sélectionnable sans changer de modèle
La plupart des modèles vous enferment dans un seul mode d’inférence : raisonnement activé ou désactivé. DeepSeek-V4-Flash vous offre trois modes de fonctionnement distincts sur le même point de terminaison API :
| Mode | Caractéristiques | Meilleur pour |
|---|---|---|
| Non-think | Rapide, sans chaîne de pensée | Tâches à volume élevé, chat, résumé |
| Think | Raisonnement pas à pas, équilibré | Questions-réponses complexes, génération de code, analyse |
| Think Max | Budget de raisonnement maximal | Compétitions de mathématiques, tâches de codage difficiles, benchmarks |
L’écart entre les modes est significatif : sur GPQA Diamond, V4-Flash Non-think obtient 71,2 contre 87,4 pour Think et 88,1 pour Think Max. Sur LiveCodeBench, Think Max atteint 91,6 contre 55,2 pour Non-think. Vous choisissez le coût par rapport à la qualité par requête — aucun changement d’infrastructure requis.
Architecture d’attention hybride pour un contexte de 1M de tokens
Le contexte natif d’un million de tokens est plus difficile à réaliser qu’il n’y paraît. DeepSeek-V4-Flash y parvient grâce à une architecture d’attention hybride spécialement conçue, combinant deux mécanismes :
- Attention Sparse Comprimée (CSA) — réduit considérablement le budget de calcul d’attention pour les longues séquences
- Attention Fortement Comprimée (HCA) — compresse l’empreinte mémoire du cache KV pour l’inférence avec un contexte de 1M
Le résultat : une inférence sur des entrées de 1M de tokens avec un coût gérable en FLOP et en mémoire. Pour des charges de travail comme l’analyse de code, l’examen de documents juridiques ou les agents à sessions longues, cette architecture fait la différence entre réalisable et prohibitif.
Efficacité MoE : 13B activés à l’échelle 284B
Le ratio 284B/13B activés est la source de l’efficacité en termes de coûts. Seuls 13B paramètres sont actifs par passage avant, ce qui maintient la latence et le coût par token proches d’un modèle dense de 13B — tandis que le pool complet de 284B paramètres offre une capacité de connaissance comparable à celle d’un réseau dense beaucoup plus grand. La précision mixte FP4 + FP8 réduit encore la pression sur la bande passante mémoire pour les poids des experts.
Pipeline de post-entraînement solide
DeepSeek-V4-Flash suit un processus de post-entraînement en deux étapes : d’abord, une culture experte spécifique au domaine via SFT et apprentissage par renforcement avec GRPO ; ensuite, une consolidation unifiée du modèle via distillation sur politique. Cela produit un modèle unique avec des profils de capacité différenciés en codage, raisonnement et connaissances générales — pas un simple suiveur d’instructions générique.
Performances de référence
L’histoire des benchmarks pour DeepSeek-V4-Flash concerne la sélection du mode de raisonnement. En mode Non-think, il se comporte comme un modèle efficace de 13B activés. Passez à Think Max et il atteint un niveau complètement différent.

Performances de DeepSeek-V4-Flash selon les modes par rapport aux modèles de pointe [Source : DeepSeek AI / HuggingFace]
Performances selon les modes de raisonnement
Voici les scores de V4-Flash sur les principaux benchmarks, comparant les trois modes de fonctionnement :
| Benchmark | V4-Flash Non-Think | V4-Flash Think | V4-Flash Think Max |
|---|---|---|---|
| LiveCodeBench (Pass@1) | 55,2 | 88,4 | 91,6 |
| GPQA Diamond (Pass@1) | 71,2 | 87,4 | 88,1 |
| HMMT 2026 Fév (Pass@1) | 40,8 | 91,9 | 94,8 |
| IMOAnswerBench (Pass@1) | 41,9 | 85,1 | 88,4 |
| Classement Codeforces | — | 2816 | 3052 |
| SWE Verified (Résolu) | 73,7 | 78,6 | 79,0 |
| MRCR 1M (MMR) | 37,5 | 76,9 | 78,7 |
| MCPAtlas (Pass@1) | 64,0 | 67,4 | 69,0 |
| MMLU-Pro (EM) | 83,0 | 86,4 | 86,2 |
Dernière vérification : 2026-04-27. Source : Rapport technique DeepSeek-V4 et fiche modèle HuggingFace.
Comparaison de V4-Flash avec les concurrents
V4-Flash Think Max (79,0 SWE Verified, 91,6 LiveCodeBench) concurrence des modèles fonctionnant à un coût par token bien plus élevé. Il ne domine pas tous les classements — V4-Pro Max est en tête sur la plupart des benchmarks de pointe — mais pour les développeurs qui regardent le coût par tâche plutôt que la performance brute maximale, le compromis est favorable :
Si vous choisissez entre les deux API DeepSeek V4 pour le routage en production, utilisez le guide de tarification et de routage DeepSeek V4 Pro vs Flash pour comparer quand Flash doit gérer le trafic de base et quand Pro vaut le prix plus élevé par token.
| Benchmark | V4-Flash Max | V4-Pro Max | Claude Opus 4.6 Max | Gemini 3.1 Pro High |
|---|---|---|---|---|
| LiveCodeBench (Pass@1) | 91,6 | 93,5 | 88,8 | 91,7 |
| GPQA Diamond (Pass@1) | 88,1 | 90,1 | 91,3 | 94,3 |
| SWE Verified (Résolu) | 79,0 | 80,6 | 80,8 | 80,6 |
| HMMT 2026 Fév (Pass@1) | 94,8 | 95,2 | 96,2 | 94,7 |
| MRCR 1M (MMR) | 78,7 | 83,5 | 92,9 | 76,3 |
Dernière vérification : 2026-04-27. Les chiffres de Claude Opus 4.6 Max et Gemini 3.1 Pro High proviennent du rapport technique DeepSeek-V4 (tableau de comparaison des modèles de pointe V4-Pro). Ces scores n’ont pas été mesurés en confrontation directe avec V4-Flash dans ce rapport.
Notablement, V4-Flash Think Max sur MRCR 1M (78,7) bat Gemini 3.1 Pro High (76,3) sur la tâche de récupération en contexte long — le benchmark qui correspond le plus directement aux cas d’utilisation du contexte 1M. Sur SWE Verified, les quatre modèles se regroupent entre 79 et 81, ce qui rend V4-Flash compétitif dans la catégorie des agents de codage réels, à une fraction du prix des modèles fermés.
Comment utiliser DeepSeek-V4-Flash via Novita AI
Option 1 : Playground (sans code)
Testez le modèle directement dans votre navigateur sur la console de modèles Novita AI. Aucune clé API requise pour commencer — passez entre les modes Non-think, Think et Think Max via l’interface de chat.
Option 2 : API (Python)
DeepSeek-V4-Flash utilise l’API compatible OpenAI. Utilisez l’ID de modèle deepseek/deepseek-v4-flash avec l’URL de base Novita :
from openai import OpenAI
client = OpenAI(
base_url="https://api.novita.ai/v3/openai",
api_key="VOTRE_CLÉ_API_NOVITA",
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash",
messages=[{"role": "user", "content": "Votre prompt ici"}]
)
print(response.choices[0].message.content)
Pour activer le mode Think ou Think Max, passez le paramètre reasoning dans le corps de la requête :
from openai import OpenAI
client = OpenAI(
base_url="https://api.novita.ai/v3/openai",
api_key="VOTRE_CLÉ_API_NOVITA",
)
# Mode Think Max — budget de raisonnement maximal
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash",
messages=[{"role": "user", "content": "Résoudre : x^4 - 5x^2 + 4 = 0"}],
extra_body={"reasoning": {"effort": "high"}} # "low" = Think, "high" = Think Max
)
print(response.choices[0].message.content)
Obtenez votre clé API sur novita.ai/settings.
Option 3 : Outils tiers
Étant donné que Novita AI expose un point de terminaison compatible OpenAI, DeepSeek-V4-Flash fonctionne directement avec :
- LangChain / LlamaIndex — utilisez
ChatOpenAIavecbase_url="https://api.novita.ai/v3/openai" - OpenWebUI — ajoutez comme point de terminaison personnalisé compatible OpenAI
- Continue.dev / Cursor — configurez comme modèle personnalisé avec l’URL de base Novita
Tarification de DeepSeek-V4-Flash
La tarification de DeepSeek-V4-Flash sur Novita AI est inchangée dans la mise à jour du 31 juillet 2026. Tous les chiffres ci-dessous sont par million de tokens, dernière vérification le 2026-08-03 :
| Fournisseur | Entrée ($/M) | Sortie ($/M) | Lecture de cache ($/M) | Contexte max |
|---|---|---|---|---|
| Novita AI | 0,14 $ | 0,28 $ | 0,028 $ | 1 048 576 tokens |
| DeepSeek Officiel | 0,14 $ | 0,28 $ | 0,028 $ | 131 072 tokens |
| SiliconFlow | 0,14 $ | 0,28 $ | 0,028 $ | 65 536 tokens |
| DeepInfra | 0,14 $ | 0,28 $ | — | 16 384 tokens |
Le taux par token reste le même après la mise à jour 0731 — mais le contexte maximum varie encore considérablement selon le fournisseur. Novita AI offre la fenêtre de contexte complète de 1M de tokens. DeepInfra plafonne à 16 384 tokens. Si votre charge de travail implique de longs documents, des bases de code ou des agents multi-tours, Novita est le choix pratique.
Cas d’utilisation recommandés
Agents de codage autonomes
La fenêtre de contexte de 1M de V4-Flash permet à un agent de charger l’intégralité d’une base de code dans le contexte sans découpage. Combiné avec 79,0 SWE Verified en mode Think Max, il gère les refontes multi-fichiers et le débogage sans perdre l’état entre les tours.
QA sur documents longs et RAG
MRCR 1M (Multi-Round Context Retrieval) à 78,7 % en Think Max — le benchmark mesure la précision de récupération sur une véritable fenêtre de 1M de tokens. Pour l’indexation de documents juridiques, d’articles académiques ou de spécifications techniques longues, V4-Flash récupère avec précision là où la plupart des modèles se dégradent après 32K tokens.
Raisonnement mathématique et scientifique
94,8 % sur HMMT 2026 février (mathématiques de compétition) avec Think Max. Le mode de pensée budgétaire vous permet d’ajuster le coût par rapport à la précision — utilisez Think pour les problèmes standard, Think Max pour les plus difficiles. Une seule requête ne consomme pas un budget de calcul fixe ; vous choisissez.
API de production avec mise en cache
À 0,028 $/M pour les lectures de cache, les invites système répétées et les schémas d’outils ne coûtent pratiquement rien à grande échelle. Les produits de chatbot et les wrappers API qui réinjectent le même contexte à chaque appel bénéficient de la tarification des lectures de cache par rapport à la tarification des entrées brutes.
Pour une configuration multi-modèles, gardez Flash comme valeur par défaut pour les appels de production répétés et escaladez les prompts difficiles en contexte long ou d’agent de codage vers Pro. Le guide du contexte long DeepSeek V4 Pro montre comment configurer l’ID du modèle Pro, l’URL de base, la forme de la requête et les contrôles de coûts pour ces chemins plus difficiles.
Commencez à utiliser DeepSeek-V4-Flash dès aujourd’hui
DeepSeek-V4-Flash reste disponible via Novita AI après la mise à jour du 31 juillet avec la fenêtre de contexte complète de 1M, la même tarification compétitive et zéro surcharge d’infrastructure. Vous choisissez le mode de raisonnement ; Novita s’occupe du reste.
→ Essayez DeepSeek-V4-Flash propulsé par Novita AI
→ Documentation de l’API LLM Novita AI
FAQ
Qu’est-ce qui a changé dans la révision 0731 de DeepSeek-V4-Flash ?
Sur Novita AI, le contrat de déploiement visible reste le même : l’ID du modèle reste deepseek/deepseek-v4-flash, la tarification reste à 0,14 $/M d’entrée et 0,28 $/M de sortie, et la fenêtre de contexte complète de 1 048 576 tokens est toujours disponible. La mise à jour 0731 est une actualisation de la version de service plutôt qu’une famille de modèles distincte.
Qu’est-ce que DeepSeek-V4-Flash ?
DeepSeek-V4-Flash est un modèle de langage à mélange d’experts de 284 milliards de paramètres développé par DeepSeek AI, publié le 2026-04-23. Il n’active que 13 milliards de paramètres par passage avant, ce qui le rend considérablement plus rapide et moins cher que les modèles denses de capacité comparable. Il prend en charge une fenêtre de contexte de 1 048 576 tokens et trois modes de raisonnement : Non-thinking (rapide), Budget Thinking et Extended Thinking (Think Max).
Quelle est la différence entre DeepSeek-V4-Flash et DeepSeek-V4-Pro ?
V4-Flash est la variante plus légère et plus rapide, optimisée pour la vitesse et le coût. V4-Pro est le modèle phare avec des scores de référence plus élevés (par exemple, 93,5 contre 91,6 sur LiveCodeBench Think Max). V4-Flash « atteint des performances de raisonnement comparables à la version Pro lorsqu’on lui donne un budget de réflexion plus important » — en pratique, V4-Flash Think Max comble la plupart de l’écart avec V4-Pro Think Max à un coût par token inférieur.
Si vous avez besoin d’une règle de routage en production, comparez les deux modèles dans le guide de décision API DeepSeek V4 Pro vs Flash avant de déplacer tout le trafic vers un seul modèle.
Que signifie « Flash » dans le nom du modèle ?
Flash signale une variante optimisée pour la vitesse, cohérent avec l’utilisation que Google fait du terme pour Gemini Flash. DeepSeek-V4-Flash privilégie une latence et un coût plus faibles par rapport à la précision brute maximale, avec des modes de réflexion disponibles lorsque vous avez besoin de combler l’écart de performance.
DeepSeek-V4-Flash prend-il en charge une fenêtre de contexte de 1M avec Novita AI ?
Oui. Novita AI expose la fenêtre de contexte complète de 1 048 576 tokens — la plus grande disponible parmi tous les fournisseurs actuels pour ce modèle. Les jetons de complétion maximum sur Novita sont de 393 216.
Comment changer de mode de raisonnement via l’API ?
Passez le paramètre extra_body={"reasoning": {"effort": "low"}} pour Budget Thinking, ou "effort": "high" pour Think Max. Omettez complètement le paramètre pour le mode Non-thinking (rapide). L’API est compatible OpenAI — aucune modification de SDK requise.
Quelle est la tarification de DeepSeek-V4-Flash avec Novita AI ?
Au 2026-08-03 : 0,14 $/M de tokens d’entrée, 0,28 $/M de tokens de sortie, 0,028 $/M de tokens de lecture de cache. Cela correspond à la tarification officielle de DeepSeek et est cohérent entre les fournisseurs — le différenciateur chez Novita est la fenêtre de contexte complète de 1M et une disponibilité fiable.
DeepSeek-V4-Flash est-il open source ?
Oui. Les poids du modèle sont disponibles sur HuggingFace sous licence MIT — confirmé dans le dépôt officiel DeepSeek-V4. L’auto-hébergement et l’utilisation commerciale sont autorisés selon les termes de la licence MIT. L’utilisation via l’API Novita AI ne nécessite aucun auto-hébergement.
