Guide des LLM open source d'août 2026 : derniers modèles, accès API et agents de codage

Guide des LLM open source d'août 2026 : derniers modèles, accès API et agents de codage

Le meilleur LLM open source pour votre projet en août 2026 dépend de la tâche, et non du titre du benchmark. Les options actuelles incluent DeepSeek V4 Pro, Qwen3.6, Kimi K2.6 et GLM-5.1, chacun avec des forces différentes en matière de raisonnement, de codage, de gestion de longs contextes et de licences. La question pratique est de savoir si vous avez besoin de poids téléchargeables ou d’une API hébergée qui fonctionne sans une équipe d’exploitation GPU. Ce guide compare le paysage actuel, explique l’auto-hébergement par rapport à l’accès API, et montre comment utiliser des modèles à poids ouverts dans un agent de codage avec Novita AI.

Qu’est-ce qu’un LLM open source ?

« Open source » recouvre en pratique un large éventail de possibilités. La distinction la plus importante sur le plan opérationnel est de savoir si vous pouvez exécuter les poids du modèle vous-même, et non si le code d’entraînement est public. Les cas courants sont :

  • Poids entièrement ouverts avec licence permissive (Apache 2.0, MIT) : Vous pouvez utiliser, modifier et servir le modèle commercialement, sous réserve des termes de la licence. Exemples : Qwen3.6 (Apache 2.0), DeepSeek R1 (MIT) et GLM-5.1 (MIT).
  • Poids ouverts avec licence personnalisée : Les poids sont téléchargeables, mais l’utilisation commerciale, la redistribution ou le fine-tuning peuvent être soumis à des restrictions. Le Llama 4 de Meta utilise une licence personnalisée avec des seuils de nombre d’utilisateurs au-delà de 700 millions d’utilisateurs mensuels.
  • Poids réservés à la recherche ou avec accès restreint : Les poids sont disponibles mais limités à un usage non commercial ou nécessitent une approbation. Moins pertinents pour les équipes de production.

Pour la plupart des décisions de production, le filtre pratique est : pouvez-vous servir légalement ce modèle à vos utilisateurs, et la licence autorise-t-elle le cas d’usage commercial dont vous avez besoin ?

Les meilleurs LLM open source en 2026

Le segment des poids ouverts s’est considérablement réduit. Cette liste a été mise à jour le 24 août 2026 pour inclure les versions plus récentes de Qwen, Kimi et GLM. Kimi K2.6 reste le modèle Kimi téléchargeable couvert ici.

Usage général et raisonnement

DeepSeek V4 Pro (685B, quasi-MIT) est actuellement le leader des benchmarks pour le codage agentique. Il égale ou bat les modèles propriétaires de pointe sur SWE-Bench et les benchmarks d’appels de fonctions, ce qui en fait un choix pratique pour les agents de codage qui doivent lire de grandes bases de code et exécuter des appels d’outils en plusieurs étapes. Il est disponible via une API hébergée si vous n’avez pas l’infrastructure pour exécuter vous-même un modèle 685B.

Qwen3.6 étend la famille Qwen à poids ouverts avec des variantes denses et MoE éparses, une entrée multimodale et une fenêtre de contexte native de 262K. La licence Apache 2.0 le rend pratique pour un déploiement commercial, tandis que la gamme de tailles de modèles donne aux équipes plus de latitude pour arbitrer entre qualité et coût de service.

Kimi K2.6 est le modèle MoE à poids ouverts de 1 000 milliards de paramètres de Moonshot AI, avec 32 milliards de paramètres actifs et une fenêtre de contexte de 256K. Il est conçu pour le codage agentique à long terme, l’utilisation d’outils et la coordination multi-agents, et il est disponible via un accès API hébergé si vous ne souhaitez pas exploiter le modèle complet vous-même.

DeepSeek R1 (685B, MIT) reste le meilleur choix pour les mathématiques et le raisonnement formel — 79,8 % sur AIME. Si votre application implique la vérification de code, les preuves formelles ou les chaînes de raisonnement structurées, R1 est le point de référence des benchmarks.

GLM-5.1 est la mise à jour sous licence MIT de GLM-5 par Z.ai, avec 40B de paramètres actifs et une fenêtre de contexte de 204.8K. Son principal atout est le travail agentique à long terme, où un modèle doit continuer à itérer, inspecter les résultats et changer de stratégie plutôt que de s’arrêter après un court passage de codage.

Spécifique au codage

Qwen 2.5 Coder 32B (Apache 2.0) atteint 92 % sur HumanEval et fonctionne sur une seule RTX 4090. Si vous avez besoin d’un modèle de codage que vous pouvez auto-héberger sur du matériel grand public, c’est le choix pratique.

Kimi K2.6 est également le choix Kimi actuel axé sur le codage. Sa conception à long contexte et à long terme le rend plus pertinent que la variante précédente Kimi K2 Code pour le travail soutenu sur des dépôts, les flux de travail fortement outillés et le débogage autonome.

Si vous choisissez l’environnement d’exécution de l’agent autour de ces modèles, comparez Agents de codage open source : meilleurs outils et comment en construire un avec Que sont les agents de codage ?.

Petits et efficaces

Phi-4 14B de Microsoft fonctionne dans 8 Go de VRAM et gère bien le suivi d’instructions, le code et le raisonnement léger. Utilisez-le lorsque la latence et les contraintes matérielles comptent plus que la qualité maximale.

Llama 4 Scout de Meta prend en charge jusqu’à 10M de jetons de contexte et tient dans 16 Go de VRAM. Le bon choix lorsque votre charge de travail implique le traitement de longs documents.

Comparaison des modèles en un coup d’œil

Modèle Taille Licence Idéal pour Contexte
DeepSeek V4 Pro 685B Quasi-MIT Codage agentique, SWE-Bench 1M
Qwen3.6 Variantes denses et MoE Apache 2.0 Raisonnement multimodal, usage commercial 262K
Kimi K2.6 1T MoE, 32B actifs MIT modifiée Codage agentique, utilisation d’outils 256K
DeepSeek R1 685B MIT Mathématiques, raisonnement formel 163K
GLM-5.1 MoE, 40B actifs MIT Travail agentique à long terme 204.8K
Qwen 2.5 Coder 32B 32B Apache 2.0 Code, auto-hébergé 128K
Phi-4 14B 14B MIT Faible VRAM, usage dev 128K
Llama 4 Scout ~109B Personnalisée Documents à long contexte 10M

Auto-hébergement vs inférence par API hébergée

C’est la décision opérationnelle qui détermine votre coût réel et votre investissement en temps. En bref : l’inférence par API hébergée est moins chère et plus rapide à exploiter, sauf si vous dépassez environ 2 à 5 millions de jetons par jour avec un trafic soutenu sur une période de 12 mois.

Quand l’inférence par API hébergée gagne

  • Votre équipe n’a pas d’expérience en exploitation GPU
  • Vous êtes encore en phase de prototypage ou d’itération sur le choix du modèle
  • Votre volume de jetons est inférieur au seuil de rentabilité de l’auto-hébergement
  • Vous devez changer rapidement de modèle à mesure que de nouvelles versions apparaissent
  • La fiabilité et la mise à l’échelle automatique comptent plus que l’optimisation des coûts

Une API LLM hébergée, surtout si elle est compatible OpenAI, vous permet d’ajouter un nouveau modèle avec une modification d’une ligne dans votre URL de base et votre identifiant de modèle. Vous évitez la gestion des démarrages à froid, les compromis de quantification, la configuration du batching et les mises à niveau du framework de service.

Quand l’auto-hébergement gagne

  • Vos données ne peuvent pas quitter votre infrastructure (santé, finance, droit, secteurs réglementés)
  • Vous traitez plus de 5 millions de jetons par jour avec un trafic prévisible
  • Vous devez servir un checkpoint affiné ou adapté qu’aucun fournisseur hébergé ne propose
  • Vous disposez d’un cluster GPU existant avec une capacité disponible

L’auto-hébergement sur H100 avec SGLang ou vLLM est réellement rentable à grande échelle. Des benchmarks récents placent SGLang à 29 % de débit en plus par rapport à vLLM sur des charges de travail standard, et jusqu’à 6 fois plus rapide sur les pipelines RAG à forte charge de préfixes grâce à RadixAttention. Mais ces gains ne comptent que si vous avez la capacité opérationnelle de maintenir la pile de service à travers les mises à jour de modèles, les pannes matérielles et les pics de trafic.

La voie hybride

La plupart des équipes finissent par adopter une approche hybride : API hébergée pour le prototypage et un accès flexible aux modèles, instances GPU pour les charges de travail qui justifient une capacité dédiée. L’avantage pratique de rester sur une seule plateforme cloud IA est que vous n’avez pas besoin de reconstruire les pipelines d’authentification, de facturation, d’observabilité et de déploiement lorsque vous passez d’une API serverless à un endpoint dédié, puis à une instance GPU personnalisée.

Comment accéder aux LLM open source via une API

Novita AI fournit un accès API compatible OpenAI à un catalogue de modèles open source, notamment DeepSeek V4 Pro, DeepSeek V4 Flash, Kimi K2.6, Qwen3.6, GLM-5.1, MiniMax M3 et d’autres. La structure de l’endpoint est la même que celle d’OpenAI, de sorte que le code existant qui utilise le SDK openai peut se connecter aux modèles Novita avec des modifications minimes.

Appel API de base

from openai import OpenAI

client = OpenAI(
    base_url="https://api.novita.ai/v3/openai",
    api_key="YOUR_NOVITA_API_KEY",
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4-pro",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Explain the difference between DeepSeek R1 and V4 Pro."},
    ],
)

print(response.choices[0].message.content)

Pour changer de modèle, modifiez le paramètre model. Aucune autre modification n’est nécessaire. Une liste complète des identifiants de modèles pris en charge est disponible sur novita.ai/docs/model-api/reference/llm/models.html.

TypeScript

import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://api.novita.ai/v3/openai",
  apiKey: process.env.NOVITA_API_KEY,
});

const response = await client.chat.completions.create({
  model: "qwen/qwen3.5-397b-a17b",
  messages: [{ role: "user", content: "Write a Python function to parse JSON." }],
});

console.log(response.choices[0].message.content);

Référence des prix

Les prix varient selon le modèle et sont facturés par million de jetons. DeepSeek V4 Flash à 0,14 $/M de jetons en entrée et 0,28 $/M de jetons en sortie est l’option la plus rentable pour un usage général. DeepSeek V4 Pro à 1,60 $/M de jetons en entrée et 3,20 $/M de jetons en sortie est le choix premium pour les flux de travail agentiques et de codage où la qualité du modèle affecte directement le taux de réussite des tâches. Consultez novita.ai/models/llm pour les prix actuels, car ils changent avec l’ajout de nouveaux modèles.

LLM open source pour les agents de codage

Les configurations d’agents de codage les plus efficaces en 2026 combinent un LLM open source pour le raisonnement et la génération de code avec un environnement d’exécution sandboxé pour exécuter le code. C’est une architecture différente d’un simple appel API : l’agent doit lire des fichiers, écrire du code, exécuter des commandes, inspecter les résultats et itérer.

Les deux modes de défaillance à éviter sont :

  1. Exécuter le code généré par l’agent sur votre machine de développement ou votre serveur de production — une erreur si le modèle génère quelque chose de destructeur ou d’inattendu
  2. Configurer vous-même une VM complète pour chaque session d’agent — vite dépassé, lent à passer à l’échelle

Novita Agent Sandbox

Le Agent Sandbox de Novita fournit des environnements Linux isolés qui démarrent en moins de 200 ms. Chaque sandbox dispose d’un système de fichiers que l’agent peut lire et écrire, d’un shell dans lequel l’agent peut exécuter des commandes, et d’un isolement afin que tout ce que le modèle génère ne puisse pas affecter les autres sandboxes ni votre infrastructure. Les sessions persistent entre les requêtes, ce qui permet à l’agent de conserver un état tout au long d’une tâche en plusieurs étapes.

Le SDK Python est simple :

from novita_sandbox.code_interpreter import Sandbox

sandbox = Sandbox.create()

# Agent writes a file
sandbox.files.write("/workspace/app.py", code_content)

# Agent runs it
result = sandbox.commands.run("python /workspace/app.py")
print(result.stdout)

# Clean up
sandbox.kill()

Associez cela à n’importe quel modèle compatible OpenAI sur l’API LLM de Novita, et vous obtenez un agent de codage capable de générer, exécuter, inspecter et réviser du code sans aucune infrastructure au-delà de votre clé API.

Frameworks d’agents open source

Plusieurs agents de codage open source sont disponibles comme environnements d’exécution prêts à l’emploi sur l’Agent Sandbox de Novita :

  • OpenClaw sur Novita — déployez un agent OpenClaw persistant via le sandbox Novita sans limite de session. Il se connecte automatiquement à l’API LLM et au sandbox de Novita, ce qui le rend pratique pour les tâches d’automatisation de longue durée.
  • Hermes Agent — un agent autonome de Nous Research avec mémoire persistante. Fonctionne comme un processus de longue durée plutôt que comme une session unique.
  • Goose — un agent de codage open source (plus de 45 000 étoiles GitHub) avec Novita comme fournisseur natif, lui donnant accès à plus de 200 modèles avec une seule identification.

Pour les équipes qui créent des agents de codage personnalisés plutôt que de déployer un framework existant, le Novita Agent Runtime offre une couche d’échafaudage légère qui gère le cycle de vie du sandbox, le routage des appels d’outils et la persistance des sessions.

Quel LLM open source devriez-vous utiliser ?

L’arbre de décision est court :

Pour le codage et les tâches agentiques : Commencez par DeepSeek V4 Pro via l’API. C’est le leader actuel en performances pour SWE-Bench et l’utilisation d’outils en plusieurs étapes. Si le coût est une contrainte, DeepSeek V4 Flash gère des tâches de code plus simples à une fraction du prix.

Pour le raisonnement et les mathématiques : DeepSeek R1 reste la référence des benchmarks pour AIME et le raisonnement formel. Utilisez-le lorsque la tâche implique une résolution de problème structurée plutôt qu’une exécution de code.

Pour un usage commercial avec une licence ouverte : Qwen3.6 sous Apache 2.0 est un point de départ pratique lorsque votre équipe juridique a besoin d’une licence permissive familière. Choisissez parmi les variantes denses et MoE en fonction de votre budget de service et de vos tests de qualité sur la tâche.

Pour le codage auto-hébergé sur GPU grand public : Qwen 2.5 Coder 32B fonctionne sur une seule RTX 4090 et obtient un score de 92 % sur HumanEval. Si vous devez auto-héberger un modèle de codage sans infrastructure GPU haut de gamme, c’est le choix pratique.

Pour les documents longs : Llama 4 Scout avec sa fenêtre de contexte de 10M de jetons gère des charges de travail qui nécessiteraient un découpage sur tout autre modèle.

Pour les environnements restreints : Phi-4 14B tient dans 8 Go de VRAM et gère bien le suivi d’instructions, la génération de code et le raisonnement léger.

Le schéma commun à tous ces choix : l’accès API hébergé élimine la surcharge opérationnelle et vous permet de changer de modèle à mesure que le paysage évolue. L’auto-hébergement a du sens lorsque la souveraineté des données ou l’économie des jetons à grande échelle justifient l’investissement dans l’exploitation GPU. La plupart des équipes de production finissent par faire les deux.

Conclusion

Le paysage des LLM open source en 2026 est fondamentalement différent de celui d’il y a deux ans. Des modèles comme DeepSeek V4 Pro, Qwen3.6, Kimi K2.6 et GLM-5.1 sont des candidats de premier choix pour des charges de travail spécifiques telles que le codage agentique, le raisonnement formel, l’analyse multimodale et le traitement de longs contextes.

La décision pratique n’est pas de savoir quel modèle est le meilleur dans un classement. Il s’agit de savoir quel modèle correspond à votre modèle opérationnel : une API hébergée si vous devez aller vite et éviter l’exploitation GPU, l’auto-hébergement si vos données ne peuvent pas quitter votre infrastructure ou si l’économie de vos jetons justifie l’investissement, et une couche d’exécution sandbox si votre modèle doit agir sur le code plutôt que simplement le générer.

L’API LLM de Novita AI couvre les principaux modèles open source derrière un endpoint compatible OpenAI, afin que vous puissiez exécuter le même code d’intégration avec DeepSeek, Qwen, Kimi ou GLM sans reconstruire votre pile à chaque version de modèle. Associez-la à Agent Sandbox lorsque la tâche nécessite l’exécution de code, et vous disposez du cœur d’un agent de codage prêt pour la production sans gérer vous-même l’infrastructure sous-jacente.

FAQ

Quel est le meilleur LLM open source en 2026 ?

DeepSeek V4 Pro est un candidat solide pour le codage agentique, Kimi K2.6 cible l’utilisation d’outils à long terme, Qwen3.6 propose des options Apache 2.0 en plusieurs tailles, et GLM-5.1 cible l’exécution agentique soutenue. La bonne réponse dépend de votre tâche, de vos exigences de licence, de votre matériel et de votre souhait d’auto-héberger ou non.

Quels sont les meilleurs LLM open source pour une utilisation locale ?

Qwen 2.5 Coder 32B (une seule RTX 4090), Phi-4 14B (8 Go de VRAM) et Llama 4 Scout (16 Go de VRAM, contexte 10M) sont les choix pratiques pour l’inférence locale. Les modèles de plus de 70B nécessitent généralement des configurations multi-GPU.

Les grands modèles de langage open source sont-ils aussi bons que les modèles fermés ?

Pour des tâches spécifiques, oui. DeepSeek V4 Pro égale ou dépasse GPT-4.1 sur SWE-Bench et les benchmarks de codage. Pour les tâches générales ouvertes, les meilleurs modèles fermés conservent un avantage. L’écart dépend fortement de la tâche et du benchmark spécifiques.

Quelles sont les actualités des LLM open source aujourd’hui ?

Au 24 août 2026, les versions récentes à poids ouverts incluent Qwen3.6, Kimi K2.6, GLM-5.1 et DeepSeek V4 Pro.

Comment accéder aux modèles LLM open source sans auto-hébergement ?

Utilisez une API d’inférence hébergée. Novita AI fournit un accès compatible OpenAI à DeepSeek, Qwen, Kimi, GLM, MiniMax et d’autres modèles open source. Remplacez votre URL de base par https://api.novita.ai/v3/openai et l’identifiant du modèle par celui que vous souhaitez ; aucune autre modification de votre code existant n’est nécessaire.

Quelle est la différence entre les LLM open source et les modèles de langage open source ?

Les termes sont utilisés de manière interchangeable dans la plupart des contextes. Techniquement, « grand modèle de langage » désigne spécifiquement les modèles de langage basés sur des transformeurs entraînés à grande échelle. « Modèle de langage open source » peut également désigner des modèles plus petits ou des modèles hors architecture transformeur, mais dans l’usage courant, les deux termes décrivent la même catégorie de modèles.

Articles recommandés