- La réponse courte : oui, avec trois types de « gratuit »
- Forme gratuite 1 : API LLM avec niveau gratuit permanent (limitées en débit, sans expiration)
- Forme gratuite 2 : API LLM avec crédit d'inscription (montant plafonné, puis vous payez)
- Forme gratuite 3 : LLM open-source auto-hébergés (pas d'API, pas de facture, pas de limite de débit)
- Comparaison des fournisseurs d'API LLM gratuits
- Quelle API LLM gratuite devriez-vous réellement utiliser ?
- Conclusion
- FAQ
- Articles recommandés
Oui — plusieurs fournisseurs vous offrent une clé API gratuite pour appeler des LLM open-source, mais « gratuit » recouvre trois réalités très différentes : un niveau gratuit permanent avec des limites de débit qui n’expire jamais, un crédit d’inscription unique qui s’épuise, ou des poids de modèle que vous devez télécharger et héberger vous-même. Ci-dessous, 6 fournisseurs actifs en août 2026, classés selon leur catégorie, afin que vous puissiez choisir en fonction de la durée réelle d’accès gratuit dont vous avez besoin, sans être surpris par une facture au bout de trois semaines.
La réponse courte : oui, avec trois types de « gratuit »
Si vous voulez une clé aujourd’hui sans saisir de carte, OpenRouter et Groq offrent tous deux un accès gratuit permanent sans expiration — vous devez simplement composer avec des limites de débit. Si vous avez besoin temporairement d’un débit plus élevé, Together AI, Novita AI et Hugging Face vous offrent des crédits gratuits ou des modèles gratuits pour démarrer, puis vous facturent une fois ce crédit épuisé. Si vous ne voulez dépendre ni de la disponibilité ni des changements de tarification d’aucun fournisseur, les modèles ouverts sont téléchargeables directement depuis le Hub Hugging Face et vous pouvez les exécuter sur votre propre matériel — ce n’est pas un appel API au service hébergé de Hugging Face, mais c’est la seule option qui reste gratuite pour toujours, sans aucune limite de débit.
Forme gratuite 1 : API LLM avec niveau gratuit permanent (limitées en débit, sans expiration)
Ces fournisseurs ne demandent pas d’informations de paiement et ne se coupent pas après une période d’essai. La contrainte porte sur le débit, pas sur la durée.
OpenRouter vous permet d’appeler n’importe quel modèle tagué :free dans son catalogue sans ajouter de crédits, avec une limite de 20 requêtes par minute et 50 requêtes par jour. Achetez 10 $ de crédits (une seule fois, ils n’expirent pas) et le plafond quotidien passe à 1 000 requêtes, le plafond par minute restant inchangé. Au moment de la rédaction, OpenRouter répertorie 17 modèles avec le suffixe :free, dont le GLM-5.2 de Z.ai, le Gemma 4 de Google (variantes 26B et 31B) et plusieurs modèles Nvidia Nemotron. (Vérifié le 18 août 2026 via openrouter.ai/api/v1/models et la documentation des limites de débit de la plateforme sur openrouter.ai/docs/api_reference/limits.)
Groq n’exige pas de carte de crédit pour son niveau gratuit et ne le verrouille pas derrière une fenêtre d’essai, mais chaque modèle possède ses propres limites de requêtes et de tokens par minute et par jour. Par exemple, openai/gpt-oss-120b est limité à 30 requêtes/minute, 1 000 requêtes/jour, 8 000 tokens/minute et 200 000 tokens/jour sur le niveau gratuit — les petits modèles de texte comme les variantes Llama Prompt Guard bénéficient de plafonds de tokens bien plus élevés (500 000 tokens/jour). Les clients payants du niveau « on-demand » disposent d’environ 30 à 40 fois plus de marge en requêtes et en tokens, mais le niveau gratuit lui-même n’expire pas. (Vérifié le 18 août 2026 via le tableau des limites de débit publié par Groq.)
Novita AI maintient un ensemble tournant de modèles ouverts à zéro dollar par token en tant qu’élément permanent de son catalogue, et non comme une promotion limitée dans le temps — actuellement Qwen3.5-Plus, Qwen3.6-Plus et Bunny, chacun avec une tarification entrée/sortie à 0/0 selon la liste des modèles en direct. Cela est distinct du tour d’horizon des modèles gratuits dédiés de Novita couvrant Llama, Qwen, GLM et BGE-M3, et également distinct du programme de parrainage de la plateforme ci-dessous. La sélection des modèles du niveau gratuit ici tourne au fur et à mesure que de nouveaux modèles sont lancés et que les anciens passent en tarification payante. Vérifiez donc le catalogue en direct plutôt que de supposer qu’un modèle spécifique reste gratuit. (Vérifié le 18 août 2026 via api.novita.ai/openai/v1/models.)
Forme gratuite 2 : API LLM avec crédit d’inscription (montant plafonné, puis vous payez)
C’est le type de « gratuit » le plus courant, et celui qui surprend — le compteur tourne dès le premier jour, il commence simplement à zéro.
Le programme de parrainage de Novita AI offre 10 $ de crédits API LLM, à la fois au parrain et au nouvel inscrit, avec un plafond annoncé allant jusqu’à 500 $ au total via les parrainages. Il s’agit d’une recharge de portefeuille, pas d’un niveau limité en débit — une fois les 10 $ dépensés, la tarification standard par token s’applique. (Vérifié le 18 août 2026 via novita.ai/referral.)
Together AI a supprimé son essai gratuit général lors d’un changement de facturation en juillet 2025 — les nouveaux comptes doivent désormais disposer d’un solde prépayé minimum de 5 $ avant de pouvoir passer des appels. Il propose cependant des points de terminaison de modèles spécifiques facturés à 0,00 $/1 M de tokens en dehors de cette exigence de prépaiement, comme le Prism-ML’s Ternary-Bonsai-27B, un modèle ouvert de 27B avec une fenêtre de contexte de 262 000 tokens. Les startups peuvent également postuler séparément pour obtenir jusqu’à 50 000 $ de crédits via son programme Startup Accelerator, qui est un processus de candidature, et non un avantage à l’inscription. (Vérifié le 18 août 2026 via le bloc de tarification together.ai/models/prism-ml-ternary-bonsai-27b et la documentation de facturation de Together.)
Inference Providers de Hugging Face est une API hébergée — vous l’appelez à distance avec un jeton d’accès Hugging Face, de la même manière que vous appelleriez OpenRouter ou Together AI, et Hugging Face achemine la requête vers le fournisseur sous-jacent et vous facture. Chaque compte gratuit reçoit automatiquement 0,10 $ par mois de crédit, qui passe à 2,00 $/mois sur le plan PRO à 9 $/mois. C’est suffisant pour des tests légers de petits modèles, pas pour un trafic de production — le crédit se renouvelle mensuellement plutôt que d’être une dotation unique, mais le montant est assez faible pour que la plupart des charges de travail réelles l’épuisent en une poignée de requêtes. (Vérifié le 18 août 2026 via huggingface.co/docs/api-inference/en/pricing.)
DeepInfra annonce « 10 $ USD gratuits par mois » sur sa page de tarification, structuré comme une allocation mensuelle récurrente plutôt qu’un bonus d’inscription unique. (Vérifié le 18 août 2026 via deepinfra.com/pricing.)
Forme gratuite 3 : LLM open-source auto-hébergés (pas d’API, pas de facture, pas de limite de débit)
Ce n’est pas du tout une clé API — il s’agit de télécharger vous-même les poids du modèle et de les exécuter sur du matériel que vous contrôlez, via quelque chose comme vLLM, Ollama ou llama.cpp. Le Hub Hugging Face est le point de distribution principal des versions ouvertes (Llama, Qwen, GLM et la plupart des autres familles open-source publient toutes leurs poids là-bas) — c’est une chose distincte de l’API hébergée Inference Providers de Hugging Face décrite ci-dessus ; le Hub héberge simplement les fichiers. Vous payez pour le calcul plutôt que pour les tokens, et il n’y a pas de limite de débit car il n’y a pas de service partagé — mais vous êtes responsable du GPU, de la pile de service et de la disponibilité. Cette voie a du sens si vous avez besoin d’une disponibilité garantie ou si vous traitez un volume suffisamment important pour qu’un GPU loué soit plus avantageux que la tarification par token ; c’est le mauvais choix si vous voulez simplement tester un modèle cet après-midi.
Comparaison des fournisseurs d’API LLM gratuits
| Fournisseur | Type gratuit | Ce que vous obtenez | Expire ? |
|---|---|---|---|
| OpenRouter | Niveau gratuit permanent | 50 req/jour (ou 1 000/jour après achat de 10 $ de crédit), 20 req/min, modèles :free uniquement |
Non |
| Groq | Niveau gratuit permanent | Plafonds RPM/RPD/TPM/TPD par modèle, ex. 1 000 req/jour sur gpt-oss-120b | Non |
| Novita AI (modèles niveau gratuit) | Niveau gratuit permanent | Modèles ouverts sélectionnés à 0 $/M tokens, catalogue tournant | Non, mais la liste des modèles change |
| Novita AI (parrainage) | Crédit d’inscription | 10 $ de crédits par parrainage, plafond total de 500 $ | Oui, une fois dépensé |
| Together AI | Crédit d’inscription + points de terminaison gratuits | Minimum de 5 $ prépayé pour usage général ; points de terminaison spécifiques à 0,00 $/M (ex. Ternary-Bonsai-27B) | Points de terminaison gratuits : non. Crédit général : aucun proposé depuis juil. 2025 |
| Hugging Face (Inference Providers, API hébergée) | Crédit d’inscription (mensuel) | 0,10 $/mois gratuit, 2,00 $/mois sur PRO | Se renouvelle mensuellement, montant faible |
| DeepInfra | Crédit d’inscription (mensuel) | 10 $ USD gratuits par mois | Se renouvelle mensuellement |
| Auto-hébergé (poids depuis le Hub Hugging Face) | Pas d’API | Poids complets du modèle, exécution sur votre propre GPU | Jamais, mais pas d’avantage API/limite de débit non plus |
Quelle API LLM gratuite devriez-vous réellement utiliser ?
Si vous prototypiez et souhaitez une friction d’installation nulle, commencez avec OpenRouter ou Groq — pas de carte, pas d’expiration, et vous saurez en une heure si la limite de débit est une véritable contrainte pour votre cas d’usage. Si vous construisez quelque chose qui nécessite un débit stable avant d’être prêt à payer, un crédit d’inscription comme les 10 $ de parrainage de Novita AI ou les points de terminaison à 0,00 $ de Together AI vous offre une véritable marge de test sans les limites strictes par minute des niveaux gratuits permanents. Si vous êtes déjà engagé sur un modè spécifique et avez besoin qu’il fonctionne indéfiniment sans dépendre des limites de débit ou des changements de tarification d’un fournisseur, télchargez les poids depuis le Hub Hugging Face et auto-hébergez-le.
Aucun de ces scénarios n’est « gratuit pour toujours sans limites » — cette combinaison n’existe pas pour les API hébergées, car quelqu’un paie le temps GPU en dessous. Les niveaux gratuits pernanents plafonent les démandes au lieu des dollars ; les crédits d’inscription plafonent les dollars au lieu des démandes ; l’auto-hébergement supprime les deux plafonds mais vous remet la facture d’infrastructure et le travail opéationnel.
Conclusion
Oui — des API LLM opens-source gratuites existent aujourd’hui, mais « gratuit » est une étiquette qui recouvre trois offres diférentes, pas une seule. Les niveaux gratuits permanents (OpenRouter, Groq, les modèles à 0 $ tournants de Novita AI) n’expirent jamais mais plafonnent vos démandes ou votre débit de tokens. Les crédits d’inscription (parainage de Novita AI, points de terminaison exemptés de prépaiement de Together AI, Hugging Face, DeepInfra) vous donnent une allocation en dollars réelle qui s’épise une fois dépassée. L’auto-hébergement de poids ouverts depuis le Hub Hugging Face supprime les deux types de plafonds, au coût de l’exécution et du paiement du GPU vous-même. Le choix de « l’option gratuite » pour vous dépend de votre contrainte : limites de débit, plafond de dépenses ou indépendance à long terme des décisions tarifaires d’un fournisseur — et non de la recherche d’un fournisseur unique qui éviterait les trois compromis à la fois, car aucun ne le fait actuellement.
Si vous évaluez la famille de modèles GLM, comparez les canaux API GLM gratuits actuellement disponibles plutôt que de supposer qu’une étiquette de niveau gratuit s’applique à chaque modèle GLM.
FAQ
Les API LLM open-source sont-elles réellement gratuites, ou y a-t-il toujours une condition ?
Il y a toujours une condition, et elle prend l’une des trois formes suivantes : un plafond de requêtes par jour/minute qui n’expire jamais (OpenRouter, Groq), un crédit en dollars qui s’épise (parainage de Novita AI, minimum de 5 $ de Together AI, Hugging Face, DeepInfra), ou l’obligation d’auto-héberge sur votre propre matériel. Savoir quelle forme vous obtenez avant de construire dessus évite la surpise de la facture ou de l’erreur 429.
Quel fournisseur a le niveau gratuit permanent le plus généreux ?
Le niveau gratuit de Groq offre des plafonds de tokens plus élevés sur certains modèles — jusqu’à 200 000 tokens/jour sur gpt-oss-120b et 500 000 tokens/jour sur les modèles de garde plus petits — comparé au plafond plat de 50 requêtes/jour d’OpenRouter avant d’ajouter des crédits. Lequel gagne pour vous dépend de la nature de votre goulot d’étranglement : le nombre de requêtes ou le volume de tokens ; une appli de chat avec des échanges courts ateint le plafond de requêtes d’OpenRouter en premier, tandis qu’un charge de travail de résuméisation par lot ateint les limites de tokens en premier.
Puis-je combiner les niveaux gratuits de plusieurs fournisseurs pour obtenir plus de capacité ?
Oui, et c’est un schéma courant pour les tests — achez le trafic vers les niveaux gratuits de diférents fournisseurs plutô que de déprendre d’un seul. Soyez conscient que la sélection des modèles du niveau gratuit change avec le temps (un modèle qui est :free sur OpenRouter aujourd’hui ne le sera peut-être plus le trimestre prochain), donc construisez pour un repli entre fournisseurs plutô que de coder en dur un identifiant de modè gratuit spécifique.
Le crédit de parainage de 10 $ de Novita AI est-il le même que ses modèles de niveau gratuit ?
Non, ils sont séparés. Le programme de parainage est un crédit unique de 10 $ vers la facturation standard par token, plafonné à 500 $ au total tous parainages confondus. Les modèles de niveau gratuit sont des entrées de catalogue spécifiques, facturées à 0 $ par token sur une base continue, indépendamment de l’utilisation ou non d’un code de parrainage. Vérifiez le catalogue de modèles en direct pour savoir quels modèles bénéficient actuellement d’une tarification à 0 $, car cette liste tourne au fur et à mesure du lancement de nouveaux modèles.
Si j’auto-héberge un modèle open-source, est-ce vraiment gratuit ?
Les poids du modèle sont gratuits à télécharger, mais les exécuter ne l’est pas — vous payez pour le calcul GPU, le stockage et votre propre disponibilité au lieu de la tarification par token de l’API. Pour un trafic faible et constant, c’est généralement plus chér qu’un niveau d’API payant une fois que l’on prend en compte le temps GPU inactif ; cela devient rentable principalement pour un volume élevé et prévisible, ou lorsque vous avez besoin d’une localité des données garantie.
