- La réponse courte : oui, avec trois types de « gratuit »
- Forme gratuite 1 : API LLM de niveau gratuit permanent (limitées en débit, sans expiration)
- Forme gratuite 2 : API LLM avec crédit d'inscription (montant plafonné, puis vous payez)
- Forme gratuite 3 : LLM open source auto-hébergés (pas d'API, pas de facture, pas de limite de débit)
- Comparaison des fournisseurs d'API LLM gratuits
- Quelle API LLM gratuite devriez-vous réellement utiliser ?
- Conclusion
- FAQ
- Articles recommandés
Oui – plusieurs fournisseurs vous donnent une clé API gratuite pour appeler des LLM open source, mais « gratuit » se décline en trois offres très différentes : un niveau gratuit permanent avec des limites de débit qui n’expire jamais, un crédit d’inscription unique qui s’épuise, ou des poids de modèle que vous devez télécharger et héberger vous-même. Vous trouverez ci-dessous 6 fournisseurs actifs en août 2026, classés par catégorie, afin que vous puissiez choisir en fonction de la durée pendant laquelle vous avez réellement besoin d’un accès gratuit, plutôt que d’être surpris par une facture au bout de trois semaines.
La réponse courte : oui, avec trois types de « gratuit »
Si vous voulez une clé aujourd’hui et ne voulez pas entrer de carte, OpenRouter et Groq offrent tous deux un accès gratuit permanent sans expiration – vous devez simplement composer avec les limites de débit. Si vous souhaitez un débit plus élevé temporairement, Together AI, Novita AI et Hugging Face vous offrent des crédits gratuits ou des modèles gratuits pour commencer, puis vous facturent une fois que vous avez dépassé ce quota. Si vous ne voulez dépendre d’aucun fournisseur pour la disponibilité ou les changements de prix, les modèles à poids ouverts sont téléchargeables directement depuis le Hub Hugging Face et vous pouvez les exécuter sur votre propre matériel – ce n’est pas un appel API au service hébergé de Hugging Face, mais c’est la seule option gratuite pour toujours avec zéro limite de débit.
Forme gratuite 1 : API LLM de niveau gratuit permanent (limitées en débit, sans expiration)
Ils ne demandent pas d’informations de paiement et ne s’arrêtent pas après une période d’essai. La contrepartie est le débit, pas la durée.
OpenRouter vous permet d’appeler n’importe quel modèle marqué :free dans son catalogue sans ajouter de crédits, avec un maximum de 20 requêtes par minute et 50 requêtes par jour. Achetez pour 10 $ de crédits (une seule fois, ils n’expirent pas) et le plafond quotidien passe à 1 000 requêtes, le plafond par minute restant inchangé. Au moment de la rédaction, OpenRouter répertorie 17 modèles avec le suffixe :free, notamment le GLM-5.2 de Z.ai, le Gemma 4 de Google (variantes 26B et 31B) et plusieurs modèles Nvidia Nemotron. (Vérifié le 18/08/2026 via openrouter.ai/api/v1/models et la documentation des limites de débit de la plateforme sur openrouter.ai/docs/api_reference/limits.)
Groq ne nécessite pas de carte de crédit pour son niveau gratuit et ne le verrouille pas derrière une fenêtre d’essai, mais chaque modèle a ses propres limites de requêtes et de tokens par minute et par jour. Par exemple, openai/gpt-oss-120b est plafonné à 30 requêtes/minute, 1 000 requêtes/jour, 8 000 tokens/minute et 200 000 tokens/jour sur le niveau gratuit – les modèles de texte de petite taille comme les variantes Llama Prompt Guard bénéficient de plafonds de tokens beaucoup plus élevés (500 000 tokens/jour). Les clients payants du niveau « à la demande » disposent d’environ 30 à 40 fois plus de marge de manœuvre en termes de requêtes et de tokens, mais le niveau gratuit lui-même n’expire pas. (Vérifié le 18/08/2026 via le tableau des limites de débit publié par Groq.)
Novita AI maintient un ensemble tournant de modèles à poids ouverts au tarif de 0 $ par token en tant qu’élément permanent de son catalogue, et non comme une promotion limitée dans le temps – actuellement Qwen3.5-Plus, Qwen3.6-Plus et Bunny, chacun avec un prix d’entrée-sortie de 0/0 selon la liste des modèles en direct. Ceci est distinct du tour d’horizon des modèles gratuits dédiés de Novita couvrant Llama, Qwen, GLM et BGE-M3, et distinct également du programme de parrainage à l’échelle de la plateforme ci-dessous. La sélection des modèles du niveau gratuit ici change au fur et à mesure que de nouveaux modèles sont lancés et que les plus anciens passent à un tarif payant, alors vérifiez le catalogue en direct plutôt que de supposer qu’un modèle spécifique reste gratuit. (Vérifié le 18/08/2026 via api.novita.ai/openai/v1/models.)
Forme gratuite 2 : API LLM avec crédit d’inscription (montant plafonné, puis vous payez)
C’est le « gratuit » le plus courant que vous rencontrerez, et c’est celui qui surprend les gens – le compteur tourne dès le premier jour, il commence juste à zéro.
Le programme de parrainage de Novita AI offre 10 $ de crédits API LLM à la fois au parrain et au nouvel inscrit, avec un plafond indiqué de 500 $ au total gagnable via les parrainages. Il s’agit d’un rechargement de portefeuille, pas d’un niveau limité en débit – une fois les 10 $ dépensés, la tarification standard par token s’applique. (Vérifié le 18/08/2026 via novita.ai/referral.)
Together AI a supprimé son essai gratuit général lors d’un changement de facturation en juillet 2025 – les nouveaux comptes ont désormais besoin d’un solde prépayé minimum de 5 $ avant de pouvoir passer des appels. Cependant, il propose des points de terminaison de modèles spécifiques au tarif de 0,00 $/1M de tokens en dehors de cette exigence de prépaiement, comme le Prism-ML’s Ternary-Bonsai-27B, un modèle à poids ouverts de 27B avec une fenêtre de contexte de 262K. Les startups peuvent également demander séparément jusqu’à 50 000 $ de crédits via son programme Startup Accelerator, qui est un processus de candidature, pas un avantage à l’inscription. (Vérifié le 18/08/2026 via le bloc de tarification together.ai/models/prism-ml-ternary-bonsai-27b et les documents de facturation de Together.)
Les fournisseurs d’inférence de Hugging Face est une API hébergée – vous l’appelez à distance avec un jeton d’accès Hugging Face, de la même manière que vous appelleriez OpenRouter ou Together AI, et Hugging Face achemine la requête vers le fournisseur sous-jacent et vous facture. Chaque compte gratuit reçoit automatiquement 0,10 $ par mois de crédit, passant à 2,00 $/mois sur le plan PRO à 9 $/mois. C’est suffisant pour des tests légers de petits modèles, pas pour du trafic de production – le crédit se renouvelle mensuellement plutôt que d’être une dotation unique, mais le montant est suffisamment faible pour que la plupart des charges de travail réelles l’épuisent en quelques requêtes. (Vérifié le 18/08/2026 via huggingface.co/docs/api-inference/en/pricing.)
DeepInfra annonce « 10 $ USD gratuits par mois » sur sa page de tarification, structurés comme une allocation mensuelle récurrente plutôt qu’un bonus d’inscription unique. (Vérifié le 18/08/2026 via deepinfra.com/pricing.)
Forme gratuite 3 : LLM open source auto-hébergés (pas d’API, pas de facture, pas de limite de débit)
Ce n’est pas du tout une clé API – il s’agit de télécharger vous-même les poids du modèle et de les exécuter sur du matériel que vous contrôlez, via quelque chose comme vLLM, Ollama ou llama.cpp. Le Hub Hugging Face est le point de distribution principal pour les versions à poids ouverts (Llama, Qwen, GLM et la plupart des autres familles open source y publient toutes leurs poids) – c’est une chose distincte de l’API hébergée des fournisseurs d’inférence de Hugging Face décrite ci-dessus ; le Hub héberge simplement les fichiers. Vous payez pour le calcul au lieu des tokens, et il n’y a pas de limite de débit car il n’y a pas de service partagé – mais vous êtes responsable du GPU, de la pile de service et de la disponibilité. Cette voie a du sens si vous avez besoin d’une disponibilité garantie ou si vous traitez un volume suffisamment important pour qu’un GPU loué soit plus avantageux que la tarification par token ; c’est le mauvais choix si vous voulez simplement tester un modèle cet après-midi.
Comparaison des fournisseurs d’API LLM gratuits
| Fournisseur | Type gratuit | Ce que vous obtenez | Expire ? |
|---|---|---|---|
| OpenRouter | Niveau gratuit permanent | 50 req/jour (ou 1 000/jour après achat de crédit de 10 $), 20 req/min, modèles :free uniquement |
Non |
| Groq | Niveau gratuit permanent | Limites RPM/RPD/TPM/TPD par modèle, ex. 1 000 req/jour sur gpt-oss-120b | Non |
| Novita AI (modèles de niveau gratuit) | Niveau gratuit permanent | Modèles ouverts sélectionnés à 0 $/M tokens, catalogue tournant | Non, mais la liste des modèles change |
| Novita AI (parrainage) | Crédit d’inscription | 10 $ de crédits par parrainage, plafond de 500 $ au total | Oui, une fois dépensés |
| Together AI | Crédit d’inscription + points de terminaison gratuits | Minimum prépayé de 5 $ pour usage général ; points de terminaison spécifiques à 0,00 $/M (ex. Ternary-Bonsai-27B) | Points de terminaison gratuits : non. Crédit général : aucun offert depuis juillet 2025 |
| Hugging Face (fournisseurs d’inférence, API hébergée) | Crédit d’inscription (mensuel) | 0,10 $/mois gratuit, 2,00 $/mois sur PRO | Se renouvelle mensuellement, petit montant |
| DeepInfra | Crédit d’inscription (mensuel) | 10 $ USD gratuits par mois | Se renouvelle mensuellement |
| Auto-hébergé (poids depuis le Hub Hugging Face) | Pas d’API | Poids complets du modèle, exécution sur votre propre GPU | Jamais, mais pas d’avantage API/limite de débit non plus |
Quelle API LLM gratuite devriez-vous réellement utiliser ?
Si vous prototypiez et souhaitez une friction d’installation nulle, commencez par OpenRouter ou Groq – pas de carte, pas d’expiration, et vous saurez en une heure si la limite de débit est une contrainte réelle pour votre cas d’utilisation. Si vous construisez quelque chose qui nécessite un débit constant avant d’être prêt à payer, un crédit d’inscription comme les 10 $ de parrainage de Novita AI ou les points de terminaison de modèles à prix 0,00 $ de Together AI vous offre une réelle marge de test sans les limites strictes par minute qu’imposent les niveaux gratuits permanents. Si vous êtes déjà engagé sur un modèle spécifique et avez besoin qu’il fonctionne indéfiniment sans dépendre des limites de débit ou des changements de prix d’un fournisseur, téléchargez les poids depuis le Hub Hugging Face et auto-hébergez-le.
Rien de tout cela n’est « gratuit pour toujours sans limites » – cette combinaison n’existe pas pour les API hébergées, car quelqu’un paie pour le temps GPU en dessous. Les niveaux gratuits permanents plafonnent les requêtes plutôt que les dollars ; les crédits d’inscription plafonnent les dollars plutôt que les requêtes ; l’auto-hébergement supprime les deux plafonds mais vous remet la facture d’infrastructure et le travail opérationnel.
Conclusion
Oui – des API LLM open source gratuites existent aujourd’hui, mais « gratuit » est une étiquette qui recouvre trois offres différentes, pas une seule. Les niveaux gratuits permanents (OpenRouter, Groq, les modèles à prix 0 $ tournants de Novita AI) n’expirent jamais mais plafonnent votre débit de requêtes ou de tokens. Les crédits d’inscription (parrainage de Novita AI, points de terminaison exonérés de prépaiement de Together AI, Hugging Face, DeepInfra) vous donnent une allocation en dollars réels qui s’épuise une fois que vous l’avez dépassée. L’auto-hébergement de poids ouverts depuis le Hub Hugging Face supprime les deux types de plafonds, au prix de l’exécution et du paiement du GPU vous-même. La « l’option gratuite » pour vous dépend de si votre contrainte est les limites de débit, un plafond de dépenses ou l’indépendance à long terme des décisions de tarification d’un fournisseur – et non de la recherche d’un seul fournisseur qui évite les trois compromis à la fois, car aucun ne le fait actuellement.
FAQ
Les API LLM open source sont-elles vraiment gratuites, ou y a-t-il toujours un piège ?
Il y a toujours un piège, et il prend l’une des trois formes : un plafond de requêtes/jour/minute qui n’expire jamais (OpenRouter, Groq), un crédit en dollars qui s’épuise (parrainage Novita AI, minimum 5 $ de Together AI, Hugging Face, DeepInfra), ou l’obligation d’auto-héberger sur votre propre matériel. Savoir quelle forme vous obtenez avant de construire dessus évite la facture surprise ou l’erreur 429 surprise.
Quel fournisseur a le niveau gratuit permanent le plus généreux ?
Le niveau gratuit de Groq offre des plafonds de tokens plus élevés sur certains modèles – jusqu’à 200 000 tokens/jour sur gpt-oss-120b et 500 000 tokens/jour sur les modèles de garde plus petits – comparé au plafond fixe de 50 requêtes/jour d’OpenRouter avant d’ajouter des crédits. Lequel gagne pour vous dépend de si votre goulot d’étranglement est le nombre de requêtes ou le volume de tokens ; une application de chat avec des échanges courts atteint d’abord le plafond de requêtes d’OpenRouter, tandis qu’une charge de travail de résumé par lots atteint d’abord les limites de tokens.
Puis-je combiner les niveaux gratuits de plusieurs fournisseurs pour obtenir plus de capacité ?
Oui, et c’est un modèle courant pour les tests – acheminez différents trafics vers les niveaux gratuits de différents fournisseurs plutôt que de vous fier à un seul. Sachez simplement que la sélection des modèles du niveau gratuit change avec le temps (un modèle qui est :free sur OpenRouter aujourd’hui peut ne plus l’être le trimestre prochain), donc construisez pour le repli entre fournisseurs plutôt que de coder en dur un seul ID de modèle gratuit.
Le crédit de parrainage de 10 $ de Novita AI est-il le même que ses modèles de niveau gratuit ?
Non, ce sont des choses distinctes. Le programme de parrainage est un crédit unique de 10 $ vers la facturation standard par token, plafonné à 500 $ au total tous parrainages confondus. Les modèles de niveau gratuit sont des entrées spécifiques du catalogue au prix de 0 $ par token sur une base continue, indépendamment du fait que vous ayez utilisé un code de parrainage. Consultez le catalogue de modèles en direct pour savoir quels modèles ont actuellement un prix de 0 $, car cette liste tourne au fur et à mesure que de nouveaux modèles sont lancés.
Si j’auto-héberge un modèle open source, est-ce vraiment gratuit ?
Les poids du modèle sont gratuits à télécharger, mais les exécuter ne l’est pas – vous payez pour le calcul GPU, le stockage et votre propre disponibilité au lieu de la tarification API par token. Pour un trafic faible et régulier, cela est généralement plus cher qu’un niveau API payant une fois que vous tenez compte du temps GPU inactif ; cela devient rentable principalement à volume élevé et prévisible, ou lorsque vous avez besoin d’une localisation des données garantie.
