- Comparaison rapide des API LLM gratuites
- Points clés à retenir
- Comment nous avons comparé ces API LLM gratuites
- Les API LLM gratuites comparées en détail
- Comment choisir la bonne API LLM gratuite
- Utiliser les crédits gratuits sur Novita AI
- Notes sur les tarifs, les licences et la disponibilité
- Checklist de décision pour les développeurs
- FAQ
- Articles recommandés
La plupart des offres « API LLM gratuites » ne sont pas un accès illimité ; ce sont soit un modèle avec limite de débit, soit un quota de requêtes quotidien, soit un crédit de parrainage. Cette comparaison couvre six fournisseurs, chacun avec un mécanisme d’offre gratuite vérifié et un nombre précis associé, afin que vous sachiez exactement ce que « gratuit » vous apporte avant de développer dessus.
Comparaison rapide des API LLM gratuites
| Fournisseur | Type d’offre gratuite | Limite concrète | Couverture des modèles |
|---|---|---|---|
| Novita AI | Crédit de parrainage (des deux côtés) | 10 $ de crédit pour le parrain et le nouveau compte parrainé à chaque parrainage réussi, jusqu’à 500 $ au total | Catalogue complet d’API LLM serverless |
| OpenRouter | Variantes de modèles gratuites avec limite de débit | 20 requêtes/minute ; 50 requêtes/jour sans crédits achetés, 1 000 requêtes/jour avec 10 $ ou plus de crédits à vie | 17 des 414 modèles du catalogue disposent d’une variante :free |
| Google Gemini API | Tokens phares gratuits ; grounding nécessite la facturation | 0 $ par token en entrée/sortie/mise en cache de contexte sur Gemini 3.7 Flash sans facturation activée ; le grounding avec Google Search n’est pas disponible tant que la facturation n’est pas activée, puis plafonné à 5 000 requêtes/mois | Famille de modèles Gemini 3.x |
| Groq | Offre gratuite avec limite de débit, par modèle | 30 requêtes/minute, 1 000 requêtes/jour, 200 000 tokens/jour sur openai/gpt-oss-120b |
14 modèles hébergés entre les niveaux production et preview |
| Cloudflare Workers AI | Allocation de calcul quotidienne | 10 000 Neurons/jour sans frais sur les formules Workers gratuite et payante | 84 modèles hébergés au 2026-08-18 (le catalogue est mis à jour en continu) |
| Hugging Face Inference Providers | Crédit mensuel | 0,10 $/mois pour les comptes de niveau gratuit | Des centaines de modèles auprès de 18 fournisseurs d’inférence partenaires |
Points clés à retenir
- Aucun fournisseur de cette liste n’offre un accès illimité aux API LLM gratuites. Chaque offre gratuite est limitée par un débit de requêtes, un plafond quotidien ou un crédit en dollars.
- Les offres gratuites basées sur des crédits (Novita AI, Hugging Face) ne plafonnent pas les requêtes par minute ; les offres gratuites avec limite de débit (OpenRouter, Groq) le font, et le plafond dépend du modèle.
- Les variantes
:freed’OpenRouter n’existent que pour une minorité de son catalogue (17 des 414 modèles au moment de la vérification), pas pour tout le marketplace. - L’offre gratuite de Google est spécifique au modèle et à la fonctionnalité : le prix des tokens sur le modèle phare Flash actuel est de 0 $ sans facturation activée, mais le grounding Search ne fait pas partie de ce niveau sans facturation — il n’est disponible qu’une fois la facturation activée, avec son propre plafond mensuel séparé.
- Les chiffres des offres gratuites changent sans préavis. Chaque chiffre ci-dessous a une source et une date de vérification ; revérifiez avant de construire une dépendance de production sur l’un d’eux.
Comment nous avons comparé ces API LLM gratuites
La plupart des comparatifs existants sur les « API LLM gratuites » omettent les chiffres concrets, ignorent complètement Novita AI, ou deviennent obsolètes entre deux mises à jour. Cette comparaison repose sur trois vérifications pour chaque ligne :
- Un mécanisme d’offre gratuite explicite. L’accès gratuit de chaque fournisseur se présente sous l’une de ces trois formes : un crédit d’inscription ou de parrainage unique, un modèle gratuit avec limite de débit, ou une allocation quotidienne de calcul/requêtes.
- Une limite numérique vérifiée. Chaque limite de requêtes par minute, requêtes par jour, montant en dollars ou plafond de tokens provient de la documentation tarifaire ou de limites de débit actuelle du fournisseur, et non d’un article de blog de seconde main.
- Un état en direct au moment de la vérification. Les conditions des offres gratuites changent souvent (le seuil d’OpenRouter pour des limites quotidiennes plus élevées, la tarification gratuite par modèle de Google et l’allocation de Neurons de Cloudflare ont tous changé au cours des cycles précédents), donc chaque chiffre ci-dessous est daté.
Les fournisseurs sont classés selon la taille approximative de leur allocation gratuite quotidienne lorsqu’elle est publiée, les niveaux basés sur des crédits (qui ne sont pas plafonnés par le nombre de requêtes) étant placés en fonction de leur plafond en dollars.
Les API LLM gratuites comparées en détail
Cloudflare Workers AI : la plus grande allocation quotidienne brute
Workers AI de Cloudflare donne à chaque compte, y compris la formule Workers gratuite, une allocation quotidienne fixe de Neurons plutôt qu’un plafond de requêtes par modèle. Au moment de la vérification, cette allocation était de 10 000 Neurons par jour sans frais, l’utilisation au-delà étant facturée 0,011 $ par 1 000 Neurons sur la formule payante. Le coût en Neurons varie selon le modèle, donc 10 000 Neurons correspondent à un nombre différent de requêtes réelles selon le modèle que vous appelez.
Idéal pour : les équipes qui utilisent déjà Cloudflare Workers et qui souhaitent intégrer l’inférence dans la même plateforme. Attention : l’allocation gratuite est en Neurons, pas en requêtes, donc un modèle volumineux ou à contexte long la consomme plus rapidement qu’un petit modèle.
OpenRouter : le catalogue le plus large, une part gratuite étroite
OpenRouter achemine vers des centaines de modèles de nombreux fournisseurs, mais seule une partie porte le suffixe :free. Au moment de la vérification, 17 des 414 modèles du catalogue avaient une variante gratuite. Les variantes gratuites sont plafonnées à 20 requêtes par minute ; le plafond quotidien dépend des achats de crédits à vie de votre compte : 50 requêtes par jour si vous avez acheté moins de 10 $ de crédits au total, puis 1 000 requêtes par jour une fois que vous avez acheté au moins 10 $.
Idéal pour : tester un modèle open-weight spécifique qui dispose d’une variante :free, sans vous engager auprès d’un fournisseur.
Attention : la part gratuite est une petite fraction du catalogue, et le plafond quotidien utile nécessite un achat unique de 10 $ de crédits, pas seulement une inscription.
Groq : l’inférence la plus rapide, le plus petit catalogue
L’offre gratuite de Groq est limitée en débit par modèle, et non au niveau du compte. Pour openai/gpt-oss-120b, les limites publiées sont de 30 requêtes par minute, 1 000 requêtes par jour, 8 000 tokens par minute et 200 000 tokens par jour. Les autres modèles hébergés sur l’offre gratuite de Groq ont leurs propres limites séparées.
Idéal pour : le prototypage à faible latence, lorsque la vitesse d’inférence de Groq compte plus que la diversité des modèles. Attention : les limites sont définies par modèle, donc changer de modèle en cours de projet peut impliquer de relire le tableau des limites.
Google Gemini API : des tokens phares gratuits, un plafond de grounding étroit
L’offre gratuite de Gemini est tarifée par modèle et par fonctionnalité plutôt que comme une allocation forfaitaire unique. Sur le modèle phare actuel Gemini 3.7 Flash, le prix d’entrée, le prix de sortie et le prix de mise en cache de contexte sont tous indiqués comme gratuits tant que la facturation n’est pas activée sur le compte. Le grounding avec Google Search, une fonctionnalité complémentaire distincte, n’est pas disponible du tout sans facturation activée ; il ne devient utilisable qu’une fois la facturation activée, auquel cas l’offre payante inclut 5 000 requêtes de grounding gratuites par mois, partagées sur toute la famille de modèles Gemini 3.x, puis facturées à 14 $ par 1 000 requêtes.
Idéal pour : les équipes qui veulent un coût de tokens de 0 $ sur un modèle phare actuel et n’ont pas besoin du grounding Search sans activer la facturation. Attention : la gratuité au niveau des tokens et le grounding Search ne font pas partie du même niveau — le grounding nécessite d’activer la facturation avant qu’une quelconque allocation de requêtes existe, vous ne pouvez donc pas obtenir de réponses avec grounding sur un compte purement sans facturation.
Hugging Face Inference Providers : le crédit le plus petit, une friction minimale
Chaque compte Hugging Face reçoit un crédit mensuel pour Inference Providers, un marketplace qui achemine vers des backends d’inférence tiers pour les modèles ouverts. Les comptes de niveau gratuit reçoivent 0,10 $ par mois ; les comptes PRO reçoivent 2,00 $ par mois, et les comptes Team ou Enterprise reçoivent 2,00 $ par siège.
Idéal pour : des appels ponctuels rapides vers un modèle ouvert déjà hébergé via le marketplace de fournisseurs de Hugging Face. Attention : 0,10 $ par mois couvre un petit nombre d’appels sur la plupart des modèles ; cela se réinitialise chaque mois mais ne se reporte pas et ne se cumule pas.
Novita AI : pas de modèle gratuit avec limite de débit, mais un vrai crédit de parrainage
Le catalogue d’API LLM serverless de Novita AI est tarifé par modèle, et aucun modèle actuel de ce catalogue n’est proposé à 0 $ par token. Le mécanisme d’offre gratuite provient plutôt du programme de parrainage de Novita : un parrainage réussi donne au parrain et au nouveau compte parrainé 10 $ de crédits d’API LLM, jusqu’à 500 $ de crédits au total pour un même parrain. Ce crédit s’applique à l’ensemble du catalogue serverless de Novita plutôt qu’à un seul modèle gratuit, il n’est donc pas plafonné par des requêtes par minute ou par jour comme le sont les offres gratuites d’OpenRouter ou de Groq.
Idéal pour : les développeurs qui veulent une utilisation gratuite sur une tarification et une disponibilité de modèles de niveau production, plutôt qu’un modèle gratuit séparé et plus limité. Attention : le crédit est conditionné au parrainage, ce n’est pas un octroi automatique à chaque nouvelle inscription, et c’est une allocation de dépenses plutôt qu’un modèle gratuit illimité ; une fois épuisé, la tarification standard par token s’applique. Vérifiez toujours la page de tarification actuelle de Novita pour connaître les tarifs en vigueur avant d’estimer jusqu’où un crédit donné ira.
Comment choisir la bonne API LLM gratuite
Faites correspondre le mécanisme de l’offre gratuite à ce que vous faites réellement :
- Vous enchaînez beaucoup de petits appels de test vers un modèle ouvert : une offre gratuite avec limite de débit (les variantes
:freed’OpenRouter ou Groq) vous donne un vrai volume de requêtes sans rien dépenser, tant que le modèle spécifique dont vous avez besoin dispose d’une variante gratuite. - Vous prototypiez avec un modèle de production que vous pourriez utiliser en phase de lancement : un crédit de parrainage (Novita AI) vous permet de dépenser sur le même catalogue et la même tarification que ceux que vous utiliseriez en production, au lieu de changer de modèle lorsque vous quittez une offre gratuite.
- Vous testez rapidement plusieurs fournisseurs ou modèles : le crédit d’Inference Providers de Hugging Face est petit mais nécessite le moins de configuration si vous avez déjà un compte.
- Vous avez besoin de réponses avec grounding par la recherche, pas seulement d’appels de modèles bruts : vérifiez spécifiquement le plafond de grounding de Google. Il n’est pas inclus dans l’offre gratuite sans facturation — vous devez activer la facturation avant que les requêtes de grounding comptent dans un plafond mensuel (de l’offre payante).
Quel que soit le niveau choisi, lisez la page actuelle de limites de débit ou de tarification du fournisseur avant de développer ; chaque chiffre ci-dessus a une date de vérification, et les conditions des offres gratuites sont parmi les pages les plus fréquemment révisées sur toute plateforme d’inférence.
Pour qui cette comparaison n’est pas faite
Aucun des niveaux ci-dessus n’est conçu pour supporter du trafic de production. Si votre application a déjà besoin de plus de quelques milliers de requêtes par jour de manière constante, d’un SLA de support ou d’un accès à des modèles frontaliers fermés comme GPT-5 ou Claude, aucun des six fournisseurs ici ne l’offre dans un plan gratuit — vous devrez de toute façon passer à une utilisation payante, quel que soit celui que vous choisissez. Cette comparaison ne remplace pas non plus la lecture des conditions actuelles du fournisseur avant de livrer : elle vous indique à quoi ressemblait chaque offre gratuite à la date de vérification, pas à quoi elle ressemblera lorsque vous aurez réellement besoin de la capacité.
Utiliser les crédits gratuits sur Novita AI
Pour utiliser le crédit de parrainage de Novita AI :
- Créez un compte Novita AI via le lien de parrainage d’un ami, ou invitez un ami avec votre propre lien, afin que les deux côtés reçoivent le crédit de parrainage de 10 $.
- Générez une clé API depuis la console Novita AI.
- Appelez n’importe quel modèle du catalogue d’API LLM serverless via l’endpoint compatible OpenAI à l’adresse
https://api.novita.ai/openai/v1/chat/completions, en utilisant votre clé API et un ID de modèle du catalogue actuel. - Partagez votre lien de parrainage depuis la page de parrainage Novita AI pour ajouter 10 $ de crédit à chaque parrainage réussi, jusqu’à 500 $ au total.
curl https://api.novita.ai/openai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer <NOVITA_API_KEY>" \
-d '{
"model": "<MODEL_ID>",
"messages": [{"role": "user", "content": "Hello"}],
"max_tokens": 512
}'
Consultez le catalogue de modèles Novita AI pour connaître les ID de modèles actuels et la tarification par modèle avant de dépenser du crédit sur un modèle spécifique.
Notes sur les tarifs, les licences et la disponibilité
Les conditions des offres gratuites de cette comparaison ont été vérifiées le 2026-08-18 directement sur la documentation tarifaire ou de limites de débit de chaque fournisseur. Les crédits d’inscription, les plafonds de parrainage, les limites de débit et les allocations quotidiennes sont le genre de détails que les fournisseurs modifient lors de mises à jour produit normales, pas toujours avec une entrée de changelog. Revérifiez la page source de chaque fournisseur avant de vous fier à un chiffre précis dans la planification de production, et considérez chaque chiffre ci-dessus comme un instantané plutôt qu’une garantie permanente.
Checklist de décision pour les développeurs
- [ ] Confirmez quelle forme d’offre gratuite s’applique (crédit d’inscription, crédit de parrainage, modèle gratuit avec limite de débit ou allocation de calcul quotidienne).
- [ ] Confirmez que le modèle dont vous avez réellement besoin est couvert par cette offre gratuite, pas seulement le fournisseur en général.
- [ ] Confirmez la limite numérique spécifique (requêtes/minute, requêtes/jour, tokens/jour ou crédit en dollars) sur la documentation actuelle du fournisseur, pas dans cet article, avant de livrer quoi que ce soit qui en dépend.
- [ ] Confirmez si l’offre gratuite nécessite un seuil de crédits achetés avant que des limites plus élevées s’appliquent (comme c’est le cas pour OpenRouter).
- [ ] Prévoyez ce qui se passe lorsque l’offre gratuite est épuisée : la tarification s’applique-t-elle simplement, ou la requête est-elle rejetée ?
FAQ
Existe-t-il une API LLM gratuite vraiment illimitée ?
Non. Chaque fournisseur comparé ici limite l’utilisation gratuite par un débit maximal, un plafond quotidien ou un crédit en dollars. Les fournisseurs commercialisés comme « gratuits » décrivent un niveau plafonné, pas un accès illimité.
Quelle API LLM gratuite a la limite de requêtes par jour la plus élevée ?
Parmi les offres gratuites avec limite de débit vérifiées ici, OpenRouter et Groq publient tous deux un plafond de 1 000 requêtes/jour sur leurs modèles d’offre gratuite respectifs, une fois le seuil de 10 $ de crédits à vie d’OpenRouter atteint. L’allocation de 10 000 Neurons/jour de Cloudflare Workers AI est un budget de calcul plutôt qu’un nombre fixe de requêtes, elle ne se traduit donc pas par un nombre de requêtes comparable unique.
Novita AI propose-t-il un modèle LLM gratuit ?
Le catalogue actuel d’API LLM serverless de Novita AI ne répertorie aucun modèle tarifé à 0 $ par token. Son mécanisme d’offre gratuite est un programme de parrainage qui donne 10 $ de crédit au parrain et au nouveau compte parrainé à chaque parrainage réussi, jusqu’à 500 $ au total, utilisables sur l’ensemble du catalogue serverless.
Les limites des offres gratuites s’appliquent-elles par clé API ou par compte ?
Cela varie selon le fournisseur et est documenté sur la page de limites de débit de chaque fournisseur ; Groq, par exemple, indique que ses limites s’appliquent au niveau de l’organisation plutôt que par clé API individuelle. Consultez la documentation du fournisseur concerné pour connaître la distinction compte/clé avant de supposer un comportement de mutualisation des requêtes.
