Kostenlose LLM-API-Optionen im Jahr 2026: Echte Ratenbegrenzungen und Guthaben im Vergleich

Kostenlose LLM-API-Optionen im Jahr 2026: Echte Ratenbegrenzungen und Guthaben im Vergleich

Die meisten „kostenlosen“ LLM-API-Stufen sind kein unbegrenzter Zugang, sondern ein gedrosseltes Modell, ein tägliches Anfragekontingent oder eine Empfehlungsgutschrift. Dieser Vergleich umfasst sechs Anbieter, jeweils mit einer überprüften Free-Tier-Mechanik und einer konkreten Zahl, sodass Sie genau sehen, was „kostenlos“ bedeutet, bevor Sie darauf aufbauen.

Kurzvergleich der kostenlosen LLM-APIs

Anbieter Free-Tier-Typ Konkrete Grenze Modellabdeckung
Novita AI Empfehlungsgutschrift (beide Seiten) 10 $ Guthaben für den Empfehlenden und das neue geworbene Konto pro erfolgreicher Empfehlung, bis zu 500 $ insgesamt Vollständiger serverloser LLM-API-Katalog
OpenRouter Ratenbegrenzte kostenlose Modellvarianten 20 Anfragen/Minute; 50 Anfragen/Tag ohne gekauftes Guthaben, 1.000 Anfragen/Tag mit 10 $+ Lebenszeitguthaben 17 von 414 Katalogmodellen haben eine :free-Variante
Google Gemini API Kostenlose Flaggschiff-Token; Grounding erfordert Abrechnung 0 $ pro Token (Input/Output/Context Caching) auf Gemini 3.7 Flash ohne aktivierte Abrechnung; Grounding mit Google Suche ist erst nach Aktivierung der Abrechnung verfügbar, dann auf 5.000 Anfragen/Monat begrenzt Gemini 3.x-Modellfamilie
Groq Ratenbegrenzter Free Tier, pro Modell 30 Anfragen/Minute, 1.000 Anfragen/Tag, 200.000 Token/Tag auf openai/gpt-oss-120b 13 gehostete Modelle in Produktions- und Vorschau-Stufen
Cloudflare Workers AI Tägliches Rechenkontingent 10.000 Neuronen/Tag kostenlos auf Free- und Paid-Workers-Plänen 84 gehostete Modelle (Stand 18.08.2026, Katalog wird fortlaufend aktualisiert)
Hugging Face Inference Providers Monatliches Guthaben 0,10 $/Monat für Free-Tier-Konten Hunderte Modelle von 18 Partner-Inferenzanbietern

Wichtigste Erkenntnisse

  • Kein Anbieter in dieser Liste gewährt unbegrenzten kostenlosen Zugriff auf seine LLM-API. Jeder Free Tier ist durch eine Anfragebegrenzung, eine tägliche Obergrenze oder ein Guthaben in Dollar eingeschränkt.
  • Guthabenbasierte Free Tiers (Novita AI, Hugging Face) begrenzen Anfragen pro Minute nicht; ratenbegrenzte Free Tiers (OpenRouter, Groq) tun dies, und die Obergrenze ist modellspezifisch.
  • Die :free-Varianten von OpenRouter existieren nur für eine Minderheit seines Katalogs (17 von 414 Modellen zum Zeitpunkt der Überprüfung), nicht für den gesamten Marktplatz.
  • Der Free Tier von Google ist modell- und funktionsspezifisch: Die Token-Preise für das aktuelle Flaggschiff-Modell Flash betragen 0 $ bei deaktivierter Abrechnung, aber die Grounding-Funktion mit der Google-Suche ist in dieser Stufe ohne Abrechnung überhaupt nicht enthalten – sie wird erst verfügbar, wenn Sie die Abrechnung aktivieren, und unterliegt dann einer eigenen monatlichen Obergrenze.
  • Die Zahlen der Free Tiers ändern sich oft ohne große Vorankündigung. Jede Zahl unten hat eine Quelle und ein Prüfdatum; überprüfen Sie alles erneut, bevor Sie eine Produktionsabhängigkeit aufbauen.

Wie wir diese kostenlosen LLM-APIs verglichen haben

Die meisten existierenden Zusammenstellungen zu „kostenlosen LLM-APIs“ lassen entweder konkrete Zahlen vermissen, ignorieren Novita AI ganz oder sind zwischen den Updates veraltet. Dieser Vergleich verwendet drei Prüfungen für jede Zeile:

  1. Eine genannte Free-Tier-Mechanik. Der kostenlose Zugang jedes Anbieters fällt in eine von drei Formen: eine einmalige Anmelde- oder Empfehlungsgutschrift, ein ratenbegrenztes kostenloses Modell oder ein tägliches Rechen-/Anfragekontingent.
  2. Eine überprüfte numerische Grenze. Jede Angabe zu Anfragen pro Minute, Anfragen pro Tag, Dollar-Beträgen oder Token-Obergrenzen stammt aus der aktuellen Preis- oder Ratenbegrenzungsdokumentation des Anbieters, nicht aus einem Blogbeitrag aus zweiter Hand.
  3. Live-Status zum Prüfzeitpunkt. Die Bedingungen der Free Tiers ändern sich häufig (OpenRouters Schwelle für höhere tägliche Limits, Googles modellspezifische kostenlose Preise und Cloudflares Neuronenzuteilung haben sich in früheren Zyklen alle geändert), daher ist jede Zahl unten mit einem Datum versehen.

Die Anbieter sind nach der ungefähren Größe ihres täglichen kostenlosen Kontingents geordnet, sofern eines veröffentlicht ist; guthabenbasierte Stufen (die nicht durch die Anzahl der Anfragen begrenzt sind) werden stattdessen nach ihrer Dollar-Obergrenze einsortiert.

Detaillierter Vergleich der kostenlosen LLM-APIs

Cloudflare Workers AI: Größtes tägliches Rohkontingent

Cloudflares Workers AI gibt jedem Konto, einschließlich des kostenlosen Workers-Plans, eine feste tägliche Zuteilung von Neuronen, anstatt einer modellspezifischen Anfragebegrenzung. Zum Zeitpunkt der Überprüfung betrug diese Zuteilung 10.000 Neuronen pro Tag kostenlos; die darüber hinausgehende Nutzung wird im Paid-Plan mit 0,011 $ pro 1.000 Neuronen abgerechnet. Die Neuronenkosten variieren je nach Modell, daher entsprechen 10.000 Neuronen je nach aufgerufenem Modell einer unterschiedlichen Anzahl tatsächlicher Anfragen.

Am besten geeignet für: Teams, die bereits auf Cloudflare Workers laufen und Inferenz in dieselbe Plattform integrieren möchten. Achtung: Das kostenlose Kontingent wird in Neuronen gemessen, nicht in Anfragen. Ein großes Modell oder eines mit langem Kontext verbraucht es schneller als ein kleines.

OpenRouter: Breitester Katalog, schmale kostenlose Nische

OpenRouter leitet zu Hunderten von Modellen vieler Anbieter weiter, aber nur ein Teil davon trägt das Suffix :free. Zum Zeitpunkt der Überprüfung hatten 17 von 414 Katalogmodellen eine kostenlose Variante. Kostenlose Varianten sind auf 20 Anfragen pro Minute begrenzt; die tägliche Obergrenze hängt von den lebenslangen Guthabenkäufen Ihres Kontos ab: 50 Anfragen pro Tag, wenn Sie insgesamt weniger als 10 $ an Guthaben gekauft haben, steigend auf 1.000 Anfragen pro Tag, sobald Sie mindestens 10 $ gekauft haben.

Am besten geeignet für: Das Testen eines bestimmten Open-Weight-Modells, das zufällig eine :free-Variante hat, ohne sich auf einen Anbieter festzulegen. Achtung: Die kostenlose Nische ist ein kleiner Bruchteil des Katalogs, und die brauchbare tägliche Obergrenze erfordert einen einmaligen Guthabenkauf von 10 $, nicht nur eine Anmeldung.

Groq: Schnellste Inferenz, kleinster Katalog

Der Free Tier von Groq ist pro Modell ratenbegrenzt, nicht kontoweit. Für openai/gpt-oss-120b liegen die veröffentlichten Grenzen bei 30 Anfragen pro Minute, 1.000 Anfragen pro Tag, 8.000 Token pro Minute und 200.000 Token pro Tag. Andere gehostete Modelle im Free Tier von Groq haben ihre eigenen separaten Grenzen.

Am besten geeignet für: Prototyping mit geringer Latenz, bei dem die Inferenzgeschwindigkeit von Groq wichtiger ist als die Modellbreite. Achtung: Die Grenzen sind pro Modell festgelegt, daher kann ein Modellwechsel während eines Projekts bedeuten, dass Sie die Grenzwerttabelle erneut lesen müssen.

Google Gemini API: Kostenlose Flaggschiff-Token, enge Grounding-Obergrenze

Der Free Tier von Gemini wird pro Modell und pro Funktion bepreist, nicht als pauschales Kontingent. Beim aktuellen Flaggschiff-Modell Gemini 3.7 Flash sind die Preise für Input, Output und Context Caching alle als kostenlos aufgeführt, solange die Abrechnung auf dem Konto nicht aktiviert ist. Grounding mit der Google-Suche, eine separate Zusatzfunktion, ist bei deaktivierter Abrechnung überhaupt nicht verfügbar; sie wird erst nutzbar, wenn Sie die Abrechnung einschalten. Dann enthält die kostenpflichtige Stufe 5.000 kostenlose Grounding-Anfragen pro Monat, die auf die gesamte Gemini 3.x-Modellfamilie aufgeteilt werden, und wird danach mit 14 $ pro 1.000 Anfragen abgerechnet.

Am besten geeignet für: Teams, die die Token-Kosten für ein aktuelles Flaggschiff-Modell auf 0 $ senken möchten und keine Grounding-Suche ohne aktivierte Abrechnung benötigen. Achtung: Die kostenlose Token-Preisgestaltung und das Grounding mit der Suche sind nicht dieselbe Stufe – Grounding erfordert, dass die Abrechnung aktiviert ist, bevor überhaupt ein Anfragekontingent existiert. Sie können auf einem reinen Konto ohne Abrechnung keine geerdeten Antworten erhalten.

Hugging Face Inference Providers: Kleinstes Guthaben, geringster Aufwand

Jedes Hugging Face-Konto erhält ein monatliches Guthaben für Inference Providers, einen Marktplatz, der zu Inferenz-Backends Dritter für offene Modelle weiterleitet. Free-Tier-Konten erhalten 0,10 $ pro Monat; PRO-Konten erhalten 2,00 $ pro Monat, und Team- oder Enterprise-Konten erhalten 2,00 $ pro Sitzplatz.

Am besten geeignet für: Kurze einmalige Aufrufe eines offenen Modells, das bereits über den Hugging Face-Anbietermarktplatz gehostet wird. Achtung: 0,10 $ pro Monat decken bei den meisten Modellen nur eine kleine Anzahl von Aufrufen; das Guthaben wird monatlich zurückgesetzt, aber nicht übertragen oder aufgestockt.

Novita AI: Kein ratenbegrenztes kostenloses Modell, aber eine echte Empfehlungsgutschrift

Der serverlose LLM-API-Katalog von Novita AI wird pro Modell bepreist, und kein aktuelles Modell in diesem Katalog wird zu 0 $ pro Token angeboten. Der Free-Tier-Mechanismus kommt stattdessen aus dem Empfehlungsprogramm von Novita: Eine erfolgreiche Empfehlung gibt sowohl dem Empfehlenden als auch dem neuen geworbenen Konto 10 $ an LLM-API-Guthaben, bis zu 500 $ insgesamt für einen einzelnen Empfehlenden. Dieses Guthaben gilt für den gesamten serverlosen Modellkatalog von Novita, nicht nur für ein einzelnes Free-Tier-Modell. Daher ist es nicht durch Anfragen pro Minute oder pro Tag begrenzt, wie es bei den Free Tiers von OpenRouter oder Groq der Fall ist.

Am besten geeignet für: Entwickler, die kostenlose Nutzung zu produktionsreifen Modellpreisen und -verfügbarkeit wünschen, anstatt ein separates, eingeschränkteres Free-Tier-Modell. Achtung: Das Guthaben ist an Empfehlungen gebunden, kein automatischer Bonus bei jeder neuen Anmeldung, und es ist ein Ausgabenkontingent, kein unbegrenztes kostenloses Modell; sobald es aufgebraucht ist, gelten die Standard-Token-Preise. Überprüfen Sie immer die aktuelle Preisseite von Novita für aktuelle Tarife, bevor Sie abschätzen, wie weit ein bestimmtes Guthaben reicht.

So wählen Sie die richtige kostenlose LLM-API

Passen Sie den Free-Tier-Mechanismus an das an, was Sie tatsächlich tun:

  • Viele kleine Testaufrufe gegen ein einzelnes offenes Modell: Ein ratenbegrenzter Free Tier (OpenRouters :free-Varianten oder Groq) bringt echtes Anfragevolumen, ohne etwas auszugeben, solange das spezifische Modell, das Sie benötigen, eine kostenlose Variante hat.
  • Prototyping gegen ein Produktionsmodell, das Sie später ausliefern könnten: Eine Empfehlungsgutschrift (Novita AI) ermöglicht es Ihnen, denselben Katalog und dieselben Preise zu nutzen, die Sie auch in der Produktion verwenden würden, anstatt die Modelle zu wechseln, wenn Sie von einem Free Tier aufsteigen.
  • Schnelles Testen mehrerer Anbieter oder Modelle: Das Guthaben von Hugging Faces Inference Providers ist klein, erfordert aber den geringsten Einrichtungsaufwand, wenn Sie bereits ein Konto haben.
  • Sie benötigen suchbasierte Antworten, nicht nur reine Modellaufrufe: Überprüfen Sie speziell die Grounding-Obergrenze von Google. Sie ist im Free Tier ohne Abrechnung überhaupt nicht enthalten – Sie müssen die Abrechnung aktivieren, bevor Grounding-Anfragen gegen eine (kostenpflichtige) monatliche Obergrenze gezählt werden.

Egal für welche Stufe Sie sich entscheiden, lesen Sie die aktuelle Ratenbegrenzungs- oder Preisseite des Anbieters, bevor Sie etwas aufbauen; jede Zahl oben hat ein Prüfdatum, und die Bedingungen der Free Tiers gehören zu den am häufigsten überarbeiteten Seiten auf jeder Inferenzplattform.

Für wen dieser Vergleich nicht geeignet ist

Keine der oben genannten Stufen ist dafür ausgelegt, Produktionstraffic zu bewältigen. Wenn Ihre Anwendung bereits mehr als ein paar tausend Anfragen pro Tag regelmäßig benötigt, eine Support-SLA oder Zugang zu geschlossenen Frontier-Modellen wie GPT-5 oder Claude erfordert, bietet keiner der sechs hier genannten Anbieter das in einem kostenlosen Plan an – Sie müssen in jedem Fall bezahlte Nutzung in Betracht ziehen. Dieser Vergleich ersetzt auch nicht das Lesen der aktuellen Geschäftsbedingungen des Anbieters, bevor Sie etwas ausliefern: Er zeigt, wie die jeweilige kostenlose Stufe am Prüfdatum aussah, nicht wie sie aussehen wird, wenn Sie die Kapazität tatsächlich benötigen.

Kostenloses Guthaben auf Novita AI nutzen

So verwenden Sie das Empfehlungsguthaben von Novita AI:

  1. Erstellen Sie ein Novita AI-Konto über den Empfehlungslink eines Freundes, oder laden Sie einen Freund mit Ihrem eigenen Link ein, damit beide Seiten die 10 $ Empfehlungsgutschrift erhalten.
  2. Generieren Sie einen API-Schlüssel aus der Novita AI-Konsole.
  3. Rufen Sie ein beliebiges Modell im serverlosen LLM-API-Katalog über den OpenAI-kompatiblen Endpunkt unter https://api.novita.ai/openai/v1/chat/completions auf, indem Sie Ihren API-Schlüssel und eine Modell-ID aus dem aktuellen Katalog verwenden.
  4. Teilen Sie Ihren Empfehlungslink von der Novita AI-Empfehlungsseite, um pro erfolgreicher Empfehlung 10 $ Guthaben zu erhalten, bis zu insgesamt 500 $.
curl https://api.novita.ai/openai/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer <NOVITA_API_KEY>" \
  -d '{
    "model": "<MODEL_ID>",
    "messages": [{"role": "user", "content": "Hallo"}],
    "max_tokens": 512
  }'

Überprüfen Sie den Novita AI-Modellkatalog auf aktuelle Modell-IDs und modellspezifische Preise, bevor Sie Guthaben für ein bestimmtes Modell ausgeben.

Hinweise zu Preisen, Lizenz und Verfügbarkeit

Die Bedingungen der Free Tiers in diesem Vergleich wurden am 18.08.2026 direkt anhand der Preis- oder Ratenbegrenzungsdokumentation jedes Anbieters überprüft. Anmelde-Boni, Empfehlungsobergrenzen, Ratenbegrenzungen und tägliche Kontingente sind Details, die Anbieter im Rahmen normaler Produktupdates ändern, nicht immer mit einem Changelog-Eintrag. Überprüfen Sie die Quellseite für jeden Anbieter erneut, bevor Sie sich bei der Produktionsplanung auf eine bestimmte Zahl verlassen, und behandeln Sie jede Zahl oben als Momentaufnahme, nicht als dauerhafte Garantie.

Entscheidungscheckliste für Entwickler

  • [ ] Bestätigen Sie, welche Free-Tier-Form zutrifft (Anmeldeguthaben, Empfehlungsguthaben, ratenbegrenztes kostenloses Modell oder tägliches Rechenkontingent).
  • [ ] Bestätigen Sie, dass das tatsächlich benötigte Modell von diesem Free Tier abgedeckt wird, nicht nur der Anbieter im Allgemeinen.
  • [ ] Bestätigen Sie die spezifische numerische Grenze (Anfragen/Minute, Anfragen/Tag, Token/Tag oder Dollar-Guthaben) in der aktuellen Dokumentation des Anbieters, nicht in diesem Artikel, bevor Sie etwas ausliefern, das davon abhängt.
  • [ ] Bestätigen Sie, ob der Free Tier einen gekauften Guthabenschwellenwert erfordert, bevor höhere Grenzen gelten (wie bei OpenRouter).
  • [ ] Planen Sie, was passiert, wenn der Free Tier aufgebraucht ist: Setzt die Abrechnung einfach ein oder wird die Anfrage abgelehnt?

FAQ

Gibt es eine wirklich unbegrenzte kostenlose LLM-API?

Nein. Jeder hier verglichene Anbieter begrenzt die kostenlose Nutzung durch eine Ratenbegrenzung, eine tägliche Obergrenze oder ein Dollar-Guthaben. Als „kostenlos“ vermarktete Anbieter beschreiben eine gedeckelte Stufe, keinen unbegrenzten Zugang.

Welche kostenlose LLM-API hat die höchste Anfrage-pro-Tag-Grenze?

Unter den hier überprüften ratenbegrenzten Free Tiers veröffentlichen OpenRouter und Groq beide eine Obergrenze von 1.000 Anfragen pro Tag für ihre jeweiligen Free-Tier-Modelle, sobald die 10 $-Lebenszeitguthaben-Schwelle von OpenRouter erreicht ist. Das Kontingent von 10.000 Neuronen pro Tag bei Cloudflare Workers AI ist ein Rechenbudget und keine feste Anfrageanzahl, daher lässt es sich nicht mit einer einzigen vergleichbaren Anfragezahl gleichsetzen.

Bietet Novita AI ein kostenloses LLM-Modell an?

Der aktuelle serverlose LLM-API-Katalog von Novita AI enthält kein Modell, das mit 0 $ pro Token bepreist ist. Der Free-Tier-Mechanismus ist ein Empfehlungsprogramm, das pro erfolgreicher Empfehlung sowohl dem Empfehlenden als auch dem neuen geworbenen Konto 10 $ Guthaben gibt, bis zu 500 $ insgesamt, das gegen den gesamten serverlosen Katalog eingelöst werden kann.

Gelten die Free-Tier-Grenzen pro API-Schlüssel oder pro Konto?

Dies variiert je nach Anbieter und wird auf der jeweiligen Ratenbegrenzungsseite des Anbieters dokumentiert; Groq gibt beispielsweise an, dass seine Grenzen auf Organisationsebene und nicht pro einzelnen API-Schlüssel gelten. Überprüfen Sie die spezifische Dokumentation des Anbieters für die Unterscheidung zwischen Konto und Schlüssel, bevor Sie ein Pooling-Verhalten von Anfragen annehmen.

Empfohlene Artikel