Gibt es kostenlose Open-Source-LLM-API-Schlüssel im Jahr 2026? Ja, aber nicht alle bleiben kostenlos

Gibt es kostenlose Open-Source-LLM-API-Schlüssel im Jahr 2026? Ja, aber nicht alle bleiben kostenlos

Ja – mehrere Anbieter stellen Ihnen einen kostenlosen API-Schlüssel zur Verfügung, um Open-Source-LLMs aufzurufen, aber „kostenlos“ unterteilt sich in drei sehr unterschiedliche Angebote: eine dauerhafte kostenlose Stufe mit Ratenbegrenzungen, die nie abläuft, ein einmaliges Anmeldeguthaben, das aufgebraucht wird, oder Modellgewichte, die Sie selbst herunterladen und hosten müssen. Nachfolgend sind 6 Anbieter aufgeführt, die Stand August 2026 aktiv sind, sortiert nach der Kategorie, in die sie fallen. So können Sie basierend darauf auswählen, wie lange Sie tatsächlich kostenlosen Zugang benötigen, anstatt in der dritten Woche von einer Rechnung überrascht zu werden.

Die kurze Antwort: Ja, mit drei Arten von „Kostenlos“

Wenn Sie heute einen Schlüssel benötigen und keine Karte eingeben möchten, bieten OpenRouter und Groq beide dauerhaften kostenlosen Zugang ohne Ablauf – Sie müssen nur mit Ratenbegrenzungen leben. Wenn Sie vorübergehend einen höheren Durchsatz wünschen, geben Ihnen Together AI, Novita AI und Hugging Face kostenlose Guthaben oder kostenlose Modelle zum Start, stellen Ihnen dann aber eine Rechnung, sobald Sie dieses Kontingent überschritten haben. Wenn Sie nicht von der Betriebszeit oder Preisänderungen eines Anbieters abhängig sein möchten, können Sie Modelle mit offenen Gewichten direkt vom Hugging Face Hub herunterladen und auf Ihrer eigenen Hardware ausführen – das ist kein API-Aufruf an den gehosteten Dienst von Hugging Face, aber es ist die einzige Option, die für immer kostenlos und ohne Ratenbegrenzung ist.

Kostenlos Form 1: Dauerhafte kostenlose LLM-APIs (ratenbegrenzt, laufen nie ab)

Diese verlangen keine Zahlungsinformationen und schalten sich nicht nach einem Testzeitraum ab. Der Haken ist der Durchsatz, nicht die Zeit.

OpenRouter ermöglicht es Ihnen, jedes mit :free gekennzeichnete Modell in seinem Katalog aufzurufen, ohne Guthaben hinzuzufügen, begrenzt auf 20 Anfragen pro Minute und 50 Anfragen pro Tag. Wenn Sie $10 an Guthaben kaufen (einmalig, sie verfallen nicht), steigt die tägliche Obergrenze auf 1.000 Anfragen, die Grenze pro Minute bleibt unverändert. Zum Zeitpunkt der Erstellung dieses Artikels listet OpenRouter 17 Modelle unter dem Suffix :free, darunter Z.ai’s GLM-5.2, Googles Gemma 4 (26B- und 31B-Varianten) und mehrere Nvidia Nemotron-Modelle. (Geprüft am 2026-08-18 über openrouter.ai/api/v1/models und die Rate-Limits-Dokumentation der Plattform unter openrouter.ai/docs/api_reference/limits.)

Groq verlangt keine Kreditkarte für seine kostenlose Stufe und schränkt sie auch nicht durch ein Testfenster ein, aber jedes Modell hat seine eigenen Anfrage- und Token-Obergrenzen pro Minute und pro Tag. Beispielsweise ist openai/gpt-oss-120b auf 30 Anfragen/Minute, 1.000 Anfragen/Tag, 8.000 Token/Minute und 200.000 Token/Tag in der kostenlosen Stufe begrenzt – kleine Textmodelle wie die Llama Prompt Guard-Varianten haben viel höhere Token-Obergrenzen (500.000 Token/Tag). Zahlende Kunden in der „On-Demand“-Stufe erhalten etwa das 30- bis 40-fache an Anfrage- und Token-Spielraum, aber die kostenlose Stufe selbst läuft nicht ab. (Geprüft am 2026-08-18 über Groqs veröffentlichte Rate-Limits-Tabelle.)

Novita AI behält einen rotierenden Satz von Modellen mit offenen Gewichten bei, die zu $0 pro Token als ständiger Bestandteil seines Katalogs angeboten werden (keine zeitlich begrenzte Aktion) – derzeit Qwen3.5-Plus, Qwen3.6-Plus und Bunny, jeweils zu 0/0 Input/Output-Preisen laut der aktuellen Modellliste. Dies ist getrennt von Novitas spezieller Zusammenstellung kostenloser Modelle, die Llama, Qwen, GLM und BGE-M3 abdeckt, und getrennt vom plattformweiten Empfehlungsprogramm weiter unten. Die Auswahl der Modelle in der kostenlosen Stufe rotiert hier, wenn neue Modelle eingeführt werden und ältere in die kostenpflichtige Preisgestaltung übergehen. Überprüfen Sie daher den aktuellen Katalog, anstatt anzunehmen, dass ein bestimmtes Modell kostenlos bleibt. (Geprüft am 2026-08-18 über api.novita.ai/openai/v1/models.)

Kostenlos Form 2: Anmeldeguthaben-LLM-APIs (begrenzter Betrag, dann zahlen Sie)

Dies ist die häufigste „kostenlose“ Variante, auf die Sie stoßen werden, und sie überrascht die Leute – der Zähler läuft ab dem ersten Tag, er beginnt nur bei null.

Novita AIs Empfehlungsprogramm gibt $10 an LLM-API-Guthaben sowohl für den Empfehlenden als auch für den Neuanmelder, mit einer angegebenen Obergrenze von bis zu $500 insgesamt, das durch Empfehlungen verdient werden kann. Das ist eine Guthabenaufladung, keine ratenbegrenzte Stufe – sobald die $10 verbraucht sind, gelten die standardmäßigen Preise pro Token. (Geprüft am 2026-08-18 über novita.ai/referral.)

Together AI hat seine allgemeine kostenlose Testversion im Juli 2025 im Rahmen einer Abrechnungsänderung entfernt – neue Konten benötigen jetzt ein Mindestguthaben von $5, bevor sie Anrufe tätigen können. Es betreibt jedoch bestimmte Modell-Endpunkte, die außerhalb dieser Vorauszahlungsanforderung zu $0,00/1M Token angeboten werden, wie z.B. Prism-ML’s Ternary-Bonsai-27B, ein 27B-Modell mit offenen Gewichten und einem 262K-Kontextfenster. Startups können sich separat für bis zu $50.000 an Guthaben durch sein Startup Accelerator-Programm bewerben, was ein Bewerbungsprozess und kein Anmeldevorteil ist. (Geprüft am 2026-08-18 über den Preiseblock von together.ai/models/prism-ml-ternary-bonsai-27b und die Abrechnungsdokumente von Together AI.)

Hugging Faces Inference Providers ist eine gehostete API – Sie rufen sie aus der Ferne mit einem Hugging Face-Zugriffstoken auf, genauso wie Sie OpenRouter oder Together AI aufrufen würden, und Hugging Face leitet die Anfrage an den zugrunde liegenden Anbieter weiter und stellt Ihnen die Rechnung. Jeder kostenlose Account erhält automatisch $0,10 pro Monat an Guthaben, das auf dem PRO-Plan für $9/Monat auf $2,00/Monat ansteigt. Das reicht für leichte Tests kleiner Modelle, nicht für Produktionsverkehr – das Guthaben wird monatlich erneuert, anstatt eine einmalige Zuwendung zu sein, aber die Menge ist klein genug, dass die meisten echten Arbeitslasten es innerhalb weniger Anfragen aufbrauchen. (Geprüft am 2026-08-18 über huggingface.co/docs/api-inference/en/pricing.)

DeepInfra wirbt auf seiner Preisseite mit „$10 USD kostenlos pro Monat“, strukturiert als wiederkehrendes monatliches Guthaben und nicht als einmaliger Anmeldebonus. (Geprüft am 2026-08-18 über deepinfra.com/pricing.)

Kostenlos Form 3: Selbst gehostete Open-Source-LLMs (kein API, keine Rechnung, keine Ratenbegrenzung)

Dies ist überhaupt kein API-Schlüssel – es bedeutet, die Modellgewichte selbst herunterzuladen und auf eigener Hardware auszuführen, z.B. mit vLLM, Ollama oder llama.cpp. Der Hugging Face Hub ist die primäre Verteilungsstelle für Veröffentlichungen mit offenen Gewichten (Llama, Qwen, GLM und die meisten anderen Open-Source-Familien veröffentlichen ihre Gewichte dort) – das ist eine andere Sache als die oben beschriebene gehostete Inference Providers-API von Hugging Face; der Hub hostet lediglich die Dateien. Sie zahlen für Rechenzeit statt für Token, und es gibt keine Ratenbegrenzung, da es keinen gemeinsam genutzten Dienst gibt – aber Sie sind für die GPU, den Serving-Stapel und die Betriebszeit verantwortlich. Dieser Weg ist sinnvoll, wenn Sie garantierte Verfügbarkeit benötiten oder ein so großes Volumen verarbeiten, dass eine gemietete GPU günstiger ist als die Preisgestaltung pro Token; es ist die falsche Wahl, wenn Sie nur heute Nachmittag ein Modell testen möchten.

Vergleich der kostenlosen LLM-API-Anbieter

Anbieter Kostenlos-Typ Was Sie bekommen Läuft ab?
OpenRouter Dauerhafte kostenlose Stufe 50 Anf./Tag (oder 1.000/Tag nach $10-Guthabenkauf), 20 Anf./Min, nur :free Modelle Nein
Groq Dauerhafte kostenlose Stufe Pro-Modell RPM/RPD/TPM/TPD-Obergrenzen, z.B. 1.000 Anf./Tag bei gpt-oss-120b Nein
Novita AI (kostenlose Modelle) Dauerhafte kostenlose Stufe Ausgewählte Open-Modelle zu $0/M Token, Katalog rotiert Nein, aber Modelliste ändert sich
Novita AI (Empfehlung) Anmeldeguthaben $10 Guthaben pro Empfehlung, Deckel $500 insgesamt Ja, sobald verbraucht
Together AI Anmeldeguthaben + kostenlose Endpunkte $5 Vorauszahlungsminimum für allgemeine Nutzung; bestimmte $0,00/M Modell-Endpunkte (z.B. Ternary-Bonsai-27B) Kostenlose Endpunkte: Nein. Allgemeines Guthaben: seit Jul 2025 nicht mehr angeboten
Hugging Face (Inference Providers, gehostete API) Anmeldeguthaben (monatlich) $0,10/Monat kostenlos, $2,00/Monat auf PRO Erneuet sich monatlich, geringer Betrag
DeepInfra Anmeldeguthaben (monatlich) $10 USD kostenlos pro Mónat Erneuet sich monatlich
Selbst gehostet (Gewichte vom Hugging Face Húb) Kein API Volle Modellgewichte, ausgeführt auf eigener GPU Nie, aber auch kein API-/Ratenbegrenzungsvorteil

Welche kostenlose LLM-API sollten Sie tatsächlich nutzen?

Wenn Sie prototypen und null Einrichtungsaufwand wünschen, beginnen Sie mit OpenRouter oder Groq – keine Karte, kein Ablauf, und Sie werden innerhalb einer Stunde wissen, ob die Ratenbegrenzung für Ihren Anwendungsfall eine echte Einschränkung darstellt. Wenn Sie etwas bauen, das einen gleichmäßigen Durchsatz benötigt, bevor Sie bereit sind zu zahlen, verschafft Ihnen ein Anmeldeguthaben wie Novitas AI-Empfehlungs-$10 oder Together AIs $0,00-bepreisste Modellendpunkte echten Testspielraum ohne die engen Grenzen pro Minute, die dauerhafte kostenlose Stufen auferlegen. Wenn Sie bereits auf ein bestimmtes Modell festgelegt sind und es unbegrenzt laufen lassen müssen, ohne von den Ratenbegrenzungen oder Preisänderungen eines Anbieters abhängig zu sein, laden Sie die Gewichte vom Hugging Face Húb herunter und hosten Sie selbst.

Keines von dem ist „für immer kostenlos ohne Grenzen“ – diese Kombination existiert nicht für gehostete APIs, weil jemand für die GPU-Zeit darunter zahlt. Dauerhafte kostenlose Stufen begrenzen Anfrgen anstelle von Dollar; Anmeldeguthaben begrenzen Dollar anstelle von Anfrgen; selbst hosting entfernt beide Begrenzungen, gibt Ihnen aber die Infrastrukturrechnung und die Betriebsarbei stattdessen.

Fazit

Ja – kostenlose Open-Source-LLM-APIs existieren heute, aber „kostenlos“ ist ein Label, das drei verschiedene Angebote abdeckt, nicht eines. Dauerhafte kostenlose Stufen (OpenRouter, Groq, Novita AIs rotierende $0-bepreisste Modelle) laufen nie ab, begrenzen aber Ihren Anfrge- oder Token-Durchsatz. Anmeldeguthaben (Novita AIs Empfehlung, Together AIs vorauszahlungsbefreite Endpunkte, Hugging Face, DeepInfra) geben Ihnen eine echte Dollarzulage, die aufgebraucht ist, sobald Sie sie überschritten haben. Das Selbsthosten offener Gewichte vom Hugging Face-Hub entfernt beide Arten von Begrenzungen vollständig, auf Kosten des Betriebs und der Bezahlung der GPU selbst. Welche für Sie „die kostenlose Option“ ist, hängt davon ab, ob Ihre Einschränkung Ratenbegrenzungen, eine Ausgabengrenze oder die langfristige Unabhängigkeit von den Preisentscheidungen eines Anbieters ist – nicht davon, einen einzigen Anbieter zu finden, der alle drei Kompromisse gleichzeitig vermeidet, denn das tut derzeit keiner.

Wenn GLM die Modellfamilie ist, die Sie bewerten, vergleichen Sie die derzeit verfügbaren kostenlosen GLM-API-Kanäle anstatt anzunehmmen, dass ein kostenloses Label für jedes GLM-Modell gilt.

FAQ

Sind Open-Source-LLM-APIs wirklich kostenlos, oder gibt es immmer ein en Haken?

Es gibt immmer einen Haken, und er hat eine von drei Formen: eine Anfrge-pro-Tag/-Minute-Begrenzung, die nie abläuft (OpenRouter, Groq), ein Dollar-Guthaben, das aufgebraucht wird (Novita AIs Empfehlung, Together AIs $5-Mindestguthaben, Hugging Face, DeepInfra), oder die Nötigung, selbst auf eigener Hardware zu hosten. Zu wissen, welche Form Sie erhalen, bevor Sie darauf aufbauen, verhindert die Überraschungsrechnung oder den überraschenden 429-Fehler.

Welcher Anbieter hat die großzügigste dauerhafte kostenlose Stufe?

Groqs kostenlose Stufe bietet bei einigen Modellen höhere Token-Obergrenzen – bis zu 200.000 Token/Tag bei gpt-oss-120b und 500.000 Token/Tag bei kleineren Guard-Modellen – im Vergleich zu OpenRouters pauschaler 50-Anfrge-pro-Tag-Begrenzung, bevor Sie Guthaben hizufügen. Welcher für Sie gewinnt, hängt davon ab, ob Ihr Engpass die Anfrgeanzahl oder das Tokenvolumen ist; eine Chat-App mit kurzen Austäuschen stößt zuerst auf OpenRouters Anfrge-Begrenzung, wärend eine Batch-Zusammenfassungs-Arbeitslast zuerst auf Token-Begrenzungen stößt.

Kan ich kostenlose Stufen über meherere Anbieter hinweg kombinieren, um mehr Kapazität zu erhalen?

Ja, und es ist ein übliches Muster zum Testen – leiten Sie verschiedenen Verkehr zu den kostenlosen Stufen verschiedener Anbieter, anstatt sich auf einen zu verlassen. Beachten Sie jedoch, dass sich die Auswahl kostenloser Modelle im Laufe der Zeit ändert (ein Modell, das heute auf OpenRouter :free ist, kan nächtes Quartal anders sein), daher bauen Sie auf Anbieter-Fallback, anstatt eine bestimmte kostenlose Modell-ID hart zu codieren.

Ist Novita AIs $10-Empfehlungsguthaben dasselbe wie seine kostenlosen Modelle?

Nein, das sind getrennte Dinge. Das Empfehlungsprogramm ist ein einmaliges $10-Guthaben für die standardmäße Abrechnung pro Token, gedeckelt auf $500 insgesamt über alle Empfehlungen hinweg. Die kostenlosen Modelle sind spezifische Katalogeinträge, die fortlaufend zu $0 pro Token angeboten werden, unabhängig davon, ob Sie einen Empfehlungscode verwendet haben. Prüfen Sie den aktuellen Modellkatalog, welche Modelle derzeit $0-Preise haben, da sich diese Liste ändert, wenn neue Modelle starten.

Wenn ich ein Open-Source-Modell selbst hoste, ist es dann wirklich kostenlos?

Die Modellgewichte sind kostenlos herunterzuladen, aber sie auszuführen nicht – Sie zahlen für GPU-Rechenzeit, Speicher und Ihre eigene Betriebszeit statt für die API-Preisgestaltung pro Token. Bei geringem, stetigem Verkehr ist dies in der Regel teurer als eine bezahlte API-Stufe, sobald Sie die GPU-Leerlaufzeit berücksichtigen; lohnend wird es hauptsächlich bei hohem, vorhersagbarem Volumen oder wenn Sie eine garantierte Datenlokalität benötigen.

Empfohlene Artikel