Ling-3.0-flash ist jetzt über die Novita AI Serverless API als zeitlich begrenzt kostenloses Modell verfügbar, mit einem Preis von $0 für Input und Output, wie am 27. Juli 2026 gelistet. Es handelt sich um ein Textmodell, das für agentische Inferenz entwickelt wurde: 124 Milliarden Gesamtparameter, etwa 5,1 Milliarden aktive Parameter pro Token, ein Kontextfenster von 262.144 Token, Reasoning-Unterstützung und Function Calling über einen OpenAI-kompatiblen Chat-Completions-Workflow. Für Entwickler, die langlebige Agents, Tool-Nutzung oder hochvolumige Automatisierung testen, liegt der unmittelbare Reiz auf der Hand: Sie können ein großes, spärliches Modell evaluieren, ohne während des aktuellen kostenlosen Fensters pro Token zu bezahlen.
Wichtige Erkenntnisse
- Die API ist derzeit kostenlos. Die Ling-3.0-flash Modellseite listet $0 pro Million Input-Token und $0 pro Million Output-Token, mit einem „zeitlich begrenzt kostenlosen“ Label, Stand 27. Juli 2026.
- Es handelt sich um ein hochspärliches 124B MoE-Modell. Etwa 5,1B Parameter sind pro Token aktiv, das sind etwa 4,1 % der Gesamtparameteranzahl.
- Es ist für agentische Inferenz konzipiert. Novitas Modelllisting betont Token-Effizienz und produktionsreife Agent-Workloads unter Token-, Latenz- und Serving-Kostenbeschränkungen.
- Die gehostete API unterstützt langen Kontext und Tool-Nutzung. Das aktuelle Listing zeigt ein Kontextfenster von 262.144 Token, eine maximale Ausgabe von 32.768 Token, Reasoning und Function Calling.
- Behandle den kostenlosen Preis als Evaluierungsfenster, nicht als dauerhafte Zusage. Überprüfe die Live-Modellseite, bevor du Produktionskosten schätzt oder deinen Nutzern einen kostenlosen Dienst versprichst.
Was ist Ling-3.0-flash?
Ling-3.0-flash ist ein spärliches Mixture-of-Experts-Sprachmodell von InclusionAI. Anstatt alle 124B Parameter für jeden Token zu aktivieren, leitet es jeden Token durch etwa 5,1B aktive Parameter. Diese Architektur soll die Kapazität eines großen Modells bewahren, während die Rechenleistung für jeden Inferenzschritt begrenzt wird.
Die aktuelle Novita AI Beschreibung des Modells konzentriert sich auf ein praktisches Ziel statt auf eine Benchmark-Überschrift: mehr nützliche Arbeit innerhalb begrenzter Token-, Latenz- und Serving-Kostenbudgets zu erledigen. Diese Positionierung macht es besonders relevant für Agent-Systeme, bei denen eine Benutzeraktion mehrere Modellaufrufe, Tool-Aufrufe, Planungsschritte und Verifizierungsschritte auslösen kann.
Ling-3.0-flash sollte nicht mit Ling-2.6-flash verwechselt werden. Das neue Modell erhöht die Gesamtparameter von 104B auf 124B, während die aktiven Parameter von 7,4B auf etwa 5,1B reduziert werden. Beide Modelle bieten auf Novita AI langen Kontext, aber Ling-3.0-flash fügt im aktuellen gehosteten Funktionsumfang Reasoning-Unterstützung hinzu und startet mit einem zeitlich begrenzten kostenlosen API-Preis.
Wie ist Ling-3.0-flash auf Novita AI verfügbar?
Novita AI hostet Ling-3.0-flash als serverloses Textgenerierungsmodell. Die genaue Modell-ID ist inclusionai/ling-3.0-flash, und die unterstützte Endpunktfamilie ist Chat Completions. Der Dienst verwendet das gleiche OpenAI-kompatible Anfragemuster, das im gesamten Novita-LLM-Katalog verfügbar ist, sodass Teams das Modell evaluieren können, ohne ein dediziertes Deployment zu erstellen oder Inferenzhardware zu verwalten.
Stand 27. Juli 2026 wird das Modell zu $0 pro Million Input-Token und $0 pro Million Output-Token gelistet. Die Modellseite kennzeichnet das Angebot auch als zeitlich begrenzt kostenlos. Diese Unterscheidung ist wichtig: Ling-3.0-flash ist derzeit kostenlos nutzbar, aber das Listing verspricht nicht, dass der Preis auf unbestimmte Zeit bei null bleibt.
Die sicherste Produktionspraxis ist, diesen Zeitraum als Gelegenheit zu nutzen, um eigene Erkenntnisse zu sammeln. Führe repräsentative Agent-Abläufe durch, erfasse Token-Nutzung und Latenz, teste die Zuverlässigkeit von Function Calls und vergleiche die Antwortqualität mit deinem aktuellen Modell. Wenn sich die Preise später ändern, hast du genügend Daten, um zu entscheiden, ob das Modell für den Workload noch sinnvoll ist.
Ling-3.0-flash Spezifikationen und Preise
| Feld | Aktuelle Details |
|---|---|
| Anzeigename | Ling-3.0-flash |
| Modell-ID | inclusionai/ling-3.0-flash |
| Architektur | 124B-Parameter Mixture-of-Experts; etwa 5,1B aktive Parameter pro Token |
| Zugriff | Serverless API |
| API-Format | OpenAI-kompatible Chat Completions |
| Basis-URL | https://api.novita.ai/openai |
| Endpunkt | /v1/chat/completions über die OpenAI-kompatible Basis-URL |
| Kontextfenster | 262.144 Token |
| Maximale Ausgabe | 32.768 Token |
| Modalitäten | Texteingabe und Textausgabe |
| Gehostete Funktionen | Reasoning und Function Calling |
| Input-Preis | $0 pro 1 M Token, zeitlich begrenzt kostenlos |
| Output-Preis | $0 pro 1 M Token, zeitlich begrenzt kostenlos |
| Beste Eignung | Agent-Evaluierung, Langkontext-Automatisierung, Tool-nutzende Workflows und kostenbewusste Experimente |
Modellverfügbarkeit, Spezifikationen, Preise und API-Details wurden am 27. Juli 2026 anhand der Novita AI Modellseite und der LLM API-Dokumentation überprüft.
Das aktuelle Modelllisting enthält kein öffentliches Benchmark-Paket, keinen Durchsatzgarantie oder detaillierten Trainingsbericht für Ling-3.0-flash. Dieser Artikel weist dem Modell daher kein Intelligenz-Ranking zu und behauptet nicht, dass es ein anderes Modell übertrifft. Für die Produktionsauswahl teste es mit eigenen Prompts und Tools, anstatt die Qualität allein aus der Parameteranzahl abzuleiten.
Wie schneidet der Preis im Vergleich zu ähnlichen MoE-Modellen ab?
Ling-3.0-flash ist ungewöhnlich, weil sein aktueller gehosteter Token-Preis null ist. Für einen nützlicheren Vergleich als „kostenlos versus kostenpflichtig“ enthält die folgende Tabelle spärliche Modelle mit ähnlichen Gesamtparameteranzahlen oder ähnlichen Low-Active-Parameter-Designs aus dem Live-Katalog von Novita AI.
| Modell auf Novita AI | Gesamt / Aktive Parameter | Kontext | Input pro 1 M Token | Output pro 1 M Token |
|---|---|---|---|---|
| Ling-3.0-flash | 124B / ~5,1B | 262.144 | $0,00 | $0,00 |
| Qwen3.5-122B-A10B | 122B / 10B | 262.144 | $0,40 | $3,20 |
| Qwen3-Next-80B-A3B-Instruct | 80B / ~3B | 131.072 | $0,15 | $1,50 |
| Ling-2.6-flash | 104B / 7,4B | 262.144 | $0,10 | $0,30 |
Preise und gehostete Limits wurden am 27. Juli 2026 anhand der Live-Modelllistings von Novita AI überprüft. Ling-3.0-flash ist als zeitlich begrenzt kostenlos markiert, daher ist seine Zeile eine Momentaufnahme und keine dauerhafte Preisgarantie.
Die Tabelle legt nicht fest, welches Modell „am besten“ ist. Qwen3.5-122B-A10B bietet auf Novita AI ein größeres maximales Output-Limit und native Bildverarbeitungsfähigkeiten. Qwen3-Next-80B-A3B-Instruct ist ein kleineres spärliches Modell mit Unterstützung für strukturierte Ausgaben im aktuellen Listing. Ling-2.6-flash hat eine etablierte Produktgeschichte und bleibt auch außerhalb einer Werbeaktion günstig. Ling-3.0-flash ist heute das am einfachsten zu evaluierende Modell preislich, aber Fähigkeit und Zuverlässigkeit müssen dennoch workload-spezifisch getestet werden.
Warum ist das 124B/5,1B MoE-Design wichtig?
Die Gesamtparameteranzahl und die Anzahl der aktiven Parameter beschreiben unterschiedliche Teile eines MoE-Modells. Die 124B Gesamtanzahl repräsentiert die gesamte Expertenkapazität des Modells. Die etwa 5,1B aktiven Parameter beschreiben, wie viel von diesem Expertennetzwerk für einen einzelnen Token ausgewählt wird.
Für Entwickler ist der wichtige Punkt nicht, dass 5,1B aktive Parameter das Modell automatisch schnell machen. Die tatsächliche API-Latenz hängt auch von der Serving-Hardware, dem Batching, der Prompt-Länge, der Output-Länge und der Plattformlast ab. Das nützliche Signal ist, dass Ling-3.0-flash um spärliche Aktivierung und Token-Effizienz herum entwickelt wurde, anstatt den gesamten Parametersatz für jeden Token auszuführen.
Dieses Design ist besonders relevant, wenn ein Agent in einer Schleife läuft. Ein Support-Agent kann eine Anfrage klassifizieren, Kontext abrufen, ein Tool aufrufen, das Ergebnis überprüfen und eine Antwort entwerfen. Ein Codierungs-Agent kann ein Repository durchsuchen, eine Änderung planen, Dateien bearbeiten, Tests ausführen und Fehler beheben. In beiden Fällen werden die Kosten und die Latenz einer „Aufgabe“ auf viele Inferenzdurchgänge verteilt. Ein Modell, das für effiziente wiederholte Inferenz entwickelt wurde, kann wertvoller sein als eines, das nur für eine einzelne Antwort optimiert ist.
Was können Entwickler mit Ling-3.0-flash bauen?
Tool-nutzende Assistenten
Function Calling macht Ling-3.0-flash zu einem Kandidaten für Assistenten, die Tools auswählen, Argumente erzeugen, Tool-Ergebnisse prüfen und einen Workflow fortsetzen. Beispiele sind Kundensupport-Routing, Kontosuche, interne Wissensabfrage und Operations-Dashboards.
Dokument-Workflows mit langem Kontext
Das Kontextfenster von 262.144 Token kann einen umfangreichen Arbeitskontext für Vertragsprüfung, Forschungssynthese, Transkriptanalyse oder Multi-Dokument-Extraktion aufnehmen. Ein großes Kontextfenster ist kein Ersatz für ein Retrieval-Design, gibt Teams aber mehr Spielraum, um Anweisungen und relevante Beweise über eine Aufgabe hinweg zu erhalten.
Codierungs- und Repository-Agents
Reasoning und Function Calling sind nützliche Grundlagen für Code-Such- und Code-Änderungs-Schleifen. Ling-3.0-flash könnte für Repository-Triage, Issue-Klassifizierung, Migrationsplanung, Testfehleranalyse oder überwachte Codierungs-Agents geeignet sein. Teste es sorgfältig, bevor du Schreibaktionen erlaubst, insbesondere wenn Tool-Aufrufe Produktionssysteme ändern können.
Hochvolumige Evaluierungs-Pipelines
Das kostenlose Fenster senkt die Kosten für den Aufbau eines Evaluierungssatzes. Teams können echte Prompts wiedergeben, Tool-Call-Formate vergleichen, Fehlermodi untersuchen und feststellen, ob das Modell einen Platz in der Routing-Logik verdient. Dies ist eine bessere Nutzung des kostenlosen Zugangs, als anzunehmen, dass das günstigste Modell sofort zum Standard werden sollte.
Wann solltest du Ling-3.0-flash verwenden?
Wähle Ling-3.0-flash zur Evaluierung, wenn dein Workload mehrere dieser Merkmale aufweist:
- Er ist textbasiert und verwendet Chat Completions.
- Er benötigt Reasoning, Function Calling oder beides.
- Er enthält lange Anweisungen, Dokumente, Speicher oder Tool-Ergebnisse.
- Eine Benutzeraufgabe kann mehrere Modellrunden erfordern.
- Du möchtest ein großes MoE-Modell ohne Token-Gebühren während der aktuellen Aktion testen.
- Du kannst den Erfolg anhand von Aufgabenabschluss, Tool-Genauigkeit, Latenz und Token-Nutzung messen, anstatt dich auf eine öffentliche Bestenliste zu verlassen.
Das Modell ist auch ein praktischer Kandidat für Routing-Experimente. Du kannst risikoärmere Agent-Schritte an Ling-3.0-flash senden, Ergebnisse mit einem kostenpflichtigen Referenzmodell vergleichen und nur die Aufgaben eskalieren, die ein anderes Fähigkeitsprofil benötigen.
Wann solltest du ein anderes Modell wählen?
Ling-3.0-flash ist nicht die automatische Wahl für jede Anwendung.
Wähle ein anderes Modell, wenn du Bild- oder Audioeingabe benötigst, da das aktuelle gehostete Listing nur Text ist. Ziehe ein Modell mit Unterstützung für strukturierte Ausgaben in Betracht, wenn die strikte Schema-Generierung für deinen Produktionsvertrag zentral ist; Ling-3.0-flash listet derzeit Function Calling, aber nicht strukturierte Ausgaben. Ein anderes Modell kann auch vorzuziehen sein, wenn du unabhängig veröffentlichte Benchmark-Ergebnisse, eine bestimmte Latenz-Service-Level oder einen stabilen kostenpflichtigen Preis für die langfristige Budgetierung benötigst.
Die maximale Ausgabe von 32.768 Token ist für viele Agent-Aufgaben großzügig, liegt aber unter den Ausgabelimits einiger aktueller Langkontext-Modelle. Wenn deine Anwendung regelmäßig sehr große Artefakte in einem einzigen Aufruf erzeugt, vergleiche die Ausgabedeckel vor der Migration.
Baue schließlich kein Geschäftsmodell, das davon abhängt, dass die API kostenlos bleibt. Der Nullpreis ist ausdrücklich zeitlich begrenzt. Die Produktionsplanung sollte ein Fallback-Modell, Routing-Kontrollen und eine aktuelle Preisprüfung vor dem Start beinhalten.
Wie passt es in einen bestehenden API-Workflow?
Ling-3.0-flash verwendet Novita AIs OpenAI-kompatibles LLM-Interface. Auf hoher Ebene benötigt eine bestehende Chat-Completions-Anwendung drei Konfigurationswerte:
- Einen Novita AI API-Schlüssel.
- Die OpenAI-kompatible Basis-URL
https://api.novita.ai/openai. - Die Modell-ID
inclusionai/ling-3.0-flash.
Die Anfrage geht dann über den Chat-Completions-Endpunkt. Funktionsdefinitionen können für Tool-nutzende Workflows eingefügt werden, und das Reasoning-Verhalten sollte mit denselben Prompts und Aufgabenprüfungen evaluiert werden, die du in der Produktion verwenden möchtest.
Dieser Launch-Überblick endet bewusst an der Integrationsgrenze. Er enthält kein vollständiges SDK-Tutorial, keine Beispielanfragen, keine Parameteroptimierung oder Fehlerbehebungsschritte; diese gehören in eine dedizierte Schnellstartanleitung.
Fazit
Ling-3.0-flash ist einen Test wert, wenn du textbasierte Agents baust und ein großes, spärliches Modell mit langem Kontext, Reasoning und Function Calling wünschst. Der aktuelle zeitlich begrenzte kostenlose Preis beseitigt die Token-Kostenbarriere für eine ernsthafte Evaluierung, während die Architektur mit 124B Gesamt- und 5,1B aktiven Parametern dem Modell ein klares effizienzorientiertes Design verleiht.
Die richtige Entscheidung ist, das kostenlose Fenster für Erkenntnisse zu nutzen, nicht für Annahmen. Messe vollständige Agent-Aufgaben, einschließlich Wiederholungen und Tool-Fehlern. Vergleiche Ausgabequalität und Latenz mit einem Modell, dem du in deinem Stack bereits vertraust. Bestätige den Live-Preis vor dem Produktions-Rollout. Wenn Ling-3.0-flash bei diesen Tests gut abschneidet, bietet Novita AI einen unkomplizierten serverlosen Weg, um es in einen OpenAI-kompatiblen Workflow zu integrieren.
Evaluieren Sie Ling-3.0-flash auf Novita AI
FAQ
Ist die Ling-3.0-flash API kostenlos?
Ja, Stand 27. Juli 2026. Novita AI listet sowohl Input als auch Output zu $0 pro Million Token und kennzeichnet das Modell als „zeitlich begrenzt kostenlos“. Überprüfe vor der Nutzung die Live-Modellseite, da sich die Aktion ändern kann.
Wie lautet die Ling-3.0-flash Modell-ID?
Die genaue Novita AI Modell-ID ist inclusionai/ling-3.0-flash.
Wie groß ist Ling-3.0-flash?
Es ist ein 124B-Parameter Mixture-of-Experts-Modell mit etwa 5,1B Parametern, die pro Token aktiviert werden.
Welches Kontextfenster unterstützt Ling-3.0-flash?
Das aktuelle Novita AI Listing zeigt ein Kontextfenster von 262.144 Token und eine maximale Ausgabe von 32.768 Token.
Unterstützt Ling-3.0-flash Function Calling?
Ja. Novita AI listet derzeit Function Calling und Reasoning als unterstützte Funktionen. Strukturierte Ausgaben sind nicht aufgeführt, validiere daher alle strengen JSON- oder Schema-Anforderungen in deinen eigenen Tests.
Ist Ling-3.0-flash ein multimodales Modell?
Nicht am aktuellen Novita AI Endpunkt. Das gehostete Listing zeigt Texteingabe und Textausgabe.
Ist Ling-3.0-flash besser als Qwen3.5-122B-A10B?
Es gibt nicht genügend verifizierte öffentliche Beweise, um eine allgemeine Qualitätsaussage zu treffen. Ling-3.0-flash ist derzeit kostenlos und aktiviert weniger Parameter pro Token, während Qwen3.5-122B-A10B auf Novita AI Vision, strukturierte Ausgaben und ein höheres maximales Output-Limit unterstützt. Wähle mit workload-spezifischer Evaluierung.