DeepSeek-V4-Flash auf Novita AI: Schnelle Schlussfolgerungen zu geringeren Kosten

DeepSeek-V4-Flash auf Novita AI: Schnelle Schlussfolgerungen zu geringeren Kosten

Die meisten Open-Source-Modelle mit Reasoning-Fähigkeiten erzwingen einen Kompromiss: kleine Kontextfenster, langsamer Durchsatz oder Preise, die über 1 $/M Token steigen, sobald man erweitertes Denken aktiviert. DeepSeek-V4-Flash vermeidet diesen Kompromiss auch im Update vom 31. Juli 2026: das gleiche 284B-Parameter-Mixture-of-Experts-Design mit nur 13B aktivierten Parametern pro Inferenz, das gleiche native 1.048.576-Token-Kontextfenster und die gleichen $0,14/M Input-Preise auf Novita AI.

Kurz gesagt: DeepSeek-V4-Flash bleibt auf Novita AI nach der Neupost-Trainingsrevision 0731 dieselbe Modellfamilie. Das Update ist wichtig, weil es die Serving-Version aktualisiert, ohne Entwickler zu zwingen, Modell-IDs zu wechseln, Prompts umzuschreiben oder Kostenannahmen neu zu berechnen.

DeepSeek-V4-Flash in der Novita AI Modellkonsole öffnen

Was ist DeepSeek-V4-Flash?

DeepSeek-V4-Flash ist ein Mixture-of-Experts (MoE)-Sprachmodell von DeepSeek AI, das als Teil der DeepSeek-V4-Serie neben dem größeren DeepSeek-V4-Pro veröffentlicht wurde. Das Modell hat insgesamt 284B Parameter, von denen bei der Inferenz 13B aktiviert werden – das hält die Kosten pro Token niedrig, während die Parameterkapazität eines viel größeren Modells erhalten bleibt.

Wichtige Fähigkeiten auf einen Blick:

  • 284B gesamt / 13B aktivierte Parameter — MoE-Architektur, niedrige Inferenzkosten
  • 1.048.576-Token-Kontextfenster (1M Tokens) — ermöglicht durch Hybrid Attention Architecture
  • Drei Reasoning-Modi: Non-think (schnell), Think (Schritt für Schritt), Think Max (maximales Reasoning-Budget)
  • Funktionsaufruf-Unterstützung — Tool-Nutzung, strukturierte Ausgaben, JSON-Modus
  • Trainiert auf 32T+ Tokens mit mehrstufigem Post-Training (SFT, RL mit GRPO, On-Policy-Destillation)
  • MIT-Lizenz — Gewichte zum Download auf HuggingFace; kommerzielle Nutzung erlaubt
  • FP4 + FP8 gemischte Präzision — MoE-Expertengewichte in FP4, restliche Schichten in FP8

Was ist neu im Update vom 31. Juli 2026?

Die Kurzversion: Dies ist eine Revisionsaktualisierung, kein separater Launch.

Das nachtrainierte Update von DeepSeek Ende Juli behält auf Novita AI die gleiche öffentliche Produktidentität bei:

  • Gleiche Modell-ID: deepseek/deepseek-v4-flash
  • Gleiche Architektur: 284B Parameter gesamt, 13B aktiviert pro Inferenz
  • Gleiches Kontextfenster: 1.048.576 Tokens
  • Gleiche Novita AI-Preise: $0,14/M Input, $0,28/M Output, $0,028/M Cache-Lesevorgänge

Das bedeutet, dass bestehende Integrationen keine Endpunktänderungen, Preistabellen-Neuschreibungen oder Prompt-Format-Migrationen benötigen. Wenn Sie bereits Traffic an DeepSeek-V4-Flash weitergeleitet haben, ist das 0731-Update am besten als ein Update der Fähigkeiten und des Post-Trainings hinter den Kulissen zu verstehen, nicht als eine völlig neue SKU.

Für Entwickler ist diese Unterscheidung wichtig. Eine Revisionsaktualisierung bedeutet in der Regel, dass Sie das Modell mit Ihren eigenen Prompts, Evaluierungssätzen und Agentenaufgaben erneut testen können, während der gleiche Deployment-Vertrag erhalten bleibt: gleicher Name, gleicher API-Pfad, gleiches Kontextbudget und gleiche Token-Ökonomie.

Hauptmerkmale: Warum DeepSeek-V4-Flash heraussticht

Wählbare Reasoning-Tiefe ohne Modellwechsel

Die meisten Modelle sperren Sie in einen einzigen Inferenzmodus ein: entweder Reasoning ein oder Reasoning aus. DeepSeek-V4-Flash bietet Ihnen drei verschiedene Betriebsmodi am selben API-Endpunkt:

Modus Eigenschaften Am besten geeignet für
Non-think Schnell, keine Gedankenkette Aufgaben mit hohem Volumen, Chat, Zusammenfassungen
Think Schritt-für-Schritt-Reasoning, ausgewogen Komplexe Q&A, Code-Generierung, Analyse
Think Max Maximales Reasoning-Budget Mathe-Wettbewerbe, schwierige Programmieraufgaben, Benchmarks

Der Unterschied zwischen den Modi ist erheblich: Auf GPQA Diamond erreicht V4-Flash Non-think 71,2 vs. Think mit 87,4 und Think Max mit 88,1. Auf LiveCodeBench erreicht Think Max 91,6 vs. Non-think 55,2. Sie wählen Kosten vs. Qualität pro Anfrage – keine Infrastrukturänderung erforderlich.

Hybrid Attention Architecture für 1M-Token-Kontext

Ein natives Kontextfenster von einer Million Tokens ist schwieriger umzusetzen, als es klingt. DeepSeek-V4-Flash erreicht dies durch eine speziell entwickelte Hybrid Attention Architecture, die zwei Mechanismen kombiniert:

  • Compressed Sparse Attention (CSA) — reduziert das Aufmerksamkeitsrechenbudget für lange Sequenzen drastisch
  • Heavily Compressed Attention (HCA) — komprimiert den KV-Cache-Fußabdruck für die Inferenz mit 1M-Kontext

Das Ergebnis: Inferenz über 1M-Token-Eingaben mit handhabbarem FLOP- und Speicheraufwand. Für Arbeitslasten wie Codebase-Analyse, rechtliche Dokumentenprüfung oder Agenten mit langen Sitzungen macht diese Architektur den Unterschied zwischen machbar und unerschwinglich.

MoE-Effizienz: 13B aktiviert bei 284B-Maßstab

Das Verhältnis von 284B/13B aktivierten Parametern ist der Schlüssel zur Kosteneffizienz. Nur 13B Parameter sind pro Vorwärtspass aktiv, was Latenz und Kosten pro Token nahe an einem 13B-dichten Modell hält – während der gesamte 284B-Parameterpool eine Wissenskapazität bietet, die mit einem viel größeren dichten Netzwerk vergleichbar ist. Die FP4 + FP8 gemischte Präzision reduziert zudem den Speicherbandbreitendruck auf die Expertengewichte.

Leistungsstarke Post-Training-Pipeline

DeepSeek-V4-Flash durchläuft ein zweistufiges Post-Training: zuerst domänenspezifische Expertenentwicklung durch SFT und Reinforcement Learning mit GRPO; dann einheitliche Modellkonsolidierung durch On-Policy-Destillation. Dies produziert ein einzelnes Modell mit differenzierten Fähigkeitsprofilen in den Bereichen Programmierung, Reasoning und Allgemeinwissen – keinen generischen Anweisungsbefolger.

Benchmark-Leistung

Die Benchmark-Geschichte von DeepSeek-V4-Flash handelt von der Auswahl des Reasoning-Modus. Im Non-think-Modus verhält es sich wie ein effizientes 13B-aktiviertes Modell. Erhöhen Sie auf Think Max, und es erreicht eine ganz andere Stufe.

DeepSeek-V4-Flash Benchmark-Vergleichsdiagramm, das die Leistung über verschiedene Reasoning-Modi hinweg zeigt

DeepSeek-V4-Flash-Leistung über Modi hinweg im Vergleich zu führenden Modellen [Quelle: DeepSeek AI / HuggingFace]

Leistung in den verschiedenen Reasoning-Modi

Nachfolgend sind die Bewertungen von V4-Flash über wichtige Benchmarks hinweg aufgeführt, die alle drei Betriebsmodi vergleichen:

Benchmark V4-Flash Non-Think V4-Flash Think V4-Flash Think Max
LiveCodeBench (Pass@1) 55.2 88.4 91.6
GPQA Diamond (Pass@1) 71.2 87.4 88.1
HMMT 2026 Feb (Pass@1) 40.8 91.9 94.8
IMOAnswerBench (Pass@1) 41.9 85.1 88.4
Codeforces-Bewertung 2816 3052
SWE Verified (Resolved) 73.7 78.6 79.0
MRCR 1M (MMR) 37.5 76.9 78.7
MCPAtlas (Pass@1) 64.0 67.4 69.0
MMLU-Pro (EM) 83.0 86.4 86.2

Zuletzt überprüft: 2026-04-27. Quelle: DeepSeek-V4 technischer Bericht und HuggingFace-Modellkarte.

Wie V4-Flash im Vergleich zu Mitbewerbern abschneidet

V4-Flash Think Max (79.0 SWE Verified, 91.6 LiveCodeBench) konkurriert mit Modellen, die zu viel höheren Kosten pro Token laufen. Es führt nicht jede Bestenliste an – V4-Pro Max ist bei den meisten Frontier-Benchmarks führend – aber für Entwickler, die auf Kosten pro Aufgabe statt auf rohe Spitzenleistung achten, ist der Kompromiss günstig:

Wenn Sie zwischen den beiden DeepSeek V4-APIs für die Produktions-Routing wählen, verwenden Sie den DeepSeek V4 Pro vs Flash Preis- und Routing-Leitfaden, um zu vergleichen, wann Flash den Basis-Traffic verarbeiten sollte und wann Pro den höheren Token-Preis wert ist.

Benchmark V4-Flash Max V4-Pro Max Claude Opus 4.6 Max Gemini 3.1 Pro High
LiveCodeBench (Pass@1) 91.6 93.5 88.8 91.7
GPQA Diamond (Pass@1) 88.1 90.1 91.3 94.3
SWE Verified (Resolved) 79.0 80.6 80.8 80.6
HMMT 2026 Feb (Pass@1) 94.8 95.2 96.2 94.7
MRCR 1M (MMR) 78.7 83.5 92.9 76.3

Zuletzt überprüft: 2026-04-27. Claude Opus 4.6 Max und Gemini 3.1 Pro High stammen aus dem DeepSeek-V4 technischen Bericht (V4-Pro Frontier-Vergleichstabelle). Diese Werte wurden in diesem Bericht nicht direkt gegen V4-Flash gemessen.

Bemerkenswert ist, dass V4-Flash Think Max bei MRCR 1M (78.7) Gemini 3.1 Pro High (76.3) bei der Long-Context-Retrieval-Aufgabe schlägt – dem Benchmark, der am direktesten 1M-Kontext-Anwendungsfälle abbildet. Bei SWE Verified liegen alle vier Modelle zwischen 79–81, was V4-Flash in der Kategorie der realen Programmieragenten zu einem Bruchteil der Kosten eines Closed-Modells wettbewerbsfähig macht.

So verwenden Sie DeepSeek-V4-Flash über Novita AI

Option 1: Playground (Ohne Code)

Testen Sie das Modell direkt in Ihrem Browser in der Novita AI Modellkonsole. Kein API-Schlüssel erforderlich, um zu starten – wechseln Sie über die Chat-Oberfläche zwischen den Modi Non-think, Think und Think Max.

Option 2: API (Python)

DeepSeek-V4-Flash verwendet die OpenAI-kompatible API. Verwenden Sie die Modell-ID deepseek/deepseek-v4-flash mit der Novita-Basis-URL:

from openai import OpenAI

client = OpenAI(
    base_url="https://api.novita.ai/v3/openai",
    api_key="YOUR_NOVITA_API_KEY",
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4-flash",
    messages=[{"role": "user", "content": "Your prompt here"}]
)
print(response.choices[0].message.content)

Um den Think- oder Think Max-Modus zu aktivieren, übergeben Sie den Parameter reasoning im Anforderungstext:

from openai import OpenAI

client = OpenAI(
    base_url="https://api.novita.ai/v3/openai",
    api_key="YOUR_NOVITA_API_KEY",
)

# Think Max-Modus – maximales Reasoning-Budget
response = client.chat.completions.create(
    model="deepseek/deepseek-v4-flash",
    messages=[{"role": "user", "content": "Löse: x^4 - 5x^2 + 4 = 0"}],
    extra_body={"reasoning": {"effort": "high"}}  # "low" = Think, "high" = Think Max
)
print(response.choices[0].message.content)

Holen Sie sich Ihren API-Schlüssel unter novita.ai/settings.

Option 3: Drittanbieter-Tools

Da Novita AI einen OpenAI-kompatiblen Endpunkt bereitstellt, funktioniert DeepSeek-V4-Flash sofort mit:

  • LangChain / LlamaIndex — verwenden Sie ChatOpenAI mit base_url="https://api.novita.ai/v3/openai"
  • OpenWebUI — fügen Sie es als benutzerdefinierten OpenAI-kompatiblen Endpunkt hinzu
  • Continue.dev / Cursor — konfigurieren Sie es als benutzerdefiniertes Modell mit der Novita-Basis-URL

DeepSeek-V4-Flash Preise

Die Preise für DeepSeek-V4-Flash auf Novita AI sind im Update vom 31. Juli 2026 unverändert. Alle folgenden Angaben sind pro Million Tokens, zuletzt überprüft am 2026-08-03:

Anbieter Input ($/M) Output ($/M) Cache-Lesen ($/M) Max. Kontext
Novita AI $0,14 $0,28 $0,028 1.048.576 Tokens
DeepSeek Offiziell $0,14 $0,28 $0,028 131.072 Tokens
SiliconFlow $0,14 $0,28 $0,028 65.536 Tokens
DeepInfra $0,14 $0,28 16.384 Tokens

Der Preis pro Token bleibt nach dem 0731-Update gleich – aber der maximale Kontext variiert immer noch erheblich je nach Anbieter. Novita AI bietet das volle 1M-Token-Kontextfenster. DeepInfra begrenzt auf 16.384 Tokens. Wenn Ihre Arbeitslast lange Dokumente, Codebasen oder mehrschrittige Agenten umfasst, ist Novita die praktische Wahl.

Empfohlene Anwendungsfälle

Autonome Programmieragenten

Das 1M-Kontextfenster von V4-Flash bedeutet, dass ein Agent eine gesamte Codebase in den Kontext laden kann, ohne sie aufteilen zu müssen. In Kombination mit 79.0 SWE Verified im Think Max-Modus bewältigt es mehrdateiige Refactorings und Debugging, ohne den Status zwischen den Schritten zu verlieren.

Langdokument-Q&A und RAG

MRCR 1M (Multi-Round Context Retrieval) bei 78,7% Think Max – der Benchmark misst die Retrieval-Genauigkeit über ein echtes 1M-Token-Fenster. Für die Indexierung von Rechtsdokumenten, wissenschaftlichen Arbeiten oder langen technischen Spezifikationen ruft V4-Flash genau ab, wo die meisten Modelle nach 32K Tokens nachlassen.

Mathematik- und Naturwissenschaftliches Reasoning

94,8% bei HMMT 2026 Februar (Wettbewerbsmathematik) mit Think Max. Der Budget-Thinking-Modus ermöglicht es Ihnen, Kosten und Genauigkeit abzustimmen – verwenden Sie Think für Standardprobleme, Think Max für die schwierigen. Eine einzelne Anfrage verbraucht kein festes Rechenbudget; Sie wählen.

Produktions-APIs mit Caching

Bei $0,028/M Cache-Lesevorgängen kosten wiederholte System-Prompts und Tool-Schemata im großen Maßstab praktisch nichts. Chatbot-Produkte und API-Wrapper, die denselben Kontext bei jedem Aufruf erneut einfügen, profitieren von den Cache-Lesepreisen gegenüber den reinen Input-Preisen.

Für ein gemischtes Modell-Setup behalten Sie Flash als Standard für wiederholte Produktionsaufrufe und eskalieren Sie schwierige Long-Context- oder Programmieragenten-Prompts an Pro. Der DeepSeek V4 Pro Long-Context-Leitfaden zeigt, wie Sie die Pro-Modell-ID, Basis-URL, Anforderungsform und Kostenkontrollen für diese anspruchsvolleren Pfade konfigurieren.

Starten Sie noch heute mit DeepSeek-V4-Flash

DeepSeek-V4-Flash bleibt nach dem Update vom 31. Juli über Novita AI mit dem vollen 1M-Kontextfenster, den gleichen wettbewerbsfähigen Preisen und ohne Infrastrukturaufwand verfügbar. Sie wählen den Reasoning-Modus; Novita kümmert sich um den Rest.

DeepSeek-V4-Flash, unterstützt von Novita AI, ausprobieren

Novita AI LLM API-Dokumentation

FAQ

Was hat sich in der DeepSeek-V4-Flash 0731-Revision geändert?

Auf Novita AI bleibt der sichtbare Deployment-Vertrag gleich: Die Modell-ID bleibt deepseek/deepseek-v4-flash, die Preise bleiben bei $0,14/M Input und $0,28/M Output, und das volle Kontextfenster von 1.048.576 Tokens ist weiterhin verfügbar. Das 0731-Update ist eine Aktualisierung der Serving-Revision und keine separate Modellfamilie.

Was ist DeepSeek-V4-Flash?

DeepSeek-V4-Flash ist ein 284B-Parameter-Mixture-of-Experts-Sprachmodell, das von DeepSeek AI entwickelt und am 23.04.2026 veröffentlicht wurde. Es aktiviert nur 13B Parameter pro Vorwärtspass, was es deutlich schneller und günstiger macht als dichte Modelle mit vergleichbarer Leistungsfähigkeit. Es unterstützt ein Kontextfenster von 1.048.576 Tokens und drei Reasoning-Modi: Non-thinking (schnell), Budget Thinking und Extended Thinking (Think Max).

Wie unterscheidet sich DeepSeek-V4-Flash von DeepSeek-V4-Pro?

V4-Flash ist die leichtere, schnellere Variante, die für Geschwindigkeit und Kosten optimiert ist. V4-Pro ist das Flaggschiffmodell mit höheren Spitzen-Benchmark-Ergebnissen (z. B. 93.5 vs. 91.6 bei LiveCodeBench Think Max). V4-Flash „erreicht eine vergleichbare Reasoning-Leistung wie die Pro-Version, wenn ein größeres Denkbudget zur Verfügung steht“ – in der Praxis schließt V4-Flash Think Max die meisten Lücken zu V4-Pro Think Max bei niedrigeren Kosten pro Token.

Wenn Sie eine Produktions-Routing-Regel benötigen, vergleichen Sie beide Modelle im DeepSeek V4 Pro vs Flash API-Entscheidungsleitfaden, bevor Sie den gesamten Traffic auf ein Modell verlagern.

Was bedeutet „Flash“ im Modellnamen?

Flash signalisiert eine geschwindigkeitsoptimierte Variante, ähnlich wie Google den Begriff für Gemini Flash verwendet. DeepSeek-V4-Flash priorisiert niedrigere Latenz und Kosten gegenüber der rohen maximalen Genauigkeit, wobei die Thinking-Modi verfügbar sind, wenn Sie die Leistungslücke schließen müssen.

Unterstützt DeepSeek-V4-Flash ein 1M-Kontextfenster, das von Novita AI bereitgestellt wird?

Ja. Novita AI stellt das volle Kontextfenster von 1.048.576 Tokens zur Verfügung – das größte, das derzeit bei allen Anbietern für dieses Modell verfügbar ist. Die maximalen Abschluss-Tokens bei Novita betragen 393.216.

Wie wechsle ich die Reasoning-Modi über die API?

Übergeben Sie den Parameter extra_body={"reasoning": {"effort": "low"}} für Budget Thinking oder "effort": "high" für Think Max. Lassen Sie den Parameter für den Non-thinking-Modus (schnell) vollständig weg. Die API ist OpenAI-kompatibel – keine SDK-Änderungen erforderlich.

Wie sind die Preise für DeepSeek-V4-Flash, unterstützt von Novita AI?

Stand 2026-08-03: $0,14/M Input-Tokens, $0,28/M Output-Tokens, $0,028/M Cache-Lese-Tokens. Dies entspricht den offiziellen Preisen von DeepSeek und ist bei allen Anbietern konsistent – das Unterscheidungsmerkmal bei Novita ist das volle 1M-Kontextfenster und eine zuverlässige Betriebszeit.

Ist DeepSeek-V4-Flash Open Source?

Ja. Die Modellgewichte sind auf HuggingFace unter der MIT-Lizenz verfügbar – bestätigt im offiziellen DeepSeek-V4-Repository. Selbsthosting und kommerzielle Nutzung sind unter den MIT-Bedingungen erlaubt. Die Verwendung über die Novita AI-API erfordert überhaupt kein Self-Hosting.

Empfohlene Artikel