Kimi K3 Preise auf Novita AI: 3 $ Input, 15 $ Output und wann man es verwendet

Kimi K3 Preise auf Novita AI: 3 $ Input, 15 $ Output und wann man es verwendet

Kimi K3 ist auf Novita AI als Flaggschiff-Modell von Moonshot AI verfügbar, mit insgesamt 2,8 Billionen Parametern, einem Kontextfenster von 1.048.576 Token sowie Text-, Bild- und Videoeingabe. Wählen Sie K3, wenn Ihre Anwendung einen sehr großen Kontext oder multimodales Denken benötigt; wählen Sie eine Kimi-K2-Variante, wenn niedrigere Kosten pro Token, ein kleineres Kontextfenster oder eine etablierte K2-spezifische Integration wichtiger sind. Novitas aktuelle K3-Preise betragen 3 $ pro Million Input-Token, 15 $ pro Million Output-Token und 0,30 $ pro Million Cache-Read-Token, geprüft am 22. Juli 2026.

Wichtige Erkenntnisse

  • Kimi K3 ist auf Novita AI unter der genauen Modell-ID moonshotai/kimi-k3 verfügbar.
  • Die Modellseite listet einen 1M-Token-Kontext und maximal 1M Output sowie Text-, Bild- und Videoeingabefähigkeiten auf.
  • Die aktuellen Serverless-Preise betragen 3 $/M Input, 15 $/M Output und 0,30 $/M Cache-Reads. Die Preise können sich ändern, also bestätigen Sie sie vor der Budgetplanung auf der Modellseite.
  • K3 ist die bessere Kimi-Wahl für große Repositories, lange Forschungspakete, multimodale Wissensarbeit und Workflows, die das neueste Flaggschiff benötigen.
  • K2.5 oder K2 Instruct können die sinnvollere Wahl für kostenbewusste, reine Text- oder bereits integrierte Workloads sein.

Was ist Kimi K3?

Kimi K3 ist das neueste Kimi-Modell von Moonshot AI und das leistungsfähigste Modell in Novita AIs Kimi-Linie. Der wichtigste Unterschied ist die Skalierung: Die Novita-Modellseite beschreibt ein Modell mit 2,8 Billionen Parametern, das mit Kimi Delta Attention und Attention Residuals aufgebaut ist, mit nativem visuellem Verständnis und einem 1M-Token-Kontextfenster.

Diese Kontextgröße ändert die praktische Frage von „Kann das Modell diese Eingabeaufforderung beantworten?“ zu „Kann ich dem Modell den vollständigen Arbeitssatz geben?“ Ein Codierungsagent kann mehr von einem Repository im Kontext behalten. Ein Forschungsassistent kann mit einer großen Sammlung von Dokumenten arbeiten, ohne aggressives Chunking. Ein multimodaler Workflow kann Text mit Bildern oder Videos kombinieren, anstatt diese Eingaben auf separate Schritte aufzuteilen.

Der Kompromiss sind die Kosten. Der Output-Preis von K3 ist deutlich höher als die Preise, die für ältere Kimi-Endpunkte auf Novita aufgeführt sind, daher ist ein größeres Kontextfenster am nützlichsten, wenn es echte Anwendungskomplexität entfernt oder die Antwortqualität verbessert. Es ist kein Grund, jede kurze Chat-Anfrage an das Flaggschiff zu senden.

Kimi K3 Spezifikationen und Preise

Die folgenden Werte stammen von der Kimi K3 Modellseite auf Novita AI, geprüft am 22. Juli 2026.

Feld Kimi K3 Details
Herausgeber Moonshot AI
Modell-ID moonshotai/kimi-k3
Architekturhinweis 2,8T Parameter; Kimi Delta Attention und Attention Residuals
Kontextfenster 1.048.576 Token (1M)
Maximaler Output 1.048.576 Token
Eingabe Text, Bild, Video
Ausgabe Text
Eingabepreis 3 $ pro Million Token
Cache-Read-Preis 0,30 $ pro Million Token
Ausgabepreis 15 $ pro Million Token
Novita-Verfügbarkeit Serverless API
API-Stile OpenAI-kompatible und Anthropic-kompatible Endpunkte

Die Preistabelle ist nutzungsbasiert: Sie zahlen für verarbeitete Token, nicht für die Bereitstellung einer dedizierten GPU. Für eine grobe Schätzung würden 10 Millionen Input-Token und 1 Million Output-Token 45 $ kosten, bevor weitere Kontoebenen-Gebühren oder Änderungen an den aufgeführten Tarifen anfallen. Ihr eigener Verkehrsmix ist wichtiger als der Ausgabepreis in der Überschrift, insbesondere wenn Eingabeaufforderungen lang und Antworten kurz sind.

K3 listet auch Cache-Read-Preise auf. Die Wiederverwendung stabiler Systemanweisungen, Tool-Definitionen oder großer Referenzmaterialien kann die Kosten für wiederholte Anfragen senken, wenn Ihre Anwendung und Ihr Anfragemuster Caching unterstützen. Behandeln Sie das Cache-Verhalten als eine zu messende Optimierung, nicht als Garantie, dass jede wiederholte Eingabeaufforderung zum Cache-Read-Tarif abgerechnet wird.

Kimi K3 vs. die Kimi K2 Familie

K2 ist nicht ein einzelner Endpunkt. Die Familie umfasst ältere K2 Instruct-Varianten und neuere K2.5- und K2.6-Versionen, jeweils mit eigenen Fähigkeiten und Preisprofilen. Der richtige Vergleich ist daher workloadbasiert und nicht eine pauschale Behauptung, dass jede K3-Antwort besser ist.

Entscheidungsfaktor Kimi K3 Kimi K2 Familie
Positionierung Neuestes Flaggschiff in der Novita Kimi-Linie Frühere Varianten mit unterschiedlichen Kosten- und Fähigkeitsabwägungen
Kontext 1M Token Variiert je nach Modell; überprüfen Sie den ausgewählten Endpunkt
Eingabemodalitäten Text, Bild, Video Variiert je nach Modell; K2.5 unterstützt multimodale Eingabe
Aktueller Novita K3 Preis 3 $/M Input, 15 $/M Output, 0,30 $/M Cache-Read Variiert je nach Version; überprüfen Sie die Modellseite vor dem Vergleich
Bester Grund, es zu wählen Sehr große Arbeitssätze und multimodale Workflows an der Spitze Niedrigere Kosten, bekanntes Verhalten oder eine bestehende Integration
Migrationsrisiko Neue Modell-ID und neue Produktionsbasis Bestehende Eingabeaufforderungen, Bewertungen und Tool-Schemas sind möglicherweise bereits abgestimmt

K3 im Vergleich mit K2.5

K2.5 bleibt eine vernünftige Wahl für multimodale Anwendungen, die keinen Million-Token-Kontext benötigen. Es kann Text, Bilder und Videos verarbeiten, und seine Novita-Modellseite listet ein kleineres Kontextfenster und niedrigere aktuelle Token-Tarife als K3 auf. Verwenden Sie K2.5, wenn Ihre Eingabeaufforderungen bequem in seine Grenzen passen und Ihre Priorität darin besteht, die Inferenzkosten vorhersehbar zu halten.

Wechseln Sie zu K3, wenn der größere Kontext einen echten Engpass beseitigt: wiederholte Abfragen, Repository-Zusammenfassungen über viele Dateien, lange Video- oder Dokumentanalysen oder Agentenläufe, die während der Komprimierung wichtigen Zustand verlieren. Wenn der Workload hauptsächlich aus kurzen Gesprächen oder gewöhnlichen Codierungsfragen besteht, bietet K2.5 möglicherweise einen besseren Kosten-Latenz-Kompromiss.

K3 im Vergleich mit K2 Instruct

K2 Instruct ist die einfachere Wertoption für textorientierten Chat und agentische Tool-Nutzung. Sein älterer Novita-Beitrag listet ein 128K-Kontextfenster und niedrigere Preise als K3 auf. Das kann für Support-Agenten, strukturierte Extraktion, Codierungsunterstützung bei kleinen Repositories und Anwendungen, die bereits auf das Eingabeaufforderungsverhalten von K2 Instruct angewiesen sind, immer noch ausreichen.

K3 ist die bessere Wahl, wenn 128K nicht ausreicht, wenn visuelle Eingaben Teil des Kernworkflows sind oder wenn Sie das aktuelle Flaggschiff von Moonshot AI bewerten möchten, anstatt eine ältere Basis zu erhalten. Migrieren Sie nicht nur, weil K3 mehr Parameter hat: Testen Sie Ihre Eingabeaufforderungen, Tool-Aufrufe, Ausgabeformat und Latenz mit repräsentativem Verkehr.

Wann man Kimi K3 verwendet

K3 verdient seinen höheren Preis, wenn eine oder mehrere dieser Bedingungen zutreffen:

Große Repositories und langlaufende Codierungsagenten

Verwenden Sie K3 für Aufgaben, die einen breiten Überblick über eine Codebasis erfordern: paketübergreifende Refactorings, Architektur-Mapping, Abhängigkeitsmigrationen oder Debugging, das Logs, Tests und Implementierungsdateien umfasst. Ein 1M-Token-Kontext macht einen Agenten nicht automatisch zuverlässig, gibt Ihrer Orchestrierungsebene jedoch mehr Spielraum, bevor sie Zustand zusammenfassen oder verwerfen muss.

Multimodale Wissensarbeit

K3 akzeptiert Text-, Bild- und Videoeingaben. Das macht es zu einem Kandidaten für Workflows wie das Überprüfen von Produktscreenshots mit Anforderungen, das Analysieren aufgezeichneter Demonstrationen zusammen mit Dokumentation oder das Extrahieren von Entscheidungen aus gemischten Medien. Halten Sie den Ausgabevertrag eng und validieren Sie extrahierte Felder, wenn das Ergebnis in ein automatisiertes System fließt.

Lange Forschung und Dokumentsynthese

Wenn eine Frage von vielen Primärdokumenten abhängt, kann K3 die Menge an Abruf- und Verkettungscode reduzieren, die erforderlich ist, um einen funktionierenden Kontext zusammenzustellen. Dies ist am nützlichsten für Vergleichs-, Synthese- und dokumentübergreifende Fragen; es ersetzt nicht die Notwendigkeit, maßgebliche Quellen zu identifizieren oder Zitate zu überprüfen.

Flaggschiff-Bewertung

Wenn Sie die aktuelle Kimi-Generation für ein neues Produkt bewerten, ist K3 der natürliche erste Endpunkt für Benchmarks. Beginnen Sie mit einem kleinen, repräsentativen Testsatz und vergleichen Sie Qualität, Latenz, Ausgabelänge und Gesamtkosten mit K2.5 oder K2 Instruct, bevor Sie Ihre Produktionsstandard ändern.

Wann K2 die bessere Wahl ist

K3 ist nicht die Standardantwort für jede Anfrage. Bleiben Sie bei einem K2-Endpunkt, wenn:

  • Ihre Eingabeaufforderungen kurz und reine Text sind, sodass der 1M-Kontext keinen praktischen Nutzen bietet.
  • Ihre Anwendung stark preisempfindlich ist und Output-Token die Rechnung dominieren.
  • Sie bereits ein stabiles K2-Eingabeaufforderungs-, Tool-Schema oder strukturiertes Ausgabebewertungssystem in Produktion haben.
  • Sie eine bekannte Latenz benötigen und K3 noch nicht unter Ihrem Raten- und Parallelitätsprofil getestet haben.
  • Ihr Workload in das ausgewählte K2-Kontextfenster passt, ohne häufige Kürzungen oder Zusammenfassungen.

Ein nützliches Routing-Muster besteht darin, K2.5 oder K2 Instruct als schnellen Pfad zu behalten und nur große Kontext-, multimodale oder schwierige Aufgaben an K3 zu senden. So können Sie K3 bei den Anfragen bewerten, bei denen der zusätzliche Kontext und die Fähigkeiten sich bezahlt machen können.

So greifen Sie auf Kimi K3 auf Novita AI zu

Die Kimi K3 Seite enthält Playground-Zugriff, Modelldokumentation und Serverless-API-Details. Für einen OpenAI-kompatiblen Client verwenden Sie Novitas OpenAI-Basis-URL und die genaue Modell-ID:

Wenn Sie die erste Anfrage, Preischecks und den Fehlerbehebungsablauf an einem Ort haben möchten, beginnen Sie mit dem Kimi K3 API Schnellstart.

from openai import OpenAI

client = OpenAI(
    api_key="<NOVITA_API_KEY>",
    base_url="https://api.novita.ai/openai",
)

response = client.chat.completions.create(
    model="moonshotai/kimi-k3",
    messages=[
        {"role": "user", "content": "Fassen Sie die wichtigsten Risiken in diesem Design zusammen."}
    ],
)

print(response.choices[0].message.content)

Halten Sie den ersten Produktionstest klein. Notieren Sie Prompt-Token, Completion-Token, Cache-Nutzung, Zeit bis zum ersten Token, Gesamtlatenz und Aufgabenerfolg. Wiederholen Sie dann dieselbe Bewertung mit dem K2-Endpunkt, den Sie sonst verwenden würden. Die Modellseite listet auch Anthropic-kompatiblen Zugriff auf, der nützlich sein kann, wenn Ihre bestehende Anwendung bereits diese Client-Form verwendet.

Fazit

Wählen Sie Kimi K3 auf Novita AI, wenn die Aufgabe wirklich kontextlastig oder multimodal ist und Sie das neueste Flaggschiff von Moonshot AI über eine Serverless-API bewerten möchten. Sein 1M-Token-Kontext, die visuelle Eingabe und die aktuelle Flaggschiff-Positionierung machen es zu einem starken Kandidaten für langfristige Codierungsagenten, dokumentlastige Forschung und Mixed-Media-Workflows.

Wählen Sie K2.5 oder K2 Instruct, wenn der Workload kleiner, textorientiert, kostenempfindlich oder bereits auf einen K2-Endpunkt abgestimmt ist. Die beste Produktionsumgebung kann ein Router sein und nicht ein einzelner Gewinner: Reservieren Sie K3 für Anfragen, die seinen größeren Arbeitssatz benötigen, und behalten Sie einen kostengünstigeren K2-Pfad für den Routineverkehr.

FAQ

Ist Kimi K3 auf Novita AI verfügbar?

Ja. Novita listet Kimi K3 als Serverless-Modell mit der Modell-ID moonshotai/kimi-k3. Verfügbarkeit und Preise können sich ändern, also bestätigen Sie die Live-Modellseite vor der Bereitstellung.

Wie viel kostet Kimi K3 auf Novita AI?

Stand 22. Juli 2026 betragen die aufgeführten Tarife 3 $ pro Million Input-Token, 15 $ pro Million Output-Token und 0,30 $ pro Million Cache-Read-Token. Überprüfen Sie die Modellseite für den aktuellen Tarif, bevor Sie die Produktionskosten schätzen.

Unterstützt Kimi K3 Bilder und Videos?

Ja. Die Novita-Modellseite listet Text, Bild und Video als Eingabemodalitäten auf, mit Textausgabe.

Sollte ich von Kimi K2.5 zu K3 migrieren?

Migrieren Sie, wenn Ihr Workload von K3s 1M-Token-Kontext, neuerer Flaggschiff-Positionierung oder multimodalen Workflows profitiert. Wenn K2.5 Ihre Eingabeaufforderungen bereits bewältigt und Ihre Priorität niedrigere Kosten sind, benchmarken Sie vor dem Wechsel.

Was ist die Kimi K3 Modell-ID?

Verwenden Sie moonshotai/kimi-k3 in der Novita-API-Konfiguration.

Empfohlene Artikel