- Wann Sie diesen Schnellstart verwenden sollten
- Schritt 1: Holen Sie sich Ihren Novita-API-Schlüssel
- Schritt 2: Modell-ID und Endpunkt bestätigen
- Schritt 3: Erste Anfrage senden
- Schritt 4: Antwort lesen
- Schritt 5: Preise, Limits und häufige Fehler prüfen
- Python-Beispiel
- cURL-Beispiel
- Wichtige Parameter
- Fehlerbehebung
- FAQ
- Empfohlene Artikel
Kimi K3 ist über die serverlose API von Novita AI mit der Modell-ID moonshotai/kimi-k3, einem OpenAI-kompatiblen Chat-Endpunkt, einem Kontextfenster von 1.048.576 Token und einer maximalen Ausgabeeinstellung von 1.048.576 Token auf der Modellseite verfügbar. Dieser Schnellstart zeigt, wie Sie sich authentifizieren, eine erste Anfrage senden, die Antwort auswerten und die Token-Preise von Kimi K3 einplanen, bevor Sie das Modell in eine größere Anwendung integrieren.
Wann Sie diesen Schnellstart verwenden sollten
Verwenden Sie diesen Leitfaden, wenn Sie Kimi K3 aus einer Anwendung testen möchten, die bereits das OpenAI-API-Format spricht. Es ist ein praktischer Ausgangspunkt für Long-Context-Softwareentwicklung, Dokumentenanalyse, Recherche und Reasoning-Workflows, bei denen die Anfrage deutlich mehr Kontext enthalten kann als ein typischer Chat-Prompt.
Die Novita-Modellseite von Kimi K3 beschreibt ein Modell mit 2,8 Billionen Parametern, nativem visuellem Verständnis und einem Kontextfenster von 1M Token. Dieselbe Seite listet Text-, Bild- und Videoeingaben mit Textausgabe sowie serverlosen Zugriff, strukturierte Ausgabe, Reasoning und Function Calling auf. Behandeln Sie diese Angaben als Fähigkeiten, die Sie gegen die gewünschte Anfrageform prüfen sollten, und gehen Sie nicht davon aus, dass jede OpenAI-SDK-Funktion modelübergreifend identisch funktioniert.
Dies ist kein Benchmark-Vergleich. Das Ziel ist, eine authentifizierte Anfrage zum Laufen zu bringen und Ihnen genügend operative Details zu liefern, um zu entscheiden, ob Kimi K3 zu Ihrem Workload passt.
Schritt 1: Holen Sie sich Ihren Novita-API-Schlüssel
Erstellen Sie ein Novita-AI-Konto, öffnen Sie die Einstellungen für Ihren API-Schlüssel und erstellen Sie einen Schlüssel für die serverseitige Nutzung. Bewahren Sie den Schlüssel nach Möglichkeit außerhalb von Frontend-Bundles, öffentlichen Repositories, Notizbüchern, die außerhalb Ihres Teams geteilt werden, und der Shell-Historie auf.
Setzen Sie den Schlüssel als Umgebungsvariable, bevor Sie eines der Beispiele ausführen:
export NOVITA_API_KEY="your_api_key_here"
Verwenden Sie einen Projekt- oder temporären Schlüssel, wenn Ihr Konto dies unterstützt. Rotieren Sie den Schlüssel nach einer öffentlichen Demo oder einem vermuteten Leck.
Schritt 2: Modell-ID und Endpunkt bestätigen
Halten Sie die Verbindungsdetails zusammen, damit ein Anzeigename nicht versehentlich die tatsächliche Modellkennung ersetzt:
| Feld | Wert |
|---|---|
| Modell-ID | moonshotai/kimi-k3 |
| Basis-URL | https://api.novita.ai/openai/v1 |
| Chat-Completions-Endpunkt | https://api.novita.ai/openai/v1/chat/completions |
| Kontextfenster | 1.048.576 Token |
| Maximale Ausgabeeinstellung | 1.048.576 Token |
| Eingabefähigkeiten | Text, Bild, Video |
| Ausgabefähigkeit | Text |
| Zugriffsart | Serverlose API |
Die Kimi-K3-Modellseite ist die maßgebliche Quelle für Verfügbarkeit, aktuelle Limits, Fähigkeiten und Preise. Prüfen Sie sie vor dem Deployment erneut, da sich Modellkonfigurationen und Preise ändern können.
Schritt 3: Erste Anfrage senden
Beginnen Sie mit einer kurzen, reinen Textanfrage. Ein kleiner Prompt erleichtert es, Authentifizierungs- oder Routing-Probleme von anwendungsbezogenen Prompt-Problemen zu trennen.
Bitten Sie Kimi K3 zum Beispiel um eine kurze Implementierungs-Checkliste:
Nennen Sie die drei größten Risiken beim Hinzufügen von Retries zu einem Streaming-API-Client. Antworten Sie mit einem Satz pro Risiko.
Halten Sie den ersten max_tokens-Wert moderat. Ein großes Ausgabelimit ist erst nützlich, wenn die Basisanfrage, die Antwortauswertung und die Fehlerbehandlung korrekt funktionieren.
Schritt 4: Antwort lesen
Die OpenAI-kompatible Antwort platziert den Text des Assistenten bei einer standardmäßigen Nicht-Streaming-Chat-Completion unter choices[0].message.content. Bewahren Sie Antwort-Metadaten und Usage-Felder in Ihrer Anwendung auf, wenn Sie Request-Tracing oder Kostenabrechnung benötigen.
Für eine Produktionsintegration protokollieren Sie mindestens:
- Modell-ID und Zeitstempel der Anfrage.
- Die Anbieter-Request-ID, wenn sie vom Client oder in den Antwort-Headern zurückgegeben wird.
- Prompt- und Completion-Token-Verbrauch.
- Retry-Anzahl und HTTP-Status.
- Ob die Anfrage nur Text oder multimodale Inhalte verwendet hat.
Sobald der erste Aufruf erfolgreich ist, testen Sie Prompts, die Ihrem realen Workload ähneln: lange Quelldateien, mehrere Dokumente, ein Tool-Schema oder einen Vertrag für strukturierte Antworten. Ein erfolgreicher kurzer Prompt verifiziert die Konnektivität, nicht die Produktionsqualität.
Schritt 5: Preise, Limits und häufige Fehler prüfen
Die Novita-Modellseite listet für Kimi K3 serverlose Preise von 3 $ pro Million Eingabe-Token, 0,30 $ pro Million gecachter Lese-Token und 15 $ pro Million Ausgabe-Token. Ihre Schätzung sollte beide Seiten der Anfrage, Retries und die Menge an Kontext umfassen, die Sie wiederholt senden.
Die Seite listet außerdem diese Stufen für die Anfragelast:
| Stufe | Anfragen pro Minute | Token pro Minute |
|---|---|---|
| T1 | 30 | 50.000.000 |
| T2 | 100 | 50.000.000 |
| T3 | 1.000 | 50.000.000 |
| T4 | 3.000 | 50.000.000 |
| T5 | 6.000 | 50.000.000 |
Die zutreffende Stufe hängt von Ihrem Konto ab. Betrachten Sie die Tabelle nicht als Zusage, dass jedes Projekt bei T1 beginnt oder dass jeder Workload die maximal angezeigte Rate nutzen kann.
Häufige Fehler bei der ersten Integration:
- Der
Authorization: Bearer-Header fehlt oder es ist die falsche Umgebungsvariable gesetzt. - Es wird
kimi-k3oder ein Marketingname stattmoonshotai/kimi-k3gesendet. - Verwendung von
https://api.novita.ai/openaials SDK-Basis-URL, wenn der Client den versionierten Pfad.../openai/v1erwartet. - Der Anfragetext ist kein gültiges JSON.
- Es wird ein Ausgabelimit gesetzt, das größer ist, als Ihre Anwendung speichern oder verarbeiten kann.
- Es wird angenommen, dass ein multimodaler Anfragetext in jedem SDK und jeder Modellfamilie identisch ist.
Python-Beispiel
Installieren Sie den OpenAI-Python-Client in Ihrer Umgebung und führen Sie dieses Beispiel mit gesetzter NOVITA_API_KEY aus:
pip install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["NOVITA_API_KEY"],
base_url="https://api.novita.ai/openai/v1",
)
response = client.chat.completions.create(
model="moonshotai/kimi-k3",
messages=[
{
"role": "system",
"content": "You are a concise engineering assistant.",
},
{
"role": "user",
"content": "List three risks when adding retries to a streaming API client.",
},
],
temperature=0.2,
max_tokens=300,
)
print(response.choices[0].message.content)
Das Beispiel verwendet bewusst eine kurze Completion. Erhöhen Sie die Kontext- und Ausgabebudgets erst, nachdem Sie Timeout-, Retry-, Logging- und Usage-Tracking hinzugefügt haben, die für Ihre Anwendung geeignet sind.
cURL-Beispiel
Dieselbe Anfrage kann ohne SDK getestet werden:
payload='{
"model": "moonshotai/kimi-k3",
"messages": [
{
"role": "system",
"content": "You are a concise engineering assistant."
},
{
"role": "user",
"content": "List three risks when adding retries to a streaming API client."
}
],
"temperature": 0.2,
"max_tokens": 300
}'
curl --request POST "https://api.novita.ai/openai/v1/chat/completions" \
--header "Authorization: Bearer $NOVITA_API_KEY" \
--header "Content-Type: application/json" \
--data "$payload"
Wichtige Parameter
| Parameter | Was er steuert | Sinnvoller erster Wert |
|---|---|---|
model |
Das gehostete Modell, das die Anfrage beantwortet | moonshotai/kimi-k3 |
messages |
System-, User- und Assistant-Gesprächsrunden | Eine System- und eine User-Nachricht |
temperature |
Variabilität der Ausgabe | 0.2 für wiederholbare Tests |
max_tokens |
Maximale erzeugte Ausgabe | 300, dann bewusst erhöhen |
stream |
Ob die Ausgabe inkrementell eintrifft | Während des Debuggens deaktiviert lassen |
tools |
Funktionsdefinitionen, die dem Modell zur Verfügung stehen | Erst hinzufügen, wenn der Basischat funktioniert |
response_format |
Anforderungen an strukturierte Ausgaben | Das zurückgegebene JSON validieren, bevor Sie es verwenden |
Bestätigen Sie bei Bild- oder Videoeingaben das aktuelle Anfrageformat in der Modell- und API-Dokumentation, bevor Sie es in Ihre Anwendung aufnehmen. Fähigkeitsbezeichnungen auf einer Modellseite ersetzen nicht das Testen der genauen Inhaltsstruktur, die Ihre Client-Bibliothek verwendet.
Fehlerbehebung
Authentifizierung schlägt fehl
Prüfen Sie, ob NOVITA_API_KEY in demselben Prozess gesetzt ist, der die Anfrage ausführt. Stellen Sie sicher, dass der Header Bearer verwendet und nicht einen Query-Parameter oder einen anderen Berechtigungsnamen.
Das Modell wird nicht gefunden
Verwenden Sie die exakte ID moonshotai/kimi-k3. Der Modellanzeigename ist kein gültiger Ersatz für die API-Modell-ID.
Die Anfrage wird abgelehnt
Reduzieren Sie die Prompt- und max_tokens-Werte, validieren Sie den JSON-Body und stellen Sie sicher, dass der Endpunkt /openai/v1/chat/completions ist. Wenn die Anfrage Bilder, Videos, Tools oder strukturierte Ausgaben verwendet, entfernen Sie diese Felder und fügen Sie sie einzeln wieder hinzu.
Anfragen sind langsam oder werden ratenlimitiert
Messen Sie die Anzahl der Prompt- und Ausgabe-Token, reduzieren Sie unnötigen wiederholten Kontext und fügen Sie begrenztes exponentielles Backoff für wiederholbare Antworten hinzu. Prüfen Sie die aktuelle Ratenstufe Ihres Kontos, statt die höchste Stufe der Tabelle auf der Modellseite anzunehmen.
Die Antwort ist unvollständig
Untersuchen Sie den Finish-Grund und die Usage-Daten. Ein kleiner max_tokens-Wert kann eine lange Antwort vorzeitig beenden; eine Erhöhung erhöht auch die Menge an Ausgabe, die Ihre Anwendung bezahlen und verarbeiten muss.
FAQ
Welche Modell-ID soll ich für Kimi K3 senden?
Senden Sie moonshotai/kimi-k3 im Feld model.
Welchen Endpunkt verwendet der OpenAI-Client?
Setzen Sie die SDK-Basis-URL auf https://api.novita.ai/openai/v1. Die Chat-Completions-Anfrage wird an https://api.novita.ai/openai/v1/chat/completions gesendet.
Wie groß ist das Kontextfenster von Kimi K3?
Die Novita-Modellseite listet ein Kontextfenster von 1.048.576 Token und eine maximale Ausgabeeinstellung von 1.048.576 Token. Prüfen Sie die Seite vor dem Deployment auf Aktualisierungen.
Ist Kimi K3 kostenlos nutzbar?
Hier wird kein kostenloser Zugriff behauptet. Die Modellseite listet tokenbasierte serverlose Preise. Prüfen Sie daher die aktuell angezeigten Preise für Ihr Konto und Modell, bevor Sie große Anfragen senden.
Sollte ich mit einer multimodalen Anfrage beginnen?
Nein. Beginnen Sie mit einer kleinen, reinen Textanfrage, damit Authentifizierung, Endpunktauswahl, Antwortauswertung und Fehlerbehandlung leicht zu überprüfen sind. Fügen Sie multimodale Eingaben erst hinzu, wenn dieser Pfad stabil ist.
Empfohlene Artikel
- Kimi K3 auf Novita AI: Preise, 1M Kontext und wann Sie es K2 vorziehen sollten
- MiniMax M3 API-Schnellstart mit Novita AI
- So greifen Sie auf Kimi K2 Thinking zu: Vollständiger Setup-Leitfaden für Entwickler
- Verwendung von LlamaIndex mit Novita AI: Eine Schritt-für-Schritt-Anleitung
Quellen
- Kimi-K3-Modellseite — Modell-ID, Verfügbarkeit, Fähigkeiten, Kontext, Limits, Preise und Ratenstufen; geprüft am 22. Juli 2026.
- Novita-AI-API-Referenz: Chat-Completion erstellen — OpenAI-kompatible Chat-Completion-Route; geprüft am 22. Juli 2026.
