- Wann dieser Schnellstart verwendet werden sollte
- Schritt 1: Holen Sie sich Ihren Novita-API-Schlüssel
- Schritt 2: Bestätigen Sie die Modell-ID und den Endpunkt
- Schritt 3: Senden Sie Ihre erste Anfrage
- Schritt 4: Lesen Sie die Antwort
- Schritt 5: Überprüfen Sie Preise, Grenzen und häufige Fehler
- Python-Beispiel
- cURL-Beispiel
- Wichtige Parameter
- Fehlerbehebung
- FAQ
- Empfohlene Artikel
Kimi K3 ist über die serverlose API von Novita AI mit der Modell-ID moonshotai/kimi-k3, einem OpenAI-kompatiblen Chat-Endpunkt, einem Kontextfenster von 1.048.576 Token und einer maximalen Ausgabeeinstellung von 1.048.576 Token, die auf der Modellseite aufgeführt ist, verfügbar. Dieser Schnellstart zeigt, wie Sie sich authentifizieren, eine erste Anfrage senden, die Antwort parsen und die Token-Preise von Kimi K3 planen, bevor Sie es mit einer größeren Anwendung verbinden.
Wann dieser Schnellstart verwendet werden sollte
Verwenden Sie diesen Leitfaden, wenn Sie Kimi K3 von einer Anwendung aus testen möchten, die bereits das OpenAI-API-Format spricht. Es ist ein praktischer Ausgangspunkt für Workflows mit langen Kontexten in der Softwareentwicklung, Dokumentenanalyse, Forschung und Reasoning, bei denen die Anfrage wesentlich mehr Kontext enthalten kann als eine typische Chat-Eingabe.
Die Novita-Modellseite von Kimi K3 beschreibt ein Modell mit 2,8 Billionen Parametern, nativem visuellem Verständnis und einem Kontextfenster von 1 Million Token. Dieselbe Seite listet Texteingaben, Bildeingaben und Videoeingaben mit Textausgabe sowie serverlosen Zugriff, strukturierte Ausgabe, Reasoning und Funktionsaufrufe auf. Betrachten Sie diese als Fähigkeiten, die Sie gegen Ihre beabsichtigte Anfrageform überprüfen sollten, anstatt anzunehmen, dass jedes OpenAI-SDK-Feature über alle Modelle hinweg identisches Verhalten aufweist.
Dies ist kein Benchmark-Vergleich. Das Ziel ist es, eine authentifizierte Anfrage zum Laufen zu bringen und Ihnen dann genügend betriebliche Details zu geben, um zu entscheiden, ob Kimi K3 zu Ihrem Arbeitsaufwand passt.
Schritt 1: Holen Sie sich Ihren Novita-API-Schlüssel
Erstellen oder wählen Sie ein Novita AI-Konto aus, öffnen Sie Ihre API-Schlüsseleinstellungen und erstellen Sie einen Schlüssel für die serverseitige Verwendung. Bewahren Sie den Schlüssel nach Möglichkeit außerhalb von Frontend-Bundles, öffentlichen Repositories, außerhalb Ihres Teams geteilten Notebooks und der Shell-Historie auf.
Setzen Sie den Schlüssel als Umgebungsvariable, bevor Sie eines der Beispiele ausführen:
export NOVITA_API_KEY="your_api_key_here"
Verwenden Sie einen Projekt- oder temporären Schlüssel, wenn Ihr Kontosetup dies unterstützt. Rotieren Sie den Schlüssel nach einer öffentlichen Demo oder einem vermuteten Leck.
Schritt 2: Bestätigen Sie die Modell-ID und den Endpunkt
Halten Sie die Verbindungsdetails zusammen, damit ein Anzeigename nicht versehentlich die tatsächliche Modellkennung ersetzt:
| Feld | Wert |
|---|---|
| Modell-ID | moonshotai/kimi-k3 |
| Basis-URL | https://api.novita.ai/openai/v1 |
| Chat-Completions-Endpunkt | https://api.novita.ai/openai/v1/chat/completions |
| Kontextfenster | 1.048.576 Token |
| Maximale Ausgabeeinstellung | 1.048.576 Token |
| Eingabefähigkeiten | Text, Bild, Video |
| Ausgabefähigkeit | Text |
| Zugriffstyp | Serverlose API |
Die Kimi K3 Modellseite ist die maßgebliche Quelle für Verfügbarkeit, aktuelle Grenzen, Fähigkeiten und Preise. Überprüfen Sie sie erneut vor dem Deployment, da sich Modellkonfigurationen und Preise ändern können.
Schritt 3: Senden Sie Ihre erste Anfrage
Beginnen Sie mit einer kurzen, reinen Textanfrage. Eine kleine Eingabe erleichtert es, Authentifizierungs- oder Routing-Probleme von anwendungsbezogenen Eingabeproblemen zu unterscheiden.
Bitten Sie Kimi K3 beispielsweise, eine kurze Implementierungscheckliste zurückzugeben:
List the three biggest risks when adding retries to a streaming API client. Return one sentence per risk.
Halten Sie den ersten max_tokens-Wert bescheiden. Eine große Ausgabeerlaubnis ist erst nützlich, nachdem die grundlegende Anfrage, das Parsen der Antwort und die Fehlerbehandlung korrekt funktionieren.
Schritt 4: Lesen Sie die Antwort
Die OpenAI-kompatible Antwort platziert den Text des Assistenten bei choices[0].message.content für eine standardmäßige, nicht-streaming Chat-Completion. Bewahren Sie Antwortmetadaten und Nutzungsfelder in Ihrer Anwendung auf, wenn Sie Anfrageverfolgung oder Kostenabrechnung benötigen.
Für eine Produktionsintegration erfassen Sie mindestens:
- Die Modell-ID und der Zeitstempel der Anfrage.
- Die Anbieter-Anfrage-ID, sofern vom Client oder in den Antwort-Headern zurückgegeben.
- Token-Nutzung von Eingabe und Vervollständigung.
- Wiederholungsanzahl und HTTP-Status.
- Ob die Anfrage nur Text oder multimodale Inhalte verwendet hat.
Sobald der erste Aufruf erfolgreich ist, testen Sie Eingaben, die Ihrem tatsächlichen Arbeitsaufwand ähneln: lange Quelldateien, mehrere Dokumente, ein Tool-Schema oder einen strukturierten Antwortvertrag. Eine erfolgreiche kurze Eingabe bestätigt die Konnektivität, nicht die Produktionsqualität.
Schritt 5: Überprüfen Sie Preise, Grenzen und häufige Fehler
Die Novita-Modellseite listet die serverlosen Preise für Kimi K3 auf: $3 pro Million Eingabe-Token, $0,30 pro Million zwischengespeicherter Lese-Token und $15 pro Million Ausgabe-Token. Ihre Schätzung sollte beide Seiten der Anfrage, Wiederholungen und die Menge des wiederholt gesendeten Kontexts umfassen.
Die Seite listet auch diese Anforderungsraten-Stufen:
| Stufe | Anfragen pro Minute | Token pro Minute |
|---|---|---|
| T1 | 30 | 50.000.000 |
| T2 | 100 | 50.000.000 |
| T3 | 1.000 | 50.000.000 |
| T4 | 3.000 | 50.000.000 |
| T5 | 6.000 | 50.000.000 |
Die anwendbare Stufe hängt von Ihrem Konto ab. Betrachten Sie die Tabelle nicht als Versprechen, dass jedes Projekt bei T1 beginnt oder dass jeder Arbeitsaufwand die maximal angezeigte Rate nutzen kann.
Häufige Fehler bei der ersten Integration sind:
- Fehlender
Authorization: Bearer-Header oder Setzen der falschen Umgebungsvariable. - Senden von
kimi-k3oder einem Marketingnamen anstelle vonmoonshotai/kimi-k3. - Verwendung von
https://api.novita.ai/openaials SDK-Basis-URL, wenn der Client den versionierten Pfad.../openai/v1erwartet. - Senden eines Anforderungstextes, der kein gültiges JSON ist.
- Festlegen eines Ausgabelimits, das größer ist, als Ihre Anwendung speichern oder verarbeiten kann.
- Annahme, dass ein multimodaler Anforderungstext über alle SDKs oder Modellfamilien hinweg identisch ist.
Python-Beispiel
Installieren Sie den OpenAI Python-Client in Ihrer Umgebung und führen Sie dann dieses Beispiel mit gesetztem NOVITA_API_KEY aus:
pip install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["NOVITA_API_KEY"],
base_url="https://api.novita.ai/openai/v1",
)
response = client.chat.completions.create(
model="moonshotai/kimi-k3",
messages=[
{
"role": "system",
"content": "You are a concise engineering assistant.",
},
{
"role": "user",
"content": "List three risks when adding retries to a streaming API client.",
},
],
temperature=0.2,
max_tokens=300,
)
print(response.choices[0].message.content)
Das Beispiel verwendet absichtlich eine kurze Vervollständigung. Erhöhen Sie die Kontext- und Ausgabebudgets erst, nachdem Sie Timeout, Wiederholung, Protokollierung und Nutzungsverfolgung hinzugefügt haben, die für Ihre Anwendung angemessen sind.
cURL-Beispiel
Dieselbe Anfrage kann ohne SDK getestet werden:
payload='{
"model": "moonshotai/kimi-k3",
"messages": [
{
"role": "system",
"content": "You are a concise engineering assistant."
},
{
"role": "user",
"content": "List three risks when adding retries to a streaming API client."
}
],
"temperature": 0.2,
"max_tokens": 300
}'
curl --request POST "https://api.novita.ai/openai/v1/chat/completions" \
--header "Authorization: Bearer $NOVITA_API_KEY" \
--header "Content-Type: application/json" \
--data "$payload"
Wichtige Parameter
| Parameter | Was er steuert | Sinnvoller erster Wert |
|---|---|---|
model |
Das gehostete Modell, das die Anfrage beantwortet | moonshotai/kimi-k3 |
messages |
System-, Benutzer- und Assistenten-Gesprächsrunden | Eine System- und eine Benutzernachricht |
temperature |
Ausgabevariabilität | 0.2 für wiederholbare Tests |
max_tokens |
Maximale generierte Ausgabe | 300, dann bewusst erhöhen |
stream |
Ob die Ausgabe inkrementell ankommt | Während des Debuggens deaktiviert lassen |
tools |
Dem Modell verfügbare Funktionsdefinitionen | Hinzufügen, nachdem der grundlegende Chat funktioniert |
response_format |
Anforderungen an die strukturierte Ausgabe | Validieren Sie das zurückgegebene JSON, bevor Sie es verwenden |
Bestätigen Sie für Bild- oder Videoeingaben das aktuelle Anfrageformat in der Modell- und API-Dokumentation, bevor Sie sie zu Ihrer Anwendung hinzufügen. Fähigkeitsbezeichnungen auf einer Modellseite ersetzen nicht das Testen der genauen Inhaltsstruktur, die von Ihrer Client-Bibliothek verwendet wird.
Fehlerbehebung
Authentifizierung schlägt fehl
Überprüfen Sie, ob NOVITA_API_KEY im selben Prozess gesetzt ist, der die Anfrage ausführt. Bestätigen Sie, dass der Header Bearer verwendet, keinen Abfrageparameter oder einen anderen Berechtigungsnamen.
Das Modell wird nicht gefunden
Verwenden Sie die genaue ID moonshotai/kimi-k3. Der Anzeigename des Modells ist kein gültiger Ersatz für die API-Modell-ID.
Die Anfrage wird abgelehnt
Reduzieren Sie die Werte für Eingabe und max_tokens, validieren Sie den JSON-Text und bestätigen Sie, dass der Endpunkt /openai/v1/chat/completions ist. Wenn die Anfrage Bilder, Videos, Tools oder strukturierte Ausgabe verwendet, entfernen Sie diese Felder und fügen Sie sie einzeln wieder hinzu.
Anfragen sind langsam oder ratenbegrenzt
Messen Sie die Token-Anzahl von Eingabe und Ausgabe, reduzieren Sie unnötig wiederholten Kontext und fügen Sie begrenztes exponentielles Backoff für wiederholbare Antworten hinzu. Überprüfen Sie die aktuelle Tarifstufe Ihres Kontos, anstatt die höchste Stufe in der Tabelle der Modellseite anzunehmen.
Die Antwort ist unvollständig
Überprüfen Sie den Abschlussgrund und die Nutzungsdaten. Ein kleiner max_tokens-Wert kann eine lange Antwort vorzeitig beenden; eine Erhöhung erhöht auch die Menge an Ausgabe, die Ihre Anwendung bezahlen und verarbeiten muss.
FAQ
Welche Modell-ID sollte ich für Kimi K3 senden?
Senden Sie moonshotai/kimi-k3 im Feld model.
Welchen Endpunkt verwendet der OpenAI-Client?
Setzen Sie die SDK-Basis-URL auf https://api.novita.ai/openai/v1. Die Chat-Completions-Anfrage wird an https://api.novita.ai/openai/v1/chat/completions gesendet.
Wie groß ist das Kontextfenster von Kimi K3?
Die Novita-Modellseite listet ein Kontextfenster von 1.048.576 Token und eine maximale Ausgabeeinstellung von 1.048.576 Token auf. Überprüfen Sie die Seite vor dem Deployment auf Aktualisierungen.
Ist Kimi K3 kostenlos nutzbar?
Hier wird kein kostenloser Zugang beansprucht. Die Modellseite listet tokenbasierte serverlose Preise auf. Überprüfen Sie daher die aktuellen Preise, die für Ihr Konto und Modell angezeigt werden, bevor Sie große Anfragen senden.
Sollte ich mit einer multimodalen Anfrage beginnen?
Nein. Beginnen Sie mit einer kleinen, reinen Textanfrage, damit Authentifizierung, Endpunktauswahl, Antwortparsen und Fehlerbehandlung leicht überprüft werden können. Fügen Sie multimodale Eingaben hinzu, nachdem dieser Pfad stabil ist.
Empfohlene Artikel
- MiniMax M3 API Schnellstart mit Novita AI
- Wie Sie auf Kimi K2 Thinking zugreifen: Vollständige Einrichtungsanleitung für Entwickler
- Verwendung von LlamaIndex mit Novita AI: Eine Schritt-für-Schritt-Anleitung
Quellen
- Kimi K3 Modellseite — Modell-ID, Verfügbarkeit, Fähigkeiten, Kontext, Grenzen, Preise und Tarifstufen; überprüft am 22. Juli 2026.
- Novita AI API-Referenz: Chat-Completion erstellen — OpenAI-kompatibler Chat-Completion-Route; überprüft am 22. Juli 2026.
