Kling O1 auf Novita AI: T2V-, I2V-, Ref2V- und Video-Edit-Modi

Kling O1 auf Novita AI: T2V-, I2V-, Ref2V- und Video-Edit-Modi

Kling O1 (Kling Omni Video O1) ist das erste vereinheitlichte multimodale Videomodell von Kuaishou und bietet über die Novita AI API vier verschiedene Generierungsmodi: Text-to-Video (T2V), Image-to-Video (I2V), Reference-to-Video (Ref2V) und Video Edit. Jeder Modus akzeptiert unterschiedliche Eingaben und löst ein anderes Problem – die falsche Wahl führt zu mehr Aufwand und höheren Kosten. Dieser Leitfaden erklärt, was jeder Modus tatsächlich macht, welche Eingaben er erfordert, wie er auf Novita AI abgerechnet wird und welchen du für häufige Entwickleranwendungsfälle zuerst ausprobieren solltest.

Was ist Kling O1?

Kling O1 basiert auf Kuaishous MVL-Architektur (Multimodal Visual Language), die Text-, Bild-, Referenz- und Videobearbeitungsaufgaben in einem einzigen Modell zusammenfasst, anstatt sie auf separate spezialisierte Modelle zu verteilen. Das ist praktisch relevant: Das zugrundeliegende Bewegungsmodell und die Identitätskodierung werden modusübergreifend geteilt, sodass Charaktere und Objekte, die in einem Modus beschrieben werden, konsistente visuelle Eigenschaften in den nächsten übernehmen.

Im Vergleich zu früheren Kling-Versionen (V2.5, V2.6, V3.0 Standard/Pro) fügt Kling O1 mit Ref2V und Video Edit Funktionen hinzu, die strukturell neu sind – sie waren vor O1 in keiner Standard- oder Pro-Stufe verfügbar. T2V und I2V profitieren in O1 von der gemeinsamen MVL-Basis, was die Konsistenz der Motive über Frames hinweg im Vergleich zu den früheren Generierungsmodellen verbessert.

Kling O1 ist von Kling 3.0 (auch Kling O3 genannt) zu unterscheiden. Kling 3.0 ist ein Nachfolgemodell, das native Audio-Kogeneration und erweiterte 15-Sekunden-Clips bietet. Kling O1 auf Novita AI erzeugt derzeit Videos mit einer Länge von bis zu 10 Sekunden ohne natives Audio.

Die vier Modi auf einen Blick

Modus Primäre Eingabe Erforderliche Eingaben Dauer Preis auf Novita AI
T2V Text-Prompt prompt 5–10 s 0,112 $/s
I2V Bild + Prompt image_url, prompt 5–10 s 0,112 $/s
Ref2V Referenzbilder + Prompt prompt, image_urls oder elements 3–10 s 0,168 $/s
Video Edit Quellvideo + Prompt video_url, prompt 3–10 s (Fast: 6–20 s) 0,168 $/s (Fast: 0,09 $/s)

Preise bestätigt auf den Novita AI-Modellseiten am 26.06.2026. Die Abrechnung erfolgt pro Sekunde für die von dir angegebene Dauer.

Kling O1 Text-to-Video (T2V) auf Novita AI

Endpunkt: POST /v3/async/kling-o1-t2v

T2V generiert ein Video vollständig aus einer Textbeschreibung. Du gibst einen Prompt an; das Modell erzeugt Bewegung, Beleuchtung, Kamerabewegung und Szenenkomposition aus dem Nichts. Es gibt keinen Bildanker, sodass das Modell im Rahmen der Prompt-Vorgaben völlige kreative Freiheit hat.

Verwende T2V, wenn:

  • Du kein Referenzbild oder Szenenbild hast.
  • Du ein Konzept ausloten möchtest, bevor du dich für eine visuelle Richtung entscheidest.
  • Du viele visuelle Variationen zu niedrigen Kosten pro Clip erzeugen musst.

Bei 0,112 $/s kostet ein 5-Sekunden-Clip 0,56 $ und ein 10-Sekunden-Clip 1,12 $. T2V unterstützt auf Novita AI Dauern von 5 und 10 Sekunden mit den Seitenverhältnissen 16:9, 9:16 und 1:1.

curl --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-t2v \
  --header 'Authorization: Bearer $NOVITA_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "prompt": "A red fox trotting through a snowy pine forest, golden hour light, cinematic wide shot",
    "duration": 5,
    "aspect_ratio": "16:9"
  }'

Kling O1 Image-to-Video (I2V) auf Novita AI

Endpunkt: POST /v3/async/kling-o1-i2v

I2V animiert ein statisches Bild zu einem Videoclip. Das Quellbild wird zum Startframe; der Prompt steuert die darauf folgende Bewegung und Szenenentwicklung. Du kannst optional einen Endframe angeben, um dem Modell einen Zielzustand vorzugeben, und das Modell interpoliert die Bewegung zwischen Start und Ende.

Erforderlich: image_url (Startframe) und prompt. Der Endframe (end_image_url) ist optional, aber nützlich, wenn du eine bestimmte Komposition am Schnittpunkt wünschst.

Verwende I2V, wenn:

  • Du ein vorhandenes Bild oder Design hast, das sich bewegen soll.
  • Du eine deterministische visuelle Verankerung wünschst – das Aussehen der Figur oder Szene ist bereits im Quellbild definiert.
  • Du Produktdemos, Social-Media-Inhalte oder E-Commerce-Animationen aus vorhandenen Assets erstellst.

Mit 0,112 $/s kostet I2V genauso viel wie T2V. Der entscheidende Kompromiss ist, dass I2V den Startframe auf dein Eingabebild festlegt, was die Konsistenz verbessert, aber auch bedeutet, dass ein minderwertiges Quellbild das Ergebnis einschränkt. Bildbeschränkungen auf Novita AI: mindestens 300×300 Pixel, maximale Dateigröße 10 MB, Seitenverhältnis zwischen 0,4 und 2,5.

curl --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-i2v \
  --header 'Authorization: Bearer $NOVITA_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "image_url": "https://example.com/product-shot.jpg",
    "prompt": "The product slowly rotates to reveal the back panel, soft studio lighting",
    "duration": 5,
    "aspect_ratio": "1:1"
  }'

Kling O1 Reference-to-Video (Ref2V) auf Novita AI

Endpunkt: POST /v3/async/kling-o1-ref2v

Ref2V ist der flexibelste Modus und derjenige, der die MVL-Architektur von O1 am direktesten nutzt. Anstelle eines einzelnen Startframes lieferst du bis zu sieben Referenzbilder über zwei Eingabetypen: image_urls (Stil- oder Szenenreferenzen) und elements (Identitätsanker für Charaktere oder Objekte). Der Prompt verwendet Tags wie @Image1, @Image2 sowie @Element1, @Element2, um dem Modell mitzuteilen, welche Referenz wo angewendet werden soll.

So kannst du eine Szene aus mehreren Quell-Assets zusammensetzen: einen Charakter aus einem Porträtfoto, einen Hintergrund aus einem Ortsbild und ein Requisit aus einem Produktbild – alle im Prompt namentlich referenziert.

Eingaberegeln:

  • prompt ist erforderlich.
  • image_urls und elements sind optional, aber mindestens eine der Angaben sollte sinnvoll sein; ein reiner Prompt ohne Referenzen funktioniert, verhält sich aber eher wie T2V.
  • Die Gesamtzahl der Referenzen (elements + image_urls) darf 7 nicht überschreiten.
  • Jedes Element in elements kann mehrere reference_image_urls (Aufnahmen aus verschiedenen Winkeln) sowie optional eine frontal_image_url für eine sauberere Identitätszuordnung enthalten.

Verwende Ref2V, wenn:

  • Du konsistente Charaktere über mehrere Clips hinweg benötigst (episodische Inhalte, Marketing-Sequenzen).
  • Du Charaktere oder Objekte aus verschiedenen Quellbildern in einer einzigen Szene kombinieren möchtest.
  • Du möchtest, dass das Modell von einem Startframe aus interpoliert, während die visuelle Identität aus einem separaten Referenzsatz erhalten bleibt.

Ref2V kostet 0,168 $/s – 50 % mehr als T2V und I2V. Für einen 5-Sekunden-Clip sind das 0,84 $, für 10 Sekunden 1,68 $. Der Aufpreis spiegelt den zusätzlichen Schritt der Referenzkodierung wider. Wenn dein Anwendungsfall keine bildübergreifende Identitätskonsistenz erfordert, reicht I2V für 0,112 $/s aus.

curl --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-ref2v \
  --header 'Authorization: Bearer $NOVITA_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "prompt": "Take @Image1 as the start frame. @Element1 walks into the scene and picks up the glowing artifact. Cinematic lighting, steady camera.",
    "image_urls": ["https://example.com/scene-bg.jpg"],
    "elements": [
      {
        "reference_image_urls": ["https://example.com/character-front.jpg", "https://example.com/character-side.jpg"],
        "frontal_image_url": "https://example.com/character-front.jpg"
      }
    ],
    "duration": 5,
    "aspect_ratio": "16:9"
  }'

Kling O1 Video-Edit-Modus auf Novita AI

Endpunkt (Standard): POST /v3/async/kling-o1-video-edit

Endpunkt (Fast): verfügbar über die Fast-VideoEdit-Variante von Novita AI

Video Edit nimmt ein vorhandenes Video als Eingabe und verwandelt es mithilfe eines natürlichsprachlichen Prompts. Das Modell behält die ursprüngliche Bewegungsstruktur bei – Timing, Kamerabewegung, Handlungsbogen – während es Motive, Umgebungen oder den visuellen Stil gemäß dem Prompt ändert. Du kannst auch Referenzbilder und Elementanker mit demselben Tagging-System (@Image1 / @Element1) wie bei Ref2V bereitstellen.

Erforderlich: video_url (Quellvideo, 3–10 s, MP4 oder MOV, 720–2160 px, max. 200 MB) und prompt.

Zwei Varianten:

  • Standard VideoEdit: unterstützt 3–10 Sekunden lange Quellvideos, Preis 0,168 $/s.
  • Fast VideoEdit: unterstützt 6–20 Sekunden lange Quellvideos, Preis 0,09 $/s – die niedrigsten Kosten pro Sekunde aller Kling-O1-Modi auf Novita AI.

Verwende Video Edit, wenn:

  • Du vorhandenes Filmmaterial hast, das eine Stil- oder Inhaltsänderung benötigt, ohne neu drehen zu müssen.
  • Du einen Charakter in einem vorhandenen Video ersetzen möchtest, während die gleiche Bewegung erhalten bleibt.
  • Du einen Live-Action-Clip in einen animierten Stil umwandeln möchtest.

Die wesentliche Einschränkung: Das Quellvideo bestimmt die Bewegung. Video Edit kann nicht ändern, was ein Motiv tut – es kann nur ändern, wie das Motiv aussieht und in welcher Umgebung es sich befindet. Für Bewegungsänderungen erstelle neues Material mit T2V oder I2V.

curl --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-video-edit \
  --header 'Authorization: Bearer $NOVITA_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "video_url": "https://example.com/source-clip.mp4",
    "prompt": "Transform the setting to a neon-lit cyberpunk alley, keep the character movements exactly as-is",
    "duration": 5
  }'

Preise auf Novita AI

Alle Kling-O1-Modi auf Novita AI verwenden eine sekundengenaue Abrechnung basierend auf der von dir bei der Anfrage festgelegten Dauer. Preise bestätigt am 26.06.2026.

Modus Endpunkt Dauerbereich Preis/s 5 s Kosten 10 s Kosten
T2V /v3/async/kling-o1-t2v 5–10 s 0,112 $ 0,56 $ 1,12 $
I2V /v3/async/kling-o1-i2v 5–10 s 0,112 $ 0,56 $ 1,12 $
Ref2V /v3/async/kling-o1-ref2v 3–10 s 0,168 $ 0,84 $ 1,68 $
VideoEdit /v3/async/kling-o1-video-edit 3–10 s 0,168 $ 0,84 $ 1,68 $
VideoEdit Fast (Novita AI Fast-Variante) 6–20 s 0,090 $ 0,90 $

Neue Nutzer von Novita AI erhalten kostenloses Guthaben. Aktuelle Preise findest du auf der Novita AI-Preisseite, da sich die Preise ändern können.

Welchen Modus solltest du zuerst verwenden?

Beginne mit T2V, wenn dein Ziel die Konzepterkundung ist oder du kein bestimmtes Bild-Asset hast. Es ist der Einstieg mit dem geringsten Aufwand: ein erforderlicher Parameter (prompt), keine Asset-Vorbereitung nötig.

Wechsle zu I2V, wenn du ein Bild hast, das sich bewegen soll. Produktbilder, Charakterillustrationen und Szenenhintergründe eignen sich alle gut als I2V-Startframes. Gleicher Preis wie T2V, mehr visuelle Kontrolle.

Verwende Ref2V, wenn die Identitätskonsistenz über mehrere Clips hinweg wichtig ist – zum Beispiel für einen wiederkehrenden Charakter in mehreren Szenen oder die Kombination einer bestimmten Person mit einer bestimmten Umgebung. Kalkuliere den 50 %igen Aufpreis ein; für die Einzelclip-Generierung ist er nicht notwendig.

Behalte Video Edit für Postproduktions-Workflows vor, bei denen vorhandenes Filmmaterial eine visuelle Überarbeitung benötigt, die Bewegung jedoch intakt bleiben soll. Die Fast-Variante für 0,09 $/s ist die kosteneffizienteste Option für längere Bearbeitungen (6–20 Sekunden), bei denen die Generierungsgeschwindigkeit weniger kritisch ist.

Situation Empfohlener Modus
Kein Bild, Ideen erkunden T2V
Produkt- oder Szenenbild vorhanden, Bewegung gewünscht I2V
Gleicher Charakter über mehrere Clips hinweg Ref2V
Videomaterial vorhanden, anderes Aussehen gewünscht VideoEdit (Standard)
Lange Bearbeitung (6–20 s), kostenbewusst VideoEdit Fast

So rufst du die Kling-O1-API auf Novita AI auf

Alle vier Kling-O1-Modi auf Novita AI sind asynchron. Jede Anfrage gibt sofort eine task_id zurück; rufe den Task-Result-Endpunkt ab, bis der Status succeed ist.

# Schritt 1: Generierungsaufgabe senden (Beispiel: T2V)
RESPONSE=$(curl --silent --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-t2v \
  --header "Authorization: Bearer $NOVITA_API_KEY" \
  --header "Content-Type: application/json" \
  --data '{"prompt": "Your prompt here", "duration": 5, "aspect_ratio": "16:9"}')

TASK_ID=$(echo $RESPONSE | python3 -c "import sys,json; print(json.load(sys.stdin)['task_id'])")

# Schritt 2: Ergebnisse abrufen
curl --request GET \
  --url "https://api.novita.ai/v3/async/task-result?task_id=$TASK_ID" \
  --header "Authorization: Bearer $NOVITA_API_KEY"

Die Antwort enthält ein Feld status. Wenn es succeed lautet, enthält das Array videos die Ausgabe-URL. Die typische Generierungszeit beträgt 30–120 Sekunden, abhängig von Dauer und Modus.

Deinen API-Schlüssel erhältst du aus dem Novita AI-Dashboard. Neue Konten erhalten kostenloses Guthaben, um alle vier Modi zu testen, bevor du dich für die Produktion entscheidest.

Fazit

Kling O1 auf Novita AI bietet Entwicklern Zugriff auf vier verschiedene Videogenerierungsmodi – T2V, I2V, Ref2V und Video Edit – über eine einzige, einheitliche API. T2V und I2V decken die häufigen Generierungsfälle zu 0,112 $/s ab. Ref2V fügt eine Multi-Referenz-Identitätskomposition für wiederkehrende Charaktere zu 0,168 $/s hinzu. Video Edit transformiert vorhandenes Filmmaterial unter Beibehaltung der Bewegung, mit einer Fast-Variante für 0,09 $/s für längere Clips. Die richtige Wahl des Modus spart Kosten und reduziert Aufwand: Beginne mit T2V, wenn du kein Bild-Asset hast, mit I2V, wenn du eines hast, mit Ref2V, wenn die Identitätskonsistenz über Clips hinweg wichtig ist, und mit Video Edit, wenn die Bewegung bereits aufgezeichnet ist. Alle Modi teilen das gleiche asynchrone Aufgabenmuster auf Novita AI, sodass die Integration mehrerer Modi in eine Pipeline nur minimalen zusätzlichen Code erfordert.

Novita AI ist eine KI-Cloud-Plattform, die Entwicklern gehosteten Zugriff auf Video-, Bild-, Audio- und Sprachmodelle über eine einheitliche API bietet.

Häufig gestellte Fragen

Was ist der Unterschied zwischen Kling O1 T2V und I2V auf Novita AI?

T2V generiert ein Video allein aus einem Text-Prompt – es ist kein Bild erforderlich. I2V nimmt ein Bild als Startframe und animiert es gemäß dem Prompt. Beide sind zu 0,112 $/s erhältlich und unterstützen 5–10 Sekunden lange Clips. Verwende T2V zur Erkundung; verwende I2V, wenn du einen bestimmten visuellen Anker hast.

Was kann Kling O1 Ref2V, was I2V nicht kann?

Ref2V akzeptiert bis zu 7 Referenzbilder über mehrere Eingabeschlitze und ermöglicht so die Kombination separater Quellen für Charakteridentität, Szenenhintergrund und Stil. Du referenzierst jede Eingabe namentlich im Prompt (@Element1, @Image1). I2V verwendet einen einzelnen Startframe ohne benanntes Referenzsystem.

Ist Kling O1 dasselbe wie Kling 3.0?

Nein. Kling O1 (veröffentlicht Dezember 2025) ist das grundlegende, vereinheitlichte multimodale Videomodell. Kling 3.0 (auch Kling O3 genannt, veröffentlicht Februar 2026) ist ein Nachfolger, der native Audio-Kogeneration und Clips mit bis zu 15 Sekunden hinzufügt. Kling O1 auf Novita AI unterstützt Videos mit bis zu 10 Sekunden ohne natives Audio.

Wie wähle ich zwischen VideoEdit Standard und VideoEdit Fast?

Standard VideoEdit akzeptiert 3–10 Sekunden lange Quellclips zu 0,168 $/s. Fast VideoEdit akzeptiert 6–20 Sekunden lange Clips zu 0,09 $/s. Wenn dein Quellvideo kürzer als 10 Sekunden ist und die Bearbeitungszeit eine Rolle spielt, verwende Standard. Wenn du längere Clips hast oder Batch-Postproduktionsarbeit durchführst, ist Fast deutlich günstiger.

Empfohlene Artikel