Kling O1 sur Novita AI : modes T2V, I2V, Ref2V et Video Edit

Kling O1 sur Novita AI : modes T2V, I2V, Ref2V et Video Edit

Kling O1 (Kling Omni Video O1) est le premier modèle vidéo multimodal unifié de Kuaishou, exposant quatre modes de génération distincts via l’API Novita AI : Text-to-Video (T2V), Image-to-Video (I2V), Reference-to-Video (Ref2V) et Video Edit. Chaque mode accepte différentes entrées et résout un problème différent — choisir le mauvais mode ajoute des frictions et des coûts. Ce guide explique ce que chaque mode fait réellement, ce qu’il nécessite, comment il est tarifé sur Novita AI, et lequel essayer en premier pour les cas d’usage courants des développeurs.

Qu’est-ce que Kling O1 ?

Kling O1 est construit sur l’architecture MVL (Multimodal Visual Language) de Kuaishou, qui consolide les tâches de texte, d’image, de référence et d’édition vidéo en un seul modèle plutôt que de les router vers des modèles spécialisés séparés. Cela a une importance pratique : le modèle de mouvement sous-jacent et l’encodage d’identité sont partagés entre les modes, de sorte que les personnages et objets décrits dans un mode conservent des propriétés visuelles cohérentes dans le suivant.

Comparé aux versions précédentes de Kling (V2.5, V2.6, V3.0 Standard/Pro), Kling O1 ajoute des capacités Ref2V et Video Edit structurellement nouvelles — elles n’étaient disponibles dans aucun niveau Standard ou Pro avant O1. T2V et I2V dans O1 bénéficient du backbone MVL partagé, ce qui améliore la cohérence des sujets entre les images par rapport aux modèles de génération précédents.

Kling O1 est distinct de Kling 3.0 (également appelé Kling O3). Kling 3.0 est un modèle successeur qui ajoute la co-génération audio native et des clips étendus jusqu’à 15 secondes. Kling O1 sur Novita AI couvre actuellement des vidéos jusqu’à 10 secondes sans audio natif.

Les quatre modes en un coup d’œil

Mode Entrée principale Entrées requises Durée Prix sur Novita AI
T2V Prompt textuel prompt 5–10 s $0.112/s
I2V Image + prompt image_url, prompt 5–10 s $0.112/s
Ref2V Images de référence + prompt prompt, image_urls ou elements 3–10 s $0.168/s
Video Edit Vidéo source + prompt video_url, prompt 3–10 s (Fast : 6–20 s) $0.168/s (Fast : $0.09/s)

Prix vérifiés sur les pages des modèles Novita AI le 2026-06-26. La facturation à la seconde s’applique à la durée que vous spécifiez.

Kling O1 Text-to-Video (T2V) sur Novita AI

Point d’accès : POST /v3/async/kling-o1-t2v

T2V génère une vidéo entièrement à partir d’une description textuelle. Vous fournissez un prompt ; le modèle crée le mouvement, l’éclairage, le mouvement de la caméra et la composition de la scène à partir de zéro. Il n’y a pas d’image d’ancrage, donc le modèle a une latitude créative totale dans les contraintes du prompt.

Utilisez T2V lorsque :

  • Vous n’avez pas d’image de référence ou de cadre de scène.
  • Vous explorez un concept avant de vous engager dans une direction visuelle.
  • Vous devez générer de nombreuses variations visuelles à faible coût par clip.

À $0.112/s, un clip de 5 secondes coûte $0.56 et un clip de 10 secondes coûte $1.12. T2V prend en charge les durées de 5 et 10 secondes sur Novita AI avec les ratios d’aspect 16:9, 9:16 et 1:1.

curl --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-t2v \
  --header 'Authorization: Bearer $NOVITA_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "prompt": "A red fox trotting through a snowy pine forest, golden hour light, cinematic wide shot",
    "duration": 5,
    "aspect_ratio": "16:9"
  }'

Kling O1 Image-to-Video (I2V) sur Novita AI

Point d’accès : POST /v3/async/kling-o1-i2v

I2V anime une image statique en un clip vidéo. L’image source devient la trame de départ ; le prompt contrôle le mouvement et le développement de la scène qui suivent. Vous pouvez éventuellement fournir une trame de fin pour donner un état cible au modèle, et le modèle interpole le mouvement entre le début et la fin.

Requis : image_url (trame de départ) et prompt. La trame de fin (end_image_url) est facultative mais utile lorsque vous souhaitez une composition spécifique au point de coupe.

Utilisez I2V lorsque :

  • Vous avez une image ou un design existant qui doit bouger.
  • Vous souhaitez un ancrage visuel déterministe — l’apparence du personnage ou de la scène est déjà définie dans l’image source.
  • Vous créez des démos produits, du contenu social ou des animations e-commerce à partir d’actifs existants.

À $0.112/s, I2V coûte le même prix que T2V. Le compromis clé est qu’I2V verrouille la trame de départ sur votre image d’entrée, ce qui améliore la cohérence mais signifie également qu’une image source de mauvaise qualité limite la sortie. Contraintes d’image sur Novita AI : taille minimale 300×300 px, taille de fichier maximale 10 Mo, ratio d’aspect entre 0.4 et 2.5.

curl --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-i2v \
  --header 'Authorization: Bearer $NOVITA_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "image_url": "https://example.com/product-shot.jpg",
    "prompt": "The product slowly rotates to reveal the back panel, soft studio lighting",
    "duration": 5,
    "aspect_ratio": "1:1"
  }'

Kling O1 Reference-to-Video (Ref2V) sur Novita AI

Point d’accès : POST /v3/async/kling-o1-ref2v

Ref2V est le mode le plus flexible et celui qui utilise le plus directement l’architecture MVL d’O1. Au lieu d’une seule trame de départ, vous fournissez jusqu’à sept images de référence réparties sur deux types d’entrée : image_urls (références de style ou de scène) et elements (ancres d’identité de personnage ou d’objet). Le prompt utilise les balises @Image1, @Image2, et @Element1, @Element2 pour indiquer au modèle quelle référence appliquer et où.

Règles d’entrée :

  • prompt est requis.
  • image_urls et elements sont facultatifs mais au moins l’un d’eux doit être significatif ; un prompt nu sans références fonctionne mais se comporte davantage comme T2V.
  • Le nombre total de références (elements + image_urls) ne doit pas dépasser 7.
  • Chaque élément dans elements peut inclure plusieurs reference_image_urls (prises de vue multi-angles) ainsi qu’un frontal_image_url facultatif pour une correspondance d’identité plus nette.

Utilisez Ref2V lorsque :

  • Vous avez besoin de personnages cohérents sur plusieurs clips (contenu épisodique, séquences marketing).
  • Vous combinez des personnages ou objets de différentes images sources en une seule scène.
  • Vous souhaitez que le modèle interpole à partir d’une trame de départ tout en maintenant l’identité visuelle d’un ensemble de références séparé.

Ref2V coûte $0.168/s — 50 % de plus que T2V et I2V. Pour un clip de 5 secondes, cela fait $0.84 ; pour 10 secondes, $1.68. La prime reflète l’étape supplémentaire d’encodage des références. Si votre cas d’utilisation ne nécessite pas de cohérence d’identité entre les images, I2V à $0.112/s est suffisant.

curl --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-ref2v \
  --header 'Authorization: Bearer $NOVITA_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "prompt": "Take @Image1 as the start frame. @Element1 walks into the scene and picks up the glowing artifact. Cinematic lighting, steady camera.",
    "image_urls": ["https://example.com/scene-bg.jpg"],
    "elements": [
      {
        "reference_image_urls": ["https://example.com/character-front.jpg", "https://example.com/character-side.jpg"],
        "frontal_image_url": "https://example.com/character-front.jpg"
      }
    ],
    "duration": 5,
    "aspect_ratio": "16:9"
  }'

Kling O1 Video Edit Mode sur Novita AI

Point d’accès (standard) : POST /v3/async/kling-o1-video-edit

Point d’accès (rapide) : disponible via la variante Fast VideoEdit de Novita AI

Video Edit prend une vidéo existante en entrée et la transforme à l’aide d’un prompt en langage naturel. Le modèle préserve la structure de mouvement originale — le timing, le mouvement de la caméra, l’arc d’action — tout en changeant les sujets, environnements ou le style visuel selon le prompt. Vous pouvez également fournir des images de référence et des ancres d’éléments en utilisant le même système de balises @Image1 / @Element1 que Ref2V.

Requis : video_url (vidéo source, 3–10 s, MP4 ou MOV, 720–2160 px, max 200 Mo) et prompt.

Deux variantes :

  • VideoEdit standard : prend en charge les vidéos sources de 3 à 10 secondes, tarifé à $0.168/s.
  • VideoEdit rapide : prend en charge les vidéos sources de 6 à 20 secondes, tarifé à $0.09/s — le coût par seconde le plus bas de tous les modes Kling O1 sur Novita AI.

Utilisez Video Edit lorsque :

  • Vous avez des images qui nécessitent un changement de style ou de contenu sans avoir à refilmer.
  • Vous souhaitez remplacer un personnage dans une vidéo existante tout en conservant le même mouvement.
  • Vous devez transformer un clip en prises de vues réelles en un style animé.

La limitation clé : la vidéo source contrôle le mouvement. Video Edit ne peut pas changer ce qu’un sujet fait — il peut seulement changer l’apparence du sujet et l’environnement qu’il occupe. Pour des changements de mouvement, générez de nouvelles séquences avec T2V ou I2V.

curl --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-video-edit \
  --header 'Authorization: Bearer $NOVITA_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "video_url": "https://example.com/source-clip.mp4",
    "prompt": "Transform the setting to a neon-lit cyberpunk alley, keep the character movements exactly as-is",
    "duration": 5
  }'

Tarification sur Novita AI

Tous les modes Kling O1 sur Novita AI utilisent une facturation à la seconde basée sur la durée que vous définissez lors de la requête. Prix vérifiés le 2026-06-26.

Mode Point d’accès Plage de durée Prix/s Coût 5 s Coût 10 s
T2V /v3/async/kling-o1-t2v 5–10 s $0.112 $0.56 $1.12
I2V /v3/async/kling-o1-i2v 5–10 s $0.112 $0.56 $1.12
Ref2V /v3/async/kling-o1-ref2v 3–10 s $0.168 $0.84 $1.68
VideoEdit /v3/async/kling-o1-video-edit 3–10 s $0.168 $0.84 $1.68
VideoEdit Fast (variante rapide Novita AI) 6–20 s $0.090 $0.90

Les nouveaux utilisateurs de Novita AI reçoivent des crédits gratuits. Consultez la page de tarification Novita AI pour les tarifs actuels, car les prix peuvent changer.

Par quel mode devriez-vous commencer ?

Commencez par T2V si votre objectif est l’exploration de concepts ou si vous ne disposez pas d’un actif image spécifique. C’est le point d’entrée le moins contraignant : un seul paramètre requis (prompt), aucune préparation d’actif nécessaire.

Passez à I2V lorsque vous avez une image qui doit bouger. Les images de produits, les illustrations de personnages et les arrière-plans de scène fonctionnent tous bien comme trames de départ I2V. Même prix que T2V, plus de contrôle visuel.

Utilisez Ref2V lorsque la cohérence d’identité entre les clips est importante — par exemple, un personnage récurrent dans plusieurs scènes, ou la combinaison d’une personne spécifique avec un environnement spécifique. Prévoyez la prime de 50 % ; elle n’est pas nécessaire pour la génération d’un seul clip.

Réservez Video Edit pour les workflows de post-production où des séquences existantes nécessitent une refonte visuelle mais où le mouvement doit rester intact. La variante rapide à $0.09/s est l’option la plus rentable pour les montages plus longs (6–20 secondes) où la vitesse de génération est moins critique.

Situation Mode recommandé
Pas d’image, exploration d’idées T2V
Vous avez une image de produit ou de scène, vous voulez du mouvement I2V
Besoin du même personnage sur plusieurs clips Ref2V
Vous avez des images vidéo, vous voulez un aspect différent VideoEdit (standard)
Montage long (6–20 s), sensible au coût VideoEdit Fast

Comment appeler l’API Kling O1 sur Novita AI

Les quatre modes Kling O1 sur Novita AI sont asynchrones. Chaque requête renvoie immédiatement un task_id ; interrogez le point d’accès Task Result jusqu’à ce que le statut soit succeed.

# Step 1: Submit your generation task (example: T2V)
RESPONSE=$(curl --silent --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-t2v \
  --header "Authorization: Bearer $NOVITA_API_KEY" \
  --header "Content-Type: application/json" \
  --data '{"prompt": "Your prompt here", "duration": 5, "aspect_ratio": "16:9"}')

TASK_ID=$(echo $RESPONSE | python3 -c "import sys,json; print(json.load(sys.stdin)['task_id'])")

# Step 2: Poll for results
curl --request GET \
  --url "https://api.novita.ai/v3/async/task-result?task_id=$TASK_ID" \
  --header "Authorization: Bearer $NOVITA_API_KEY"

La réponse inclut un champ status. Lorsqu’il indique succeed, le tableau videos contient l’URL de sortie. Le temps de génération typique est de 30 à 120 secondes selon la durée et le mode.

Obtenez votre clé API depuis le tableau de bord Novita AI. Les nouveaux comptes reçoivent des crédits gratuits pour tester les quatre modes avant de passer à un volume de production.

Conclusion

Kling O1 sur Novita AI donne aux développeurs accès à quatre modes distincts de génération vidéo — T2V, I2V, Ref2V et Video Edit — via une API unifiée unique. T2V et I2V couvrent les cas de génération courants à $0.112/s. Ref2V ajoute la composition d’identité multi-références pour les personnages récurrents à $0.168/s. Video Edit transforme les séquences existantes tout en préservant le mouvement, avec une variante rapide à $0.09/s pour les clips plus longs. Choisir le bon mode en amont permet d’économiser des coûts et de réduire les frictions : commencez par T2V si vous n’avez pas d’actif image, I2V si vous en avez, Ref2V lorsque la cohérence d’identité entre les clips est importante, et Video Edit lorsque le mouvement est déjà capturé. Tous les modes partagent le même modèle de tâche asynchrone sur Novita AI, donc l’intégration de plusieurs modes dans un seul pipeline nécessite un minimum de code supplémentaire.

Novita AI est une plateforme cloud IA qui offre aux développeurs un accès hébergé à des modèles vidéo, image, audio et langage via une API unifiée.

Foire aux questions

Quelle est la différence entre Kling O1 T2V et I2V sur Novita AI ?

T2V génère une vidéo à partir d’un seul prompt textuel — aucune image n’est requise. I2V prend une image comme trame de départ et l’anime selon le prompt. Les deux sont tarifés à $0.112/s et prennent en charge des clips de 5 à 10 secondes. Utilisez T2V pour l’exploration ; utilisez I2V lorsque vous avez un ancrage visuel spécifique.

Que fait Kling O1 Ref2V que I2V ne peut pas faire ?

Ref2V accepte jusqu’à 7 images de référence réparties sur plusieurs emplacements d’entrée, vous permettant de combiner des sources séparées pour l’identité du personnage, l’arrière-plan de la scène et le style. Vous référencez chaque entrée par son nom dans le prompt (@Element1, @Image1). I2V utilise une seule trame de départ sans système de référence nommé.

Kling O1 est-il le même que Kling 3.0 ?

Non. Kling O1 (sorti en décembre 2025) est le modèle vidéo multimodal unifié de base. Kling 3.0 (également appelé Kling O3, sorti en février 2026) est un successeur qui ajoute la co-génération audio native et des clips jusqu’à 15 secondes. Kling O1 sur Novita AI prend en charge les vidéos jusqu’à 10 secondes sans audio natif.

Comment choisir entre VideoEdit standard et VideoEdit rapide ?

VideoEdit standard accepte les clips sources de 3 à 10 secondes à $0.168/s. VideoEdit rapide accepte les clips de 6 à 20 secondes à $0.09/s. Si votre vidéo source fait moins de 10 secondes et que le délai d’exécution est important, utilisez la version standard. Si vous avez des clips plus longs ou si vous effectuez un travail de post-production par lots, la version rapide est nettement moins chère.

Articles recommandés