Kling O1 на Novita AI: режимы T2V, I2V, Ref2V и Video Edit

Kling O1 на Novita AI: режимы T2V, I2V, Ref2V и Video Edit

Kling O1 (Kling Omni Video O1) — это первая унифицированная мультимодальная видеомодель Kuaishou, которая через API Novita AI предоставляет четыре различных режима генерации: Text-to-Video (T2V), Image-to-Video (I2V), Reference-to-Video (Ref2V) и Video Edit. Каждый режим принимает разные входные данные и решает свою задачу — выбор неправильного режима добавляет сложности и затраты. В этом руководстве объясняется, что на самом деле делает каждый режим, какие входные данные ему требуются, как он тарифицируется на Novita AI и какой режим стоит попробовать первым для типичных задач разработчика.

Что такое Kling O1?

Kling O1 построен на архитектуре MVL (Multimodal Visual Language) от Kuaishou, которая объединяет задачи работы с текстом, изображениями, референсами и редактированием видео в одну модель, а не направляет их в отдельные специализированные модели. Это важно на практике: базовая модель движения и кодирование идентичности являются общими для всех режимов, поэтому персонажи и объекты, описанные в одном режиме, переносят согласованные визуальные свойства в следующий.

По сравнению с более ранними версиями Kling (V2.5, V2.6, V3.0 Standard/Pro), Kling O1 добавляет возможности Ref2V и Video Edit, которые являются структурно новыми — они не были доступны ни в одном из уровней Standard или Pro до O1. T2V и I2V в O1 получают общую основу MVL, что улучшает согласованность объектов между кадрами по сравнению с более ранними моделями генерации.

Kling O1 отличается от Kling 3.0 (также называемого Kling O3). Kling 3.0 — это последующая модель, которая добавляет нативную совместную генерацию аудио и расширенные 15-секундные клипы. Kling O1 на Novita AI в настоящее время поддерживает видео до 10 секунд без нативного аудио.

Краткий обзор четырёх режимов

Режим Основной вход Обязательные входные данные Длительность Цена на Novita AI
T2V Текстовый промпт prompt 5–10 с $0.112/с
I2V Изображение + промпт image_url, prompt 5–10 с $0.112/с
Ref2V Референсные изображения + промпт prompt, image_urls или elements 3–10 с $0.168/с
Video Edit Исходное видео + промпт video_url, prompt 3–10 с (Fast: 6–20 с) $0.168/с (Fast: $0.09/с)

Цены проверены на страницах моделей Novita AI 26 июня 2026 г. Посекундная оплата применяется к указанной вами длительности.

Kling O1 Text-to-Video (T2V) на Novita AI

Эндпоинт: POST /v3/async/kling-o1-t2v

T2V генерирует видео полностью из текстового описания. Вы передаёте промпт; модель создаёт движение, освещение, движение камеры и композицию сцены с нуля. Здесь нет привязки к изображению, поэтому модель имеет полную творческую свободу в рамках ограничений промпта.

Используйте T2V, когда:

  • У вас нет референсного изображения или кадра сцены.
  • Вы исследуете концепцию перед выбором визуального направления.
  • Вам нужно сгенерировать много визуальных вариаций при низкой стоимости одного клипа.

При цене $0.112/с 5-секундный клип стоит $0.56, а 10-секундный — $1.12. T2V на Novita AI поддерживает длительность 5 и 10 секунд с соотношениями сторон 16:9, 9:16 и 1:1.

curl --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-t2v \
  --header 'Authorization: Bearer $NOVITA_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "prompt": "A red fox trotting through a snowy pine forest, golden hour light, cinematic wide shot",
    "duration": 5,
    "aspect_ratio": "16:9"
  }'

Kling O1 Image-to-Video (I2V) на Novita AI

Эндпоинт: POST /v3/async/kling-o1-i2v

I2V оживляет статичное изображение, превращая его в видеоклип. Исходное изображение становится стартовым кадром; промпт управляет движением и развитием сцены. Вы также можете указать конечный кадр, чтобы задать модели целевое состояние; модель интерполирует движение между началом и концом.

Обязательные параметры: image_url (стартовый кадр) и prompt. Конечный кадр (end_image_url) необязателен, но полезен, когда нужна конкретная композиция в точке склейки.

Используйте I2V, когда:

  • У вас есть готовое изображение или дизайн, который нужно оживить.
  • Вам нужна детерминированная визуальная основа — внешность персонажа или сцены уже задана в исходном изображении.
  • Вы создаёте продуктовые демо, контент для соцсетей или анимации для e-commerce на основе существующих материалов.

При цене $0.112/с I2V стоит столько же, сколько T2V. Ключевой компромисс в том, что I2V фиксирует начальный кадр как ваше входное изображение, что повышает согласованность, но также означает, что низкокачественное исходное изображение ограничивает результат. Ограничения для изображений на Novita AI: минимальный размер 300×300px, максимальный размер файла 10MB, соотношение сторон от 0.4 до 2.5.

curl --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-i2v \
  --header 'Authorization: Bearer $NOVITA_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "image_url": "https://example.com/product-shot.jpg",
    "prompt": "The product slowly rotates to reveal the back panel, soft studio lighting",
    "duration": 5,
    "aspect_ratio": "1:1"
  }'

Kling O1 Reference-to-Video (Ref2V) на Novita AI

Эндпоинт: POST /v3/async/kling-o1-ref2v

Ref2V — самый гибкий режим и тот, который наиболее напрямую использует архитектуру MVL модели O1. Вместо одного стартового кадра вы передаёте до семи референсных изображений двух типов: image_urls (референсы стиля или сцены) и elements (якоря идентичности персонажа или объекта). В промпте используются теги @Image1, @Image2, @Element1, @Element2, чтобы указать модели, какой референс применить и где.

Это позволяет собрать сцену из нескольких исходных материалов: персонажа из портретного фото, фон из изображения локации и реквизит из фотографии товара — все они указываются по имени в промпте.

Правила ввода:

  • prompt обязателен.
  • image_urls и elements необязательны, но хотя бы один из них должен быть значимым; просто промпт без референсов работает, но ведёт себя ближе к T2V.
  • Общее количество референсов (elements + image_urls) не должно превышать 7.
  • Каждый элемент в elements может включать несколько reference_image_urls (кадры с разных ракурсов) плюс необязательный frontal_image_url для более точного сопоставления идентичности.

Используйте Ref2V, когда:

  • Вам нужны согласованные персонажи в нескольких клипах (эпизодический контент, маркетинговые последовательности).
  • Вы комбинируете персонажей или объекты из разных исходных изображений в одной сцене.
  • Вы хотите, чтобы модель интерполировала из стартового кадра, сохраняя визуальную идентичность из отдельного набора референсов.

Ref2V стоит $0.168/с — на 50% больше, чем T2V и I2V. Для 5-секундного клипа это $0.84, для 10 секунд — $1.68. Надбавка отражает дополнительный этап кодирования референсов. Если ваш сценарий не требует согласованности идентичности между изображениями, достаточно I2V по $0.112/с.

curl --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-ref2v \
  --header 'Authorization: Bearer $NOVITA_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "prompt": "Take @Image1 as the start frame. @Element1 walks into the scene and picks up the glowing artifact. Cinematic lighting, steady camera.",
    "image_urls": ["https://example.com/scene-bg.jpg"],
    "elements": [
      {
        "reference_image_urls": ["https://example.com/character-front.jpg", "https://example.com/character-side.jpg"],
        "frontal_image_url": "https://example.com/character-front.jpg"
      }
    ],
    "duration": 5,
    "aspect_ratio": "16:9"
  }'

Режим Video Edit Kling O1 на Novita AI

Эндпоинт (стандартный): POST /v3/async/kling-o1-video-edit

Эндпоинт (быстрый): доступен через вариант Fast VideoEdit от Novita AI

Video Edit принимает на вход существующее видео и преобразует его с помощью промпта на естественном языке. Модель сохраняет исходную структуру движения — тайминг, движение камеры, дугу действия — изменяя при этом объекты, окружение или визуальный стиль в соответствии с промптом. Вы также можете передавать референсные изображения и якоря элементов, используя ту же систему тегов @Image1 / @Element1, что и в Ref2V.

Обязательные параметры: video_url (исходное видео, 3–10 с, MP4 или MOV, 720–2160px, максимум 200MB) и prompt.

Два варианта:

  • Standard VideoEdit: поддерживает исходные видео длительностью 3–10 секунд, цена $0.168/с.
  • Fast VideoEdit: поддерживает исходные видео длительностью 6–20 секунд, цена $0.09/с — самая низкая посекундная стоимость среди всех режимов Kling O1 на Novita AI.

Используйте Video Edit, когда:

  • У вас есть материал, которому нужна смена стиля или содержимого без пересъёмки.
  • Вы хотите заменить персонажа в существующем видео, сохранив то же движение.
  • Вам нужно преобразовать игровой клип в анимационный стиль.

Ключевое ограничение: исходное видео определяет движение. Video Edit не может изменить действия объекта — он может изменить только внешний вид объекта и окружение, в котором тот находится. Для изменения движения создавайте новые кадры с помощью T2V или I2V.

curl --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-video-edit \
  --header 'Authorization: Bearer $NOVITA_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "video_url": "https://example.com/source-clip.mp4",
    "prompt": "Transform the setting to a neon-lit cyberpunk alley, keep the character movements exactly as-is",
    "duration": 5
  }'

Цены на Novita AI

Все режимы Kling O1 на Novita AI используют посекундную тарификацию в зависимости от длительности, указанной в запросе. Цены проверены 26 июня 2026 г.

Режим Эндпоинт Диапазон длительности Цена/с Стоимость 5 с Стоимость 10 с
T2V /v3/async/kling-o1-t2v 5–10 с $0.112 $0.56 $1.12
I2V /v3/async/kling-o1-i2v 5–10 с $0.112 $0.56 $1.12
Ref2V /v3/async/kling-o1-ref2v 3–10 с $0.168 $0.84 $1.68
VideoEdit /v3/async/kling-o1-video-edit 3–10 с $0.168 $0.84 $1.68
VideoEdit Fast (вариант Fast от Novita AI) 6–20 с $0.090 $0.90

Новые пользователи Novita AI получают бесплатные кредиты. Актуальные тарифы смотрите на странице цен Novita AI, так как цены могут меняться.

С какого режима начать?

Начните с T2V, если ваша цель — исследование концепции или у вас нет конкретного изображения. Это самый простой вход: один обязательный параметр (prompt), никакой подготовки материалов не требуется.

Переходите к I2V, когда у вас есть изображение, которое нужно оживить. Фотографии товаров, иллюстрации персонажей и фоны сцен отлично подходят в качестве стартовых кадров для I2V. Та же цена, что и у T2V, но больше визуального контроля.

Используйте Ref2V, когда важна согласованность идентичности между клипами — например, повторяющийся персонаж в нескольких сценах или сочетание конкретного человека с конкретным окружением. Заложите 50% надбавку к цене; она не нужна для генерации одного клипа.

Приберегите Video Edit для постпродакшн-задач, где существующий материал требует визуальной переработки, но движение должно сохраниться. Вариант Fast по цене $0.09/с — самый экономичный вариант для более длинных правок (6–20 секунд), когда скорость генерации менее критична.

Ситуация Рекомендуемый режим
Нет изображения, исследование идей T2V
Есть изображение товара или сцены, нужно движение I2V
Нужен один и тот же персонаж в нескольких клипах Ref2V
Есть видеоматериал, нужен другой вид VideoEdit (стандартный)
Длинная правка (6–20 с), важна стоимость VideoEdit Fast

Как вызывать API Kling O1 на Novita AI

Все четыре режима Kling O1 на Novita AI асинхронны. Каждый запрос немедленно возвращает task_id; опрашивайте эндпоинт Task Result, пока статус не станет succeed.

# Шаг 1: отправьте задачу на генерацию (пример: T2V)
RESPONSE=$(curl --silent --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-t2v \
  --header "Authorization: Bearer $NOVITA_API_KEY" \
  --header "Content-Type: application/json" \
  --data '{"prompt": "Your prompt here", "duration": 5, "aspect_ratio": "16:9"}')

TASK_ID=$(echo $RESPONSE | python3 -c "import sys,json; print(json.load(sys.stdin)['task_id'])")

# Шаг 2: опрос результатов
curl --request GET \
  --url "https://api.novita.ai/v3/async/task-result?task_id=$TASK_ID" \
  --header "Authorization: Bearer $NOVITA_API_KEY"

Ответ содержит поле status. Когда оно принимает значение succeed, массив videos содержит URL результата. Типичное время генерации составляет 30–120 секунд в зависимости от длительности и режима.

Получите API-ключ в панели управления Novita AI. Новые аккаунты получают бесплатные кредиты для тестирования всех четырёх режимов перед запуском в продакшн.

Заключение

Kling O1 на Novita AI даёт разработчикам доступ к четырём различным режимам генерации видео — T2V, I2V, Ref2V и Video Edit — через единый унифицированный API. T2V и I2V покрывают типовые сценарии генерации по цене $0.112/с. Ref2V добавляет многокомпонентную композицию идентичности для повторяющихся персонажей по цене $0.168/с. Video Edit преобразует существующий материал, сохраняя движение, а вариант Fast по цене $0.09/с подходит для более длинных клипов. Правильный выбор режима заранее экономит средства и устраняет лишние сложности: начинайте с T2V, если у вас нет изображения, с I2V, если оно есть, используйте Ref2V, когда важна согласованность идентичности между клипами, и Video Edit, когда движение уже зафиксировано. Все режимы используют один и тот же асинхронный шаблон задач на Novita AI, поэтому интеграция нескольких режимов в один пайплайн требует минимума дополнительного кода.

Novita AI — это облачная платформа ИИ, которая предоставляет разработчикам хостинг-доступ к видеомоделям, моделям изображений, аудио и языковым моделям через единый API.

Часто задаваемые вопросы

В чём разница между Kling O1 T2V и I2V на Novita AI?

T2V генерирует видео только из текстового промпта — изображение не требуется. I2V берёт изображение в качестве стартового кадра и оживляет его согласно промпту. Оба режима стоят $0.112/с и поддерживают клипы длительностью 5–10 секунд. Используйте T2V для исследования; используйте I2V, когда у вас есть конкретная визуальная привязка.

Что умеет Kling O1 Ref2V такого, чего не умеет I2V?

Ref2V принимает до 7 референсных изображений в нескольких входных слотах, что позволяет комбинировать разные источники для идентичности персонажа, фона сцены и стиля. Вы ссылаетесь на каждый вход по имени в промпте (@Element1, @Image1). I2V использует один стартовый кадр без системы именованных референсов.

Kling O1 — это то же самое, что Kling 3.0?

Нет. Kling O1 (выпущен в декабре 2025 года) — базовая унифицированная мультимодальная видеомодель. Kling 3.0 (также называемый Kling O3, выпущен в феврале 2026 года) — последующая модель, которая добавляет нативную совместную генерацию аудио и клипы длительностью до 15 секунд. Kling O1 на Novita AI поддерживает видео до 10 секунд без нативного аудио.

Как выбрать между VideoEdit standard и VideoEdit Fast?

Standard VideoEdit принимает исходные клипы длительностью 3–10 секунд по цене $0.168/с. Fast VideoEdit принимает клипы длительностью 6–20 секунд по цене $0.09/с. Если ваше исходное видео короче 10 секунд и важна скорость выполнения, используйте стандартный вариант. Если у вас более длинные клипы или вы выполняете пакетный постпродакшн, Fast значительно дешевле.

Рекомендуемые статьи