- Что такое Kling O1?
- Краткий обзор четырёх режимов
- Kling O1 Text-to-Video (T2V) на Novita AI
- Kling O1 Image-to-Video (I2V) на Novita AI
- Kling O1 Reference-to-Video (Ref2V) на Novita AI
- Режим Video Edit Kling O1 на Novita AI
- Цены на Novita AI
- С какого режима начать?
- Как вызывать API Kling O1 на Novita AI
- Заключение
- Часто задаваемые вопросы
- Рекомендуемые статьи
Kling O1 (Kling Omni Video O1) — это первая унифицированная мультимодальная видеомодель Kuaishou, которая через API Novita AI предоставляет четыре различных режима генерации: Text-to-Video (T2V), Image-to-Video (I2V), Reference-to-Video (Ref2V) и Video Edit. Каждый режим принимает разные входные данные и решает свою задачу — выбор неправильного режима добавляет сложности и затраты. В этом руководстве объясняется, что на самом деле делает каждый режим, какие входные данные ему требуются, как он тарифицируется на Novita AI и какой режим стоит попробовать первым для типичных задач разработчика.
Что такое Kling O1?
Kling O1 построен на архитектуре MVL (Multimodal Visual Language) от Kuaishou, которая объединяет задачи работы с текстом, изображениями, референсами и редактированием видео в одну модель, а не направляет их в отдельные специализированные модели. Это важно на практике: базовая модель движения и кодирование идентичности являются общими для всех режимов, поэтому персонажи и объекты, описанные в одном режиме, переносят согласованные визуальные свойства в следующий.
По сравнению с более ранними версиями Kling (V2.5, V2.6, V3.0 Standard/Pro), Kling O1 добавляет возможности Ref2V и Video Edit, которые являются структурно новыми — они не были доступны ни в одном из уровней Standard или Pro до O1. T2V и I2V в O1 получают общую основу MVL, что улучшает согласованность объектов между кадрами по сравнению с более ранними моделями генерации.
Kling O1 отличается от Kling 3.0 (также называемого Kling O3). Kling 3.0 — это последующая модель, которая добавляет нативную совместную генерацию аудио и расширенные 15-секундные клипы. Kling O1 на Novita AI в настоящее время поддерживает видео до 10 секунд без нативного аудио.
Краткий обзор четырёх режимов
| Режим | Основной вход | Обязательные входные данные | Длительность | Цена на Novita AI |
|---|---|---|---|---|
| T2V | Текстовый промпт | prompt |
5–10 с | $0.112/с |
| I2V | Изображение + промпт | image_url, prompt |
5–10 с | $0.112/с |
| Ref2V | Референсные изображения + промпт | prompt, image_urls или elements |
3–10 с | $0.168/с |
| Video Edit | Исходное видео + промпт | video_url, prompt |
3–10 с (Fast: 6–20 с) | $0.168/с (Fast: $0.09/с) |
Цены проверены на страницах моделей Novita AI 26 июня 2026 г. Посекундная оплата применяется к указанной вами длительности.
Kling O1 Text-to-Video (T2V) на Novita AI
Эндпоинт: POST /v3/async/kling-o1-t2v
T2V генерирует видео полностью из текстового описания. Вы передаёте промпт; модель создаёт движение, освещение, движение камеры и композицию сцены с нуля. Здесь нет привязки к изображению, поэтому модель имеет полную творческую свободу в рамках ограничений промпта.
Используйте T2V, когда:
- У вас нет референсного изображения или кадра сцены.
- Вы исследуете концепцию перед выбором визуального направления.
- Вам нужно сгенерировать много визуальных вариаций при низкой стоимости одного клипа.
При цене $0.112/с 5-секундный клип стоит $0.56, а 10-секундный — $1.12. T2V на Novita AI поддерживает длительность 5 и 10 секунд с соотношениями сторон 16:9, 9:16 и 1:1.
curl --request POST \
--url https://api.novita.ai/v3/async/kling-o1-t2v \
--header 'Authorization: Bearer $NOVITA_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"prompt": "A red fox trotting through a snowy pine forest, golden hour light, cinematic wide shot",
"duration": 5,
"aspect_ratio": "16:9"
}'
Kling O1 Image-to-Video (I2V) на Novita AI
Эндпоинт: POST /v3/async/kling-o1-i2v
I2V оживляет статичное изображение, превращая его в видеоклип. Исходное изображение становится стартовым кадром; промпт управляет движением и развитием сцены. Вы также можете указать конечный кадр, чтобы задать модели целевое состояние; модель интерполирует движение между началом и концом.
Обязательные параметры: image_url (стартовый кадр) и prompt. Конечный кадр (end_image_url) необязателен, но полезен, когда нужна конкретная композиция в точке склейки.
Используйте I2V, когда:
- У вас есть готовое изображение или дизайн, который нужно оживить.
- Вам нужна детерминированная визуальная основа — внешность персонажа или сцены уже задана в исходном изображении.
- Вы создаёте продуктовые демо, контент для соцсетей или анимации для e-commerce на основе существующих материалов.
При цене $0.112/с I2V стоит столько же, сколько T2V. Ключевой компромисс в том, что I2V фиксирует начальный кадр как ваше входное изображение, что повышает согласованность, но также означает, что низкокачественное исходное изображение ограничивает результат. Ограничения для изображений на Novita AI: минимальный размер 300×300px, максимальный размер файла 10MB, соотношение сторон от 0.4 до 2.5.
curl --request POST \
--url https://api.novita.ai/v3/async/kling-o1-i2v \
--header 'Authorization: Bearer $NOVITA_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"image_url": "https://example.com/product-shot.jpg",
"prompt": "The product slowly rotates to reveal the back panel, soft studio lighting",
"duration": 5,
"aspect_ratio": "1:1"
}'
Kling O1 Reference-to-Video (Ref2V) на Novita AI
Эндпоинт: POST /v3/async/kling-o1-ref2v
Ref2V — самый гибкий режим и тот, который наиболее напрямую использует архитектуру MVL модели O1. Вместо одного стартового кадра вы передаёте до семи референсных изображений двух типов: image_urls (референсы стиля или сцены) и elements (якоря идентичности персонажа или объекта). В промпте используются теги @Image1, @Image2, @Element1, @Element2, чтобы указать модели, какой референс применить и где.
Это позволяет собрать сцену из нескольких исходных материалов: персонажа из портретного фото, фон из изображения локации и реквизит из фотографии товара — все они указываются по имени в промпте.
Правила ввода:
promptобязателен.image_urlsиelementsнеобязательны, но хотя бы один из них должен быть значимым; просто промпт без референсов работает, но ведёт себя ближе к T2V.- Общее количество референсов (elements + image_urls) не должно превышать 7.
- Каждый элемент в
elementsможет включать несколькоreference_image_urls(кадры с разных ракурсов) плюс необязательныйfrontal_image_urlдля более точного сопоставления идентичности.
Используйте Ref2V, когда:
- Вам нужны согласованные персонажи в нескольких клипах (эпизодический контент, маркетинговые последовательности).
- Вы комбинируете персонажей или объекты из разных исходных изображений в одной сцене.
- Вы хотите, чтобы модель интерполировала из стартового кадра, сохраняя визуальную идентичность из отдельного набора референсов.
Ref2V стоит $0.168/с — на 50% больше, чем T2V и I2V. Для 5-секундного клипа это $0.84, для 10 секунд — $1.68. Надбавка отражает дополнительный этап кодирования референсов. Если ваш сценарий не требует согласованности идентичности между изображениями, достаточно I2V по $0.112/с.
curl --request POST \
--url https://api.novita.ai/v3/async/kling-o1-ref2v \
--header 'Authorization: Bearer $NOVITA_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"prompt": "Take @Image1 as the start frame. @Element1 walks into the scene and picks up the glowing artifact. Cinematic lighting, steady camera.",
"image_urls": ["https://example.com/scene-bg.jpg"],
"elements": [
{
"reference_image_urls": ["https://example.com/character-front.jpg", "https://example.com/character-side.jpg"],
"frontal_image_url": "https://example.com/character-front.jpg"
}
],
"duration": 5,
"aspect_ratio": "16:9"
}'
Режим Video Edit Kling O1 на Novita AI
Эндпоинт (стандартный): POST /v3/async/kling-o1-video-edit
Эндпоинт (быстрый): доступен через вариант Fast VideoEdit от Novita AI
Video Edit принимает на вход существующее видео и преобразует его с помощью промпта на естественном языке. Модель сохраняет исходную структуру движения — тайминг, движение камеры, дугу действия — изменяя при этом объекты, окружение или визуальный стиль в соответствии с промптом. Вы также можете передавать референсные изображения и якоря элементов, используя ту же систему тегов @Image1 / @Element1, что и в Ref2V.
Обязательные параметры: video_url (исходное видео, 3–10 с, MP4 или MOV, 720–2160px, максимум 200MB) и prompt.
Два варианта:
- Standard VideoEdit: поддерживает исходные видео длительностью 3–10 секунд, цена $0.168/с.
- Fast VideoEdit: поддерживает исходные видео длительностью 6–20 секунд, цена $0.09/с — самая низкая посекундная стоимость среди всех режимов Kling O1 на Novita AI.
Используйте Video Edit, когда:
- У вас есть материал, которому нужна смена стиля или содержимого без пересъёмки.
- Вы хотите заменить персонажа в существующем видео, сохранив то же движение.
- Вам нужно преобразовать игровой клип в анимационный стиль.
Ключевое ограничение: исходное видео определяет движение. Video Edit не может изменить действия объекта — он может изменить только внешний вид объекта и окружение, в котором тот находится. Для изменения движения создавайте новые кадры с помощью T2V или I2V.
curl --request POST \
--url https://api.novita.ai/v3/async/kling-o1-video-edit \
--header 'Authorization: Bearer $NOVITA_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"video_url": "https://example.com/source-clip.mp4",
"prompt": "Transform the setting to a neon-lit cyberpunk alley, keep the character movements exactly as-is",
"duration": 5
}'
Цены на Novita AI
Все режимы Kling O1 на Novita AI используют посекундную тарификацию в зависимости от длительности, указанной в запросе. Цены проверены 26 июня 2026 г.
| Режим | Эндпоинт | Диапазон длительности | Цена/с | Стоимость 5 с | Стоимость 10 с |
|---|---|---|---|---|---|
| T2V | /v3/async/kling-o1-t2v |
5–10 с | $0.112 | $0.56 | $1.12 |
| I2V | /v3/async/kling-o1-i2v |
5–10 с | $0.112 | $0.56 | $1.12 |
| Ref2V | /v3/async/kling-o1-ref2v |
3–10 с | $0.168 | $0.84 | $1.68 |
| VideoEdit | /v3/async/kling-o1-video-edit |
3–10 с | $0.168 | $0.84 | $1.68 |
| VideoEdit Fast | (вариант Fast от Novita AI) | 6–20 с | $0.090 | — | $0.90 |
Новые пользователи Novita AI получают бесплатные кредиты. Актуальные тарифы смотрите на странице цен Novita AI, так как цены могут меняться.
С какого режима начать?
Начните с T2V, если ваша цель — исследование концепции или у вас нет конкретного изображения. Это самый простой вход: один обязательный параметр (prompt), никакой подготовки материалов не требуется.
Переходите к I2V, когда у вас есть изображение, которое нужно оживить. Фотографии товаров, иллюстрации персонажей и фоны сцен отлично подходят в качестве стартовых кадров для I2V. Та же цена, что и у T2V, но больше визуального контроля.
Используйте Ref2V, когда важна согласованность идентичности между клипами — например, повторяющийся персонаж в нескольких сценах или сочетание конкретного человека с конкретным окружением. Заложите 50% надбавку к цене; она не нужна для генерации одного клипа.
Приберегите Video Edit для постпродакшн-задач, где существующий материал требует визуальной переработки, но движение должно сохраниться. Вариант Fast по цене $0.09/с — самый экономичный вариант для более длинных правок (6–20 секунд), когда скорость генерации менее критична.
| Ситуация | Рекомендуемый режим |
|---|---|
| Нет изображения, исследование идей | T2V |
| Есть изображение товара или сцены, нужно движение | I2V |
| Нужен один и тот же персонаж в нескольких клипах | Ref2V |
| Есть видеоматериал, нужен другой вид | VideoEdit (стандартный) |
| Длинная правка (6–20 с), важна стоимость | VideoEdit Fast |
Как вызывать API Kling O1 на Novita AI
Все четыре режима Kling O1 на Novita AI асинхронны. Каждый запрос немедленно возвращает task_id; опрашивайте эндпоинт Task Result, пока статус не станет succeed.
# Шаг 1: отправьте задачу на генерацию (пример: T2V)
RESPONSE=$(curl --silent --request POST \
--url https://api.novita.ai/v3/async/kling-o1-t2v \
--header "Authorization: Bearer $NOVITA_API_KEY" \
--header "Content-Type: application/json" \
--data '{"prompt": "Your prompt here", "duration": 5, "aspect_ratio": "16:9"}')
TASK_ID=$(echo $RESPONSE | python3 -c "import sys,json; print(json.load(sys.stdin)['task_id'])")
# Шаг 2: опрос результатов
curl --request GET \
--url "https://api.novita.ai/v3/async/task-result?task_id=$TASK_ID" \
--header "Authorization: Bearer $NOVITA_API_KEY"
Ответ содержит поле status. Когда оно принимает значение succeed, массив videos содержит URL результата. Типичное время генерации составляет 30–120 секунд в зависимости от длительности и режима.
Получите API-ключ в панели управления Novita AI. Новые аккаунты получают бесплатные кредиты для тестирования всех четырёх режимов перед запуском в продакшн.
Заключение
Kling O1 на Novita AI даёт разработчикам доступ к четырём различным режимам генерации видео — T2V, I2V, Ref2V и Video Edit — через единый унифицированный API. T2V и I2V покрывают типовые сценарии генерации по цене $0.112/с. Ref2V добавляет многокомпонентную композицию идентичности для повторяющихся персонажей по цене $0.168/с. Video Edit преобразует существующий материал, сохраняя движение, а вариант Fast по цене $0.09/с подходит для более длинных клипов. Правильный выбор режима заранее экономит средства и устраняет лишние сложности: начинайте с T2V, если у вас нет изображения, с I2V, если оно есть, используйте Ref2V, когда важна согласованность идентичности между клипами, и Video Edit, когда движение уже зафиксировано. Все режимы используют один и тот же асинхронный шаблон задач на Novita AI, поэтому интеграция нескольких режимов в один пайплайн требует минимума дополнительного кода.
Novita AI — это облачная платформа ИИ, которая предоставляет разработчикам хостинг-доступ к видеомоделям, моделям изображений, аудио и языковым моделям через единый API.
Часто задаваемые вопросы
В чём разница между Kling O1 T2V и I2V на Novita AI?
T2V генерирует видео только из текстового промпта — изображение не требуется. I2V берёт изображение в качестве стартового кадра и оживляет его согласно промпту. Оба режима стоят $0.112/с и поддерживают клипы длительностью 5–10 секунд. Используйте T2V для исследования; используйте I2V, когда у вас есть конкретная визуальная привязка.
Что умеет Kling O1 Ref2V такого, чего не умеет I2V?
Ref2V принимает до 7 референсных изображений в нескольких входных слотах, что позволяет комбинировать разные источники для идентичности персонажа, фона сцены и стиля. Вы ссылаетесь на каждый вход по имени в промпте (@Element1, @Image1). I2V использует один стартовый кадр без системы именованных референсов.
Kling O1 — это то же самое, что Kling 3.0?
Нет. Kling O1 (выпущен в декабре 2025 года) — базовая унифицированная мультимодальная видеомодель. Kling 3.0 (также называемый Kling O3, выпущен в феврале 2026 года) — последующая модель, которая добавляет нативную совместную генерацию аудио и клипы длительностью до 15 секунд. Kling O1 на Novita AI поддерживает видео до 10 секунд без нативного аудио.
Как выбрать между VideoEdit standard и VideoEdit Fast?
Standard VideoEdit принимает исходные клипы длительностью 3–10 секунд по цене $0.168/с. Fast VideoEdit принимает клипы длительностью 6–20 секунд по цене $0.09/с. Если ваше исходное видео короче 10 секунд и важна скорость выполнения, используйте стандартный вариант. Если у вас более длинные клипы или вы выполняете пакетный постпродакшн, Fast значительно дешевле.
