Kling O1 على Novita AI: أوضاع T2V وI2V وRef2V وتحرير الفيديو

Kling O1 على Novita AI: أوضاع T2V وI2V وRef2V وتحرير الفيديو

Kling O1 (Kling Omni Video O1) هو أول نموذج فيديو متعدد الوسائط موحد من Kuaishou، ويقدم أربعة أوضاع توليد متميزة عبر واجهة Novita AI: نص إلى فيديو (T2V)، وصورة إلى فيديو (I2V)، ومرجع إلى فيديو (Ref2V)، وتحرير الفيديو. كل وضع يقبل مدخلات مختلفة ويحل مشكلة مختلفة — اختيار الوضع الخطأ يضيف احتكاكًا وتكلفة. يشرح هذا الدليل ما يفعله كل وضع فعليًا، وما يتطلبه، وكيف يتم تسعيره على Novita AI، وأي واحد تجربه أولاً لحالات الاستخدام المطور الشائعة.

ما هو Kling O1؟

Kling O1 مبني على بنية MVL (اللغة المرئية متعددة الوسائط) من Kuaishou، والتي تدمج مهام النصوص والصور والمراجع وتحرير الفيديو في نموذج واحد بدلاً من توجيهها إلى نماذج متخصصة منفصلة. هذا مهم عمليًا: نموذج الحركة الأساسي وترميز الهوية مشتركان عبر الأوضاع، لذا فإن الشخصيات والأشياء الموصوفة في وضع واحد تحمل خصائص بصرية متسقة إلى الوضع التالي.

مقارنة بإصدارات Kling السابقة (V2.5، V2.6، V3.0 Standard/Pro)، يضيف Kling O1 إمكانيات Ref2V وتحرير الفيديو الجديدة هيكليًا — لم تكن متاحة في أي مستوى Standard أو Pro قبل O1. T2V وI2V في O1 يكتسبان العمود الفقري المشترك لـ MVL، مما يحسن اتساق الموضوع عبر الإطارات مقارنة بنماذج التوليد السابقة.

يختلف Kling O1 عن Kling 3.0 (يسمى أيضًا Kling O3). Kling 3.0 هو نموذج لاحق يضيف توليدًا صوتيًا أصليًا متزامن ومقاطع ممتدة حتى 15 ثانية. يغطي Kling O1 على Novita AI حاليًا فيديوهات تصل إلى 10 ثوانٍ بدون صوت أصلي.

الأوضاع الأربعة في لمحة

الوضع المدخل الأساسي المدخلات المطلوبة المدة السعر على Novita AI
T2V موجه نصي prompt 5–10 ث 0.112 دولار/ثانية
I2V صورة + موجه image_url، prompt 5–10 ث 0.112 دولار/ثانية
Ref2V صور مرجعية + موجه prompt, image_urls أو elements 3–10 ث 0.168 دولار/ثانية
تحرير الفيديو فيديو مصدر + موجه video_url، prompt 3–10 ث (سريع: 6–20 ث) 0.168 دولار/ثانية (سريع: 0.09 دولار/ثانية)

التسعير تم التحقق منه على صفحات نموذج Novita AI في 2026-06-26. الفوترة لكل ثانية تنطبق على المدة التي تحددها.

Kling O1 نص إلى فيديو (T2V) على Novita AI

الوصلة: POST /v3/async/kling-o1-t2v

T2V يولّد فيديو بالكامل من وصف نصي. تقدم موجهًا؛ ينشئ النموذج الحركة والإضاءة وحركة الكاميرا وتكوين المشهد من الصفر. لا يوجد مرساة صورة، لذا يتمتع النموذج بحرية إبداعية كاملة ضمن قيود الموجه.

استخدم T2V عندما:

  • ليس لديك صورة مرجعية أو إطار مشهد.
  • تستكشف فكرة قبل الالتزام باتجاه بصري.
  • تحتاج إلى توليد العديد من الاختلافات البصرية بتكلفة منخفضة لكل مقطع.

بسعر 0.112 دولار/ثانية، مقطع 5 ثوانٍ يكلف 0.56 دولار ومقطع 10 ثوانٍ يكلف 1.12 دولار. يدعم T2V مدد 5 و10 ثوانٍ على Novita AI بنسب أبعاد 16:9 و9:16 و1:1.

curl --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-t2v \
  --header 'Authorization: Bearer $NOVITA_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "prompt": "ثعلب أحمر يهرول عبر غابة صنوبر ثلجية، ضوء الساعة الذهبية، لقطة سينمائية واسعة",
    "duration": 5,
    "aspect_ratio": "16:9"
  }'

Kling O1 صورة إلى فيديو (I2V) على Novita AI

الوصلة: POST /v3/async/kling-o1-i2v

I2V يحوّل صورة ثابتة إلى مقطع فيديو. الصورة المصدر تصبح الإطار البداية؛ يتحكم الموجه في الحركة وتطور المشهد التالي. يمكنك اختياريًا توفير إطار نهاية لإعطاء النموذج حالة مستهدفة، ويقوم النموذج باستيفاء الحركة بين البداية والنهاية.

مطلوب: image_url (إطار البداية) وprompt. إطار النهاية (end_image_url) اختياري ولكنه مفيد عندما تريد تكوينًا معينًا عند نقطة القطع.

استخدم I2V عندما:

  • لديك صورة أو تصميم موجود يحتاج إلى الحركة.
  • تريد تأريضًا بصريًا حتميًا — مظهر الشخصية أو المشهد محدد بالفعل في الصورة المصدر.
  • تقوم ببناء عروض توضيحية للمنتج أو محتوى اجتماعي أو رسوم متحركة للتجارة الإلكترونية من أصول موجودة.

بسعر 0.112 دولار/ثانية، I2V يكلف نفس T2V. المفاضلة الرئيسية هي أن I2V يثبت الإطار الافتتاحي لصورتك المدخلة، مما يحسن الاتساق ولكنه يعني أيضًا أن صورة المصدر منخفضة الجودة تحد من المخرجات. قيود الصور على Novita AI: 300×300px كحد أدنى، حجم ملف أقصى 10MB، نسبة أبعاد بين 0.4 و2.5.

curl --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-i2v \
  --header 'Authorization: Bearer $NOVITA_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "image_url": "https://example.com/product-shot.jpg",
    "prompt": "المنتج يدور ببطء ليكشف عن اللوحة الخلفية، إضاءة استوديو ناعمة",
    "duration": 5,
    "aspect_ratio": "1:1"
  }'

Kling O1 مرجع إلى فيديو (Ref2V) على Novita AI

الوصلة: POST /v3/async/kling-o1-ref2v

Ref2V هو الوضع الأكثر مرونة والذي يستخدم بشكل مباشر بنية MVL الخاصة بـ O1. بدلاً من إطار بداية واحد، توفر ما يصل إلى سبع صور مرجعية عبر نوعي إدخال: image_urls (مراجع النمط أو المشهد) وelements (مراسي هوية الشخصية أو الكائن). يستخدم الموجه علامات @Image1 و@Image2 و@Element1 و@Element2 لإخبار النموذج بالمرجع الذي يجب تطبيقه وأين.

هذا يتيح لك تكوين مشهد من عدة أصول مصدر: شخصية من صورة شخصية، خلفية من صورة موقع، ودعامة من صورة منتج — كلها مرجعية بالاسم في الموجه.

قواعد الإدخال:

  • prompt مطلوب.
  • image_urls وelements اختياريان ولكن يجب أن يكون واحد على الأقل ذا معنى؛ موجه عاري بدون مراجع يعمل لكنه يتصرف أقرب إلى T2V.
  • إجمالي المراجع (elements + image_urls) يجب ألا يتجاوز 7.
  • كل عنصر في elements يمكن أن يتضمن عدة reference_image_urls (لقطات متعددة الزوايا) بالإضافة إلى frontal_image_url اختياري لمطابقة هوية أنظف.

استخدم Ref2V عندما:

  • تحتاج إلى شخصيات متسقة عبر مقاطع متعددة (محتوى حلقات، تسلسلات تسويقية).
  • تجمع شخصيات أو أشياء من صور مصدر مختلفة في مشهد واحد.
  • تريد أن يقوم النموذج باستيفاء من إطار بداية مع الحفاظ على الهوية البصرية من مجموعة مرجعية منفصلة.

Ref2V يكلف 0.168 دولار/ثانية — 50% أكثر من T2V وI2V. لمقطع 5 ثوانٍ، هذا 0.84 دولار؛ لـ10 ثوانٍ، 1.68 دولار. العلاوة تعكس خطوة ترميز المرجع الإضافية. إذا كانت حالة الاستخدام الخاصة بك لا تتطلب اتساق الهوية عبر الصور، فإن I2V بسعر 0.112 دولار/ثانية كافٍ.

curl --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-ref2v \
  --header 'Authorization: Bearer $NOVITA_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "prompt": "خذ @Image1 كإطار بداية. @Element1 يدخل المشهد ويلتقط القطعة المتوهجة. إضاءة سينمائية، كاميرا ثابتة.",
    "image_urls": ["https://example.com/scene-bg.jpg"],
    "elements": [
      {
        "reference_image_urls": ["https://example.com/character-front.jpg", "https://example.com/character-side.jpg"],
        "frontal_image_url": "https://example.com/character-front.jpg"
      }
    ],
    "duration": 5,
    "aspect_ratio": "16:9"
  }'

وضع تحرير الفيديو Kling O1 على Novita AI

الوصلة (قياسي): POST /v3/async/kling-o1-video-edit

الوصلة (سريع): متاح عبر متغير Fast VideoEdit من Novita AI

تحرير الفيديو يأخذ فيديو موجود كمدخل ويحوله باستخدام موجه بلغة طبيعية. يحافظ النموذج على بنية الحركة الأصلية — التوقيت، حركة الكاميرا، منحنى الحركة — مع تغيير الموضوعات أو البيئات أو النمط البصري وفقًا للموجه. يمكنك أيضًا توفير صور مرجعية ومراسي عنصر باستخدام نفس نظام وضع العلامات @Image1 / @Element1 مثل Ref2V.

مطلوب: video_url (فيديو مصدر، 3–10 ثوانٍ، MP4 أو MOV، 720–2160px، حد أقصى 200MB) وprompt.

نوعان مختلفان:

  • VideoEdit قياسي: يدعم فيديوهات مصدر 3–10 ثوانٍ، بسعر 0.168 دولار/ثانية.
  • VideoEdit سريع: يدعم فيديوهات مصدر 6–20 ثانية، بسعر 0.09 دولار/ثانية — أقل تكلفة في الثانية لأي وضع Kling O1 على Novita AI.

استخدم تحرير الفيديو عندما:

  • لديك لقطات تحتاج إلى تغيير في النمط أو المحتوى بدون إعادة تصوير.
  • تريد استبدال شخصية في فيديو موجود مع الحفاظ على نفس الحركة.
  • تحتاج إلى تحويل مقطع حي إلى نمط متحرك.

القيد الرئيسي: الفيديو المصدر يتحكم في الحركة. لا يمكن لتحرير الفيديو تغيير ما تفعله الشخصية — يمكنه فقط تغيير مظهر الشخصية والبيئة التي تشغلها. لتغييرات الحركة، قم بتوليد لقطات جديدة باستخدام T2V أو I2V بدلاً من ذلك.

curl --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-video-edit \
  --header 'Authorization: Bearer $NOVITA_API_KEY' \
  --header 'Content-Type: application/json' \
  --data '{
    "video_url": "https://example.com/source-clip.mp4",
    "prompt": "حول الإعداد إلى زقاق سايبربانك مضاء بالنيون، حافظ على حركات الشخصية كما هي تمامًا",
    "duration": 5
  }'

التسعير على Novita AI

جميع أوضاع Kling O1 على Novita AI تستخدم الفوترة لكل ثانية مقابل المدة التي تحددها عند الطلب. التسعير تم التحقق منه 2026-06-26.

الوضع الوصلة نطاق المدة السعر/ثانية تكلفة 5 ثوانٍ تكلفة 10 ثوانٍ
T2V /v3/async/kling-o1-t2v 5–10 ث 0.112 دولار 0.56 دولار 1.12 دولار
I2V /v3/async/kling-o1-i2v 5–10 ث 0.112 دولار 0.56 دولار 1.12 دولار
Ref2V /v3/async/kling-o1-ref2v 3–10 ث 0.168 دولار 0.84 دولار 1.68 دولار
VideoEdit /v3/async/kling-o1-video-edit 3–10 ث 0.168 دولار 0.84 دولار 1.68 دولار
VideoEdit سريع (متغير Fast من Novita AI) 6–20 ث 0.090 دولار 0.90 دولار

المستخدمون الجدد لـ Novita AI يحصلون على رصيد مجاني. تحقق من صفحة تسعير Novita AI للأسعار الحالية، حيث قد تتغير الأسعار.

أي وضع يجب أن تبدأ به؟

ابدأ بـ T2V إذا كان هدفك هو استكشاف المفاهيم أو ليس لديك أصل صورة محدد. إنها نقطة الدخول ذات الاحتكاك الأقل: معامل واحد مطلوب (prompt)، لا حاجة لتجهيز الأصول.

انتقل إلى I2V عندما يكون لديك صورة تحتاج إلى الحركة. صور المنتج، رسوم الشخصيات، وخلفيات المشاهد كلها تعمل بشكل جيد كإطارات بداية I2V. نفس سعر T2V، تحكم بصري أكثر.

استخدم Ref2V عندما يكون اتساق الهوية عبر المقاطع مهمًا — على سبيل المثال، شخصية متكررة في مشاهد متعددة، أو دمج شخص معين مع بيئة معينة. خطط للعلاوة السعرية 50%؛ ليست ضرورية لتوليد مقطع واحد.

احجز تحرير الفيديو لسير عمل ما بعد الإنتاج حيث تحتاج اللقطات الموجودة إلى تجديد بصري ولكن يجب أن تبقى الحركة سليمة. المتغير السريع بسعر 0.09 دولار/ثانية هو الخيار الأكثر فعالية من حيث التكلفة للتحريرات الأطول (6–20 ثانية) حيث تكون سرعة التوليد أقل أهمية.

الموقف الوضع الموصى به
لا توجد صورة، استكشاف الأفكار T2V
لديك صورة منتج أو مشهد، تريد الحركة I2V
تحتاج نفس الشخصية عبر مقاطع متعددة Ref2V
لديك لقطات فيديو، تريد مظهرًا مختلفًا VideoEdit (قياسي)
تحرير طويل (6–20 ث)، حساس للتكلفة VideoEdit سريع

كيفية استدعاء واجهة Kling O1 API على Novita AI

جميع أوضاع Kling O1 الأربعة على Novita AI غير متزامنة. كل طلب يعيد task_id فورًا؛ قم باستطلاع وصلة نتيجة المهمة حتى تصبح الحالة succeed.

# الخطوة 1: إرسال مهمة التوليد (مثال: T2V)
RESPONSE=$(curl --silent --request POST \
  --url https://api.novita.ai/v3/async/kling-o1-t2v \
  --header "Authorization: Bearer $NOVITA_API_KEY" \
  --header "Content-Type: application/json" \
  --data '{"prompt": "موجهك هنا", "duration": 5, "aspect_ratio": "16:9"}')

TASK_ID=$(echo $RESPONSE | python3 -c "import sys,json; print(json.load(sys.stdin)['task_id'])")

# الخطوة 2: استطلاع النتائج
curl --request GET \
  --url "https://api.novita.ai/v3/async/task-result?task_id=$TASK_ID" \
  --header "Authorization: Bearer $NOVITA_API_KEY"

الاستجابة تتضمن حقل status. عندما يكون succeed، فإن مصفوفة videos تحتوي على رابط الإخراج. وقت التوليد النموذجي هو 30–120 ثانية حسب المدة والوضع.

احصل على مفتاح API الخاص بك من لوحة تحكم Novita AI. الحسابات الجديدة تحصل على رصيد مجاني لاختبار جميع الأوضاع الأربعة قبل الالتزام بحجم الإنتاج.

الخاتمة

يمنح Kling O1 على Novita AI المطورين إمكانية الوصول إلى أربعة أوضاع توليد فيديو متميزة — T2V وI2V وRef2V وتحرير الفيديو — من خلال واجهة برمجة تطبيقات موحدة واحدة. يغطي T2V وI2V حالات التوليد الشائعة بسعر 0.112 دولار/ثانية. يضيف Ref2V تكوين هوية متعدد المراجع للشخصيات المتكررة بسعر 0.168 دولار/ثانية. يحول تحرير الفيديو اللقطات الموجودة مع الحفاظ على الحركة، مع متغير سريع بسعر 0.09 دولار/ثانية للمقاطع الأطول. اختيار الوضع الصحيح مقدمًا يوفر التكلفة ويزيل الاحتكاك: ابدأ بـ T2V إذا لم يكن لديك أصل صورة، I2V إذا كان لديك، Ref2V عندما يكون اتساق الهوية عبر المقاطع مهمًا، وتحرير الفيديو عندما تكون الحركة ملتقطة بالفعل. جميع الأوضاع تشارك نفس نمط المهمة غير المتزامن على Novita AI، لذا فإن دمج أوضاع متعددة في خط أنابيب واحد يتطلب القليل من التعليمات البرمجية الإضافية.

Novita AI هي منصة سحابية للذكاء الاصطناعي تمنح المطورين وصولاً مستضافًا لنماذج الفيديو والصور والصوت واللغة عبر واجهة برمجة تطبيقات موحدة.

الأسئلة الشائعة

ما الفرق بين Kling O1 T2V وI2V على Novita AI؟

T2V يولّد فيديو من موجه نصي فقط — لا حاجة لصورة. I2V يأخذ صورة كإطار بداية ويحركها وفقًا للموجه. كلاهما مسعر بسعر 0.112 دولار/ثانية ويدعمان مقاطع من 5–10 ثوانٍ. استخدم T2V للاستكشاف؛ استخدم I2V عندما يكون لديك مرساة بصرية محددة.

ما الذي يفعله Kling O1 Ref2V ولا يستطيع I2V فعله؟

Ref2V يقبل ما يصل إلى 7 صور مرجعية عبر فتحات إدخال متعددة، مما يتيح لك دمج مصادر منفصلة لهوية الشخصية وخلفية المشهد والنمط. تشير إلى كل إدخال بالاسم في الموجه (@Element1، @Image1). I2V يستخدم إطار بداية واحد بدون نظام مرجعي مسمى.

هل Kling O1 هو نفسه Kling 3.0؟

لا. Kling O1 (صدر ديسمبر 2025) هو نموذج الفيديو متعدد الوسائط الموحد الأساسي. Kling 3.0 (يسمى أيضًا Kling O3، صدر فبراير 2026) هو نموذج لاحق يضيف توليدًا صوتيًا أصليًا متزامن ومقاطع تصل إلى 15 ثانية. Kling O1 على Novita AI يدعم فيديو يصل إلى 10 ثوانٍ بدون صوت أصلي.

كيف أختار بين VideoEdit القياسي وVideoEdit السريع؟

VideoEdit القياسي يقبل مقاطع مصدر 3–10 ثوانٍ بسعر 0.168 دولار/ثانية. VideoEdit السريع يقبل مقاطع 6–20 ثانية بسعر 0.09 دولار/ثانية. إذا كان فيديو المصدر أقل من 10 ثوانٍ ووقت الاستجابة مهم، استخدم القياسي. إذا كان لديك مقاطع أطول أو تقوم بأعمال إنتاجية دفعة، فالسريع أرخص بكثير.

مقالات موصى بها