Novita AI LLM, Updates

Ling-3.0-Flash-VL على Novita AI: واجهة برمجة تطبيقات متعددة الوسائط أصلية والتسعير

Ling-3.0-Flash-VL على Novita AI: واجهة برمجة تطبيقات متعددة الوسائط أصلية والتسعير

Ling-3.0-Flash-VL متاح على Novita AI كنموذج متعدد الوسائط بدون خادم للتطبيقات التي تحتاج إلى إدخال نص وصورة وفيديو في سير عمل API واحد. يُظهر القائمة المستضافة لـ inclusionai/ling-3.0-flash-vl نافذة سياقية بسعة 262,144 رمزًا، وإخراج أقصى 32,768 رمزًا، والاستدلال، واستدعاء الوظائف، ورموز الإدخال والإخراج المجانية حتى 23 سبتمبر 2026 الساعة 2:30 صباحًا بالتوقيت العالمي المنسق. هو عضو اللغة المرئية في عائلة Ling-3.0-flash، ويضيف فهمًا بصريًا أصليًا وقدرات وكيل بصري بدلاً من الحاجة إلى خط أنابيب منفصل لتحويل الصورة إلى نص.

النقاط الرئيسية

  • Ling-3.0-Flash-VL يقبل النصوص والصور ومقاطع الفيديو. تسرد Novita طرق الإدخال الثلاثة هذه وإخراج النص للنموذج المستضاف.
  • نقطة نهاية Novita هي نشر بسياق 256 ألف وإخراج 32 ألف. الحدود الدقيقة هي 262,144 رمز سياق و32,768 رمز إخراج أقصى.
  • النموذج متناثر بسعة إجمالية كبيرة. يصف بطاقة النموذج الرسمية من InclusionAI إجمالي 124 مليار معلمة وحوالي 5.5 مليار معلمة مفعلة لكل رمز.
  • استخدام الرموز مجاني حتى 23 سبتمبر 2026 الساعة 2:30 صباحًا بالتوقيت العالمي المنسق. بعد ذلك الوقت، أعد التحقق من صفحة النموذج قبل وضع ميزانية لحركة المرور الإنتاجية.
  • الاختلاف الرئيسي في حالة الاستخدام عن Ling-3.0-flash الأساسي هو الإدخال المرئي. استخدم نظرة عامة على Ling-3.0-flash لنقطة الدخول لعائلة النص فقط؛ تركز هذه الصفحة على المتغير -VL.

ما هو Ling-3.0-Flash-VL؟

Ling-3.0-Flash-VL هو نموذج متعدد الوسائط أصلي من InclusionAI والامتداد البصري اللغوي لـ Ling-3.0-flash. تصف بطاقة النموذج الأولية نظامًا يجلب المعلومات المرئية إلى الفهم والاستدلال والتخطيط والعمل والتحقق. هذا دور أوسع من إرفاق أداة تعليق على الصور بنموذج لغوي نصي فقط: يمكن أن تظل الصورة أو الفيديو جزءًا من سياق الاستدلال للنموذج أثناء معالجته لمهمة.

تذكر بطاقة النموذج إجمالي 124 مليار معلمة وحوالي 5.5 مليار معلمة مفعلة لكل رمز. هذا تصميم مختلط متناثر من الخبراء، لذا فإن العدد الإجمالي للمعلمات والمعلمات النشطة لكل رمز يصف خصائص مختلفة. يشير الأول إلى سعة النموذج الإجمالية؛ يصف الأخير مقدار الحوسبة الموجهة تقريبًا لكل رمز. لا يضمن أي من الرقمين بمفرده زمن انتقال معين أو جودة إخراج في عبء العمل الخاص بك.

الامتداد المرئي هو الفرق المهم لهذا الإطلاق. Ling-3.0-flash الأساسي هو نموذج نصي في قائمة Novita الحالية، بينما يقبل Ling-3.0-Flash-VL إدخال الصور والفيديو بالإضافة إلى النص. هذا يجعل صفحة -VL ذات صلة بفهم الواجهة، وتحليل المستندات والمخططات، والفحص البصري، والإجابة على أسئلة الفيديو، والوكلاء الذين يحتاجون إلى تفسير ما هو على الشاشة.

كيفية الوصول إليه على Novita AI

تستضيف Novita النموذج كنقطة نهاية بدون خادم بمعرف النموذج الدقيق inclusionai/ling-3.0-flash-vl. تسرد صفحة النموذج عائلتي نهايات chat/completions والنهايات المتوافقة مع Anthropic، بالإضافة إلى ميزات الاستدلال واستدعاء الوظائف. بالنسبة لعميل متوافق مع OpenAI موجود، استخدم عنوان URL الأساسي لـ API الخاص بـ Novita وحدد معرف النموذج الدقيق في تكوين طلبك.

صفحة النموذج هي مصدر الحقيقة للتكوين المستضاف. على وجه الخصوص، لا تنسخ ادعاء السياق الأكبر لبطاقة النموذج الأولي في تكامل Novita دون التحقق من حدود النشر: تصف بطاقة النموذج ما يصل إلى 1 مليون رمز على مستوى النموذج، بينما تتعرض Novita حاليًا 262,144 رمز سياق و32,768 رمز إخراج أقصى لهذه القائمة.

يظهر الكتالوج الحالي أيضًا حد 30 طلبًا في الدقيقة للمستوى الافتراضي، مع إدراج قيم المستوى الأعلى بشكل منفصل. تعامل مع ذلك كحصة كتالوج، وليس كضمان إنتاجية تطبيق عالمي. يمكن أن يؤثر مستوى الحساب وحجم الطلب والتزامن وإعادة المحاولات وتنفيذ الأدوات على الإنتاجية من البداية إلى النهاية.

ملخص المواصفات والتسعير

الحقل التفاصيل
اسم العرض Ling 3.0 Flash VL
معرف النموذج inclusionai/ling-3.0-flash-vl
البنية 124 مليار معلمة إجمالاً؛ حوالي 5.5 مليار نشطة لكل رمز؛ MoE متناثر
طرق الإدخال النص والصورة والفيديو
طريقة الإخراج النص
نافذة السياق 262,144 رمزًا على نشر Novita
أقصى إخراج 32,768 رمزًا
الميزات المستضافة بدون خادم، استدعاء وظائف، استدلال
عائلات النهايات chat/completions، متوافقة مع Anthropic
RPM الكتالوج 30 RPM على مستوى القائمة الافتراضية
سعر الإدخال مجاني حتى 23 سبتمبر 2026 الساعة 2:30 صباحًا بالتوقيت العالمي المنسق
سعر الإخراج مجاني حتى 23 سبتمبر 2026 الساعة 2:30 صباحًا بالتوقيت العالمي المنسق

العرض المجاني مفيد للتقييم حتى 23 سبتمبر 2026 الساعة 2:30 صباحًا بالتوقيت العالمي المنسق. قبل الإطلاق، سجل السعر الحالي، وأضف حماية الميزانية، وقرر أي نموذج أو قائمة انتظار يجب أن تستقبل حركة المرور بعد انتهاء الفترة الترويجية.

ما الذي يمكن للمطورين بناؤه به؟

فهم المستندات والمخططات والواجهات

يمكن للإدخال المرئي تقليل مقدار المعالجة المسبقة اللازمة للمستندات ولوحات المعلومات ولقطات الشاشة وواجهات البرامج. يمكن للمطور تمرير لقطة شاشة مع تعليمات المهمة ويطلب من النموذج تحديد الحقول أو تلخيص الحالة المرئية أو تحديد هدف التفاعل. بالنسبة للمستندات والمخططات، اختبر ما إذا كان النموذج يحافظ على الوحدات والأساطير وهياكل الجداول والعلاقات المكانية بدلاً من الحكم عليه من مثال شرح قصير.

الاستدلال على الصور والفيديو

تستخدم البنية الأولية مشفرًا بصريًا ومعالجة الموضع الزمني للفيديو. هذا مهم عندما تعتمد الإجابة على التغيير بمرور الوقت، مثل تحديد وقت حدوث حدث، أو مقارنة لحظتين في مقطع، أو استخراج سلسلة من الإجراءات. لا تزال مقاطع الفيديو الطويلة بحاجة إلى أخذ عينات دقيقة وتصميم موجه: لا يجعل حد السياق الكبير كل إطار مفيدًا بنفس القدر أو ميسور التكلفة بعد تغييرات التسعير.

دعم الوكلاء البصريين

يتوافق وضع الوكيل البصري للنموذج مع سير العمل حيث يكون الإدراك مجرد مرحلة واحدة من حلقة أكبر. قد يقوم الوكيل بفحص لقطة شاشة للمتصفح، والتفكير في الإجراء التالي، واستدعاء أداة، والتحقق من الشاشة الناتجة. يمكن أن يوفر استدعاء الوظائف حدود الإجراء، بينما يوفر السياق المرئي دليلاً لاتخاذ قرار بشأن ما يجب فعله بعد ذلك. حافظ على صلاحيات ضيقة وتحقق من كل وسيطة أداة؛ الفهم متعدد الوسائط لا يلغي الحاجة إلى فحوصات السلامة من جانب التطبيق.

توجيه أحمال العمل المختلطة من النص والمرئيات

يمكن للفرق التي توجه بالفعل مهام النص إلى Ling-3.0-flash تقييم المتغير -VL للطلبات التي تحتوي على دليل مرئي. يمكن للموجه العملي إرسال حركة مرور النص فقط إلى النموذج الأساسي وحجز المتغير المرئي للرسائل التي تحتوي على صور أو مقاطع فيديو أو حالة مستمدة من لقطة شاشة. قم بقياس المسار الكامل، بما في ذلك تحضير الصورة ووقت التحميل وزمن انتقال النموذج وإعادة المحاولات واستدعاءات الأدوات النهائية.

إشارات الأداء والتقييم

تذكر بطاقة النموذج الرسمية من InclusionAI درجة 42 على مؤشر الذكاء في التحليل الاصطناعي v4.1.1 وتصف أبعاد القدرة متعددة الوسائط بما في ذلك الفهم والاستدلال والتنفيذ. هذه إشارة مفيدة حول الإصدار الأولي، وليس ضمانًا لنشر Novita المستضاف أو لتوزيع الموجه الخاص بك. تلاحظ الصفحة أيضًا تكوين تقييم Terminal-Bench بسياق 256 ألف، وهو أقرب إلى حد السياق المستضاف من بيان بطاقة النموذج العام “حتى 1 مليون”.

من أجل تقييم ذي معنى، استخدم مجموعة مهام صغيرة تعكس منتجك:

  • الاستخراج المرئي: قياس دقة الحقل في لقطات الشاشة والنماذج والجداول والمخططات.
  • الاستدلال الزمني: اختبار ما إذا كانت الإجابات تحدد الحدث الصحيح والنطاق الزمني في مقاطع الفيديو القصيرة.
  • تنفيذ الوكيل: تسجيل كل من الأداة المختارة والحالة النهائية بعد تشغيل الأداة.
  • الترسيخ: تضمين صور بتفاصيل غامضة أو غير ذات صلة والتحقق من الادعاءات غير المدعومة.
  • العملياتيات: تسجيل زمن الانتقال واستخدام الرموز ومعدل الفشل وسلوك حد المعدل وتأثير إعادة المحاولات.

لا تستخدم درجة معيارية أولية كبديل لفحوصات التطبيق هذه. يمكن للنموذج أن يعمل بشكل جيد على معيار عام بينما لا يزال بحاجة إلى تغييرات في الموجه أو المعالجة المسبقة أو التوجيه في واجهة الإنتاج.

متى تستخدم Ling-3.0-Flash-VL

اختر Ling-3.0-Flash-VL عندما يحتوي طلبك على دليل مرئي وتتطلب الإجابة أكثر من شرح لمرة واحدة. إنه مرشح جيد للتقييم من أجل:

  • فهم لقطة الشاشة وواجهة المتصفح
  • الإجابة على أسئلة المخططات والجداول والمستندات
  • توطين الأحداث في الفيديو القصير وتلخيصها
  • الوكلاء البصريون الذين يستخدمون الأدوات
  • سير العمل المختلط للنص والصورة

القائمة المجانية حتى 23 سبتمبر 2026 الساعة 2:30 صباحًا بالتوقيت العالمي المنسق تجعل من العملي بناء مجموعة اختبار تمثيلية قبل الالتزام بخطة توجيه مدفوعة. التقط حالة التسعير عند تشغيل تلك الاختبارات حتى تظل مقارنات التكلفة قابلة للتكرار.

متى تختار نموذجًا آخر

اختر صفحة نموذج Ling-3.0-flash الأساسية لأحمال عمل النص فقط إذا كنت لا تحتاج إلى مدخلات مرئية. قد يبسط مسار النص فقط معالجة الحمولة ويقلل من المعالجة متعددة الوسائط غير الضرورية.

اختر نموذجًا آخر إذا كنت بحاجة إلى سعر ثابت بشكل دائم، أو حد سياق أو إخراج مختلف، أو مستوى خدمة زمن انتقال تم اختباره، أو إدخال صوتي، أو قدرة غير مدرجة لهذا النشر. احتفظ أيضًا بخطة احتياطية إذا كان تطبيقك يعتمد على العرض المجاني الذي ينتهي في 23 سبتمبر 2026 الساعة 2:30 صباحًا بالتوقيت العالمي المنسق. أفضل تصميم إنتاجي يعامل السعر الترويجي وحصة الكتالوج كتكوين قابل للتغيير، وليس كضمانات منتج مشفرة في الكود.

كيف يتناسب مع سير عمل API الحالي

على مستوى عالٍ، يحتاج تطبيق متوافق مع OpenAI موجود إلى مفتاح API لـ Novita، وعنوان URL الأساسي لـ API المتوافق مع OpenAI لـ Novita، و inclusionai/ling-3.0-flash-vl كمعرف النموذج. يجب أن يستخدم الطلب بنية الرسالة متعددة الوسائط التي تدعمها نقطة النهاية المحددة، مع محتوى الصورة أو الفيديو بجانب تعليمات النص للمستخدم.

حافظ على الأصول المرئية قابلة للوصول لنقطة النهاية وتحقق من تنسيقها قبل إرسالها. بالنسبة لسير عمل الوكيل، حدد الأدوات بشكل منفصل عن المحتوى المرئي، وقيّد ما يمكن لكل أداة فعله، وسجل الإجراء المختار للنموذج وحالة التطبيق الناتجة. يمكن لمقالة بداية سريعة مخصصة تغطية بناء الطلب الخاص بـ SDK؛ تركز صفحة الإطلاق هذه عمدًا على التوفر والتوضيع والحدود والتسعير.

التوصية النهائية

Ling-3.0-Flash-VL هو فرد عائلة Ling-3.0-flash الذي يجب اختباره عندما يجب أن يشارك الدليل البصري في الاستدلال أو تنفيذ الوكيل. يجمع القائمة الحالية بدون خادم من Novita بين إدخال الصورة والفيديو مع سياق 262 ألف وإخراج أقصى 32 ألف واستدلال واستدعاء وظائف، بينما تخفض رموز الإدخال والإخراج المجانية حتى 23 سبتمبر 2026 الساعة 2:30 صباحًا بالتوقيت العالمي المنسق حاجز التقييم.

ابدأ بمجموعة اختبار خاصة بعبء العمل، وقارنها بمسار النص فقط الحالي، وسجل المقاييس التشغيلية بالإضافة إلى جودة الإجابة. إذا استوفت متطلبات الدقة البصرية وسلامة الأدوات، احتفظ بمعرف نموذج Novita والسعر الحالي في التكوين حتى لا يتطلب تغيير الكتالوج المستقبلي إعادة كتابة الكود.

جرب Ling-3.0-Flash-VL على Novita AI

الأسئلة الشائعة

ما هو معرف نموذج Ling-3.0-Flash-VL على Novita AI؟

معرف النموذج الدقيق هو inclusionai/ling-3.0-flash-vl.

هل يدعم Ling-3.0-Flash-VL إدخال الصور والفيديو؟

نعم. تدعم قائمة Novita الحالية إدخال النص والصورة والفيديو، مع إخراج نص.

ما هي نافذة السياق وحد الإخراج التي توفرها Novita؟

تظهر القائمة المستضافة نافذة سياقية بسعة 262,144 رمزًا وأقصى إخراج 32,768 رمزًا. هذه هي قيم نشر Novita ويجب التحقق منها مرة أخرى قبل الاستخدام في الإنتاج.

هل Ling-3.0-Flash-VL مجاني على Novita AI؟

تقدم Novita حاليًا رموز إدخال وإخراج مجانية حتى 23 سبتمبر 2026 الساعة 2:30 صباحًا بالتوقيت العالمي المنسق. تأكد من صفحة النموذج المباشرة بعد ذلك الوقت قبل الاعتماد على السعر.

هل يدعم استدعاء الوظائف والاستدلال؟

نعم. تسرد Novita كلاً من استدعاء الوظائف والاستدلال بين الميزات المستضافة.

كيف يختلف عن Ling-3.0-flash؟

يضيف Ling-3.0-Flash-VL إدخال الصورة والفيديو الأصلي بالإضافة إلى قدرات الوكيل البصري. صفحة Ling-3.0-flash الأساسية الحالية هي نقطة دخول عائلة نصية فقط، لذا استخدم المتغير -VL عندما يكون الدليل المرئي جزءًا من الطلب.

هل يدعم النموذج الأولي سياق 1 مليون رمز؟

تصف بطاقة النموذج الرسمية من InclusionAI ما يصل إلى 1 مليون رمز على مستوى النموذج. تتعرض قائمة Novita المستضافة الحالية 262,144 رمزًا، لذا استخدم القيمة المستضافة عند تصميم الطلبات عبر Novita.

مقالات موصى بها

مقالات ذات صلة