معظم النماذج مفتوحة المصدر ذات القدرات الاستدلالية تفرض مقايضة: نوافذ سياق صغيرة، أو إنتاجية بطيئة، أو أسعار تتجاوز $1/مليون رمز بمجرد تفعيل التفكير الموسع. لا يزال DeepSeek-V4-Flash يتجنب هذه المقايضة في تحديث 31 يوليو 2026: نفس تصميم Mixture-of-Experts بـ 284B معلمة مع تفعيل 13B فقط لكل استدلال، نفس نافذة السياق الأصلية 1,048,576 رمزًا، ونفس تسعير الإدخال $0.14/مليون على Novita AI.
باختصار: يظل DeepSeek-V4-Flash نفس عائلة النماذج على Novita AI بعد مراجعة إعادة التدريب اللاحق لـ 0731. التحديث مهم لأنه يحدّث إصدار الخدمة دون إجبار المطورين على تبديل معرفات النماذج، أو إعادة كتابة المطالبات، أو إعادة حساب افتراضات التكلفة.
افتح DeepSeek-V4-Flash في وحدة تحكم نماذج Novita AI
ما هو DeepSeek-V4-Flash؟
DeepSeek-V4-Flash هو نموذج لغة من نوع Mixture-of-Experts (MoE) من DeepSeek AI، تم إصداره كجزء من سلسلة DeepSeek-V4 إلى جانب النموذج الأكبر DeepSeek-V4-Pro. يحتوي النموذج على 284B معلمة إجمالية مع تفعيل 13B عند الاستدلال - مما يحافظ على انخفاض تكلفة الحوسبة لكل رمز مع الاحتفاظ بسعة المعلمات لنموذج أكبر بكثير.
القدرات الرئيسية بنظرة سريعة:
- 284B إجمالي / 13B معلمات مُفعّلة — بنية MoE، تكلفة استدلال منخفضة
- نافذة سياق 1,048,576 رمزًا (1M رمز) — مدعومة ببنية الانتباه الهجينة
- ثلاثة أوضاع استدلال: Non-think (سريع)، Think (خطوة بخطوة)، Think Max (أقصى ميزانية استدلال)
- دعم استدعاء الدوال — استخدام الأدوات، المخرجات المهيكلة، وضع JSON
- تدريب على أكثر من 32T رمز مع تدريب لاحق متعدد المراحل (SFT، RL مع GRPO، تقطير على السياسة)
- ترخيص MIT — الأوزان متاحة للتحميل على HuggingFace؛ الاستخدام التجاري مسموح
- دقة مختلطة FP4 + FP8 — أوزان خبراء MoE في FP4، والطبقات المتبقية في FP8
ما الجديد في تحديث 31 يوليو 2026؟
النسخة المختصرة: هذا تحديث مراجعة، وليس إطلاقًا منفصلًا.
تحديث إعادة التدريب اللاحق من DeepSeek في أواخر يوليو يحافظ على نفس هوية المنتج العامة على Novita AI:
- نفس معرف النموذج:
deepseek/deepseek-v4-flash - نفس البنية: 284B معلمة إجمالية، 13B مُفعّلة لكل استدلال
- نفس نافذة السياق: 1,048,576 رمزًا
- نفس تسعير Novita AI: $0.14/مليون إدخال، $0.28/مليون إخراج، $0.028/مليون قراءة مخبأة
هذا يعني أن التكاملات الحالية لا تحتاج إلى تغييرات في نقطة النهاية، أو إعادة كتابة جداول الأسعار، أو ترحيل تنسيق المطالبات. إذا كنت قد وجهت حركة المرور بالفعل إلى DeepSeek-V4-Flash، فمن الأفضل فهم تحديث 0731 على أنه تحديث للقدرات والتدريب اللاحق وراء الكواليس وليس وحدة تخزين جديدة تمامًا.
بالنسبة للمطورين، هذا الفرق مهم. تحديث المراجعة يعني عادةً أنه يمكنك إعادة اختبار النموذج على مطالباتك الخاصة، ومجموعات التقييم، ومهام الوكيل مع الحفاظ على نفس عقد النشر: نفس الاسم، نفس مسار API، نفس ميزانية السياق، ونفس اقتصاديات الرمز.
الميزات الرئيسية: لماذا يتميز DeepSeek-V4-Flash
عمق استدلال قابل للتحديد دون تبديل النماذج
معظم النماذج تحبسك في وضع استدلال واحد: إما التفكير قيد التشغيل أو إيقاف التشغيل. يمنحك DeepSeek-V4-Flash ثلاثة أوضاع تشغيل متميزة على نفس نقطة نهاية API:
| الوضع | الخصائص | الأفضل لـ |
|---|---|---|
| Non-think | سريع، بدون سلسلة أفكار | المهام عالية الحجم، الدردشة، التلخيص |
| Think | استدلال خطوة بخطوة، متوازن | الأسئلة والأجوبة المعقدة، توليد الكود، التحليل |
| Think Max | أقصى ميزانية استدلال | مسابقات الرياضيات، مهام البرمجة الصعبة، المعايير |
الفجوة بين الأوضاع كبيرة: على GPQA Diamond، يسجل V4-Flash Non-think 71.2 مقابل Think عند 87.4 وThink Max عند 88.1. على LiveCodeBench، يصل Think Max إلى 91.6 مقابل 55.2 لـ Non-think. أنت تختار التكلفة مقابل الجودة لكل طلب - لا حاجة لتغيير البنية التحتية.
بنية الانتباه الهجينة لسياق 1M رمز
سياق المليون رمز الأصلي أصعب مما يبدو. يحققه DeepSeek-V4-Flash من خلال بنية انتباه هجينة مخصصة تجمع بين آليتين:
- الانتباه المتفرق المضغوط (CSA) — يقلل بشكل كبير من ميزانية حساب الانتباه للتسلسلات الطويلة
- الانتباه المضغوط بشدة (HCA) — يضغط مساحة ذاكرة التخزين المؤقت KV لاستدلال سياق 1M
النتيجة: استدلال على مدخلات 1M رمز بتكلفة FLOP وذاكرة يمكن التحكم فيها. لسير العمل مثل تحليل قاعدة الكود، مراجعة المستندات القانونية، أو وكلاء الجلسات الطويلة، تجعل هذه البنية الفرق بين الممكن والمحظور.
كفاءة MoE: 13B مُفعّلة على نطاق 284B
نسبة التفعيل 284B/13B هي مصدر كفاءة التكلفة. فقط 13B معلمة نشطة لكل تمرير أمامي، مما يحافظ على زمن الاستجابة والتكلفة لكل رمز قريبة من نموذج كثيف بحجم 13B - بينما توفر مجموعة المعلمات الكاملة 284B سعة معرفية مماثلة لشبكة كثيفة أكبر بكثير. الدقة المختلطة FP4 + FP8 تقلل أيضًا من ضغط عرض النطاق الترددي للذاكرة على أوزان الخبراء.
خط أنابيب تدريب لاحق قوي
يتبع DeepSeek-V4-Flash عملية تدريب لاحق من مرحلتين: أولاً، تنمية خبرة خاصة بالمجال عبر SFT والتعلم المعزز مع GRPO؛ ثم، توحيد النموذج من خلال التقطير على السياسة. ينتج عن ذلك نموذج واحد بملفات قدرات متمايزة عبر البرمجة والاستدلال والمعرفة العامة - وليس مجرد متعليم تعليمات عام.
أداء المعايير
قصة المعايير لـ DeepSeek-V4-Flash تدور حول اختيار وضع الاستدلال. في وضع Non-think، يتصرف كنموذج فعال بحجم 13B مُفعّلة. ارفع إلى Think Max ويصل إلى مستوى مختلف تمامًا.

أداء DeepSeek-V4-Flash عبر الأوضاع مقابل النماذج الحدودية [المصدر: DeepSeek AI / HuggingFace](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash]
الأداء عبر أوضاع الاستدلال
فيما يلي نتائج V4-Flash عبر المعايير الرئيسية، مقارنة بين أوضاع التشغيل الثلاثة:
| المعيار | V4-Flash Non-Think | V4-Flash Think | V4-Flash Think Max |
|---|---|---|---|
| LiveCodeBench (Pass@1) | 55.2 | 88.4 | 91.6 |
| GPQA Diamond (Pass@1) | 71.2 | 87.4 | 88.1 |
| HMMT 2026 Feb (Pass@1) | 40.8 | 91.9 | 94.8 |
| IMOAnswerBench (Pass@1) | 41.9 | 85.1 | 88.4 |
| Codeforces Rating | — | 2816 | 3052 |
| SWE Verified (Resolved) | 73.7 | 78.6 | 79.0 |
| MRCR 1M (MMR) | 37.5 | 76.9 | 78.7 |
| MCPAtlas (Pass@1) | 64.0 | 67.4 | 69.0 |
| MMLU-Pro (EM) | 83.0 | 86.4 | 86.2 |
آخر تحقق: 2026-04-27. المصدر: التقرير الفني DeepSeek-V4 وبطاقة نموذج HuggingFace.
كيف يقارن V4-Flash بالمنافسين
يتنافس V4-Flash Think Max (79.0 SWE Verified، 91.6 LiveCodeBench) مع نماذج تعمل بتكلفة أعلى بكثير لكل رمز. لا يتصدر كل لوحة متصدرين - V4-Pro Max يتصدر في معظم المعايير الحدودية - ولكن بالنسبة للمطورين الذين ينظرون إلى التكلفة لكل مهمة بدلاً من الأداء الخام الأقصى، فإن المقايضة مواتية:
إذا كنت تختار بين واجهتي DeepSeek V4 API لتوجيه الإنتاج، استخدم دليل تسعير وتوجيه DeepSeek V4 Pro vs Flash لمقارنة متى يجب على Flash التعامل مع حركة المرور الأساسية ومتى يكون Pro يستحق سعر الرمز الأعلى.
| المعيار | V4-Flash Max | V4-Pro Max | Claude Opus 4.6 Max | Gemini 3.1 Pro High |
|---|---|---|---|---|
| LiveCodeBench (Pass@1) | 91.6 | 93.5 | 88.8 | 91.7 |
| GPQA Diamond (Pass@1) | 88.1 | 90.1 | 91.3 | 94.3 |
| SWE Verified (Resolved) | 79.0 | 80.6 | 80.8 | 80.6 |
| HMMT 2026 Feb (Pass@1) | 94.8 | 95.2 | 96.2 | 94.7 |
| MRCR 1M (MMR) | 78.7 | 83.5 | 92.9 | 76.3 |
آخر تحقق: 2026-04-27. أرقام Claude Opus 4.6 Max و Gemini 3.1 Pro High مأخوذة من التقرير الفني DeepSeek-V4 (جدول مقارنة V4-Pro الحدودي). لم يتم قياس هذه النتائج وجهاً لوجه ضد V4-Flash في ذلك التقرير.
جدير بالملاحظة أن V4-Flash Think Max على MRCR 1M (78.7) يتفوق على Gemini 3.1 Pro High (76.3) في مهمة استرجاع السياق الطويل - المعيار الذي يتوافق بشكل مباشر مع حالات استخدام سياق 1M. على SWE Verified، تتجمع جميع النماذج الأربعة بين 79-81، مما يجعل V4-Flash تنافسيًا في فئة وكيل البرمجة الواقعي بجزء صغير من سعر النموذج المغلق.
كيفية استخدام DeepSeek-V4-Flash عبر Novita AI
الخيار 1: الملعب (بدون كود)
اختبر النموذج مباشرة في متصفحك على وحدة تحكم نماذج Novita AI. لا حاجة لمفتاح API للبدء - قم بالتبديل بين أوضاع Non-think و Think و Think Max عبر واجهة الدردشة.
الخيار 2: API (Python)
يستخدم DeepSeek-V4-Flash واجهة برمجة تطبيقات متوافقة مع OpenAI. استخدم معرف النموذج deepseek/deepseek-v4-flash مع عنوان URL الأساسي لـ Novita:
from openai import OpenAI
client = OpenAI(
base_url="https://api.novita.ai/v3/openai",
api_key="YOUR_NOVITA_API_KEY",
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash",
messages=[{"role": "user", "content": "مطالبتك هنا"}]
)
print(response.choices[0].message.content)
لتفعيل وضع Think أو Think Max، قم بتمرير معامل reasoning في جسم الطلب:
from openai import OpenAI
client = OpenAI(
base_url="https://api.novita.ai/v3/openai",
api_key="YOUR_NOVITA_API_KEY",
)
# وضع Think Max - أقصى ميزانية استدلال
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash",
messages=[{"role": "user", "content": "حل: x^4 - 5x^2 + 4 = 0"}],
extra_body={"reasoning": {"effort": "high"}} # "low" = Think، "high" = Think Max
)
print(response.choices[0].message.content)
احصل على مفتاح API الخاص بك على novita.ai/settings.
الخيار 3: أدوات الطرف الثالث
نظرًا لأن Novita AI يعرض نقطة نهاية متوافقة مع OpenAI، فإن DeepSeek-V4-Flash يعمل فورًا مع:
- LangChain / LlamaIndex — استخدم
ChatOpenAIمعbase_url="https://api.novita.ai/v3/openai" - OpenWebUI — أضف كنقطة نهاية مخصصة متوافقة مع OpenAI
- Continue.dev / Cursor — قم بتكوينه كنموذج مخصص مع عنوان URL الأساسي لـ Novita
تسعير DeepSeek-V4-Flash
تسعير DeepSeek-V4-Flash على Novita AI لم يتغير في تحديث 31 يوليو 2026. جميع الأرقام أدناه لكل مليون رمز، آخر فحص في 2026-08-03:
| المزود | الإدخال ($/M) | الإخراج ($/M) | قراءة المخبأ ($/M) | السياق الأقصى |
|---|---|---|---|---|
| Novita AI | $0.14 | $0.28 | $0.028 | 1,048,576 رمزًا |
| DeepSeek الرسمي | $0.14 | $0.28 | $0.028 | 131,072 رمزًا |
| SiliconFlow | $0.14 | $0.28 | $0.028 | 65,536 رمزًا |
| DeepInfra | $0.14 | $0.28 | — | 16,384 رمزًا |
يبقى معدل الرمز كما هو بعد تحديث 0731 - لكن السياق الأقصى لا يزال يختلف بشكل كبير حسب المزود. يقدم Novita AI نافذة السياق الكاملة 1M رمز. DeepInfra يحدد عند 16,384 رمزًا. إذا كان عبء عملك يتضمن مستندات طويلة، أو قواعد أكواد، أو وكلاء متعددين، فإن Novita هو الخيار العملي.
حالات الاستخدام الموصى بها
وكلاء البرمجة المستقلون
نافذة السياق 1M لـ V4-Flash تعني أن الوكيل يمكنه تحميل قاعدة أكواد كاملة في السياق دون تقسيم. جنبًا إلى جنب مع 79.0 SWE Verified في وضع Think Max، فإنه يتعامل مع إعادة هيكلة متعددة الملفات وتصحيح الأخطاء دون فقدان الحالة بين الجولات.
الأسئلة والأجوبة للمستندات الطويلة و RAG
MRCR 1M (استرجاع السياق متعدد الجولات) عند 78.7% Think Max - يقيس المعيار دقة الاسترجاع عبر نافذة سياق حقيقية 1M رمز. لفهرسة المستندات القانونية، الأوراق الأكاديمية، أو المواصفات الفنية الطويلة، يسترجع V4-Flash بدقة حيث تتدهور معظم النماذج بعد 32K رمز.
الاستدلال الرياضي والعلمي
94.8% على HMMT 2026 فبراير (رياضيات المسابقات) مع Think Max. وضع التفكير بالميزانية يسمح لك بضبط التكلفة مقابل الدقة - استخدم Think للمشكلات القياسية، Think Max للصعبة. طلب واحد لا يحرق ميزانية حوسبة ثابتة؛ أنت تختار.
واجهات برمجة التطبيقات الإنتاجية مع التخزين المؤقت
بسعر $0.028/M لقراءة المخبأ، فإن المطالبات النظامية المتكررة ومخططات الأدوات لا تكلف شيئًا فعليًا على نطاق واسع. منتجات الشات بوت وأغلفة API التي تعيد حقن نفس السياق في كل مكالمة تستفيد من تسعير قراءة المخبأ على تسعير الإدخال الخام.
لإعداد نموذج مختلط، احتفظ بـ Flash كخيار افتراضي للمكالمات الإنتاجية المتكررة وقم بتصعيد المطالبات الصعبة ذات السياق الطويل أو وكلاء البرمجة إلى Pro. يوضح دليل السياق الطويل DeepSeek V4 Pro كيفية تكوين معرف نموذج Pro، وعنوان URL الأساسي، وشكل الطلب، وضوابط التكلفة لتلك المسارات الأعلى صعوبة.
ابدأ باستخدام DeepSeek-V4-Flash اليوم
لا يزال DeepSeek-V4-Flash متاحًا عبر Novita AI بعد تحديث 31 يوليو مع نافذة السياق الكاملة 1M، ونفس التسعير التنافسي، وصفر عبء بنية تحتية. أنت تختار وضع الاستدلال؛ Novita يتولى الباقي.
→ جرب DeepSeek-V4-Flash المدعوم من Novita AI
→ وثائق واجهة برمجة تطبيقات LLM الخاصة بـ Novita AI
الأسئلة الشائعة
ما الذي تغير في مراجعة DeepSeek-V4-Flash 0731؟
على Novita AI، يبقى عقد النشر المرئي كما هو: يظل معرف النموذج deepseek/deepseek-v4-flash، ويظل التسعير $0.14/M للإدخال و $0.28/M للإخراج، ونافذة السياق الكاملة 1,048,576 رمزًا لا تزال متاحة. تحديث 0731 هو تحديث لمراجعة الخدمة وليس عائلة نموذج منفصلة.
ما هو DeepSeek-V4-Flash؟
DeepSeek-V4-Flash هو نموذج لغة من نوع Mixture-of-Experts بـ 284B معلمة طورته DeepSeek AI، تم إصداره في 2026-04-23. يقوم بتفعيل 13B معلمة فقط لكل تمرير أمامي، مما يجعله أسرع وأرخص بكثير من النماذج الكثيفة ذات القدرة المماثلة. يدعم نافذة سياق 1,048,576 رمزًا وثلاثة أوضاع استدلال: Non-thinking (سريع)، Budget Thinking، و Extended Thinking (Think Max).
كيف يختلف DeepSeek-V4-Flash عن DeepSeek-V4-Pro؟
V4-Flash هو البديل الأخف والأسرع المحسن للسرعة والتكلفة. V4-Pro هو النموذج الرائد مع نتائج معايير أعلى (مثل 93.5 مقابل 91.6 على LiveCodeBench Think Max). V4-Flash “يحقق أداء استدلاليًا مشابهًا لإصدار Pro عند منحه ميزانية تفكير أكبر” - عمليًا، يغلق V4-Flash Think Max معظم الفجوة ضد V4-Pro Think Max بتكلفة أقل لكل رمز.
إذا كنت بحاجة إلى قاعدة توجيه إنتاجية، قارن كلا النموذجين في دليل قرار واجهة API DeepSeek V4 Pro vs Flash قبل نقل كل حركة المرور إلى نموذج واحد.
ماذا يعني “Flash” في اسم النموذج؟
Flash يشير إلى متغير محسن للسرعة، بما يتوافق مع كيفية استخدام Google للمصطلح لـ Gemini Flash. يعطي DeepSeek-V4-Flash الأولوية لزمن استجابة وتكلفة أقل على الدقة القصوى الخام، مع توفر أوضاع التفكير عندما تحتاج إلى سد فجوة الأداء.
هل يدعم DeepSeek-V4-Flash نافذة سياق 1M مدعومة من Novita AI؟
نعم. يعرض Novita AI نافذة السياق الكاملة 1,048,576 رمزًا - الأكبر المتاحة بين جميع المزودين الحاليين لهذا النموذج. الحد الأقصى لرموز الإكمال على Novita هو 393,216.
كيف يمكنني تبديل أوضاع الاستدلال عبر API؟
قم بتمرير معامل extra_body={"reasoning": {"effort": "low"}} لـ Budget Thinking، أو "effort": "high" لـ Think Max. احذف المعامل تمامًا لوضع Non-thinking (سريع). API متوافق مع OpenAI - لا حاجة لتغييرات في SDK.
ما هو تسعير DeepSeek-V4-Flash المدعوم من Novita AI؟
اعتبارًا من 2026-08-03: $0.14/M لرموز الإدخال، $0.28/M لرموز الإخراج، $0.028/M لرموز قراءة المخبأ. هذا يتطابق مع التسعير الرسمي لـ DeepSeek وهو متسق عبر المزودين - المميز في Novita هو نافذة السياق الكاملة 1M ووقت التشغيل الموثوق.
هل DeepSeek-V4-Flash مفتوح المصدر؟
نعم. أوزان النموذج متاحة على HuggingFace تحت ترخيص MIT - تم تأكيده في مستودع DeepSeek-V4 الرسمي. الاستضافة الذاتية والاستخدام التجاري مسموحان بموجب شروط MIT. استخدامه عبر API الخاص بـ Novita AI لا يتطلب أي استضافة ذاتية على الإطلاق.
