هل تبحث عن واجهة برمجة تطبيقات DeepSeek للتعرف البصري؟ أصدرت DeepSeek جيلين: الجيل الأصلي DeepSeek-OCR وخلفه DeepSeek OCR2. تستضيف Novita AI الجيل الحالي، deepseek/deepseek-ocr-2، كنقطة نهاية متوافقة مع OpenAI، ويغطي هذا الدليل كيفية استدعائها، وتكلفتها، وكيفية التمييز بين الجيلين قبل كتابة أي كود.
لم يعد التعرف البصري مجرد “استخراج نص”. تحتاج الفرق الحديثة إلى ذكاء المستندات: ترتيب القراءة، التخطيط، الجداول، والمخرجات المنظمة على نطاق واسع - دون أسعار المؤسسات الباهظة. يدفع DeepSeek OCR2 هذا الاتجاه إلى أبعد من ذلك بنموذج تشفير مرئي جديد، وتجعل Novita AI من العملي نشره في الإنتاج باستخدام واجهة برمجة تطبيقات وتسعير شفاف قائم على الرموز المميزة.
الجيل الأول مقابل الجيل الثاني: إذا كان لديك بالفعل كود يستدعي
model="deepseek/deepseek-ocr"(الجيل الأول)، فتحقق من مقال DeepSeek-OCR على Novita AI قبل نشر عمل جديد عليه. يسرد كتالوج النماذج المباشر لـ Novita معرف النموذج هذا بحالة إرثية إلى جانب نماذج الجيل المتقاعد الأخرى، لذا يجب أن تستهدف التكاملات الجديدةdeepseek/deepseek-ocr-2أدناه بدلاً من ذلك.
ما هو DeepSeek OCR2
مقدمة أساسية
DeepSeek-OCR 2 هو نموذج تعريف متعدد الوسائط للمستندات من DeepSeek AI، تم وضعه كترقية لـ DeepSeek-OCR (الجيل الأول). التغيير الرئيسي فيه هو DeepEncoder V2، والذي ينقل المعالجة المرئية من “مسح نقطي” صارم (من أعلى اليسار إلى أسفل اليمين) نحو قراءة دلالية وسببية - أقرب إلى كيفية متابعة البشر للهياكل المنطقية في المستندات المعقدة.
غالبًا ما تتعطل خطوط أنابيب التعرف البصري التقليدية عند التعامل مع ملفات PDF متعددة الأعمدة، والبيانات المالية الكثيفة، والجداول المختلطة مع الحواشي، والنماذج ذات ترتيب القراءة الصعب. تم تصميم OCR2 لفهم الصفحة، وليس فقط “التعرف على الأحرف”.
| الميزة | DeepSeek OCR2 |
| المنظمة | DeepSeek AI |
| نوع النموذج | التعرف على المستندات متعدد الوسائط (OCR + فهم واعي بالتخطيط) |
| الابتكار الرئيسي | يقوم DeepEncoder V2 بإعادة ترتيب الرموز المميزة المرئية بناءً على دلالات الصورة (“المسح الثابت” ← “الاستدلال الدلالي”) |
| نافذة السياق / الحد الأقصى للإخراج | 8,192 / 8,192 |
| المدخلات / المخرجات | المدخلات: نص، صورة / المخرجات: نص |
| الكمية | bf16 |
| الترخيص | Apache-2.0 |

DeepSeek-OCR 2: التدفق السببي البصري
🔍على مستوى عالٍ:
- جانب التشفير: يمكن لـ DeepEncoder V2 إعادة ترتيب الرموز المميزة المرئية بناءً على دلالات الصورة قبل خطوة فك التشفير على غرار LLM.
- تصميم النظام: يُوصف OCR2 بأنه يحتفظ بـ مفكك تشفير DeepSeek-3B-MoE، مع استبدال مشفر CLIP الأصلي بمكون LLM خفيف الوزن (Qwen2-0.5B).
- كفاءة الرموز المميزة: يستهدف OCR2 تغطية المستندات باستخدام ميزانية محدودة من الرموز المميزة المرئية (يتم الإبلاغ عنها في نطاق 256–1120 حسب التعقيد).
أداء المعايير
تكون تحسينات OCR2 أكثر وضوحًا في المعايير التي تركز على المستندات:
- في OmniDocBench v1.5، يحقق DeepSeek-OCR 2 91.09% بشكل عام، بزيادة +3.73% عن سابقه، ويقلل مسافة التحرير لترتيب القراءة من 0.085 → 0.057.
- تم تصميم OmniDocBench لتقييم تحليل ملفات PDF في العالم الحقيقي عبر أنواع المستندات والتخطيطات واللغات المختلفة.
إذا كنت تقوم ببناء سير عمل للمستندات (استخراج الفواتير، معالجة المطالبات، ملفات PDF للامتثال، RAG عبر الأدلة)، فإن هذه المقاييس أكثر أهمية من “دقة التعرف البصري” العامة، لأنها تقيس فهم البنية + التخطيط، وليس مجرد التعرف على مستوى الأحرف.
كيفية تقييم مزودي واجهات برمجة تطبيقات الذكاء الاصطناعي: المقاييس الخمسة الرئيسية
اختيار النموذج هو نصف القرار فقط - حيث يحدد المزود ما إذا كان بإمكانك التوسع بشكل موثوق.
| المقياس | التركيز الرئيسي | التأثير التجاري | سياق Novita AI / DeepSeek-OCR2 |
| طول السياق | حد الرموز المميزة | أجزاء أقل ← استدعاءات أقل ← خطوط أنابيب أبسط | يساعد سياق 8,192 رمزًا في الحفاظ على تحليل متعدد الصفحات في تمريرة واحدة |
| تكلفة الرموز المميزة | تسعير API | يؤثر بشكل مباشر على عائد الاستثمار لعمليات الاستخراج واسعة النطاق | تسعير محسّن لأحمال عمل التعرف البصري عالية الحجم (التفاصيل أدناه) |
| وقت الاستجابة (TTFT/TPOT) | سرعة الاستجابة | يحسن تجارب التعرف البصري الموجهة للمستخدم | زمن انتقال منخفض لمعاينات أسرع وتطبيقات سريعة الاستجابة |
| الإنتاجية | RPS / التزامن | يتيح المعالجة المجمعة والتعامل مع ذروة الحركة | سعة تزامن عالية للوظائف المجمعة والمتزامنة |
| التكامل | التوافق | شحن أسرع من خلال إعادة استخدام الأدوات الحالية | يعمل مع أدوات متوافقة مع OpenAI؛ يدعم أيضًا التكامل على غرار Anthropic |
لماذا يجب أن تختار Novita AI؟
ملاحظة: بالإضافة إلى واجهات برمجة التطبيقات المتوافقة مع OpenAI، توفر Novita AI أيضًا واجهات متوافقة مع Anthropic، مما يسمح للفرق بإعادة استخدام أدوات وأوامر Claude الحالية بأقل تغييرات.
كفاءة التطوير
التكامل الأسرع = وقت أقصر لتحقيق القيمة. تقدم Novita واجهة متوافقة مع OpenAI، لذا يمكن لمعظم الفرق دمج OCR2 فقط عن طريق تغيير:
- base_url:
https://api.novita.ai/openai - api_key:
<مفتاح API الخاص بك> - اسم النموذج:
deepseek/deepseek-ocr-2
ميزة التكلفة
تدرج Novita OCR2 بتسعير مباشر للغاية: نفس السعر المنخفض لرموز الإدخال والإخراج، مما يبسط التنبؤ بأحمال عمل التعرف البصري الثقيلة.
ونظرًا لأن Novita تدير نقاط نهاية بدون خادم، فإنك تتجنب عادةً العبء التشغيلي لـ:
- توفير وحدات معالجة الرسوميات،
- التوسع التلقائي لخوادم الاستدلال،
- صيانة مكدس CUDA + الاستدلال.
سعر API DeepSeek OCR2
في كتالوج نماذج Novita، تم إدراج deepseek/deepseek-ocr-2 على النحو التالي (تم التحقق منه في 2026-08-24، يتم تحديث الأسعار باستمرار):
- الإدخال: 0.03 دولار / 1 مليون رمز مميز
- الإخراج: 0.03 دولار / 1 مليون رمز مميز
- نافذة السياق: 8,192 رمزًا مميزًا
الوصول إلى API DeepSeek OCR2
بداية سريعة: جرب DeepSeek OCR2 فورًا في ملعب Novita
أسرع طريقة للتحقق من صحة OCR2 لمستنداتك هي تشغيل بعض العينات الحقيقية في ملعب Novita - بدون أي إعداد مسبق
⚠ ملاحظة: للحصول على مخرجات حتمية ومستقرة، يرجى ضبط كل من
temperatureوtop_kعلى0. يؤدي ذلك إلى تعطيل العشوائية ويضمن أن النموذج ينتج نتائج متسقة عبر عمليات التشغيل.
الحصول على مفتاح API
- الخطوة 1: إنشاء حساب أو تسجيل الدخول إليه
قم بزيارة novita.ai و سجل أو سجل الدخول إلى حسابك الحالي
- الخطوة 2: انتقل إلى إدارة المفاتيح
بعد تسجيل الدخول، ابحث عن “مفاتيح API”

- الخطوة 3: إنشاء مفتاح جديد
انقر على زر “إضافة مفتاح جديد”.

- الخطوة 4: احفظ مفتاحك فورًا
انسخ المفتاح واحفظه فور إنشائه؛ عادةً ما يظهر مرة واحدة فقط ولا يمكن استرجاعه لاحقًا. احتفظ بالمفتاح في مكان آمن مثل مدير كلمات المرور أو الملاحظات المشفرة
استخدام API (بايثون)
استخدم أمثلة الكود التالية للتكامل مع API الخاص بنا:
from openai import OpenAI
client = OpenAI(
api_key="<Your API Key>",
base_url="https://api.novita.ai/openai"
)
response = client.chat.completions.create(
model="deepseek/deepseek-ocr-2",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Hello, how are you?"}
],
max_tokens=8192,
temperature=0.7
)
print(response.choices[0].message.content)
على الرغم من أن المثال أعلاه يستخدم بايثون، إلا أن API الخاص بـ Novita يعمل بنفس الطريقة في لغات أخرى مثل TypeScript و Java و Go و Shell - فقط مكتبة العميل هي التي تتغير.
الخاتمة
يقوم DeepSeek OCR2 بترقية ذكاء المستندات عن طريق تحويل التشفير المرئي من المسح الثابت إلى القراءة الدلالية والسببية - وهو مفيد بشكل خاص للتخطيطات المعقدة مثل الجداول وملفات PDF متعددة الأعمدة والنماذج الكثيفة. مع Novita AI كمزود API لـ OCR2، تحصل على تكامل متوافق مع OpenAI، وإعداد سريع، وتسعير شفاف بسعر 0.03 دولار لكل 1 مليون رمز إدخال و 0.03 دولار لكل 1 مليون رمز إخراج. إذا كنت تقوم ببناء سير عمل إنتاجي للتعرف البصري (PDF → Markdown/JSON، استخراج الفواتير، تحويل المستندات إلى RAG)، فإن Novita هي مسار نظيف وقابل للتطوير من النموذج الأولي إلى الإنتاجية.
Novita AI هي منصة سحابية للذكاء الاصطناعي تقدم للمطورين طريقة سهلة لنشر نماذج الذكاء الاصطناعي باستخدام واجهة برمجة تطبيقات بسيطة، مع توفير سحابة GPU ميسورة التكلفة وموثوقة للبناء والتوسع.
الأسئلة الشائعة
هل يدعم DeepSeek التعرف البصري؟
نعم. توفر DeepSeek قدرات التعرف البصري من خلال DeepSeek OCR2، نموذج التعرف البصري من الجيل الثاني المصمم للتعرف على النصوص في المستندات والصور مع فهم قوي للتخطيط.
هل DeepSeek OCR مجاني؟
DeepSeek OCR2 هو مفتوح المصدر على مستوى النموذج، ولكن استخدام API ليس مجانيًا.
باستخدام Novita AI، تحصل على تسعير فعال من حيث التكلفة وشفاف وادفع حسب الاستخدام دون أي أعباء بنية تحتية - مما يجعله أكثر عملية واقتصادًا من الاستضافة الذاتية للاستخدام الإنتاجي.
كيف يمكن الوصول إلى DeepSeek OCR؟
يمكنك الوصول إلى DeepSeek OCR2 إما عن طريق الاستضافة الذاتية للنموذج مفتوح المصدر أو باستخدام مزود API سحابي مثل Novita AI، الذي يوفر وصولاً فوريًا إلى API، وملعبًا، وتكاملًا متوافقًا مع SDK.
هل هناك فرق بين API DeepSeek OCR و API DeepSeek OCR2؟
نعم. deepseek/deepseek-ocr (الجيل الأول) و deepseek/deepseek-ocr-2 هما معرفان منفصلان للنموذج في كتالوج Novita، والجيل الثاني فقط هو الإصدار الحالي والمدعوم بنشاط. إذا كان تكاملك لا يزال يشير إلى معرف نموذج الجيل الأول، فقم بتبديله إلى deepseek/deepseek-ocr-2 — خطوات الإعداد أعلاه متطابقة بصرف النظر عن هذا السلسلة.
