Ищете DeepSeek OCR API? DeepSeek выпустил два поколения: оригинальный DeepSeek-OCR и его преемника — DeepSeek OCR2. Novita AI размещает текущее поколение, deepseek/deepseek-ocr-2, в виде конечной точки, совместимой с OpenAI. Это руководство рассказывает, как его вызывать, сколько это стоит и как различить два поколения до того, как вы напишете код.
OCR уже давно не просто «извлечение текста». Современным командам требуется интеллект документов: порядок чтения, макет, таблицы и структурированные результаты в масштабе — без корпоративных ценников OCR. DeepSeek OCR2 продвигает эту тенденцию дальше с новой парадигмой визуального кодирования, а Novita AI делает возможным его практическое внедрение в производство с помощью API и прозрачного ценообразования по токенам.
Попробовать DeepSeek OCR 2 сейчас
Gen 1 vs Gen 2: Если у вас уже есть код, вызывающий
model="deepseek/deepseek-ocr"(Gen 1), перед развёртыванием новой работы ознакомьтесь со статьёй DeepSeek-OCR на Novita AI. Текущий каталог моделей Novita помечает этот ID модели как устаревший вместе с другими моделями прошлых поколений, поэтому новые интеграции должны вместо него использоватьdeepseek/deepseek-ocr-2, описанный ниже.
Что такое DeepSeek OCR2
Основное введение
DeepSeek-OCR 2 — это мультимодальная модель распознавания документов от DeepSeek AI, позиционируемая как обновление DeepSeek-OCR (Gen 1). Её ключевое изменение — DeepEncoder V2, который переводит визуальную обработку от жёсткого «растрового сканирования» (слева направо, сверху вниз) к семантическому, причинно-обусловленному чтению — более близкому к тому, как люди следят за логическими структурами в сложных документах.
Традиционные OCR-пайплайны часто дают сбой на многоколоночных PDF-файлах, плотных финансовых отчётах, смешанных таблицах + сносках и формах со сложным порядком чтения. OCR2 предназначен для понимания страницы, а не только «распознавания символов».
| Характеристика | DeepSeek OCR2 |
| Организация | DeepSeek AI |
| Тип модели | Мультимодальное распознавание документов (OCR + понимание макета) |
| Ключевая инновация | DeepEncoder V2 переупорядочивает визуальные токены на основе семантики изображения («фиксированное сканирование» → «семантическое рассуждение») |
| Контекстное окно / Макс. вывод | 8 192 / 8 192 |
| Ввод / Вывод | Ввод: текст, изображение / Вывод: текст |
| Квантование | bf16 |
| Лицензия | Apache-2.0 |

DeepSeek-OCR 2: Визуальный причинный поток
🔍На высоком уровне:
- Сторона энкодера: DeepEncoder V2 может переупорядочивать визуальные токены на основе семантики изображения перед этапом декодирования в стиле LLM.
- Системный дизайн: OCR2 описывается как сохраняющий декодер DeepSeek-3B-MoE, заменяя исходный энкодер на базе CLIP лёгким LLM-компонентом (Qwen2-0.5B).
- Эффективность токенов: OCR2 нацелен на покрытие документа с использованием ограниченного бюджета визуальных токенов (сообщается в диапазоне 256–1120 в зависимости от сложности).
Производительность по бенчмаркам
Улучшения OCR2 наиболее заметны на бенчмарках, ориентированных на документы:
- На OmniDocBench v1.5 DeepSeek-OCR 2 достигает 91.09% в целом, что на +3.73% больше, чем у предшественника, и сокращает расстояние редактирования порядка чтения с 0.085 → 0.057.
- OmniDocBench предназначен для оценки реального парсинга PDF в различных типах документов, макетах и языках.
Если вы создаете рабочие процессы с документами (обработка счетов, обработка претензий, PDF-файлы для соответствия требованиям, RAG по руководствам), эти метрики важнее, чем общая «точность OCR», потому что они измеряют понимание структуры + макета, а не только распознавание символов.
Как оценивать AI API-провайдеров: 5 ключевых метрик
Выбор модели — только половина решения; провайдер определяет, сможете ли вы надежно масштабироваться.
| Метрика | Ключевой фокус | Бизнес-влияние | Контекст Novita AI / DeepSeek-OCR2 |
| Длина контекста | Лимит токенов | Меньше чанков → меньше вызовов → проще пайплайны | Контекст 8 192 токенов помогает обрабатывать многостраничный парсинг за один проход |
| Стоимость токенов | Цены API | Прямое влияние на ROI для крупномасштабного извлечения | Оптимизированные цены для высоконагруженных OCR-задач (подробности ниже) |
| Задержка (TTFT/TPOT) | Скорость ответа | Улучшает пользовательский опыт в OCR | Низкая задержка для более быстрых предпросмотров и отзывчивых приложений |
| Пропускная способность | RPS / параллелизм | Обеспечивает пакетную обработку и обработку пикового трафика | Высокая ёмкость параллелизма для пакетных + одновременных задач |
| Интеграция | Совместимость | Более быстрый запуск за счёт повторного использования существующих инструментов | Работает с инструментарием, совместимым с OpenAI; также поддерживает интеграцию в стиле Anthropic |
Почему стоит выбрать Novita AI?
Примечание: Помимо API, совместимых с OpenAI, Novita AI также предоставляет интерфейсы, совместимые с Anthropic, что позволяет командам повторно использовать существующие инструменты и промпты в стиле Claude с минимальными изменениями.
Эффективность разработки
Более быстрая интеграция = более быстрое получение ценности. Novita предлагает совместимый с OpenAI интерфейс, поэтому большинство команд могут интегрировать OCR2, изменив всего лишь:
- base_url:
https://api.novita.ai/openai - api_key:
<Ваш API-ключ> - имя модели:
deepseek/deepseek-ocr-2
Преимущество в стоимости
Novita предлагает OCR2 с чрезвычайно простыми ценами: одинаковая низкая ставка для токенов ввода и вывода, что упрощает прогнозирование для задач с большим объёмом OCR.
А поскольку Novita использует serverless-энпоинты, вы обычно избегаете операционной нагрузки, связанной с:
- выделением GPU,
- автоматическим масштабированием серверов инференса,
- поддержкой стека CUDA + инференс.
Цена API DeepSeek OCR2
В каталоге моделей Novita deepseek/deepseek-ocr-2 указан (проверено 2026-08-24, цены постоянно обновляются):
- Ввод: $0.03 / 1M токенов
- Вывод: $0.03 / 1M токенов
- Контекстное окно: 8 192 токена
Доступ к API DeepSeek OCR2
Быстрый старт: попробуйте DeepSeek OCR2 мгновенно в Playground Novita
Самый быстрый способ проверить OCR2 на ваших документах — запустить несколько реальных образцов в Novita Playground — никакой настройки не требуется
⚠ Примечание: Для детерминированных и стабильных результатов установите
temperatureиtop_kв0. Это отключает случайность и гарантирует, что модель будет выдавать согласованные результаты между запусками.
Получить API-ключ
- Шаг 1: Создайте или войдите в свою учётную запись
Перейдите на novita.ai и зарегистрируйтесь или войдите в существующую учётную запись
- Шаг 2: Перейдите в управление ключами
После входа найдите «API Keys»

- Шаг 3: Создайте новый ключ
Нажмите кнопку «Add New Key».

- Шаг 4: Немедленно сохраните ключ
Скопируйте и сохраните ключ сразу после его генерации; обычно он отображается только один раз и не может быть получен позже. Храните ключ в безопасном месте, например, в менеджере паролей или зашифрованных заметках.
Использование API (Python)
Используйте следующие примеры кода для интеграции с нашим API:
from openai import OpenAI
client = OpenAI(
api_key="<Your API Key>",
base_url="https://api.novita.ai/openai"
)
response = client.chat.completions.create(
model="deepseek/deepseek-ocr-2",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Hello, how are you?"}
],
max_tokens=8192,
temperature=0.7
)
print(response.choices[0].message.content)
Хотя приведённый выше пример использует Python, API Novita работает точно так же на других языках, таких как TypeScript, Java, Go и Shell — меняется только клиентская библиотека.
Заключение
DeepSeek OCR2 улучшает интеллект документов, смещая визуальное кодирование от фиксированного сканирования к семантическому, причинно-обусловленному чтению — что особенно ценно для сложных макетов, таких как таблицы, многоколоночные PDF и плотные формы. С Novita AI в качестве провайдера API для OCR2 вы получаете интеграцию, совместимую с OpenAI, быструю настройку и прозрачные цены: $0.03 за 1M входных токенов и $0.03 за 1M выходных токенов. Если вы создаёте производственные OCR-процессы (PDF → Markdown/JSON, извлечение счетов, документ-в-RAG), Novita — это чистый, масштабируемый путь от прототипа до высокой пропускной способности.
Novita AI — это облачная платформа AI, которая предлагает разработчикам простой способ развёртывания моделей AI с помощью нашего простого API, а также предоставляет доступные и надёжные GPU-облака для создания и масштабирования.
Часто задаваемые вопросы
Поддерживает ли DeepSeek OCR?
Да. DeepSeek предоставляет возможности OCR через DeepSeek OCR2, свою модель распознавания документов второго поколения, предназначенную для распознавания текста в документах и изображениях с сильным пониманием макета.
Бесплатен ли DeepSeek OCR?
DeepSeek OCR2 является открытым исходным кодом на уровне модели, но использование API не бесплатно.
Используя Novita AI, вы получаете экономичное, прозрачное ценообразование с оплатой по мере использования без инфраструктурных накладных расходов — что делает его гораздо более практичным и экономичным, чем самостоятельное размещение для промышленного использования.
Как получить доступ к DeepSeek OCR?
Вы можете получить доступ к DeepSeek OCR2 либо путём самостоятельного размещения модели с открытым исходным кодом, либо с помощью облачного API-провайдера, такого как Novita AI, который предлагает мгновенный доступ к API, playground и интеграцию, совместимую с SDK.
Есть ли разница между DeepSeek OCR API и DeepSeek OCR2 API?
Да. deepseek/deepseek-ocr (Gen 1) и deepseek/deepseek-ocr-2 — это два отдельных ID модели в каталоге Novita, и только Gen 2 является текущей, активно поддерживаемой версией. Если ваша интеграция всё ещё указывает на ID модели Gen 1, переключите её на deepseek/deepseek-ocr-2 — шаги настройки выше идентичны, за исключением этой одной строки.
