DeepSeek-OCR на Novita AI: Революционное сжатие контекста через зрение

DeepSeek-OCR на Novita AI: Революционное сжатие контекста через зрение

DeepSeek-OCR обеспечивает 10-кратное сжатие текста с точностью 97%, рассматривая изображения как сжатое хранилище для текста. Вместо того чтобы обрабатывать 1000 текстовых токенов по отдельности, модель обрабатывает их как одно изображение, используя всего 100 токенов зрения — это позволяет снизить затраты до 85%.

Теперь доступный на Novita AI, DeepSeek-OCR обрабатывает свыше 200 000 страниц в день на одном GPU, поддерживает 100 языков и предлагает пять режимов разрешения (от 64 до более 400 токенов). Он выходит за рамки традиционного распознавания текста: парсит диаграммы в структурированные данные, распознаёт химические формулы, извлекает геометрические фигуры и обеспечивает инновационное управление памятью для длинных диалогов.

Попробуйте сейчас в Playground Novita AI →

Ищете актуальное поколение? DeepSeek с тех пор выпустил DeepSeek-OCR 2 с более высоким показателем OmniDocBench и лучшей точностью порядка чтения. Для новых интеграций перейдите на API-провайдера DeepSeek OCR2 и используйте идентификатор модели deepseek/deepseek-ocr-2.

Что такое DeepSeek-OCR?

производительность deepseek ocr

DeepSeek-OCR — это визионно-языковая модель, которая рассматривает изображения как сжатое хранилище для текста. Вместо обработки документа с 1000 текстовых токенов по отдельности (что требует больших вычислительных затрат) модель обрабатывает его как одно изображение, используя всего 100 токенов зрения — это 10-кратное сокращение вычислительных расходов.

Базовая архитектура

Модель состоит из двух ключевых компонентов:

DeepEncoder (~380 млн параметров): Специализированный кодировщик изображений, который эффективно обрабатывает изображения документов, используя уникальную последовательную архитектуру, объединяющую оконное внимание (SAM) и глобальное внимание (CLIP) со слоем 16-кратного сжатия между ними.

DeepSeek3B-MoE Decoder (570 млн активных параметров): Компактная языковая модель на основе смеси экспертов (MoE), которая преобразует сжатые визуальные данные обратно в текст с высокой точностью.

Такая архитектура обеспечивает беспрецедентную эффективность обработки документов, что делает её идеальной для компаний, работающих с большими объёмами документов, или для приложений, требующих понимания длинного контекста.

Почему оптическое сжатие имеет значение

Традиционная проблема

Традиционная обработка текста в моделях ИИ масштабируется квадратично — удвоение длины документа может привести к четырёхкратному увеличению затрат. Для компаний, обрабатывающих тысячи документов ежедневно, это становится непомерно дорогим.

Решение DeepSeek-OCR

Документы объёмом до 1000 текстовых токенов можно сжать в 10 раз с точностью 97%. Даже при 20-кратном сжатии точность остаётся на уровне около 60% — что часто достаточно для многих применений.

Реальный пример:

Документ, содержащий 900 текстовых токенов, традиционно требует 900 токенов для обработки. С DeepSeek-OCR в режиме Small (100 токенов зрения) вы достигаете 9,7-кратного сжатия с точностью 96,8%. Для документов с 1100 текстовыми токенами сжатие составляет 10,6× при точности 91,5%.

Влияние на бизнес

Снижение затрат на API: Обработка до 10 раз меньшего количества токенов для типовых документов означает значительную экономию средств — компания, обрабатывающая 1 миллион страниц ежемесячно, может сэкономить более $50 000 в год.

Ускорение обработки: Меньшее количество токенов напрямую сокращает время отклика, улучшая пользовательский опыт и позволяя создавать приложения реального времени.

Лучшая масштабируемость: Обрабатывайте в 10 раз больше документов с теми же инвестициями в инфраструктуру, делая рост более предсказуемым и доступным.

Эффективность памяти: Храните историю диалогов в виде сжатых изображений, что позволяет создавать приложения со сверхдлинным контекстом без экспоненциального роста требований к памяти.

Производительность и бенчмарки

Комплексные результаты OmniDocBench

На бенчмарке OmniDocBench, комплексном эталоне разбора документов, DeepSeek-OCR достигает исключительной производительности при минимальном использовании ресурсов. Таблица ниже показывает подробные сравнения по разным типам документов и языкам (расстояние редактирования — чем меньше, тем лучше):

Производительность различных моделей OCR

Ключевые моменты:

Конвейерные модели (традиционные многоэтапные подходы): Лучшая конвейерная модель, PPstructure-v3, показывает 0,152 в целом по английскому и 0,223 по китайскому языкам, но требует сложной многомодельной инфраструктуры.

Сквозные модели (одномодельные подходы): Среди конкурентов MinerU2.0, использующий 6 790 токенов, достигает 0,133 по английскому и 0,238 по китайскому. Qwen2.5-VL-72B с 3 949 токенами набирает 0,214 по английскому и 0,261 по китайскому.

Производительность DeepSeek-OCR:

  • Режим Small (100 токенов): 0,221 по английскому в целом, 0,284 по китайскому в целом
  • Режим Base (256 токенов): 0,137 по английскому в целом, 0,240 по китайскому в целом
  • Режим Gundam (795 токенов): 0,127 по английскому в целом, 0,181 по китайскому в целом
  • Режим Gundam-M при 200 dpi (1 853 токена): 0,123 по английскому в целом, 0,157 по китайскому в целом — достигает самых современных результатов

Замечательное достижение: Режим Base от DeepSeek-OCR, используя всего 256 токенов, превосходит модели, использующие в 15-26 раз больше токенов. Режим Gundam-M показывает наилучшую общую производительность среди всех сквозных моделей, при этом используя значительно меньше токенов, чем традиционные подходы.

Производительность по категориям

Распознавание текста: DeepSeek-OCR (Gundam-M) показывает 0,049 по английскому тексту и 0,087 по китайскому тексту, превосходя даже Gemini2.5-Pro.

Распознавание формул: С показателем 0,242 по английским формулам и 0,377 по китайским формулам DeepSeek-OCR демонстрирует высокую способность работы с математическим содержанием.

Извлечение таблиц: Результаты 0,147 по английским таблицам и 0,08 по китайским таблицам свидетельствуют о надёжном извлечении структурированных данных.

Производственные возможности

Скорость обработки: Один GPU A100-40G может обрабатывать свыше 200 000 страниц в день. Масштабирование до 20 узлов (160 GPU) позволяет обрабатывать 33 миллина страниц в день — достаточно для самых требовательных корпоративных нагрузок.

Эффективность затрат: Для компании, обрабатывающей 1 миллион страниц документов в месяц, разница очевидна. Традиционные модели, требующие 6 000 токенов на страницу, потребляют 6 миллиардов токенов в общей сложности. DeepSeek-OCR при 800 токенах на страницу использует всего 800 миллионов токенов — снижение использования токенов на 87% и связанных с этим затрат.

Ключевые функции и возможности

1. Поддержка многих языков

DeepSeek-OCR поддерживает почти 100 языков — от основных мировых (английский, китайский, испанский, арабский, хинди) до специализированных письменностей (тайский, иврит, кириллица). Это устраняет необходимость в языко-специфичных OCR-сервисах и упрощает международные операции.

2. Продвинутое понимание документов

Модель распознаёт гораздо больше, чм просто текст. Она парсит диаграммы в структурированные данные, извлекает математические формулы с форматированием LaTeX, определяет геометрические фигуры с выводом в SVG и сохраняет структуру таблиц, включая объединённые ячейки и сложное форматирование.

3. Гибкие форматы вывода

Выбирайте между простым извлечением текста (самый быстрый), Markdown с сохранением форматирования, HTML для встраивания в веб-приложения или структурированным JSON для программной обработки. Режим grounding сохраняет пространственные взаимоотношения, гарантируя, что извлечённые данные сохраняют структуру исходного документа.

4. Оптическое сжатие для длинного контекста

Храните историю диалогов в виде сжатых изображений вместо текстовых токенов. Разговор из 10 реплик, который традиционно потребовал бы 10 000 текстовых токенов, может быть сжат до 1 000 токенов зрения, что позволяет создавать приложения со сверхдлинными окнами контекста при устойчивых затратах.

Эффект: Чат-приложения могут поддерживать контекст на протяжении сотен реплик без экспоненциального роста затрат, обеспечивая по-настоящему длинные AI-взаимодействия.

Начало работы на Novita AI

Понимание режимов разрешения

Novita AI предоставляет DeepSeek-OCR с пятью режимами разрешения, разработанными для баланса производительности, скорости и стоимости в различных сценариях использования.

Нативные режимы разрешения:

Режим Tiny (512×512, 64 токена): Оптимизирован для простых документов, где скорость является приоритетом. Идеален для чеков, простых форм или задач быстрого извлечения текста.

Режим Small (640×640, 100 токено): Оптимальный вариант для большинства приложений. Предлагает лучший баланс точности, скорости и стоимости. Идеален для стандартных деловых документов, счетов-фактур и отчётов.

Режим Base (1024×1024, 256 токенов): Обрабатывает сложные макеты с сохранением соотношений сторон с помощью заполнения (padding). Рекомендуется для контрактов, подробных отчётов и документов, где важна структура.

Режим Large (1280×1280, 400 токенов): Максимальное качество для детализированных документов высокого разрешения. Лучше всего подходит для научных статей, технических документов с формулами и требований к премиальному качеству.

Режим динамического разрешения:

Режим Gundam (n×640×640 + 1×1024×1024, переменное количество токенов): Адаптивная тайловая разбивка для документов сверхвысокого разрешения. Автоматически разбивает большие изображения на 2-9 локальных видов размером 640×640 плюс один глобальный вид размером 1024×1024. Необходим для газет, журналов и сложных многоколоночных макетов. Для изображений меньшего размера, чем 640×640, автоматически переходит в режим Base.

Доступ к API DeepSeek-OCR

Novita AI предоставляет простой REST API для DeepSeek-OCR. Чтобы начать работу, зарегистрируйтесь в Novita AI и получите свой API-ключ. Конечная точка API принимает URL изображений или изображения в кодировке base64 вместе с параметрами конфигурации, такими как режим разрешения, языковые предпочтения и формат вывода.

from openai import OpenAI

client = OpenAI(
    base_url="https://api.novita.ai/openai",
    api_key="<Ваш API-ключ>",
)

response = client.chat.completions.create(
    model="deepseek/deepseek-ocr",
    messages=[
      {
        "role": "user",
        "content": [
          {
            "type": "image_url",
            "image_url": {
              "url": "https://example.com/image.png"
            }
          },
          {
            "type": "text",
            "text": "<|grounding|>OCR this image."
          }
        ]
      }
    ],
    stream=False,
    max_tokens=4096
)

content = response.choices[0].message.content

print(content)

Базовые сценарии использования

Для простого извлечения текста, когда форматирование не имеет значения, используйте режим «Free OCR». Для структурированного разбора документов с сохранением макета, таблиц и форматирования используйте режим “grounding” с выводом в Markdown. Для продвинутого разбора диаграмм, формул или геометрических фигур используйте подсказку «Parse the figure».

Руководство по выбору разрешения

Выбор правильного режима

Для счётов-фактур, чеков и простых форм: Режим Small (100 токенов) — ваш лучший выбор. Он быстрый, экономичный и обеспечивает достаточную точность для извлечения структурированных данных. Это покрывает большинство потребностей рутинной обработки деловых документов.

Для деловых документов, отчётов и контрактов: Режим Base (256 токенов) хорошо справляется со сложными макетами и сохраняет соотношения сторон с помощью заполнения. Это правильный баланс, когда важны структура документа и форматирование.

Для научных статей и технических документов: Режим Large (400 токенов) обеспечивает точность, необходимую для плотного текста, математических формул и технических диаграмм. Более высокое количество токенов оправдано требованиями к точности.

Для газет, журналов и многоколоночных макетов: Режим Gundam (переменное количество токенов) незаменим. Его адаптивная тайловая разбивка справляется со сверхвысоким разрешением и сложными многоколоночными макетами, которые были бы искажены в режимах с фиксированным разрешением. Хотя он использует больше токенов, он всё равно гораздо эффективнее традиционных подходов.

Показатели производительности по типу документа

На основе результатов комплексного тестирования OmniDocBench:

Слайды и простые документы: Даже режим Tiny (64 токена) показывает удивительно хорошие результаты с расстоянием редактирования 0,116 для слайдов, в то время как режим Small предлагает оптимальное соотношение цена-качество. Это связано с тем, что презентационные слайды обычно имеют чёткие макеты и ограниченный объём текста на странице.

Книги и стандартные документы: Режим Small (100 токенов) предлагает отличное соотношение цена-качество при расстоянии редактирования 0,085 для книг. Большинство книг содержат 600-1 000 текстовых токенов на страницу, что хорошо вписывается в 10-кратное сжатие.

Научные статьи: Рекомендуются режимы Large или Gundam, причём Gundam достигает расстояния редактирования 0,039 для научных статей — превосходя модели, использующие в 5-8 раз больше токенов.

Газеты: Режим Gundam обязателен, достигая расстояния редактирования 0,122 по сравнению с 0,940 для режима Tiny. Газеты содержат 4 000-5 000 текстовых токенов на страницу со сложными многоколоночными макетами, которые требуют адаптивного тайлового подхода.

Документы с большим содержанием формул: Для документов с математическими формулами режим Gundam-M показывает наилучшую производительность с расстоянием редактирования 0,242 для английских формул, что сопоставимо со специализированными большими моделями.

Подробный разбор режима Gundam

Режим Gundam работает, создавая несколько локальных видов (2-9 тайлов по 640×640), которые захватывают детализированные области, плюс один глобальный вид (1024×1024), который сохраняет общий контекст. Общее количество токенов вычисляется как n×100 + 256, где n — количество тайлов.

Когда использовать режим Gundam: Используйте его для изображений, размер которых превышает 1280 пикселей в любом измерении, для документов с многоколоночными макетами, для содержимого с 4 000+ текстовых токенов или для сложных инфографик, требующих как детализации, так и контекста.

Реальный пример: Небольшая газетная страница может использовать 3 тайла (всего 556 токенов), в то время как большая газетная страница использует 6 тайлов (856 токенов). Сравните это с традиционными подходами, требующими 6 000+ токенов — вы всё ещё достигаете 7-10-кратного сжатия даже для самых сложных документов.

Заключение

DeepSeek-OCR на Novita AI достигает 10-кратного сжатия с точностью 97%, сокращая затраты на обработку документов до 85%, поддерживая при этом 100 языков и обрабатывая более 200 000 страниц на GPU в день.

Результаты говорят сами за себя: Компании, обрабатывающие 100 000 документов ежемесячно, экономят более $50 000 в год. Скорость обработки увеличивается в 5-10 раз. Инфраструктура масштабируется линейно, а не экспоненциально.

Гтовы изиенить обрабтку документов?

Начните бесплатно в Playground →

Протестируйте DeepSeek-OCR на своих собственных документах за считанные минуты. Кредитная карта не требуется. Выбирайте из пяти режимов разрешения, обрабатывайте документы на 100 языках и оцените 10-кратное сжатие лично.

Novita AI — это ведущая облачная AI-платформа, предоставляющая разработчикам простые в использовании API и доступную надёжную GPU-инфраструктуру для создания и масштабирования AI-приложений.