- Что такое DeepSeek-V4-Flash?
- Что нового в обновлении от 31 июля 2026 года?
- Ключевые особенности: почему DeepSeek-V4-Flash выделяется
- Производительность в бенчмарках
- Как использовать DeepSeek-V4-Flash через Novita AI
- Цены на DeepSeek-V4-Flash
- Рекомендуемые сценарии использования
- Начните использовать DeepSeek-V4-Flash сегодня
- FAQ
- Рекомендуемые статьи
Большинство open-source моделей с возможностями рассуждения вынуждают идти на компромисс: маленькие окна контекста, низкая пропускная способность или цены, превышающие $1/M токенов, как только вы включаете расширенное мышление. DeepSeek-V4-Flash по-прежнему избегает этого компромисса в своем обновлении от 31 июля 2026 года: та же архитектура Mixture-of-Experts с 284B параметрами, из которых только 13B активируются за один вывод, то же родное окно контекста в 1 048 576 токенов и те же цены на ввод $0.14/M на Novita AI.
Коротко: DeepSeek-V4-Flash остается тем же семейством моделей на Novita AI после повторного обучения (re-post-trained revision) 0731. Обновление важно, потому что оно обновляет серверную версию без необходимости разработчикам менять ID модели, переписывать промпты или пересчитывать ценовые предположения.
Открыть DeepSeek-V4-Flash в консоли моделей Novita AI
Что такое DeepSeek-V4-Flash?
DeepSeek-V4-Flash — это языковая модель Mixture-of-Experts (MoE) от DeepSeek AI, выпущенная в рамках серии DeepSeek-V4 вместе с более крупной DeepSeek-V4-Pro. Модель имеет 284B общих параметров, из которых 13B активируются при выводе, что позволяет сохранять низкую стоимость вычислений на токен, сохраняя при этом емкость параметров гораздо более крупной модели.
Ключевые возможности:
- 284B всего / 13B активированных параметров — архитектура MoE, низкая стоимость вывода
- Окно контекста в 1 048 576 токенов (1M токенов) — обеспечивается гибридной архитектурой внимания (Hybrid Attention Architecture)
- Три режима рассуждения: Non-think (быстрый), Think (пошаговый), Think Max (максимальный бюджет рассуждения)
- Поддержка вызова функций — использование инструментов, структурированные выходные данные, JSON-режим
- Обучена на 32T+ токенах с многоэтапным пост-обучением (SFT, RL с GRPO, дистилляция на политике)
- Лицензия MIT — веса доступны для скачивания на HuggingFace; разрешено коммерческое использование
- Смешанная точность FP4 + FP8 — веса экспертов MoE в FP4, остальные слои в FP8
Что нового в обновлении от 31 июля 2026 года?
Краткая версия: это обновление ревизии, а не отдельный запуск.
Повторное обучение (re-post-trained update) DeepSeek в конце июля сохраняет ту же публичную идентичность продукта на Novita AI:
- Тот же ID модели:
deepseek/deepseek-v4-flash - Та же архитектура: 284B всего параметров, 13B активированных за вывод
- То же окно контекста: 1 048 576 токенов
- Те же цены Novita AI: $0.14/M ввод, $0.28/M вывод, $0.028/M чтение кэша
Это означает, что существующим интеграциям не нужны изменения конечных точек, переписывание таблицы цен или миграция форматов промптов. Если вы уже направляли трафик на DeepSeek-V4-Flash, обновление 0731 лучше всего понимать как обновление возможностей и пост-обучения, а не как новый SKU.
Для разработчиков это различие имеет значение. Обновление ревизии обычно означает, что вы можете перетестировать модель на своих промптах, наборах для оценки и задачах агентов, сохраняя тот же контракт развертывания: то же имя, тот же путь API, тот же бюджет контекста и та же экономика токенов.
Ключевые особенности: почему DeepSeek-V4-Flash выделяется
Выбор глубины рассуждения без переключения моделей
Большинство моделей привязывают вас к одному режиму вывода: либо рассуждение включено, либо выключено. DeepSeek-V4-Flash предоставляет три различных режима работы на одной и той же конечной точке API:
| Режим | Характеристики | Для чего лучше всего |
|---|---|---|
| Non-think | Быстрый, без цепочки рассуждений | Задачи с высоким объемом, чат, суммаризация |
| Think | Пошаговое рассуждение, сбалансировано | Сложные вопросы и ответы, генерация кода, анализ |
| Think Max | Максимальный бюджет рассуждения | Математические конкурсы, сложные задачи кодирования, бенчмарки |
Разрыв между режимами значителен: на GPQA Diamond V4-Flash Non-think набирает 71.2 против 87.4 у Think и 88.1 у Think Max. На LiveCodeBench Think Max достигает 91.6 против 55.2 у Non-think. Вы выбираете стоимость против качества для каждого запроса — без изменения инфраструктуры.
Гибридная архитектура внимания для контекста в 1M токенов
Родной миллионный контекст — сложнее, чем кажется. DeepSeek-V4-Flash достигает этого с помощью специально созданной гибридной архитектуры внимания, объединяющей два механизма:
- Сжатое разреженное внимание (CSA) — значительно сокращает бюджет вычислений внимания для длинных последовательностей
- Сильно сжатое внимание (HCA) — сжимает объем KV-кэша для вывода с контекстом 1M
Результат: вывод по входам длиной 1M токенов с управляемыми FLOP и затратами памяти. Для рабочих нагрузок, таких как анализ кодовой базы, проверка юридических документов или агенты с длительными сессиями, эта архитектура делает разницу между возможным и невозможным.
Эффективность MoE: 13B активированных при масштабе 284B
Соотношение 284B/13B активированных параметров — вот откуда берется эффективность затрат. Только 13B параметров активны за один прямой проход, что поддерживает задержку и стоимость за токен близкими к плотной модели с 13B — в то время как полный пул из 284B параметров обеспечивает емкость знаний, сравнимую с гораздо более крупной плотной сетью. Смешанная точность FP4 + FP8 дополнительно снижает нагрузку на пропускную способность памяти для весов экспертов.
Мощный конвейер пост-обучения
DeepSeek-V4-Flash следует двухэтапному процессу пост-обучения: сначала выращивание доменно-специфических экспертов с помощью SFT и обучения с подкреплением с GRPO; затем консолидация унифицированной модели через дистилляцию на политике. Это создает единую модель с дифференцированными профилями возможностей в области кодирования, рассуждения и общих знаний — а не обычного исполнителя инструкций.
Производительность в бенчмарках
История бенчмарков для DeepSeek-V4-Flash связана с выбором режима рассуждения. В режиме Non-think она ведет себя как эффективная модель с активацией 13B. Переключитесь на Think Max, и она переходит на совершенно другой уровень.

Производительность DeepSeek-V4-Flash в разных режимах в сравнении с передовыми моделями [Источник: DeepSeek AI / HuggingFace]
Производительность в различных режимах рассуждения
Ниже приведены баллы V4-Flash по ключевым бенчмаркам в сравнении всех трех режимов работы:
| Бенчмарк | V4-Flash Non-Think | V4-Flash Think | V4-Flash Think Max |
|---|---|---|---|
| LiveCodeBench (Pass@1) | 55.2 | 88.4 | 91.6 |
| GPQA Diamond (Pass@1) | 71.2 | 87.4 | 88.1 |
| HMMT 2026 Feb (Pass@1) | 40.8 | 91.9 | 94.8 |
| IMOAnswerBench (Pass@1) | 41.9 | 85.1 | 88.4 |
| Codeforces Rating | — | 2816 | 3052 |
| SWE Verified (Resolved) | 73.7 | 78.6 | 79.0 |
| MRCR 1M (MMR) | 37.5 | 76.9 | 78.7 |
| MCPAtlas (Pass@1) | 64.0 | 67.4 | 69.0 |
| MMLU-Pro (EM) | 83.0 | 86.4 | 86.2 |
Последняя проверка: 2026-04-27. Источник: DeepSeek-V4 technical report and HuggingFace model card.
Как V4-Flash сравнивается с конкурентами
V4-Flash Think Max (79.0 SWE Verified, 91.6 LiveCodeBench) конкурирует с моделями, работающими с гораздо более высокой стоимостью за токен. Она не возглавляет все таблицы лидеров — V4-Pro Max лидирует по большинству передовых бенчмарков — но для разработчиков, смотрящих на стоимость за задачу, а не на пиковую производительность, компромисс выгоден:
Если вы выбираете между двумя API DeepSeek V4 для производственной маршрутизации, используйте руководство по сравнению цен и маршрутизации DeepSeek V4 Pro vs Flash, чтобы сравнить, когда Flash должен обрабатывать базовый трафик, а когда Pro стоит более высокой цены за токен.
| Бенчмарк | V4-Flash Max | V4-Pro Max | Claude Opus 4.6 Max | Gemini 3.1 Pro High |
|---|---|---|---|---|
| LiveCodeBench (Pass@1) | 91.6 | 93.5 | 88.8 | 91.7 |
| GPQA Diamond (Pass@1) | 88.1 | 90.1 | 91.3 | 94.3 |
| SWE Verified (Resolved) | 79.0 | 80.6 | 80.8 | 80.6 |
| HMMT 2026 Feb (Pass@1) | 94.8 | 95.2 | 96.2 | 94.7 |
| MRCR 1M (MMR) | 78.7 | 83.5 | 92.9 | 76.3 |
Последняя проверка: 2026-04-27. Данные Claude Opus 4.6 Max и Gemini 3.1 Pro High взяты из технического отчета DeepSeek-V4 (таблица сравнения передовых моделей V4-Pro). Эти оценки не измерялись напрямую против V4-Flash в этом отчете.
Примечательно, что V4-Flash Think Max на MRCR 1M (78.7) превосходит Gemini 3.1 Pro High (76.3) в задаче извлечения длинного контекста — бенчмарке, который наиболее прямо соответствует случаям использования с контекстом 1M. На SWE Verified все четыре модели группируются между 79–81, что делает V4-Flash конкурентоспособным в категории реальных кодирующих агентов за долю цены закрытых моделей.
Как использовать DeepSeek-V4-Flash через Novita AI
Вариант 1: Песочница (без кода)
Протестируйте модель прямо в браузере в консоли моделей Novita AI. Для начала не требуется API-ключ — переключайтесь между режимами Non-think, Think и Think Max через интерфейс чата.
Вариант 2: API (Python)
DeepSeek-V4-Flash использует API, совместимый с OpenAI. Используйте ID модели deepseek/deepseek-v4-flash с базовым URL Novita:
from openai import OpenAI
client = OpenAI(
base_url="https://api.novita.ai/v3/openai",
api_key="YOUR_NOVITA_API_KEY",
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash",
messages=[{"role": "user", "content": "Your prompt here"}]
)
print(response.choices[0].message.content)
Чтобы включить режим Think или Think Max, передайте параметр reasoning в теле запроса:
from openai import OpenAI
client = OpenAI(
base_url="https://api.novita.ai/v3/openai",
api_key="YOUR_NOVITA_API_KEY",
)
# Think Max mode — maximum reasoning budget
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash",
messages=[{"role": "user", "content": "Solve: x^4 - 5x^2 + 4 = 0"}],
extra_body={"reasoning": {"effort": "high"}} # "low" = Think, "high" = Think Max
)
print(response.choices[0].message.content)
Получите свой API-ключ на novita.ai/settings.
Вариант 3: Сторонние инструменты
Поскольку Novita AI предоставляет конечную точку, совместимую с OpenAI, DeepSeek-V4-Flash работает из коробки с:
- LangChain / LlamaIndex — используйте
ChatOpenAIсbase_url="https://api.novita.ai/v3/openai" - OpenWebUI — добавьте как пользовательскую конечную точку, совместимую с OpenAI
- Continue.dev / Cursor — настройте как пользовательскую модель с базовым URL Novita
Цены на DeepSeek-V4-Flash
Цены на DeepSeek-V4-Flash на Novita AI не изменились в обновлении от 31 июля 2026 года. Все приведенные ниже цифры указаны за миллион токенов, последняя проверка 2026-08-03:
| Провайдер | Ввод ($/M) | Вывод ($/M) | Чтение кэша ($/M) | Макс. контекст |
|---|---|---|---|---|
| Novita AI | $0.14 | $0.28 | $0.028 | 1 048 576 токенов |
| DeepSeek Official | $0.14 | $0.28 | $0.028 | 131 072 токенов |
| SiliconFlow | $0.14 | $0.28 | $0.028 | 65 536 токенов |
| DeepInfra | $0.14 | $0.28 | — | 16 384 токенов |
Ставка за токен остается прежней после обновления 0731 — но максимальный контекст все еще значительно варьируется в зависимости от провайдера. Novita AI предлагает полное окно контекста в 1M токенов. DeepInfra ограничивает до 16 384 токенов. Если ваша рабочая нагрузка включает длинные документы, кодовые базы или многоэтапных агентов, Novita — практичный выбор.
Рекомендуемые сценарии использования
Автономные агенты кодирования
Окно контекста в 1M токенов V4-Flash означает, что агент может загрузить всю кодовую базу в контекст без разбиения на части. В сочетании с 79.0 SWE Verified в режиме Think Max, он обрабатывает многофайловые рефакторинги и отладку без потери состояния между оборотами.
QA и RAG по длинным документам
MRCR 1M (Multi-Round Context Retrieval) на 78.7% Think Max — бенчмарк измеряет точность извлечения в окне реального размера 1M токенов. Для индексации юридических документов, академических работ или длинных технических спецификаций V4-Flash извлекает точно там, где большинство моделей ухудшают производительность после 32K токенов.
Рассуждение в математике и науке
94.8% на HMMT 2026 February (конкурсная математика) с Think Max. Режим бюджетного мышления позволяет настраивать стоимость против точности — используйте Think для стандартных задач, Think Max для сложных. Один запрос не сжигает фиксированный бюджет вычислений; вы выбираете.
Продакшн API с кэшированием
При $0.028/M за чтение кэша повторяющиеся системные промпты и схемы инструментов фактически ничего не стоят в масштабе. Продукты чат-ботов и обертки API, которые повторно вводят один и тот же контекст при каждом вызове, выигрывают от ценообразования на чтение кэша по сравнению с ценообразованием на сырой ввод.
Для смешанной настройки моделей оставьте Flash по умолчанию для повторяющихся продакшн-вызовов и передавайте сложные длинные контексты или промпты для кодирующих агентов на Pro. Руководство по длинному контексту DeepSeek V4 Pro показывает, как настроить ID модели Pro, базовый URL, форму запроса и контроль стоимости для этих более сложных путей.
Начните использовать DeepSeek-V4-Flash сегодня
DeepSeek-V4-Flash остается доступным через Novita AI после обновления 31 июля с полным окном контекста в 1M токенов, теми же конкурентоспособными ценами и нулевыми накладными расходами на инфраструктуру. Вы выбираете режим рассуждения; Novita делает все остальное.
→ Попробовать DeepSeek-V4-Flash на базе Novita AI
→ Документация API LLM Novita AI
FAQ
Что изменилось в ревизии DeepSeek-V4-Flash 0731?
На Novita AI видимый контракт развертывания остается прежним: ID модели остается deepseek/deepseek-v4-flash, цены остаются $0.14/M за ввод и $0.28/M за вывод, а полное окно контекста в 1 048 576 токенов все еще доступно. Обновление 0731 — это обновление серверной ревизии, а не отдельная модель.
Что такое DeepSeek-V4-Flash?
DeepSeek-V4-Flash — это языковая модель Mixture-of-Experts с 284B параметрами, разработанная DeepSeek AI, выпущенная 2026-04-23. Она активирует только 13B параметров за один прямой проход, что делает ее значительно быстрее и дешевле, чем плотные модели сопоставимой производительности. Она поддерживает окно контекста в 1 048 576 токенов и три режима рассуждения: Non-thinking (быстрый), Budget Thinking (бюджетное мышление) и Extended Thinking (Think Max).
Чем DeepSeek-V4-Flash отличается от DeepSeek-V4-Pro?
V4-Flash — это более легкий, быстрый вариант, оптимизированный для скорости и стоимости. V4-Pro — это флагманская модель с более высокими пиковыми показателями бенчмарков (например, 93.5 против 91.6 на LiveCodeBench Think Max). V4-Flash «достигает сравнимой производительности рассуждения с версией Pro при большем бюджете на размышления» — на практике V4-Flash Think Max закрывает большую часть разрыва с V4-Pro Think Max при более низкой стоимости за токен.
Если вам нужно правило производственной маршрутизации, сравните обе модели в руководстве по выбору между DeepSeek V4 Pro и Flash API, прежде чем переносить весь трафик на одну модель.
Что означает «Flash» в названии модели?
Flash означает вариант, оптимизированный для скорости, что согласуется с тем, как Google использует этот термин для Gemini Flash. DeepSeek-V4-Flash ставит приоритет на более низкую задержку и стоимость, а не на максимальную точность, при этом режимы рассуждения доступны, когда вам нужно закрыть разрыв в производительности.
Поддерживает ли DeepSeek-V4-Flash окно контекста в 1M токенов на Novita AI?
Да. Novita AI предоставляет полное окно контекста в 1 048 576 токенов — самое большое среди всех текущих провайдеров для этой модели. Максимальное количество токенов завершения на Novita — 393 216.
Как переключать режимы рассуждения через API?
Передайте параметр extra_body={"reasoning": {"effort": "low"}} для Budget Thinking или "effort": "high" для Think Max. Полностью опустите параметр для режима Non-thinking (быстрый). API совместим с OpenAI — изменения SDK не требуются.
Какая цена на DeepSeek-V4-Flash на Novita AI?
По состоянию на 2026-08-03: $0.14/M за входные токены, $0.28/M за выходные токены, $0.028/M за чтение кэша. Это соответствует официальным ценам DeepSeek и согласовано с другими провайдерами — отличительной особенностью Novita является полное окно контекста в 1M токенов и надежное время работы.
Является ли DeepSeek-V4-Flash открытым исходным кодом?
Да. Веса модели доступны на HuggingFace под лицензией MIT — подтверждено в официальном репозитории DeepSeek-V4. Разрешены самостоятельное размещение и коммерческое использование по условиям MIT. Использование через API Novita AI вообще не требует самостоятельного размещения.
