大多数具备推理能力的开源模型都迫使你做出权衡:要么上下文窗口很小,要么吞吐量很慢,要么一旦启用扩展思考,价格就会飙升至每百万 token 1 美元以上。DeepSeek-V4-Flash 在其 2026 年 7 月 31 日更新版本中依然避免了这种权衡:同样的 284B 参数混合专家设计,每次推理仅激活 13B 参数,同样的原生 1,048,576 token 上下文窗口,以及在 Novita AI 上同样的 $0.14/M 输入定价。
简而言之:在 0731 重新训练发布后,DeepSeek-V4-Flash 在 Novita AI 上仍然是同一个模型系列。这次更新之所以重要,是因为它刷新了服务版本,而无需开发者切换模型 ID、重写提示词或重新计算成本假设。
在 Novita AI 模型控制台中打开 DeepSeek-V4-Flash
DeepSeek-V4-Flash 是什么?
DeepSeek-V4-Flash 是来自 DeepSeek AI 的混合专家(MoE)语言模型,作为 DeepSeek-V4 系列的一部分发布,与更大的 DeepSeek-V4-Pro 同属一个系列。该模型总参数为 284B,推理时激活 13B——在保持低每 token 计算成本的同时,保留了更大模型才有的参数容量。
主要能力概览:
- 284B 总参数 / 13B 激活参数 — MoE 架构,低推理成本
- 1,048,576 token 上下文窗口(1M tokens)— 由混合注意力架构实现
- 三种推理模式: 非思考(快速)、思考(逐步推理)、最大思考(最大推理预算)
- 支持函数调用 — 工具使用、结构化输出、JSON 模式
- 在 32T+ tokens 上训练,包含多阶段后训练(SFT、基于 GRPO 的强化学习、在策略蒸馏)
- MIT 许可证 — 权重可在 HuggingFace 下载;允许商业使用
- FP4 + FP8 混合精度 — MoE 专家权重使用 FP4,其余层使用 FP8
2026 年 7 月 31 日更新版本有哪些新内容?
简单来说:这是一次修订更新,而非独立发布。
DeepSeek 在 7 月下旬的重新训练更新在 Novita AI 上保持了相同的公共产品标识:
- 相同的模型 ID:
deepseek/deepseek-v4-flash - 相同的架构: 284B 总参数,每次推理激活 13B
- 相同的上下文窗口: 1,048,576 tokens
- 相同的 Novita AI 定价: $0.14/M 输入,$0.28/M 输出,$0.028/M 缓存读取
这意味着现有集成无需更改端点、重写定价表或迁移提示词格式。如果你已经将流量路由到 DeepSeek-V4-Flash,那么 0731 更新最好理解为一次幕后的能力和后训练更新,而非一个全新的 SKU。
对于开发者来说,这个区别很重要。修订更新通常意味着你可以针对自己的提示词、评估集和智能体任务重新测试模型,同时保持相同的部署契约:相同的名称、相同的 API 路径、相同的上下文预算以及相同的 token 经济性。
关键特性:DeepSeek-V4-Flash 为何脱颖而出
无需切换模型即可选择推理深度
大多数模型将你锁定在单一推理模式中:要么推理开启,要么推理关闭。DeepSeek-V4-Flash 在同一个 API 端点上为你提供三种不同的操作模式:
| 模式 | 特点 | 最佳适用场景 |
|---|---|---|
| 非思考 | 快速,无思维链 | 高吞吐量任务、聊天、总结 |
| 思考 | 逐步推理,均衡 | 复杂问答、代码生成、分析 |
| 最大思考 | 最大推理预算 | 数学竞赛、困难编程任务、基准测试 |
模式之间的差距显著:在 GPQA Diamond 上,V4-Flash 非思考模式得分为 71.2,而思考模式为 87.4,最大思考模式为 88.1。在 LiveCodeBench 上,最大思考模式达到 91.6,而非思考模式仅为 55.2。你可以根据每个请求在成本与质量之间进行选择——无需任何基础设施变更。
支持 1M Token 上下文的混合注意力架构
原生百万 token 上下文实现起来比听起来要困难得多。DeepSeek-V4-Flash 通过专门构建的混合注意力架构实现了这一点,该架构结合了两种机制:
- 压缩稀疏注意力(CSA) — 显著减少长序列的注意力计算预算
- 重度压缩注意力(HCA) — 压缩 KV 缓存占用,支持 1M 上下文推理
结果:对 1M token 输入进行推理,FLOP 和内存成本都在可控范围内。对于代码库分析、法律文档审查或长时间会话的智能体等工作负载,这种架构决定了方案是可行还是不可行。
MoE 效率:284B 规模下仅激活 13B
284B/13B 的激活比例正是成本效率的来源。每次前向传播仅激活 13B 参数,保持了接近 13B 密集模型的延迟和每 token 成本——而完整的 284B 参数池提供的知识容量堪比更大的密集网络。FP4 + FP8 混合精度进一步降低了专家权重的内存带宽压力。
强大的后训练流程
DeepSeek-V4-Flash 遵循两阶段后训练流程:首先,通过 SFT 和基于 GRPO 的强化学习进行领域特定专家培养;然后,通过在策略蒸馏进行统一模型整合。这产生了一个在编码、推理和通用知识方面具有差异化能力配置的单一模型——而非一个通用的指令跟随者。
基准测试表现
DeepSeek-V4-Flash 的基准测试表现关键在于推理模式的选择。在非思考模式下,它的表现像一个高效的 13B 激活模型。将模式调至最大思考,它便进入了另一个层级。

DeepSeek-V4-Flash 在不同模式下的性能表现 vs 前沿模型 [来源: DeepSeek AI / HuggingFace]
各推理模式下的性能表现
以下是 V4-Flash 在关键基准测试中的得分,比较了所有三种操作模式:
| 基准测试 | V4-Flash 非思考 | V4-Flash 思考 | V4-Flash 最大思考 |
|---|---|---|---|
| LiveCodeBench (Pass@1) | 55.2 | 88.4 | 91.6 |
| GPQA Diamond (Pass@1) | 71.2 | 87.4 | 88.1 |
| HMMT 2026 Feb (Pass@1) | 40.8 | 91.9 | 94.8 |
| IMOAnswerBench (Pass@1) | 41.9 | 85.1 | 88.4 |
| Codeforces Rating | — | 2816 | 3052 |
| SWE Verified (Resolved) | 73.7 | 78.6 | 79.0 |
| MRCR 1M (MMR) | 37.5 | 76.9 | 78.7 |
| MCPAtlas (Pass@1) | 64.0 | 67.4 | 69.0 |
| MMLU-Pro (EM) | 83.0 | 86.4 | 86.2 |
最后验证时间:2026-04-27。来源:DeepSeek-V4 技术报告和 HuggingFace 模型卡片。
V4-Flash 与竞争对手的对比
V4-Flash 最大思考模式(SWE Verified 79.0,LiveCodeBench 91.6)与运行成本远高于其的模型竞争。它并非在每个排行榜上都位居榜首——V4-Pro Max 在大多数前沿基准测试中领先——但对于关注每任务成本而非原始峰值性能的开发者来说,这种权衡是有利的:
如果你正在为生产路由选择两个 DeepSeek V4 API,请参考 DeepSeek V4 Pro 与 Flash 定价及路由指南,以比较何时 Flash 应处理基线流量,以及何时 Pro 更高 token 价格是值得的。
| 基准测试 | V4-Flash Max | V4-Pro Max | Claude Opus 4.6 Max | Gemini 3.1 Pro High |
|---|---|---|---|---|
| LiveCodeBench (Pass@1) | 91.6 | 93.5 | 88.8 | 91.7 |
| GPQA Diamond (Pass@1) | 88.1 | 90.1 | 91.3 | 94.3 |
| SWE Verified (Resolved) | 79.0 | 80.6 | 80.8 | 80.6 |
| HMMT 2026 Feb (Pass@1) | 94.8 | 95.2 | 96.2 | 94.7 |
| MRCR 1M (MMR) | 78.7 | 83.5 | 92.9 | 76.3 |
最后验证时间:2026-04-27。Claude Opus 4.6 Max 和 Gemini 3.1 Pro High 的数据来源于 DeepSeek-V4 技术报告(V4-Pro 前沿对比表)。该报告并未将这些得分与 V4-Flash 进行直接对比。
值得注意的是,V4-Flash 最大思考模式在 MRCR 1M(78.7)上超过了 Gemini 3.1 Pro High(76.3),这是一个长上下文检索任务——也是最能直接对应 1M 上下文使用场景的基准测试。在 SWE Verified 上,所有四个模型得分集中在 79–81 之间,使得 V4-Flash 在现实世界编码智能体类别中具有竞争力,而价格仅为封闭模型的一小部分。
如何通过 Novita AI 使用 DeepSeek-V4-Flash
选项 1:在线 Playground(无需代码)
在 Novita AI 模型控制台 中,直接在浏览器中测试模型。无需 API 密钥即可开始使用——通过聊天界面在非思考、思考和最大思考模式之间切换。
选项 2:API(Python)
DeepSeek-V4-Flash 使用兼容 OpenAI 的 API。使用模型 ID deepseek/deepseek-v4-flash 配合 Novita 基础 URL:
from openai import OpenAI
client = OpenAI(
base_url="https://api.novita.ai/v3/openai",
api_key="你的_NOVITA_API_KEY",
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash",
messages=[{"role": "user", "content": "你的提示词在这里"}]
)
print(response.choices[0].message.content)
要启用思考或最大思考模式,请在请求体中传递 reasoning 参数:
from openai import OpenAI
client = OpenAI(
base_url="https://api.novita.ai/v3/openai",
api_key="你的_NOVITA_API_KEY",
)
# 最大思考模式 — 最大推理预算
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash",
messages=[{"role": "user", "content": "求解:x^4 - 5x^2 + 4 = 0"}],
extra_body={"reasoning": {"effort": "high"}} # "low" = 思考, "high" = 最大思考
)
print(response.choices[0].message.content)
在 novita.ai/settings 获取你的 API 密钥。
选项 3:第三方工具
由于 Novita AI 提供兼容 OpenAI 的端点,DeepSeek-V4-Flash 可与以下工具开箱即用:
- LangChain / LlamaIndex — 使用
ChatOpenAI并设置base_url="https://api.novita.ai/v3/openai" - OpenWebUI — 添加为自定义兼容 OpenAI 的端点
- Continue.dev / Cursor — 配置为自定义模型,并使用 Novita 基础 URL
DeepSeek-V4-Flash 定价
DeepSeek-V4-Flash 在 Novita AI 上的定价在 2026 年 7 月 31 日更新后保持不变。以下所有数据均为每百万 token 价格,最后检查时间:2026-08-03:
| 提供商 | 输入 ($/M) | 输出 ($/M) | 缓存读取 ($/M) | 最大上下文 |
|---|---|---|---|---|
| Novita AI | $0.14 | $0.28 | $0.028 | 1,048,576 tokens |
| DeepSeek 官方 | $0.14 | $0.28 | $0.028 | 131,072 tokens |
| SiliconFlow | $0.14 | $0.28 | $0.028 | 65,536 tokens |
| DeepInfra | $0.14 | $0.28 | — | 16,384 tokens |
0731 更新后,每 token 费率保持不变——但最大上下文因提供商而异。Novita AI 提供完整的 1M token 上下文窗口。DeepInfra 上限为 16,384 tokens。如果你的工作负载涉及长文档、代码库或多轮智能体,Novita 是实际的选择。
推荐使用场景
自主编码智能体
V4-Flash 的 1M 上下文窗口意味着智能体可以将整个代码库加载到上下文中,无需分块。结合最大思考模式下 SWE Verified 79.0 的得分,它能够处理多文件重构和调试,而不会在轮次之间丢失状态。
长文档问答与 RAG
MRCR 1M(多轮上下文检索)在最大思考模式下达到 78.7%——该基准测试衡量的是在真正的 1M token 窗口内的检索准确性。对于索引法律文档、学术论文或长篇技术规格书,V4-Flash 能够准确检索,而大多数模型在 32K tokens 后性能就会下降。
数学与科学推理
HMMT 2026 年 2 月(竞赛数学)在最大思考模式下达到 94.8%。预算思考模式让你可以根据成本与准确性进行调优——标准问题使用思考模式,困难问题使用最大思考模式。单个请求不会消耗固定的计算预算;你可以自行选择。
使用缓存的生产 API
缓存读取价格为 $0.028/M,重复的系统提示词和工具模式在规模化下几乎零成本。每次调用都重新注入相同上下文的聊天机器人产品和 API 封装器,受益于缓存读取定价而非原始输入定价。
对于混合模型设置,将 Flash 保留为重复生产调用的默认模型,并将困难的长上下文或编码智能体提示升级到 Pro。DeepSeek V4 Pro 长上下文指南 展示了如何为这些更高难度的路径配置 Pro 模型 ID、基础 URL、请求格式和成本控制。
立即开始使用 DeepSeek-V4-Flash
DeepSeek-V4-Flash 在 7 月 31 日更新后仍可通过 Novita AI 使用,提供完整的 1M 上下文窗口、相同的具有竞争力的定价以及零基础设施开销。你选择推理模式;Novita 处理其余一切。
→ 立即体验基于 Novita AI 的 DeepSeek-V4-Flash
常见问题
DeepSeek-V4-Flash 0731 修订版有什么变化?
在 Novita AI 上,可见的部署契约保持不变:模型 ID 仍然是 deepseek/deepseek-v4-flash,定价仍为 $0.14/M 输入和 $0.28/M 输出,完整的 1,048,576 token 上下文窗口仍然可用。0731 更新是服务版本的刷新,而非独立的模型系列。
DeepSeek-V4-Flash 是什么?
DeepSeek-V4-Flash 是 DeepSeek AI 开发的 284B 参数混合专家语言模型,于 2026 年 4 月 23 日发布。每次前向传播仅激活 13B 参数,使其比同等能力的密集模型更快、更便宜。它支持 1,048,576 token 上下文窗口和三种推理模式:非思考(快速)、预算思考和扩展思考(最大思考)。
DeepSeek-V4-Flash 与 DeepSeek-V4-Pro 有何不同?
V4-Flash 是更轻量、更快的变体,针对速度和成本进行了优化。V4-Pro 是旗舰模型,具有更高的峰值基准测试得分(例如,LiveCodeBench 最大思考模式下 93.5 vs 91.6)。V4-Flash “在获得更大思考预算时,能够实现与 Pro 版本相当的推理性能”——在实践中,V4-Flash 最大思考模式以更低的每 token 成本,缩小了与 V4-Pro 最大思考模式的大部分差距。
如果你需要生产路由规则,在将所有流量迁移到单个模型之前,请先参考 DeepSeek V4 Pro 与 Flash API 决策指南 对两者进行比较。
模型名称中的“Flash”是什么意思?
Flash 表示一个速度优化的变体,与 Google 对 Gemini Flash 术语的使用方式一致。DeepSeek-V4-Flash 优先考虑更低的延迟和成本,而非原始的最大准确性,但当你需要缩小性能差距时,可以使用思考模式。
DeepSeek-V4-Flash 是否支持由 Novita AI 支持的 1M 上下文窗口?
是的。Novita AI 提供完整的 1,048,576 token 上下文窗口——这是当前所有提供商中该模型可用的最大窗口。Novita 上的最大补全 tokens 为 393,216。
如何通过 API 切换推理模式?
传递 extra_body={"reasoning": {"effort": "low"}} 参数用于预算思考,或传递 "effort": "high" 用于最大思考。完全省略该参数则使用非思考(快速)模式。API 兼容 OpenAI——无需更改 SDK。
基于 Novita AI 的 DeepSeek-V4-Flash 定价是多少?
截至 2026 年 8 月 3 日:$0.14/M 输入 tokens,$0.28/M 输出 tokens,$0.028/M 缓存读取 tokens。这与 DeepSeek 的官方定价一致,并且在各提供商之间保持一致——Novita 的差异化优势在于完整的 1M 上下文窗口和可靠的正常运行时间。
DeepSeek-V4-Flash 是开源的吗?
是的。模型权重可在 HuggingFace 上根据 MIT 许可证 获取——已在官方 DeepSeek-V4 仓库中确认。根据 MIT 条款,允许自行托管和商业使用。通过 Novita AI 的 API 使用则完全无需自行托管。
