如何在 Claude Code 中使用 Novita AI 的 DeepSeek V4 Flash API

如何在 Claude Code 中使用 Novita AI 的 DeepSeek V4 Flash API

DeepSeek V4 Flash 是一个拥有 284B 参数的 MoE 模型,支持 100 万令牌的上下文窗口,通过 Novita AI 兼容 Anthropic 的端点提供——这意味着 Claude Code 只需更改三行环境变量即可直接使用。输入令牌价格为 $0.14/M,而 Claude Sonnet 为 $3/M,对于运行持续代理式编码会话的团队来说,成本差异非常显著。

为什么在 Claude Code 中使用 DeepSeek V4 Flash

最直接的原因是经济性。Claude Code 默认使用 Claude Sonnet,其输入价格为 $3/M 令牌,输出价格为 $15/M 令牌。Novita AI 上的 DeepSeek V4 Flash 输入价格为 $0.14/M,输出价格为 $0.28/M——输入成本降低约 20 倍,输出成本降低约 50 倍。对于一个每天运行 8 小时 Claude Code 的团队来说,这种差异会迅速累积。

除了成本,V4 Flash 还带来了两项对代理式编码至关重要的能力:

  • 100 万令牌上下文窗口——Claude Code 可以将整个代码库加载到上下文中,无需分块。多文件重构、跨仓库调试以及长时间对话历史记录都能保持连贯,无需手动管理上下文。
  • 可选择的推理模式——非思考模式为模板化任务提供快速响应;思考模式和最大思考模式则针对复杂的架构决策或困难的调试问题提供逐步推理。你可以在每个会话中根据需求选择,无需切换模型。

Novita AI 提供了兼容 Anthropic 的端点(/anthropic),因此 Claude Code 将其视为即插即用的替代方案。无需更改 SDK,无需插件——只需设置环境变量。

什么是 DeepSeek V4 Flash

DeepSeek V4 Flash 是 DeepSeek AI 推出的一款混合专家(MoE)模型。它共有 284B 参数,但每次前向传播仅激活 13B,这使得延迟和每个令牌的成本接近 13B 的密集模型,同时保留了更大网络的知识容量。

关键规格一览:

规格
模型 ID deepseek/deepseek-v4-flash
总参数 284B(每次推理激活 13B)
上下文窗口 1,048,576 个令牌
最大输出令牌 393,216
输入价格(Novita AI) $0.14/M 令牌
输出价格(Novita AI) $0.28/M 令牌
缓存读取价格 $0.028/M 令牌
推理模式 非思考、思考、最大思考
函数调用 支持
结构化输出 支持
许可证 MIT

三种推理模式让你可以根据每个会话的成本和质量进行调节。非思考模式快速且便宜——适合重复的脚手架代码或模板生成。思考模式则增加了逐步推理,用于代码审查、架构工作和调试。最大思考模式使用最大推理预算,在大多数编码基准测试中与 V4 Pro 相当。

Novita AI 提供完整的 100 万令牌上下文窗口和可靠的正常运行时间,使其成为生产环境中代理式工作负载的实际选择。

获取你的 Novita AI API 密钥

注册 Novita AI 账户 即可获得免费试用积分。登录后,导航至 密钥管理页面,然后点击 创建新密钥

立即复制密钥——它不会再次显示。将其保存在密码管理器或密钥存储中;下一步会用到。

安装 Claude Code

Claude Code 需要 Node.js 18 或更高版本。首先检查你的版本:

node --version

如果 Node 版本低于 18,请先前往 nodejs.org 更新。

Windows

打开命令提示符并运行:

npm install -g @anthropic-ai/claude-code

Mac 和 Linux

打开终端并运行:

npm install -g @anthropic-ai/claude-code

全局安装后,可以在任何目录中使用 claude 命令。

配置环境变量

以下四个变量将 Claude Code 重定向到 Novita AI 兼容 Anthropic 的端点,并将 DeepSeek V4 Flash 设置为活动模型。

Windows

set ANTHROPIC_BASE_URL=https://api.novita.ai/anthropic
set ANTHROPIC_AUTH_TOKEN=<你的 Novita API 密钥>
set ANTHROPIC_MODEL=deepseek/deepseek-v4-flash
set ANTHROPIC_SMALL_FAST_MODEL=deepseek/deepseek-v4-flash

这些设置在当前命令提示符会话中有效。若要永久生效,请通过 系统属性 → 环境变量 进行设置。

Mac 和 Linux

export ANTHROPIC_BASE_URL="https://api.novita.ai/anthropic"
export ANTHROPIC_AUTH_TOKEN="<你的 Novita API 密钥>"
export ANTHROPIC_MODEL="deepseek/deepseek-v4-flash"
export ANTHROPIC_SMALL_FAST_MODEL="deepseek/deepseek-v4-flash"

若要跨会话持久化,请将这些行添加到 ~/.bashrc~/.zshrc 或相应的 shell 配置文件中。

ANTHROPIC_SMALL_FAST_MODEL 控制 Claude Code 用于快速内部任务(如文件查找和摘要)的轻量级模型。将其设置为相同的模型 ID,可以将所有流量保留在单一账单行上,并避免意外的 Anthropic API 调用。

启动 Claude Code

导航到你的项目目录并启动 Claude Code:

cd <你的项目目录>
claude .

Claude Code 会在当前目录打开一个交互式会话。一旦与 Novita AI 的端点建立连接,你就会看到提示符。从这里开始,用自然语言描述你的任务——Claude Code 会读取你的文件,提出更改建议,并在你的批准后应用更改。

处理大型代码库

100 万令牌的上下文窗口是 V4 Flash 相比其他小上下文替代方案的最实际优势。一个典型的中等规模生产代码库在展平后大约有 10 万到 30 万令牌。V4 Flash 可以将整个代码库放入上下文,无需任何分块策略。

以下是一些直接受益的工作流程:

跨文件重构——要求 Claude Code 重命名数据模型、更改 API 契约或重构服务接口,涉及所有引用该内容的文件。由于拥有完整的上下文窗口,它可以同时看到所有依赖关系,而不是逐个文件处理。

长时间调试会话——随着调试会话累积工具调用、文件读取和推理痕迹,较小的上下文窗口会截断早期历史记录。V4 Flash 则保留完整会话,因此模型可以推理出 200 个工具调用之前看到的模式。

仓库级审查——将整个代码库提供给 V4 Flash 的思考或最大思考模式,要求进行安全审查、架构评估或死代码分析。这很快就会耗尽 128K 模型的容量,但在 V4 Flash 的窗口内却绰绰有余。

系统提示开销——Claude Code 使用详细的系统提示,可能占用 1 万到 2 万个令牌。在 128K 模型上,这种开销很明显。在 1M 窗口上,它几乎可以忽略不计,几乎所有上下文预算都用于实际代码。

对于长时间会话的成本控制,非思考模式以最低成本处理大部分常规文件编辑。当任务需要设计推理时切换到思考模式,对于困难的算法或调试问题则使用最大思考模式。Novita 的缓存读取价格($0.028/M)意味着即使在大规模场景下,重复的系统提示注入成本也非常低。

选择每个会话的推理模式

DeepSeek V4 Flash 支持三种推理模式,你可以在每个会话中进行控制。非思考模式返回快速、直接的完成结果——适合模板生成、常规编辑和快速查找。思考模式为代码审查、重构和架构决策启用逐步推理。最大思考模式分配最大推理预算,在大多数编码基准测试中与 V4 Pro 相当。

让 Claude Code 偏向更深层推理的最简单方法是自定义系统提示:

claude --system "在架构决策和复杂调试时使用扩展思考。"

对于程序化控制,Novita AI 的端点接受 budget_tokens 参数。设置为 0 则完全禁用思考;任何正值都会启用思考,直到该令牌预算。这在代理式管道中很有用,只有特定步骤需要深度推理:

import anthropic

client = anthropic.Anthropic(
    base_url="https://api.novita.ai/anthropic",
    api_key="<你的 Novita API 密钥>",
)

# 最大思考模式——针对难题使用最大推理预算
response = client.messages.create(
    model="deepseek/deepseek-v4-flash",
    max_tokens=16000,
    thinking={"type": "enabled", "budget_tokens": 10000},
    messages=[{"role": "user", "content": "审查此函数,查找微妙的并发错误。"}],
)

对于成本敏感的会话,从非思考模式开始,只在遇到需要思考的问题时切换到思考模式。由于 Novita 的缓存读取价格为 $0.028/M 令牌,即使在长时间的多步骤会话中,重复的系统提示注入成本也很低。

结论

Novita AI 上的 DeepSeek V4 Flash 为 Claude Code 提供了一个强大且经济高效的支撑——100 万上下文、可选择的推理和函数调用,价格仅为 Claude Sonnet 的一小部分。设置过程不到五分钟。一旦环境变量就位,你现有的 Claude Code 工作流程无需更改即可运行。

在 Novita AI 上试用 DeepSeek V4 Flash,并查看 Novita AI LLM API 文档 了解更多配置选项。

常见问题

Claude Code 是否需要任何插件或扩展才能使用 Novita AI?

不需要。Claude Code 在启动时读取 ANTHROPIC_BASE_URL 环境变量,并将所有 API 调用路由到该地址。无需插件、扩展或代码更改——完全通过环境变量切换。

使用 Novita AI 时,Anthropic 会向我收费吗?

不会。当 ANTHROPIC_BASE_URL 指向 Novita AI 时,所有流量和计费都通过你的 Novita AI 账户进行。你的 Anthropic 账户不会被使用。

我能否在不重新安装的情况下切换回 Claude Sonnet?

可以。取消设置 ANTHROPIC_BASE_URLANTHROPIC_MODEL——或者打开一个没有这些导出变量的新 shell——Claude Code 就会恢复到默认的 Anthropic 端点,使用 Claude Sonnet。

V4 Flash 是否适合自动化 CI 管道?

V4 Flash 支持函数调用和结构化输出,这是 Claude Code 最依赖的两项能力。它是自动化编码管道、CI 集成以及需要上下文连续性和成本可预测性的长时间代理式会话的实用选择。

如果上下文窗口满了会怎样?

V4 Flash 的上下文窗口为 1,048,576 个令牌,大多数会话不会填满它。如果你运行的是极长的会话——数天积累的历史记录、非常大的仓库——Claude Code 会开始截断最早的消息。实际上,为每个新任务启动一个新的会话是保持在限制内最简单的方法。

Novita AI 是一个 AI 云平台,为开发者提供通过简单 API 部署 AI 模型的便捷方式,同时也提供经济实惠且可靠的 GPU 云用于构建和扩展。

推荐文章