DeepSeek V4 Flash 是一個擁有 284B 參數的 MoE 模型,具備 100 萬 token 的上下文視窗,可透過 Novita AI 的 Anthropic 相容端點使用——這代表 Claude Code 只需更改三行環境變數就能直接使用它。輸入 token 價格為 $0.14/M,而 Claude Sonnet 為 $3/M,對於執行持續性代理編碼任務的團隊來說,成本差異相當顯著。
為什麼要在 Claude Code 中使用 DeepSeek V4 Flash
最直接的原因在於經濟效益。Claude Code 預設使用 Claude Sonnet,輸入 token 價格為 $3/M,輸出 token 價格為 $15/M。Novita AI 上的 DeepSeek V4 Flash 輸入價格為 $0.14/M,輸出價格為 $0.28/M——輸入成本約降低 20 倍,輸出成本約降低 50 倍。對於一個在八小時工作日內持續使用 Claude Code 的團隊來說,這個差異很快就會累積起來。
除了成本之外,V4 Flash 還帶來了兩項對代理編碼特別重要的能力:
- 100 萬 token 上下文視窗——Claude Code 可以將整個程式碼庫載入上下文,而無需分塊處理。多檔案重構、跨儲存庫除錯以及長時間的對話歷史記錄都能保持連貫性,無需手動管理上下文。
- 可選擇的推理模式——非思考模式可針對樣板任務提供快速回應;思考模式與思考 Max 模式則能針對複雜的架構決策或困難的除錯環節,實現逐步推理。您可以根據每次會話的需求選擇,無需切換模型。
Novita AI 提供了一個 Anthropic 相容的端點(/anthropic),因此 Claude Code 將其視為直接替代方案。無需更改 SDK,也無需安裝外掛程式——只需設定環境變數即可。
什麼是 DeepSeek V4 Flash
DeepSeek V4 Flash 是 DeepSeek AI 開發的混合專家(MoE)模型。它擁有 284B 的總參數,但每次前向傳遞僅啟用 13B 參數,這使得延遲和每個 token 的成本接近 13B 的密集模型,同時保留了更大網路的知識容量。
主要規格一覽:
| 規格 | 數值 |
|---|---|
| 模型 ID | deepseek/deepseek-v4-flash |
| 總參數 | 284B(每次推理啟用 13B) |
| 上下文視窗 | 1,048,576 個 token |
| 最大輸出 token | 393,216 |
| 輸入價格(Novita AI) | $0.14/M 個 token |
| 輸出價格(Novita AI) | $0.28/M 個 token |
| 快取讀取價格 | $0.028/M 個 token |
| 推理模式 | 非思考、思考、思考 Max |
| 函式呼叫 | 是 |
| 結構化輸出 | 是 |
| 授權條款 | MIT |
三種推理模式讓您可以根據每次會話的需求,在成本與品質之間取得平衡。非思考模式快速且便宜——適合重複性的程式碼骨架或樣板生成。思考模式則加入逐步推理,適用於程式碼審查、架構設計與除錯。思考 Max 使用最大的推理預算,在多數程式碼基準測試中與 V4 Pro 表現相當。
Novita AI 提供完整的 100 萬 token 上下文視窗與可靠的上線時間,使其成為生產環境代理工作負載的實用選擇。
取得您的 Novita AI API 金鑰
註冊 Novita AI 帳戶即可獲得免費試用額度。登入後,前往金鑰管理頁面,然後點選 Create New Key。
請立即複製金鑰——之後將不會再顯示。請將其保存在密碼管理器或密鑰儲存庫中;您將在下一步驟中使用它。
安裝 Claude Code
Claude Code 需要 Node.js 18 或更高版本。請先檢查您的版本:
node --version
如果 Node 版本低於 18,請先從 nodejs.org 更新後再繼續。
Windows
開啟命令提示字元並執行:
npm install -g @anthropic-ai/claude-code
Mac 與 Linux
開啟終端機並執行:
npm install -g @anthropic-ai/claude-code
全域安裝後,即可從任何目錄使用 claude 指令。
設定環境變數
這四個變數會將 Claude Code 重新導向至 Novita AI 的 Anthropic 相容端點,並將 DeepSeek V4 Flash 設為使用中的模型。
Windows
set ANTHROPIC_BASE_URL=https://api.novita.ai/anthropic
set ANTHROPIC_AUTH_TOKEN=<您的 Novita API 金鑰>
set ANTHROPIC_MODEL=deepseek/deepseek-v4-flash
set ANTHROPIC_SMALL_FAST_MODEL=deepseek/deepseek-v4-flash
這些設定僅在目前的命令提示字元工作階段中有效。若要永久生效,請透過 系統內容 → 環境變數 進行設定。
Mac 與 Linux
export ANTHROPIC_BASE_URL="https://api.novita.ai/anthropic"
export ANTHROPIC_AUTH_TOKEN="<您的 Novita API 金鑰>"
export ANTHROPIC_MODEL="deepseek/deepseek-v4-flash"
export ANTHROPIC_SMALL_FAST_MODEL="deepseek/deepseek-v4-flash"
若要跨工作階段保留設定,請將這些行新增到您的 ~/.bashrc、~/.zshrc 或對應的 shell 設定檔中。
ANTHROPIC_SMALL_FAST_MODEL 控制 Claude Code 用於快速內部任務(如檔案查詢與摘要)的輕量級模型。將其設定為相同的模型 ID,可讓所有流量都歸入單一計費項目,並避免意外的 Anthropic API 呼叫。
啟動 Claude Code
導航到您的專案目錄並啟動 Claude Code:
cd <您的專案目錄>
claude .
Claude Code 會在目前目錄中開啟一個互動式工作階段。一旦與 Novita AI 端點建立連線,您就會看到提示出現。從這裡開始,用自然語言描述您的任務——Claude Code 會讀取您的檔案、提出變更建議,並在您核准後套用這些變更。
使用大型程式碼庫
100 萬 token 的上下文視窗是 V4 Flash 相較於較小上下文替代方案最實用的優勢。一個典型的中型生產程式碼庫,扁平化後大約有 10 萬到 30 萬個 token。V4 Flash 可以將整個程式碼庫保存在上下文中,無需任何分塊策略。
以下是一些直接受益的工作流程:
跨檔案重構——要求 Claude Code 重新命名資料模型、更改 API 合約,或重構服務介面,並遍及所有引用它的檔案。有了完整的上下文視窗,它可以同時檢視所有依賴關係,而不是逐個檔案處理。
長時間除錯工作階段——當除錯工作階段累積了工具呼叫、檔案讀取和推理軌跡時,較小的上下文視窗會截斷早期的歷史記錄。V4 Flash 會保留完整的會話記錄,因此模型可以推理出它在 200 次工具呼叫之前看到的模式。
儲存庫範圍的審查——將整個程式碼庫輸入 V4 Flash 的思考或思考 Max 模式,並要求進行安全審查、架構評估或死碼分析。這很快就會耗盡 128K 模型的能力;但在 V4 Flash 的視窗中則能輕鬆容納。
系統提示詞開銷——Claude Code 使用詳細的系統提示詞,可能佔用 1 萬到 2 萬個 token。在 128K 模型上,這個開銷會產生影響。在 1M 的視窗中則可以忽略不計,幾乎將所有上下文預算都留給了實際的程式碼。
對於長時間工作階段的成本控制,非思考模式以最低成本處理大部分例行檔案編輯。當任務需要設計推理時,切換到思考模式;對於困難的演算法或除錯問題,則使用思考 Max。Novita 的快取讀取價格($0.028/M)意味著重複的系統提示詞注入在大規模使用時成本非常低。
每次會話選擇推理模式
DeepSeek V4 Flash 支援三種推理模式,您可以針對每次會話進行控制。非思考模式會快速回傳直接結果——適合樣板生成、例行編輯與快速查詢。思考模式則啟用逐步推理,適用於程式碼審查、重構與架構決策。思考 Max 分配最大的推理預算,在多數程式碼基準測試中與 V4 Pro 表現相當。
要讓 Claude Code 傾向於更深入的推理,最簡單的方法是使用自訂系統提示詞:
claude --system "在架構決策和複雜除錯時使用延伸思考。"
若要進行程式化控制,Novita AI 的端點接受 budget_tokens 參數。將其設為 0 會完全停用思考功能;任何正值則會啟用思考,直到達到該 token 預算。這在代理管線中特別有用,因為只有特定步驟需要深度推理:
import anthropic
client = anthropic.Anthropic(
base_url="https://api.novita.ai/anthropic",
api_key="<您的 Novita API 金鑰>",
)
# 思考 Max — 為困難問題分配最大推理預算
response = client.messages.create(
model="deepseek/deepseek-v4-flash",
max_tokens=16000,
thinking={"type": "enabled", "budget_tokens": 10000},
messages=[{"role": "user", "content": "審查這個函式是否存在微妙的並行錯誤。"}],
)
對於注重成本的工作階段,請從非思考模式開始,只有在遇到需要它的問題時才切換到思考模式。由於 Novita 的快取讀取價格為 $0.028/M 個 token,即使是在長時間的多步驟工作階段中,重複的系統提示詞注入仍然保持低成本。
結論
Novita AI 上的 DeepSeek V4 Flash 為 Claude Code 提供了一個功能強大且具成本效益的基礎——100 萬上下文、可選擇的推理模式與函式呼叫,價格僅為 Claude Sonnet 的一小部分。設定過程只需不到五分鐘。一旦環境變數就定位,您現有的 Claude Code 工作流程即可照常運行。
在 Novita AI 上試用 DeepSeek V4 Flash,並參閱 Novita AI LLM API 文件以取得更多設定選項。
常見問題
Claude Code 需要使用外掛程式或擴充功能才能使用 Novita AI 嗎?
不需要。Claude Code 在啟動時會讀取 ANTHROPIC_BASE_URL 環境變數,並將所有 API 呼叫路由到該處。無需外掛程式、擴充功能或程式碼更改——完全透過環境變數進行切換。
使用 Novita AI 時,Anthropic 會向我收費嗎?
不會。當 ANTHROPIC_BASE_URL 指向 Novita AI 時,所有流量和計費都透過您的 Novita AI 帳戶進行。您的 Anthropic 帳戶不會被使用。
我可以不重新安裝就切換回 Claude Sonnet 嗎?
可以。取消設定 ANTHROPIC_BASE_URL 和 ANTHROPIC_MODEL——或者開啟一個沒有這些匯出設定的新 shell——Claude Code 就會恢復使用預設的 Anthropic 端點與 Claude Sonnet。
V4 Flash 適合自動化 CI 管線嗎?
V4 Flash 支援函式呼叫與結構化輸出,這是 Claude Code 最依賴的兩項能力。它是自動化編碼管線、CI 整合以及需要上下文連續性與成本可預測性的長時間代理工作階段的實用選擇。
如果上下文視窗滿了會怎麼樣?
在 1,048,576 個 token 的情況下,V4 Flash 的上下文視窗足夠大,大多數工作階段不會填滿它。如果您正在執行極長的工作階段——累積了數天的歷史記錄、非常大的儲存庫——Claude Code 會開始截斷最舊的訊息。實際上,為新任務啟動一個新的工作階段是保持在限制內最簡單的方法。
Novita AI 是一個 AI 雲端平台,為開發者提供透過簡單 API 部署 AI 模型的簡便方式,同時也提供價格實惠且可靠的 GPU 雲端服務,用於建置和擴展模型。
