DeepSeek V4 Flash は、100 万トークンのコンテキストウィンドウを備えた 284B MoE モデルであり、Novita AI の Anthropic 互換エンドポイントから利用できます。つまり、Claude Code は 3 行の環境変数変更だけで直接使用できます。入力トークンあたり $0.14/M と、Claude Sonnet の $3/M と比較すると、継続的なエージェントコーディングセッションを実行するチームにとって、コスト差は大きいと言えます。
Claude Code で DeepSeek V4 Flash を使用する理由
最も直接的な理由は経済性です。Claude Code はデフォルトで Claude Sonnet を使用し、入力トークンあたり $3/M、出力トークンあたり $15/M です。Novita AI 上の DeepSeek V4 Flash は、入力 $0.14/M、出力 $0.28/M であり、入力は約 20 分の 1、出力は約 50 分の 1 のコストです。8 時間労働で Claude Code を実行するチームにとって、その差はすぐに積み上がります。
コストを超えて、V4 Flash はエージェントコーディングに特に関連する 2 つの機能をもたらします。
- 100 万トークンのコンテキストウィンドウ — Claude Code はコードベース全体をチャンク化せずにコンテキストに読み込めます。複数ファイルのリファクタリング、リポジトリ間のデバッグ、長い会話履歴も、手動でコンテキストを管理することなく一貫性を保てます。
- 選択可能な推論モード — 定型タスクには Non-think モードで高速応答、複雑なアーキテクチャ決定や難しいデバッグセッションには Think モードと Think Max モードで段階的推論が可能です。モデルを切り替えずにセッションごとに選択できます。
Novita AI は Anthropic 互換エンドポイント (/anthropic) を公開しているため、Claude Code はそれをドロップイン代替として扱います。SDK の変更もプラグインも必要ありません。環境変数だけです。
DeepSeek V4 Flash とは
DeepSeek V4 Flash は、DeepSeek AI による Mixture-of-Experts(MoE)モデルです。総パラメータ数は 284B ですが、1 フォワードパスあたり 13B のみがアクティブ化されるため、13B の高密度モデルに近いレイテンシとトークンあたりのコストを維持しながら、はるかに大規模なネットワークの知識容量を保持します。
主な仕様は一目でわかります。
| 仕様 | 値 |
|---|---|
| モデル ID | deepseek/deepseek-v4-flash |
| 総パラメータ数 | 284B(推論あたり 13B がアクティブ化) |
| コンテキストウィンドウ | 1,048,576 トークン |
| 最大出力トークン数 | 393,216 |
| 入力価格(Novita AI) | $0.14/M トークン |
| 出力価格(Novita AI) | $0.28/M トークン |
| キャッシュ読み取り価格 | $0.028/M トークン |
| 推論モード | Non-think, Think, Think Max |
| 関数呼び出し | 対応 |
| 構造化出力 | 対応 |
| ライセンス | MIT |
3 つの推論モードにより、セッションごとにコストと品質を調整できます。Non-think モードは高速で低コスト — 反復的な足場作りやボイラープレート生成に適しています。Think モードはコードレビュー、アーキテクチャ作業、デバッグのために段階的推論を追加します。Think Max は最大の推論予算を割り当て、ほとんどのコーディングベンチマークで V4 Pro に匹敵します。
Novita AI は完全な 100 万トークンのコンテキストウィンドウと信頼性の高い稼働時間を提供するため、本番のエージェントワークロードにとって実用的な選択肢となります。
Novita AI API キーの取得
Novita AI アカウントにサインアップ して、無料トライアルクレジットを受け取ってください。ログイン後、キー管理ページ に移動し、Create New Key をクリックします。
キーはすぐにコピーしてください — 再表示されません。パスワードマネージャーまたはシークレットストアに保管し、次のステップで必要になります。
Claude Code のインストール
Claude Code には Node.js 18 以上が必要です。まずバージョンを確認してください。
node --version
Node が 18 未満の場合は、続行する前に nodejs.org から更新してください。
Windows
コマンドプロンプトを開いて実行します。
npm install -g @anthropic-ai/claude-code
Mac と Linux
ターミナルを開いて実行します。
npm install -g @anthropic-ai/claude-code
グローバルインストールにより、任意のディレクトリから claude が使用可能になります。
環境変数の設定
以下の 4 つの変数により、Claude Code が DeepSeek V4 Flash をアクティブモデルとして Novita AI の Anthropic 互換エンドポイントにリダイレクトされます。
Windows
set ANTHROPIC_BASE_URL=https://api.novita.ai/anthropic
set ANTHROPIC_AUTH_TOKEN=<Your Novita API Key>
set ANTHROPIC_MODEL=deepseek/deepseek-v4-flash
set ANTHROPIC_SMALL_FAST_MODEL=deepseek/deepseek-v4-flash
これらは現在のコマンドプロンプトセッションでのみ有効です。永続的にするには、システムプロパティ → 環境変数 から設定してください。
Mac と Linux
export ANTHROPIC_BASE_URL="https://api.novita.ai/anthropic"
export ANTHROPIC_AUTH_TOKEN="<Your Novita API Key>"
export ANTHROPIC_MODEL="deepseek/deepseek-v4-flash"
export ANTHROPIC_SMALL_FAST_MODEL="deepseek/deepseek-v4-flash"
セッションを越えて保持するには、これらの行を ~/.bashrc、~/.zshrc、または同等のシェルプロファイルに追加してください。
ANTHROPIC_SMALL_FAST_MODEL は、ファイル検索やサマリーなどの高速な内部タスクのために Claude Code が使用する軽量モデルを制御します。同じモデル ID に設定することで、すべてのトラフィックを 1 つの請求ラインにまとめ、予期しない Anthropic API 呼び出しを回避できます。
Claude Code の起動
プロジェクトディレクトリに移動し、Claude Code を起動します。
cd <your-project-directory>
claude .
Claude Code は現在のディレクトリで対話セッションを開きます。Novita AI のエンドポイントへの接続が確立されると、プロンプトが表示されます。ここから、タスクを自然言語で説明します — Claude Code がファイルを読み取り、変更を提案し、承認を得て適用します。
大規模コードベースでの作業
100 万トークンのコンテキストウィンドウは、V4 Flash が小規模コンテキストの代替手段よりも持つ最も実用的な利点です。一般的な中規模の本番コードベースは、フラット化すると 10 万~30 万トークンになります。V4 Flash はチャンク化戦略なしで全体をコンテキストに保持できます。
直接恩恵を受けるワークフローをいくつか紹介します。
クロスファイルリファクタリング — データモデルの名前変更、API コントラクトの変更、サービスインターフェースのリファクタリングを、それを参照するすべてのファイルにわたって Claude Code に依頼します。完全なコンテキストウィンドウにより、ファイルごとではなくすべての依存関係を同時に認識します。
長時間のデバッグセッション — デバッグセッションがツールコール、ファイル読み取り、推論トレースを蓄積するにつれて、小規模なコンテキストウィンドウは初期の履歴を切り詰めます。V4 Flash はセッション全体を保持するため、200 回前のツールコールで見たパターンについてモデルが推論できます。
リポジトリ全体のレビュー — コードベース全体を V4 Flash の Think モードまたは Think Max モードに与え、セキュリティレビュー、アーキテクチャ評価、デッドコード分析を依頼します。これは 128K モデルではすぐに枯渇しますが、V4 Flash のウィンドウには余裕で収まります。
システムプロンプトのオーバーヘッド — Claude Code は詳細なシステムプロンプトを使用し、1 万~2 万トークンになる可能性があります。128K モデルではそのオーバーヘッドが重要ですが、100 万ウィンドウでは無視でき、コンテキスト予算のほとんどすべてを実際のコードに充てられます。
長時間セッションのコスト管理には、Non-think モードが日常的なファイル編集の大部分を最低コストで処理します。設計の推論が必要なタスクには Think モードに切り替え、難しいアルゴリズムやデバッグ問題には Think Max を使用します。Novita のキャッシュ読み取り価格 ($0.028/M) により、繰り返しのシステムプロンプト注入はスケールしても非常に低コストです。
セッションごとの推論モードの選択
DeepSeek V4 Flash は 3 つの推論モードをサポートしており、セッションごとに制御できます。Non-think モードは高速で直接的な完了を返します — ボイラープレート生成、日常的な編集、クイックルックアップに適しています。Think モードはコードレビュー、リファクタリング、アーキテクチャ決定のための段階的推論を可能にします。Think Max は最大の推論予算を割り当て、ほとんどのコーディングベンチマークで V4 Pro に匹敵します。
Claude Code をより深い推論に偏らせる最も簡単な方法は、カスタムシステムプロンプトです。
claude --system "アーキテクチャの決定や複雑なデバッグには拡張思考を使用してください。"
プログラムによる制御のために、Novita AI のエンドポイントは budget_tokens パラメータを受け入れます。0 に設定すると思考が完全に無効になり、正の値を設定するとそのトークン予算まで思考が有効になります。これは、特定のステップでのみ深い推論が必要なエージェントパイプラインで役立ちます。
import anthropic
client = anthropic.Anthropic(
base_url="https://api.novita.ai/anthropic",
api_key="<Your Novita API Key>",
)
# Think Max — 難しい問題には最大の推論予算
response = client.messages.create(
model="deepseek/deepseek-v4-flash",
max_tokens=16000,
thinking={"type": "enabled", "budget_tokens": 10000},
messages=[{"role": "user", "content": "この関数に微妙な並行性バグがないかレビューしてください。"}],
)
コスト重視のセッションでは、Non-think モードで開始し、必要な問題に遭遇した場合にのみ Think に切り替えます。Novita のキャッシュ読み取り価格は $0.028/M トークンであるため、長いマルチステップセッションでも繰り返しのシステムプロンプト注入は低コストのままです。
結論
Novita AI 上の DeepSeek V4 Flash は、Claude Code に高性能でコスト効率の高いバックボーンを提供します — 100 万のコンテキスト、選択可能な推論、関数呼び出しを Claude Sonnet の価格のほんの一部で実現します。セットアップは 5 分もかかりません。環境変数が設定されれば、既存の Claude Code ワークフローは変更なく実行されます。
Novita AI で DeepSeek V4 Flash を試す そして、Novita AI LLM API ドキュメント でさらなる設定オプションを確認してください。
FAQ
Claude Code は Novita AI を使用するためにプラグインや拡張機能が必要ですか?
いいえ。Claude Code は起動時に ANTHROPIC_BASE_URL 環境変数を読み取り、すべての API 呼び出しをそこにルーティングします。プラグイン、拡張機能、コードの変更は一切必要ありません — 切り替えは完全に環境変数を通じて行われます。
Novita AI を使用する場合、Anthropic から請求されますか?
いいえ。ANTHROPIC_BASE_URL が Novita AI を指している場合、すべてのトラフィックと請求は Novita AI アカウントを通じて行われます。Anthropic アカウントは使用されません。
再インストールせずに Claude Sonnet に戻せますか?
はい。ANTHROPIC_BASE_URL と ANTHROPIC_MODEL を設定解除するか、それらのエクスポートがない新しいシェルを開くと、Claude Code はデフォルトの Anthropic エンドポイントと Claude Sonnet に戻ります。
V4 Flash は自動化 CI パイプラインに適していますか?
V4 Flash は関数呼び出しと構造化出力をサポートしており、これらは Claude Code が最も依存する 2 つの機能です。自動化コーディングパイプライン、CI 統合、およびコンテキストの継続性とコスト予測可能性が重要な長時間のエージェントセッションにとって実用的な選択肢です。
コンテキストウィンドウがいっぱいになるとどうなりますか?
1,048,576 トークンでは、V4 Flash のコンテキストウィンドウはほとんどのセッションでいっぱいにならないほど十分に大きいです。非常に長いセッション — 何日にもわたる履歴の蓄積、非常に大規模なリポジトリ — を実行している場合、Claude Code は最も古いメッセージの切り詰めを開始します。実際には、新しいタスクのために新しいセッションを開始することが、制限内に収める最も簡単な方法です。
Novita AI は、開発者がシンプルな API を使用して AI モデルを簡単にデプロイできると同時に、構築とスケーリングのための手頃で信頼性の高い GPU クラウドを提供する AI クラウドプラットフォームです。
