DeepSeek V4 Flash Vision Exp on Novita AI:テキスト推論に画像理解を追加

DeepSeek V4 Flash Vision Exp on Novita AI:テキスト推論に画像理解を追加

DeepSeek V4 Flash Vision Exp が、DeepSeek V4 Flash 0731 の実験的なビジョン対応バージョンとして Novita AI で利用可能になりました。deepseek/deepseek-v4-flash-vision-exp のホステッドリストは、エージェント、推論、世界知識などのテキスト機能においてベースの Flash モデルと同等とされるモデルに、画像入力を追加します。現在、1,048,576 トークンのコンテキストウィンドウ、393,216 トークンの出力制限、関数呼び出し、構造化出力、および入力トークン 100 万トークンあたり $0.44、出力トークン 100 万トークンあたり $1.32 の価格設定を提供しています。エージェントがスクリーンショット、チャート、または画像を含むドキュメントについて推論する必要がある場合、これは評価すべき DeepSeek V4 Flash バリアントです。ワークロードがテキストのみの場合は、DeepSeek V4 Flash 概要 が引き続き低コストのベースエントリとなります。

主要なポイント

  • DeepSeek V4 Flash Vision Exp は、Flash 0731 ファミリーに画像理解を追加します。 Novita は、ホステッドデプロイメントに対してテキストおよび画像入力とテキスト出力をリストしています。
  • 実験的というラベルは明示的です。 ワークロード固有のテストに合格するまでは、評価およびステージングモデルとして扱ってください。一般提供のエンドポイントと同じ運用成熟度を想定しないでください。
  • Novita は 100 万の入力コンテキストと 38 万 4 千の出力を公開しています。 現在のモデル値は、1,048,576 のコンテキストトークンと 393,216 の最大出力トークンです。
  • 価格設定はベースの DeepSeek V4 Flash とは異なります。 2026 年 9 月 10 日時点で、ビジョンバリアントは入力/出力トークン 100 万トークンあたり $0.44/$1.32 とリストされており、テキストのみのベースの $0.14/$0.28 と比較されます。
  • Flash のエージェント API サーフェスを保持しています。 Novita は、関数呼び出し、構造化出力、推論、および chat/completions、Anthropic、Responses エンドポイントファミリーをリストしています。

DeepSeek V4 Flash Vision Exp とは?

DeepSeek V4 Flash Vision Exp は、DeepSeek V4 Flash ファミリーのビジョン対応の実験的メンバーです。Novita のモデル説明では、エージェント、推論、世界知識を含むテキスト機能において DeepSeek V4 Flash 0731 と同等でありながら、画像理解を追加するものと位置付けています。この表現は有用ですが、モデルファミリーに関する機能の主張であり、ベンチマーク結果や、すべてのテキスト専用プロンプトが同一に動作するという約束ではありません。スワップインの等価性を前提とする前に、既存のプロンプトをビジョンバリアントで実行してください。

アーキテクチャはスパース Mixture-of-Experts 設計で、総パラメータ数 2,840 億、トークンあたりのアクティブパラメータ数 130 億です。総パラメータ数はモデルの容量を表し、アクティブパラメータ数は各トークンに使用されるルーティングされた計算を表します。どちらの数値も、お客様のコーパスにおけるレイテンシ、スループット、または品質を単独で予測するものではないため、ワークロードテストの代わりではなく、設計を理解するために使用してください。

「-exp」というサフィックスと Novita の説明は、どちらもこれを実験的バリアントとしてマークしています。この区別は計画において重要です。ビジュアルエージェントの概念実証、ドキュメント理解パイロット、または既存のテキストモデルの背後にあるフォールバックルートとして適切なモデルである可能性がありますが、本番運用は、お客様自身の精度、ツール使用、レイテンシ、およびコストチェックに基づく必要があります。

Novita AI 上の DeepSeek V4 Flash Vision Exp API アクセス

Novita は、このモデルをサーバーレス API として、正確な ID deepseek/deepseek-v4-flash-vision-exp でホストしています。モデルページには、chat/completions、Anthropic 互換、および Responses エンドポイントファミリーに加えて、関数呼び出しと構造化出力がリストされています。OpenAI 互換クライアントの場合は、Novita のベース URL を使用し、リクエスト設定に正確なモデル ID を入力してください。画像入力が必要な場合は、ベースの Flash モデル ID を再利用しないでください。

認証とリクエスト構文については、古い記事の例をコピーするのではなく、現在の Novita AI Create chat completion ドキュメント を使用してください。モデルページは、モダリティ、制限、クォータ、および価格設定に関する信頼できる情報源です。これらはこの投稿とは独立して変更される可能性があるためです。

カタログには、デフォルトティアで 1 分間あたり 30 リクエストの値が表示され、他のティアではより高い RPM および TPM 値がリストされています。これはスループットの保証ではなく、カタログクォータとして扱ってください。リクエストサイズ、同時実行性、リトライ、ツール実行、およびアカウントティアはすべて、実際のパフォーマンスに影響を与える可能性があります。

スペックと価格設定の概要

以下の値は、2026 年 9 月 10 日に確認した Novita モデルページからのものです:

フィールド 詳細 出典 / 確認日
表示名 DeepSeek V4 Flash Vision Exp Novita モデルページ; 2026 年 9 月 10 日
モデル ID deepseek/deepseek-v4-flash-vision-exp Novita モデルページ; 2026 年 9 月 10 日
アクセス Novita AI サーバーレス API Novita モデルページ; 2026 年 9 月 10 日
入力モダリティ テキスト, 画像 Novita モデルペー ジ; 2026 年 9 月 10 日
出力モダリティ テキスト Novita モデルページ; 2026 年 9 月 10 日
コンテキストウィンドウ 1,048,576 トークン Novita モデルページ; 2026 年 9 月 10 日
最大出力 393,216 トークン Novita モデルページ; 2026 年 9 月 10 日
アーキテクチャ スパース MoE; 2 4B 総 / 3B アクティブ パラメータ Novita モデル説明; 2026 年 9 月 10 日
ホステッド機能 サーバーレス、関数呼び出し、構造化出力、推論 Novita モデルページ; 2026 年 9 月 10 日
エンドポイントファミリー chat/completions、Anthropic、Responses Novita モデルページ; 2026 年 9 月 10 日
デフォルトカタログ RPM 30 Novita モデルページ; 2026 年 9 月 10 日
入力価格 $0.4 100 万ト クンあた り Novita モデ ルペー ジ; 202 6年 9 月 10 日
キ ャッシュ読み 出し価格 $0.28 100 万トーク ンあた り Novita モデルページ; 2026 年 9 月 10 日
出力価格 $1.32 100 万トークンあたり Novita モデルページ; 2026 年 9 月 10 日
プラットフォームリリース 2026 年 8 月 24 日 Novita API カタログ; 2026 年 9 月 10 日

現在の DeepSeek V4 Flash モデルページ と比較すると、テキスト専用ベースは入力トークン 100 万トークンあたり $0.14、出力トークン 100 万トークンあたり $0.28 とリストされており、1,048,576 トークンのコンテキストと 393,216 トークンの出制限を共有しています。ビジョンバリアントの視覚入力がしたがって中心的機能差であり、その入・出力トークン価格は質的に高くなっています。

ベンチマークとパフォーマンスシグナル

DeepSeek V4 Flash ision Exp に関する Novita モデルページにはベンチマーク結果はなく、この記事ではベースの Flash モデルのスコアをビジョンバリアントに投影していません。テキストパフォーマンスはテストの理由として扱い、同一の動作の証明として扱わないでください。評価では、本番環境の成功を決定する項目を測定する必要があります:

  • スクリーンショット、スキャンまたは画像の多いドキュメント、表、チャートに関する回答精度
  • アプリケーションで使用される正確なスキーマの下での構造化出力の有効性
  • 代表的なエージェントターンにおける関数呼び出しの選択と引数の品質
  • 予想されるリクエストサイズでのエンドツーエンドのレイテンシとスループット
  • 画像トークン勘定を含む、入力および出力トークンの消費
  • 拒否、切り捨て、リトライ、フォールバック率

正式なスコアリングフレームワークが必要な場合は、エンドポイントを比較する前に実際のトラフィックからラベル付きセットを構築してください。いくつかの例でのプロンプト側のスモークテストは、マルチモダルエージェントやドキュメント抽出一クを検証するには十分ではありせん。

##開発者向けの主な機能

画像とテキストの理解

モデルは画像とテキスト入力の両方を受け入れるため、視覚的な証拠を最初に損失の多いテキスト要約に減らす代わりに、指示と一緒に送信できます。これは、関連するシグナルがレイアウト、チャートの関係、スクリーンショットの状態、または画像内の細かいテキストである場合に役立ちます。

推論と構造化出力

Novita は、ホステッドデプロイメントのための推論と構造化出力をリストしています。これらは、視覚的な観察を、自由形式のキャプションではなく、型指定された結果、ルーティング決定、チケットフィールド、または検証済みの JSON ペイロードに変換する必要がある場合に関連します。

マルチモーダルエージェントのための関数呼び出し

関数呼び出しは、モデルがツールループに参加できることを意味します。有用なパターンは次のとおりです:スクリーンショットまたはドキュメント画像を受信し、関連する状態を識別し、アプリケーションのツールを呼び出し、結果を説明するテキストを返します。ツールの範囲を狭く保ち、実行前に引数を検証し、モデルのアクションと結果の状態の両方をログに記録して、マルチモーダルエージェントの動作を監査できるようにします。

混合証拠のための長いコンテキスト

100 万トークンのコンテキスト上限により、長いトランスクリプト、ポリシードキュメント、エージェントトレース、または多数のページ画像の余地が生まれます。上限は目標ではありません。短いリクエストは通常、より安価でデバッグが容易であり、実効的なリクエスト予算は、API で使用される画像表現に依存します。タスクに必要な最小限の証拠から始め、品質が低下した場合にのみ拡大してください。

DeepSeek V4 Flash Vision Exp を使用すべき場合

DeepSeek V4 Flash スタイルの推論と視覚入力の両方が必要なタスクに使用します:

  • 印刷されたテキストとレイアウトが重要なドキュメントおよび請求書のレビュー
  • チャート、ダッシュボード、および表の解釈
  • 製品または UI のスクリーンショットトリアージ
  • ユーザーが提供する画像に対するビジュアル質問応答
  • ツールコールや構造化出力を必要とするテキストと画像が混在したエージェントワークフロー
  • ユーザートランスクリプトとスクリーンショットを組み合わせたサポートワークフロー

また、すでに DeepSeek V4 Flash を評価していて、別のモデルファミリーを導入せずに 1 つのビジュアルパスを追加したいチームにとって実用的な候補でもあります。

使用すべきでない場合

純粋なテキスト作業のデフォルトとして使用しないでください。ベースの DeepSeek V4 Flash エントリ は、現在、より低い入力価格と出力価格をリストしており、大量のテキストタスクにはより直接的な適合です。

保証された一般提供、固定レイテンシのサービスレベル、音声入力、動画入力、モデルレベルのファインチューニング、またはバウンディングボックスやピクセル座標を必要とする特殊な OCR がワークロードに必要な場合は、ビジョンバリアントを再検討してください。Novita のリストはそれらの機能を確立していないため、別のモデルが必要になる場合があります。また、実験的モデルの前提を請求や信頼性の計画にハードコーディングすることは避けてください。モデル ID、制限、価格を設設定に保し、生変の前にはライブペーを再確してください。

API ワークフローへの適合方法

既存の Novita API セットップには 3 つの変が必です:正確なビジョンモデル ID を使用し、選択したエンドポイントでサポートされているマルチモーダルメッセージ形式で画像コンテンツを送信し、画像が受け入れ可能な形式であり、エンドポイントからアクセス可能であることを検証します。API リファレンスは、認証、リクエスト構築、および応答処理をカバーしています。

評価の場合、最初のリクエストはテキストのみにしてエンドポイントと認証エラーを隔離し、次に 1 つの画像を追加して出力を制限します。リクエスト ID とトークン使用量を記録し、代表的なマルチモーダルケースに拡張します。これにより、アクセスの問題と視覚入力の問題、またはスキーマ/ツール使用の失敗を区別しやすくなります。

このローンチページは、意図的にワークフローレベルで停止しています。別のクイックスタートでは、サポートされているマルチモーダルリクエストの形状が現在の Novita ドキュメントで確認された後、SDK 固有のリクエストボディとエラーハンドリングを処理する必要があります。

最終推奨

DeepSeek V4 Flash Vision Exp は、視覚的な証拠が推論またはエージェント実行に参加する必要がある場合にテストする DeepSeek V4 Flash ファミリーのオプションです。Novita の現在のリストは、画像入力を 100 万のコンテキスト、38 万 4 千の出力、関数呼び出し、構造化出力、推論、および入力/出力トークン 100 万トークンあたり $0.44/$1.32 の価格設定と組み合わせています。実験的ステータスとベースよりも高い価格設定は、デフォルトのテキスト専用 Flash モデルの置き換えではなく、ターゲット設定されたルートとして導入されるべきであることを意味します。

ワークロード固有のテストセットから始め、現在のテキスト専用パスと比較して精度とコストを比較し、正確なモデル ID と現在の制限を設定に保持してください。モデルが視覚精度とツール安全性の要件を満たしている場合、画理解が費を回できるユースケースについて、ステージングルートから本番へと段位を上げることができます。

Novita AI で DeepSeek V4 Flash Vision Exp を試す

よくある質問

DeepSeek V4 Flash Vision Exp のモデル ID は何ですか?

Novita AI では deepseek/deepseek-v4-flash-vision-exp を使用してください。

DeepSeek V4 Flash Vision Exp は画像入力をサポートしていますか?

はい。Novita の現在のリストは、テキストと画像の入力、およびテキスト出力をサポートしています。

現在の入力および出力価格はいくらですか?

2026 年 9 月 10 日時点で、Novita は入力トークン 100 万トークンあたり $0.44、キャッシュ読み出しトークン 100 万トークンあたり $0.028、出力トークン 100 万トークンあたり $1.32 とリストしています。本番予算の前にモデルページを再確認してください。

コンテキストと出力の制限はどのくらいですか?

Novita は現在、1,048,576 トークンのコンテキストウィンドウと 393,216 トークンの最大出力をリストしています。

関数呼び出しと構造化出力をサポートしていますか?

はい。Novita は、ホステッド機能の中に関数呼び出し、構造化出力、推論、およびサーバーレスアクセスをリストしています。

DeepSeek V4 Flash とはどう違うのですか?

ビジョンバリアントは画像入力を追加し、現在トークンあたりのコストが高くなっています。また、実験的とラベル付けされています。ベースの DeepSeek V4 Flash ページは、引き続きテキスト専用ファミリーのエントリポイントです。

本番準備はできていますか?

Novita はモデルを実験的と識別しているため、本番準備はお客様自身の評価に依存します。実際のトラフィックをルーティングする前に、精度、スキーマとツールコールの信頼性、レイテンシ、障処、およびコストをテストしてくだい。

推奨記事

出典