Novita AI LLM, Vision

DeepSeek V4 Flash Vision Exp on Novita AI: テキストマッチング推論に画像理解を追加

DeepSeek V4 Flash Vision Exp on Novita AI: テキストマッチング推論に画像理解を追加

DeepSeek V4 Flash Vision Exp は、Novita AI 上で DeepSeek V4 Flash 0731 の実験的なビジョン対応バージョンとして利用可能です。deepseek/deepseek-v4-flash-vision-exp のホステッドリスティングは、エージェント、推論、世界知識などのテキスト機能においてベースの Flash モデルと同等と説明されるモデルに画像入力を追加します。現在、1,048,576 トークンのコンテキストウィンドウ、393,216 トークンの出力制限、関数呼び出し、構造化出力、および入力トークン 100 万トークンあたり $0.44、出力トークン 100 万トークンあたり $1.32 の料金を提供しています。エージェントがスクリーンショット、チャート、または画像を含むドキュメントに対して推論する必要がある場合、こちらが評価すべき DeepSeek V4 Flash のバリアントです。ワークロードがテキストのみの場合は、DeepSeek V4 Flash 概要 が低コストのベースエントリとして残ります。

主要なポイント

  • DeepSeek V4 Flash Vision Exp は、Flash 0731 ファミリーに画像理解を追加します。 Novita は、ホステッドデプロイメントに対してテキストと画像の入力、およびテキスト出力をリストしています。
  • 実験的ラベルは明示的です。 ワークロード固有のテストに合格するまでは、評価およびステージングモデルとして扱ってください。一般的な提供エンドポイントと同じ運用成熟度を想定しないでください。
  • Novita は 100 万の入力コンテキストと 384K の出力を提供します。 現在のモデル値は、1,048,576 コンテキストトークンと最大 393,216 出力トークンです。
  • 料金はベースの DeepSeek V4 Flash とは異なります。 2026 年 9 月 15 日時点で、ビジョンバリアントは入力/出力トークン 100 万トークンあたり $0.44/$1.32 とリストされており、テキストのみのベースの $0.14/$0.28 と比較されます。
  • Flash のエージェント API サーフェスを維持します。 Novita は、関数呼び出し、構造化出力、推論、および chat/completions、Anthropic、Responses エンドポイントファミリーをリストしています。

DeepSeek V4 Flash Vision Exp とは?

DeepSeek V4 Flash Vision Exp は、DeepSeek V4 Flash ファミリーのビジョン対応実験メンバーです。Novita のモデル説明は、テキスト機能(エージェント、推論、世界知識を含む)において DeepSeek V4 Flash 0731 と同等でありながら、画像理解を追加するものとして位置付けています。この文言は有用ですが、モデルファミリーに関する機能の主張であり、ベンチマーク結果や、すべてのテキストのみのプロンプトが同一に動作するという約束ではありません。スワップインの同等性を前提とする前に、既存のプロンプトをビジョンバリアントで実行してください。

「-exp」サフィックスと Novita の説明は、どちらもこれを実験的なバリアントとして示しています。この区別は計画において重要です。ビジュアルエージェントの概念実証、ドキュメント理解パイロット、または既存のテキストモデルの背後にあるフォールバックルートとして適切なモデルかもしれませんが、本番展開は、独自の精度、ツール使用、レイテンシ、およびコストチェックに基づく必要があります。

Novita AI での DeepSeek V4 Flash Vision Exp API アクセス

Novita は、このモデルを正確な ID deepseek/deepseek-v4-flash-vision-exp でサーバーレス API としてホストしています。モデルページには、chat/completions、Anthropic 互換、Responses エンドポイントファミリーに加え、関数呼び出しと構造化出力がリストされています。OpenAI 互換クライアントの場合は、Novita のベース URL を使用し、リクエスト設定に正確なモデル ID を配置してください。画像入力が必要な場合は、ベースの Flash モデル ID を再利用しないでください。

認証とリクエスト構文については、古い記事の例をコピーするのではなく、現在の Novita AI Create chat completion ドキュメント を参照してください。モダリティ、制限、クォータ、および料金については、モデルページが信頼できる情報源です。これらはいずれもこの投稿とは別に変更される可能性があるためです。

カタログは、デフォルトティアの 1 分あたり 30 リクエストを示しており、他のティアではより高い RPM および TPM 値がリストされています。これをカタログクォータとして扱い、スループットの保証とは見なさないでください。リクエストサイズ、同時実行性、リトライ、ツール実行、およびアカウントティアはすべて、実際のパフォーマンスに影響を与える可能性があります。

スペックと料金の概要

以下の値は、2026 年 9 月 15 日に確認した Novita モデルページからのものです:

フィールド 詳細
表示名 DeepSeek V4 Flash Vision Exp
モデル ID deepseek/deepseek-v4-flash-vision-exp
アクセス Novita AI サーバーレス API
入力モダリティ テキスト、画像
出力モダリティ テキスト
コンテキストウィンドウ 1,048,576 トークン
最大出力 393,216 トークン
アーキテクチャ Sparse MoE; 合計 284B / アクティブ 13B パラメータ
ホステッド機能 サーバーレス、関数呼び出し、構造化出力、推論
エンドポイントファミリー chat/completions、Anthropic、Responses
デフォルトカタログ RPM 30
入力価格 100 万トークンあたり $0.44
キャッシュ読み取り価格 100 万トークンあたり $0.028
出力価格 100 万トークンあたり $1.32
プラットフォームリリース 2026 年 8 月 24 日

現在の DeepSeek V4 Flash モデルページ と比較すると、テキストのみのベースは、1,048,576 トークンのコンテキストと 393,216 トークンの出力制限を共有しながら、入力トークン 100 万トークンあたり $0.14、出力トークン 100 万トークンあたり $0.28 とリストされています。したがって、ビジョンバリアントの視覚入力が中心的な機能の違いであり、その入力および出力トークン価格は大幅に高くなっています。

ベンチマークとパフォーマンスシグナル

DeepSeek V4 Flash Vision Exp に関する Novita モデルページにはベンチマーク結果はなく、この記事はベースの Flash モデルのスコアをビジョンバリアントに投影するものではありません。テキストパフォーマンスはテストの理由として扱い、同一の動作の証明としては扱わないでください。評価では、本番環境の成功を左右する以下の項目を測定する必要があります:

  • スクリーンショット、スキャンまたは画像の多いドキュメント、テーブル、チャートに対する回答の正確性
  • アプリケーションで使用される正確なスキーマでの構造化出力の有効性
  • 代表的なエージェントターンにおける関数呼び出しの選択と引数の品質
  • 想定されるリクエストサイズでのエンドツーエンドのレイテンシとスループット
  • 画像トークン計算を含む、入力および出力トークンの消費量
  • 拒否、切り詰め、リトライ、およびフォールバック率

正式なスコアリングフレームワークが必要な場合は、エンドポイントを比較する前に、実際のトラフィックからラベル付けされたセットを構築してください。いくつかの例でのプロンプト側のスモークテストは、マルチモーダルエージェントやドキュメント抽出ワークフローを認定するには十分ではありません。

開発者のための主要機能

画像とテキストの理解

モデルは画像とテキストの入力を受け入れるため、視覚的な証拠を最初に損失の多いテキスト要約に変換する代わりに、指示とともに送信できます。これは、関連するシグナルがレイアウト、チャートの関係、スクリーンショットの状態、または画像内の細かいテキストである場合に役立ちます。

推論と構造化出力

Novita は、ホステッドデプロイメントの推論と構造化出力をリストしています。これらは、視覚的な観察を、自由形式のキャプションではなく、型指定された結果、ルーティングの決定、チケットフィールド、または検証済みの JSON ペイロードにする必要がある場合に関連します。

マルチモーダルエージェントのための関数呼び出し

関数呼び出しは、モデルがツールループに参加できることを意味します。有用なパターンは次のとおりです:スクリーンショットまたはドキュメント画像を受け取り、関連する状態を特定し、アプリケーションのツールを呼び出し、結果を説明するテキストを返します。ツールは狭い範囲に保ち、実行前に引数を検証し、モデルのアクションと結果の状態の両方を記録して、マルチモーダルエージェントの動作を監査できるようにします。

混合エビデンスのための長いコンテキスト

100 万トークンのコンテキスト上限は、長いトランスクリプト、ポリシードキュメント、エージェントトレース、または多数のページ画像に余地を与えます。上限は目標ではありません。短いリクエストは通常、より安く、デバッグが容易であり、実効リクエスト予算は API で使用される画像表現に依存します。タスクに必要な最小限の証拠から始め、品質が低下した場合にのみ拡張してください。

DeepSeek V4 Flash Vision Exp を使用すべき場合

タスクに DeepSeek V4 Flash スタイルの推論と視覚入力の両方が必要な場合に使用します:

  • 印刷テキストとレイアウトが重要であるドキュメントやイ ンボォイスのレビュー
  • チャート、ダッシュボード、テーブルの解釈
  • 製品または UI のスクリーンショットトリアージ
  • ユーザーから提供された画像に対する視覚的質問応答
  • ツールコールや構造化出力を必要とするテキストと画像の混合エージェントワークフロー
  • ユーザーのトランスクリプトとスクリーンショットを組み合わせたサポートワークフロー

また、すでに DeepSeek V4 Flash を評 価してお り 、別のモデルファミリーを導入せずに1つ の視覚パス を追加した い チームにと っ ても実 用的な候補です。

使用すべきでない場合

純粋なテ キスト作業のデフォルトとして使用しないで ください。ベースの DeepSeek V4 Flash エン ト リ は、現在、より低い入力および出力価格をリ ス トしており、大量のテキストタスクにはより直接的な適合です。

ワークロードに、保証された一般提 供、固定レ イ テ ン シ サ ー ビ ス レ ベ ル、音声入 力、ビ デ オ 入 力、モデ ル レ ベ ル の フ ァ イ ン チ ュ ー ニ ン グ、ま た は バ ウ ン デ ィ ン グ ボ ッ ク ス や ピ ク セ ル 座 標 を 必 要 と す る 専 門 的 な O C R が 必 要 な 場 合 は 、ビ ジ ョ ン バ リ ア ン ト を 再 考 し て く だ さ い 。N o v i t a の リ ス テ ィ ン グ は こ れ ら の 機 能 を 確 立 し て い な い た め 、別 の モ デ ル が 必 要 に な る 場 合 が あ り ま す 。ま た 、実 験 的 モ デ ル の 仮 定 を 請 求 や 信 頼 性 計 画 に ハ ー ド コ ー デ ィ ン グ す る こ と を 避 け、モ デ ル ID、制 限、お よ び 価 格 を 設 定 に 保 持 し、本 番 変 更 の 前 に ラ イ ブ ペ ー ジ を 再 確 認 し て く だ さ い 。

API ワークフローへの適合方法

既存の Novita API セットアップでは、3 つ の 変 更 が 必 要 で す :正 確 な ビ ジ ョ ン モデ ル ID を 使 用 し、選 択 し た エ ン ド ポ イ ン ト で サ ポ ー ト さ れ て い る マ ル チ モ ー ダ ル メ ッ セ ー ジ 形 式 で 画 像 コ ン テ ン ツ を 送 信 し、画 像 が 許 容 形 式 で あ り、エ ン ド ポ イ ン ト か ら ア ク セ ス 可 能 で あ る こ と を 確 認 し ま す 。API リ フ ァ レ ン ス は 、認 証 、リ ク エ ス ト 構 築 、お よ び 応 答 処 理 を カ バ ー し て い ま す。

評価のために、最初のリクエストはテキストのみにしてエンドポイントと認証エラを分離し、次に1つの画像を追加して出力をキヤップします。リクエスト ID とトークン使用量を記録し、その後、代表的なマルチモーダルケースに拡張します。これにより、アクセス問題と視覚入力問題、またはスキーマ/ツール使用失敗を区別しやすくなります。

このローンチペー ジは、意図的にワークフローレベルで停 止しています。別のクイックスタートでは、サポートされているマルチモーダルリクエストの形状が現在の Novita ドキュメントで検証された後、SDK 固有のリクエストボディとエラーハンドリングを処理する必要があります。

最終推奨事項

DeepSeek V4 Flash Vision Exp は、視覚的な証拠が推論またはエージェント実行に参加する必要がある場合にテス トすべき DeepSeek V4 Flash ファミリーのオプションです。Novita の現在のリステイングは、画像入力を 100 万コンテキスト、384K 出力、関数呼び出し、構造化出力、推論、および入力/出力トークン 100 万トークンあたり $0.44/$1.32 の料金と組み合わせています。実験的ステータスとベースよりも高い料金は、テキストのみの Flash モデルのデフォルトの置き換えではなく、ターゲットを絞ったルートとして導入されるべきであることを意味します。

ワクフロー固有のテス トセッ トから始 め、現 在のテキストのみのパスと精度とコストを比較 し、正確なモデル ID と現在の制限を設定に保 持してください。モデルが視覚的な精度とツールの安全性の要件を満たしていれば、ステージングルートから、画像理解がそれ自 体のコストを償うユースケースの本番環境に移行できます。

Try DeepSeek V4 Flash Vision Exp on Novita AI

FAQ

DeepSeek V4 Flash Vision Exp のモデル ID は何ですか?

N ov it a AI で de ep se ek / de ep se ek - v4 - fl a sh - v i s i o n - e xp を使用してください。

De ep Se ek V4 Fl a sh V i s i o n E x p は画 像 入 力 を サ ポ ー ト し て い ま す か?

は い 。 N o v i t a の 現 在 の リ ス テ ィ ン グ は 、テ キ ス ト と 画 像 の 入 力 、お よ び テ キ ス ト 出 力 を サ ポ ー ト し て い ま す。

現 在 の 入 力 お よ び 出 力 価 格 は ど れ く ら い で す か?

2026 年 9 月 1 5 日 時 点 で 、 N o v i t a は 、入 力 ト ー ク ン 1 0 0 万 ト ー ク ン あ た り $0 . 4 4 、キ ャ ッ シ ュ 読 み 取 り ト ー ク ン 1 0 0 万 ト ー ク ン あ た り $0 . 0 2 8 、出 力 ト ー ク ン 1 0 0 万 ト ー ク ン あ た り $1 . 3 2 を リ ス ト し て い ま す 。本 番 予 算 を 立 て る 前 に 、モ デ ル ペ ー ジ を 再 確 認 し て く だ さ い 。

コ ン テ キ ス ト と 出 力 制 限 は ど の く ら い で す か?

N o v i t a は 現 在 、1 , 0 4 8 , 5 7 6 ト ー ク ン の コ ン テ キ ス ト ウ イ ン ド ウ と 3 9 3 , 2 1 6 ト ー ク ン の 最 大 出 力 を リ ス ト し て い ま す。

関数呼び出しと構造化出力をサポートしていますか?

はい。 Novita は、ホステッド機能の中に関数呼び出し、構造化出力、推論、およびサーバーレスアクセスをリストしています。

DeepSeek V4 Flash との違いは何ですか?

ビジョンバリアントは画像入力を追加し、現在トークンあたりのコストが高くなっています。また、実験的とラベル付けされています。ベースの DeepSeek V4 Flash ページは、引き続きテキストのみのファミリーエントリポイントです。

本番環境に対応していますか?

Novita はこのモデルを実験的と識別しているため、本番環境への対応はお客様自身の評価に依存します。実際のトラフィックをルーティングする前に、精度、スキーマおよびツールコールの信頼性、レイテンシ、障害処理、およびコストをテストしてください。

推奨記事

ソース

関連記事