Novita AI の Qwen3.8 Flash:入力 $0.15/M からのマルチモーダル API

Novita AI の Qwen3.8 Flash:入力 $0.15/M からのマルチモーダル API

Qwen3.8 Flash は、マルチモーダルなサーバーレスモデルとして、また Qwen4 アーキテクチャの早期プレビューとして Novita AI で利用できます。これはより効率重視の Qwen3.8 オプションです。このモデルは合計 125B パラメータとトークンあたり 6B のアクティブパラメータを組み合わせ、テキスト、画像、動画入力を受け付け、現在 Novita AI では入力 1M トークンあたり $0.15、キャッシュ読み取り 1M トークンあたり $0.016、出力 1M トークンあたり $0.47 で提供されています。Qwen3.8 Max の料金プロファイルから始めずに長いコンテキストのマルチモーダルモデルが必要な場合、Flash は最初に評価すべきバリアントです。

Qwen3.8 Flash の概要

以下の値は、2026年8月31日に確認された Novita AI のモデルページに基づいています。モデルの制限やトークン価格は記事とは独立して変更される可能性があるため、可用性と請求に関する信頼できる情報源はこのページです。

項目 現在の値
表示名 Qwen3.8 Flash
モデル ID qwen/qwen3.8-flash
プロバイダー Alibaba / Qwen
アクセス Novita AI サーバーレス API
エンドポイントファミリー chat/completionsanthropicresponses
入力モダリティ テキスト、画像、動画
出力モダリティ テキスト
コンテキストウィンドウ 1,000,000 トークン
UI 表示 977K コンテキスト
最大出力 131,072 トークン
UI 表示 128K 最大出力
入力価格 $0.15 / 1M トークン
キャッシュ読み取り価格 $0.016 / 1M トークン
出力価格 $0.47 / 1M トークン
プラットフォームリリース 2026年8月27日

正規化された制限値と省略された UI ラベルを区別することは重要です。Novita のページでは現在、機能パネルに 977K128K を表示しつつ、対応するモデル値として 1,000,000131,072 を公開しています。厳密なバリデーションを実装する場合や最大リクエストサイズを見積もる場合は、ライブのモデルページを使用してください。

Qwen4 プレビューの意味

Qwen3.8 Flash は汎用的な小型モデルとして提示されているわけではありません。その位置づけは Qwen4 アーキテクチャの早期プレビューであり、単に密なパラメータ数を最大化するのではなく、広範な入力カバレッジと効率的なアクティベーションを狙った設計になっています。

このモデルは合計 125B パラメータを持ちますが、トークンあたり 6B のパラメータをアクティブ化します。この Mixture-of-Experts レイアウトは、幅広いモデル容量を必要としつつ、トークンあたりの計算をより集中的に保ちたいワークロードに役立つ可能性があります。アーキテクチャには 51B の N-gram 埋め込みコンポーネントも含まれ、GDN と QSA ハイブリッドアテンションを組み合わせています。これらはアーキテクチャ上の事実であり、特定のベンチマーク結果やアプリケーションでのレイテンシーを約束するものではありません。

実用的な違いは、1 つのエンドポイントに 3 つの機能が組み合わされていることです。

  • マルチモーダル入力: タスクがテキストの文字起こし以上のものに依存する場合、テキスト、画像、動画を送信できます。
  • 長い作業コンテキスト: 大規模なドキュメント、リポジトリの資料、長い動画関連のコンテキストに最大 1M トークンを利用できます(リクエスト形式とライブのプラットフォーム制限に従います)。
  • 切り替え可能な推論動作: モデルページではシンキングモードがデフォルトで有効になっており、より高速または簡潔な応答が好ましい場合にはオフにできます。

これにより、Flash は従来の低価格チャットモデルとは異なります。ホスト型 API を通じて次世代の Qwen アーキテクチャファミリーを評価するチームにとって、効率的なマルチモーダルプレビューとして理解するのが適切です。

Qwen3.8 Flash が適しているケース

マルチモーダルなドキュメントおよびメディア分析

ワークフローで書面による指示と視覚的証拠を組み合わせる必要がある場合は Flash を使用します。例としては、インシデントレポートと一緒にスクリーンショットを確認する、画像の多いドキュメントから事実を抽出する、入力タイプごとに個別のモデル統合を維持することなく動画について質問する、などが挙げられます。

長いコンテキストでのコーディングとエージェントワークフロー

1M トークンのコンテキスト容量により、開発者はリポジトリの概要、イシュー履歴、ツールトレース、設計ドキュメントを 1 つのワーキングセットでテストする余地が得られます。また、モデルの 6B アクティブパラメータという数値は、エージェントが多くのターンにわたって広範な能力を必要としつつ、常に最大の兄弟モデルを必要とするわけではない場合に、その効率重視の方向性を関連付けます。

コンテキストウィンドウは容量の上限として扱い、目標とはしないでください。タスクに必要な情報を保持する最小のコンテキストから始め、プロンプトが大きくなるにつれて回答品質、レイテンシー、コストを測定します。

長尺動画の理解

動画入力は、テキスト優先の Qwen エンドポイントとは別に Flash を評価する意義のある理由です。動画分析ワークフローでは、視覚的およびテキスト的な質問に同じモデルファミリーを使用できますが、本番テストでは代表的なクリップ、フレームレート、解像度、質問タイプを使用する必要があります。モデルページは動画入力のサポートを確認していますが、すべての動画形状に対して固定のコストやレイテンシーを保証するものではありません。

コストを重視するフロンティアモデル評価

現在表示されている料金では、Flash は Qwen3.8 Max の記事に記載されたローンチ料金よりもトークンあたり大幅に安価です。ただし、それがすべてのリクエストで自動的に低コストな選択肢になるわけではありません。実際のコストは、入力長、キャッシュ再利用、出力長、リトライ、アプリケーションが画像や動画を表現する方法によって異なります。見出しの入力料金だけでなく、タスクの総コストを比較してください。

デフォルトとして最適ではないケース

短い分類、抽出、または単純なチャットプロンプトで、より小さなテキストモデルが品質基準を満たす場合、Qwen3.8 Flash は不要かもしれません。マルチモーダルサポートは、アプリケーションがマルチモーダルな証拠を送信する場合にのみ価値があります。そうでなければ、結果を改善することなく、モデル選択とリクエスト形式の複雑さを追加するだけになる可能性があります。

また、独自のワークロードでのベンチマークの代わりにはなりません。利用可能なモデルページの説明は、モデルのモダリティ、制限、アーキテクチャの位置づけ、アクセスパスを確立するものです。Flash があなたのコードベース、言語の組み合わせ、動画コーパス、ツール呼び出しループで別のモデルを上回ることを示すものではありません。本番のデフォルトを選択する前に、代表的なプロンプトで評価してください。

最高容量の Qwen3.8 オプションが特に必要なチームは、Novita AI の Qwen3.8 Max の要件と料金を比較してください。モデルの選択がすでに決まっており、実行可能なリクエスト例が必要なチームは、Qwen3.8 Max API クイックスタート を統合パターンとして使用し、サポートされているエンドポイントとメッセージ形式を検証した後に Flash のモデル ID に置き換えてください。

制限、料金、および信頼できる情報源

Novita のモデルページには現在、Qwen3.8 Flash の 3 つのトークン料金が記載されています。

  • 入力トークン:1M トークンあたり $0.15
  • キャッシュ読み取り入力トークン:1M トークンあたり $0.016
  • 出力トークン:1M トークンあたり $0.47

キャッシュ読み取り料金は、アプリケーションが安定したシステム命令、長い参照資料、その他の再利用可能なコンテキストを繰り返し送信する場合に重要です。すべての繰り返しプロンプトに対して保証された割引として扱うべきではありません。現在の Novita アカウントと料金画面で、リクエストがどのように分類され請求されるかを確認してください。

制限については、同じページが 1,000,000 トークンのコンテキスト値と 131,072 トークンの最大出力値を公開しており、表示される機能パネルではそれらが 977K と 128K に省略されています。統合がエラーと切り捨て動作を処理できるようになるまでは、リクエストレベルの制限をライブの値より低く保ってください。記事の価格を請求システムにハードコードしないでください。

Qwen3.8 Flash へのアクセス方法

このモデルは Novita のサーバーレス API を通じて利用できます。正確なモデル ID qwen/qwen3.8-flash を使用してください。OpenAI 互換クライアントは Novita のベース URL https://api.novita.ai/openai を使用します。モデルページには Anthropic と Responses のエンドポイントファミリーも記載されています。API キー、認証、リクエストボディ、レスポンス処理は、古い記事からコピーするのではなく、現在の Novita AI API ドキュメント に従ってください。

最初の評価では、Flash が画像と動画入力をサポートしていても、リクエストはテキストのみで短く保ってください。その後、一度に 1 つのモダリティを追加し、出力トークンを上限設定し、トークン使用量を記録します。これにより、認証やエンドポイントのエラーをマルチモーダルペイロードの問題から切り分け、品質とコストのベースラインを得ることができます。

結論

Qwen3.8 Flash は、ホスト型マルチモーダル API を通じて Qwen4 アーキテクチャの早期プレビューを評価したいチームにとって有力な候補です。その特徴的なプロファイルは、テキスト、画像、動画入力の組み合わせ、1M トークンのコンテキスト上限、切り替え可能なシンキング動作、トークンあたり 6B のアクティブパラメータを備えた効率重視の MoE 設計です。Novita AI では、現在の表示価格は入力 1M トークンあたり $0.15、キャッシュ読み取り 1M トークンあたり $0.016、出力 1M トークンあたり $0.47 です。

これらの機能がワークロードに合致する場合は Flash を選択してください。ジョブが短くテキストのみの場合は、より小さなエンドポイントをテストしてください。ジョブが最大の Qwen3.8 容量を必要とする場合は Max を比較してください。目的が実装構文である場合は、クイックスタートガイドを使用してください。いずれの場合も、本番展開の前に、ライブの Novita モデルページを信頼できる情報源として扱ってください。

FAQ

Novita AI での Qwen3.8 Flash のモデル ID は何ですか?

qwen/qwen3.8-flash を使用してください。

Qwen3.8 Flash は画像と動画をサポートしていますか?

はい。Novita のモデルページには、サポートされる入力モダリティとしてテキスト、画像、動画が記載されており、出力はテキストです。

Qwen3.8 Flash の現在の料金はいくらですか?

2026年8月31日に確認したところ、Novita は入力 1M トークンあたり $0.15、キャッシュ読み取り 1M トークンあたり $0.016、出力 1M トークンあたり $0.47 を表示しています。本番予算を立てる前に、ライブのモデルページを再確認してください。

コンテキストウィンドウはどのくらいの大きさですか?

現在のモデル値は 1,000,000 トークンです。機能パネルではこれが 977K と省略されているため、統合では表示ラベルが生の値であると仮定するのではなく、ライブのプラットフォーム制限を使用する必要があります。

シンキングモードはデフォルトで有効ですか?

はい。モデルページでは、シンキングモードはデフォルトで有効であり、アプリケーションがより直接的な応答を必要とする場合にはオフに切り替え可能であると説明されています。

出典

おすすめ記事