Qwen3.8-Max API クイックスタート: OpenAI 互換セットアップ、cURL、Python

Qwen3.8-Max API クイックスタート: OpenAI 互換セットアップ、cURL、Python

Qwen3.8-Max は、Novita AI でモデル ID qwen/qwen3.8-max として利用できます。OpenAI 互換のアクセスは https://api.novita.ai/openai、コンテキストウィンドウは 1,000,000 トークン、最大出力トークンは 131,072 です。クイックスタートの答えをひとつ挙げるとすれば、チャット、エージェント、コーディングのワークフローが非常に大きな保持コンテキストから本当に恩恵を受ける場合にこれを使い、そのうえで、長いプロンプト、ツール利用、マルチモーダル入力へ規模を拡大する前に、まずは小さなテキストのみのリクエストから始めてください。提供状況と料金の概要は、Qwen3.8-Max on Novita AI: 2.4T MoE, 1M Context, and Launch Pricing を参照してください。そもそもこのモデルが最適かどうかを判断している場合は、Open Source LLM Leaderboard for Coding Agents in 2026 で代替モデルと比較してください。

Qwen3.8-Max API セットアップ

まず、次の4つの設定項目から始めます。

項目
API キー Novita AI API キーを NOVITA_API_KEY に保存する
OpenAI 互換ベース URL https://api.novita.ai/openai
Chat completions エンドポイント POST https://api.novita.ai/openai/v1/chat/completions
モデル ID qwen/qwen3.8-max

シェルでキーをエクスポートします:

export NOVITA_API_KEY="your_api_key"

すでに OpenAI SDK を使用している場合、統合の変更は小さくて済みます。クライアントコードを維持し、ベース URL を Novita AI に向けて、モデルを qwen/qwen3.8-max に切り替えるだけです。

Qwen3.8-Max の料金、制限、機能

コードでは正確なモデル ID を使用してください。ユーザー向けの表記では、表示名「Qwen3.8 Max」を使用します。

フィールド 現在の Novita の値
表示名 Qwen3.8 Max
API モデル ID qwen/qwen3.8-max
モデルファミリー Qwen
モデルページの説明 コーディングと知識作業向けの 2.4T パラメータ MoE フラッグシップ
エンドポイントファミリー chat/completions, anthropic, responses
入力モダリティ テキスト、画像、動画
出力モダリティ テキスト
コンテキストウィンドウ 1,000,000 トークン
最大出力トークン 131,072
機能 サーバーレス API、推論、構造化出力、関数呼び出し
表示されているレート階層 T1 30 RPM / 50,000,000 TPM から T5 6000 RPM / 50,000,000 TPM まで

2026年8月5日 時点で、Novita は qwen/qwen3.8-max の価格を次のように掲載しています:

トークンの種類 掲載価格
入力トークン 1Mトークンあたり $2
キャッシュ読み取り入力トークン 1Mトークンあたり $0.25
出力トークン 1Mトークンあたり $6

これらの数値は計画には十分ですが、盲目的な予算管理には向いていません。1M コンテキストのモデルは、過度に大きなプロンプトを繰り返し送信したり、完了を長く実行させたりすると、すぐに高コストになる可能性があります。本番リリースや顧客向けのコストコミットの前に、Qwen3.8 Max モデルページNovita AI 料金ページ を再確認してください。

最初の cURL リクエスト

まず、短いテキストのみのリクエストから始めます。これにより、ツール呼び出し、画像、長いプロンプトを扱う前に、認証、ルーティング、レスポンス解析を確認できます。

curl "https://api.novita.ai/openai/v1/chat/completions" \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${NOVITA_API_KEY}" \
  -d '{
    "model": "qwen/qwen3.8-max",
    "messages": [
      {
        "role": "system",
        "content": "You are a concise engineering assistant."
      },
      {
        "role": "user",
        "content": "Summarize the main risks in a multi-repository API migration in 5 bullet points."
      }
    ],
    "temperature": 0.2,
    "max_tokens": 400
  }'

成功したレスポンスは、choicesmessage.contentusage を含む標準的な chat completions 形式を返します。

このスモークテストで以下を確認してください:

  • API キーが有効であること
  • モデル ID が受け入れられること
  • クライアントが choices[0].message.content を読み取ること
  • 最初からトークン使用量をログに記録していること

Python の例

OpenAI Python SDK は、Novita のベース URL を設定することで Novita AI で動作します:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["NOVITA_API_KEY"],
    base_url="https://api.novita.ai/openai",
)

response = client.chat.completions.create(
    model="qwen/qwen3.8-max",
    messages=[
        {"role": "system", "content": "You are a concise engineering assistant."},
        {
            "role": "user",
            "content": "Review this rollout plan and point out the first three operational risks to test."
        },
    ],
    temperature=0.2,
    max_tokens=400,
)

print(response.choices[0].message.content)
print(response.usage)

本番環境では max_tokens を明示的に指定してください。Qwen3.8-Max は非常に長い回答を生成できるため、困難なタスクには有用ですが、完了に制約を設けないとコスト超過しやすくなります。

チャットワークフローパターン

チャット製品の場合、Qwen3.8-Max は、会話履歴が本当に大きい場合や、アシスタントが複数の長いドキュメントを作業メモリに保持する必要がある場合に最も役立ちます。ワークロードが短い Q&A や軽量なサポートであれば、より小さなモデルの方が安価で調整しやすい場合があります。

実用的なチャット展開パターンは次のとおりです:

  1. テキストのみのプロンプトと控えめな max_tokens 上限から始めます。
  2. 実際のシステムプロンプトとポリシーテキストを追加します。
  3. 理論上の 1M 上限ではなく、実際の製品を反映した長い履歴の会話をテストします。
  4. 使用を拡大する前に、レイテンシ、切り詰め動作、平均完了長を測定します。

避けるべき重要な間違いは、1M コンテキストウィンドウを容量の上限ではなく目標として扱うことです。大きなコンテキストは、情報の損失を防ぐ場合に有用です。自動的に効率的になるわけではありません。

エージェントワークフローパターン

Novita は関数呼び出しと構造化出力をサポート機能として掲載しており、Qwen3.8-Max はツール選択と大きな保持状態を必要とするエージェントワークフローの有力な候補です。

モデルが文章で答えるのではなくアクションを選択すべき場合は、関数呼び出しを使用します:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["NOVITA_API_KEY"],
    base_url="https://api.novita.ai/openai",
)

tools = [
    {
        "type": "function",
        "function": {
            "name": "search_repo",
            "description": "Search a repository for files or symbols.",
            "parameters": {
                "type": "object",
                "properties": {
                    "query": {"type": "string"},
                    "path": {"type": "string"}
                },
                "required": ["query"]
            }
        }
    }
]

response = client.chat.completions.create(
    model="qwen/qwen3.8-max",
    messages=[
        {"role": "system", "content": "You are a repository analysis agent."},
        {
            "role": "user",
            "content": "Find where retry backoff is implemented and identify any hard-coded sleep values."
        },
    ],
    tools=tools,
    tool_choice="auto",
    temperature=0.1,
)

message = response.choices[0].message
print(message.tool_calls or message.content)

Qwen3.8-Max は、すべてのエージェントにとって適切なデフォルトではありません。エージェントが大きな issue スレッド、設計メモ、リポジトリの要約、長いツールトレースをコンテキストに保持する必要がある場合に最適です。エージェントが主に短いタスクをタイトなツールループで処理する場合は、より安価なモデルも併せてテストしてください。

コーディングワークフローパターン

コーディングタスクでは、Qwen3.8-Max は汎用のデフォルトではなく、長文コンテキストに特化した専門モデルとして扱うのが最適です。リポジトリ規模、アーキテクチャメモ、以前のパッチ、テスト失敗をすべて同時に視野に入れておく必要がある場合に最も適しています。

次のようなワークロードに使用します:

  • リポジトリ全体のリファクタリング計画
  • 大規模な PR レビューと要約
  • 多数のファイルにまたがるデバッグ
  • 長い設計ドキュメントを使った移行分析
  • 多くの周辺コンテキストに依存するコード生成タスク

最初に使うシンプルなコーディングプロンプト:

Review this service boundary change, identify the breaking API risks, and propose the smallest safe patch sequence before writing code.

生の API 呼び出しではなくターミナルエージェントのセットアップを希望する場合は、このモデルを How to Use Codex with Novita AI Models: Complete Setup Guide と組み合わせてください。Qwen に焦点を当てたコーディングエンドポイントの比較については、Qwen3 Coder Next API on Novita AI for Coding Agents を参照してください。

マルチモーダル入力

Novita は、Qwen3.8-Max の入力モダリティとしてテキスト、画像、動画をサポートしています。つまり、同じモデルファミリーを通じて、スクリーンショットレビュー、ドキュメント理解、動画対応分析などのワークフローをテストできます。

OpenAI 互換のメッセージ形式を使用した基本的な画像入力の例:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["NOVITA_API_KEY"],
    base_url="https://api.novita.ai/openai",
)

response = client.chat.completions.create(
    model="qwen/qwen3.8-max",
    messages=[
        {"role": "system", "content": "You are a UI review assistant."},
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": "Describe the most obvious usability issues in this dashboard screenshot."
                },
                {
                    "type": "image_url",
                    "image_url": {"url": "https://example.com/dashboard.png"}
                }
            ]
        }
    ],
    max_tokens=500,
)

print(response.choices[0].message.content)

マルチモーダル入力は、テキストのみのベースラインとは別にテストしてください。ペイロードのサポートはエンドポイントファミリーやクライアントライブラリのバージョンによって異なる場合があるため、配布を予定している正確なリクエスト形状を検証してください。

よくある間違い

最も一般的なセットアップエラーは単純です:

  • qwen/qwen3.8-max ではなく表示名を使ってしまうこと
  • SDK を間違ったベース URL に向けてしまうこと
  • 小さなリクエストが機能することを確認する前に巨大なプロンプトを送信してしまうこと
  • 長文コンテキストモデルで max_tokens を制約なしのままにしておくこと
  • 掲載されているコンテキスト上限が、すべてのタスクでほぼ最大のコンテキストを使うべきという意味だと想定していること

5つ目の間違いは、通常、本番環境で最も損害が大きいものです。大きなウィンドウは重要なコンテキストを保持できますが、プロンプトの予算管理の必要性をなくすわけではありません。

本番環境チェックリスト

Qwen3.8-Max に実質的なトラフィックを流す前に、次のケースをテストしてください:

  • 認証とレイテンシのベースラインを確認する短いテキストのみのプロンプト
  • 実際の作業サイズでの長文コンテキストプロンプト
  • 正解がツール呼び出しとなる関数呼び出しプロンプト
  • 製品が画像または動画入力を使用する場合のマルチモーダルプロンプト
  • 無効なキー、タイムアウト、過大なリクエストなどの障害ケース

また、次の項目も追跡してください:

  • 平均プロンプトトークン
  • 平均完了トークン
  • 長く安定したプロンプトを再利用する場合のキャッシュ読み取り使用量
  • 想定される並行度でのレイテンシ
  • 合成ベンチマークだけでなく、独自のワークフローでの回答品質

FAQ

Qwen3.8-Max は Novita AI で利用できますか?

はい。2026年8月5日時点で、Novita は Qwen3.8-Max をサーバーレスモデルとして、API モデル ID qwen/qwen3.8-max で掲載しています。

最初に使うべきエンドポイントはどれですか?

POST https://api.novita.ai/openai/v1/chat/completions から始めてください。これは最初のリクエストに最もシンプルで、標準的な OpenAI スタイルのクライアントフローに一致します。

Qwen3.8-Max はツール使用をサポートしていますか?

はい。Novita はモデルページで関数呼び出しと構造化出力をサポート機能として掲載しています。

Qwen3.8-Max はすべてのコーディングタスクに最適なデフォルトですか?

いいえ。ワークフローが非常に大きな保持コンテキストを必要とする場合に最も強力です。より小さなコーディングタスクでは、フラッグシップオプションが自動的に最良の運用上の選択であるとは想定せず、より安価なモデルと比較してください。

おすすめ記事

出典(2026年8月5日確認): Qwen3.8 Max モデルページNovita chat completions API リファレンスNovita ドキュメントインデックス