Qwen3.8-Max 已在 Novita AI 上線,模型 ID 為 qwen/qwen3.8-max,可透過 https://api.novita.ai/openai 以 OpenAI 相容的方式存取,提供 1,000,000 個 token 的上下文視窗,以及 131,072 個 token 的最大輸出上限。如果您想要一個快速入門的答案:當您的聊天、代理或程式碼工作流程確實需要極大的保留上下文時使用它,然後從一個小型的純文字請求開始,再逐步擴展到長提示、工具使用或多模態輸入。關於更廣泛的可用性和定價概覽,請參閱 Qwen3.8-Max on Novita AI: 2.4T MoE, 1M Context, and Launch Pricing。
Qwen3.8-Max API 設定
從四個配置項目開始:
| 項目 | 值 |
|---|---|
| API 金鑰 | 將 Novita AI API 金鑰儲存在 NOVITA_API_KEY 中 |
| OpenAI 相容的基礎 URL | https://api.novita.ai/openai |
| 聊天完成端點 | POST https://api.novita.ai/openai/v1/chat/completions |
| 模型 ID | qwen/qwen3.8-max |
在您的 shell 中匯出金鑰:
export NOVITA_API_KEY="your_api_key"
如果您已經在使用 OpenAI SDK,整合的變更很小:保留您的客戶端程式碼,將基礎 URL 指向 Novita AI,然後將模型切換為 qwen/qwen3.8-max。
Qwen3.8-Max 定價、限制與功能
在程式碼中使用確切的模型 ID。在面向使用者的文案中,使用顯示名稱「Qwen3.8 Max」。
| 欄位 | 目前的 Novita 值 |
|---|---|
| 顯示名稱 | Qwen3.8 Max |
| API 模型 ID | qwen/qwen3.8-max |
| 模型家族 | Qwen |
| 模型頁面上的描述 | 2.4T 參數 MoE 旗艦模型,專為程式碼和知識工作設計 |
| 端點家族 | chat/completions、anthropic、responses |
| 輸入模態 | 文字、圖片、影片 |
| 輸出模態 | 文字 |
| 上下文視窗 | 1,000,000 個 token |
| 最大輸出 token | 131,072 |
| 功能 | 無伺服器 API、推理、結構化輸出、函數呼叫 |
| 顯示的速率層級 | T1 30 RPM / 50,000,000 TPM 至 T5 6000 RPM / 50,000,000 TPM |
根據 2026 年 8 月 5 日 的檢查,Novita 為 qwen/qwen3.8-max 列出以下價格:
| Token 類型 | 列出的價格 |
|---|---|
| 輸入 token | 每 1M 個 token 2 美元 |
| 快取讀取輸入 token | 每 1M 個 token 0.25 美元 |
| 輸出 token | 每 1M 個 token 6 美元 |
這些數字足夠用於規劃,但不足以用於盲目預算。一個 1M 上下文的模型,如果您反覆重新發送過大的提示或讓完成執行時間過長,很快就會變得昂貴。在任何生產環境上線或做出面向客戶的成本承諾之前,請重新檢查 Qwen3.8 Max 模型頁面 和 Novita AI 定價頁面。
第一個 cURL 請求
從一個簡短的純文字請求開始。這可以確認身份驗證、路由和回應解析,然後再涉及工具呼叫、圖片或長提示。
curl "https://api.novita.ai/openai/v1/chat/completions" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${NOVITA_API_KEY}" \
-d '{
"model": "qwen/qwen3.8-max",
"messages": [
{
"role": "system",
"content": "You are a concise engineering assistant."
},
{
"role": "user",
"content": "Summarize the main risks in a multi-repository API migration in 5 bullet points."
}
],
"temperature": 0.2,
"max_tokens": 400
}'
一個成功的回應會回傳標準的聊天完成格式,包含 choices、message.content 和 usage。
使用這個冒煙測試來驗證:
- API 金鑰有效
- 模型 ID 被接受
- 您的客戶端讀取
choices[0].message.content - 您從一開始就記錄 token 使用量
Python 範例
OpenAI Python SDK 在您設定 Novita 基礎 URL 後,即可與 Novita AI 搭配使用:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["NOVITA_API_KEY"],
base_url="https://api.novita.ai/openai",
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max",
messages=[
{"role": "system", "content": "You are a concise engineering assistant."},
{
"role": "user",
"content": "Review this rollout plan and point out the first three operational risks to test."
},
],
temperature=0.2,
max_tokens=400,
)
print(response.choices[0].message.content)
print(response.usage)
在生產環境中務必明確設定 max_tokens。Qwen3.8-Max 可以產生非常長的答案,這對於困難的任務很有用,但如果您讓完成執行不受限制,則很容易超支。
聊天工作流程模式
對於聊天產品,Qwen3.8-Max 在對話歷史記錄確實很大,或者助理必須在工作記憶中保留幾個長文件時最為有用。如果您的工作負載是簡短的問答或輕量級支援,那麼較小的模型可能更便宜且更容易調整。
一個實用的聊天推廣模式如下:
- 從純文字提示和適度的
max_tokens上限開始。 - 加入您真實的系統提示和政策文字。
- 測試反映您實際產品的長歷史對話,而不是理論上的 1M 最大值。
- 在擴展使用量之前,測量延遲、截斷行為和平均完成長度。
要避免的主要錯誤是將 1M 上下文視窗視為目標,而不是容量上限。大的上下文在防止資訊遺失時很有用。它並不會自動變得有效率。
代理工作流程模式
Novita 列出函數呼叫和結構化輸出為支援的功能,這使得 Qwen3.8-Max 成為需要工具選擇和大量保留狀態的代理工作流程的合理候選。
當模型應該選擇一個動作而不是用散文回答時,請使用函數呼叫:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["NOVITA_API_KEY"],
base_url="https://api.novita.ai/openai",
)
tools = [
{
"type": "function",
"function": {
"name": "search_repo",
"description": "Search a repository for files or symbols.",
"parameters": {
"type": "object",
"properties": {
"query": {"type": "string"},
"path": {"type": "string"}
},
"required": ["query"]
}
}
}
]
response = client.chat.completions.create(
model="qwen/qwen3.8-max",
messages=[
{"role": "system", "content": "You are a repository analysis agent."},
{
"role": "user",
"content": "Find where retry backoff is implemented and identify any hard-coded sleep values."
},
],
tools=tools,
tool_choice="auto",
temperature=0.1,
)
message = response.choices[0].message
print(message.tool_calls or message.content)
Qwen3.8-Max 並不是每個代理的預設最佳選擇。當代理必須在上下文中保留大量問題討論串、設計筆記、儲存庫摘要或長工具軌跡時,它是一個強大的選擇。如果代理主要處理具有緊密工具迴圈的簡短任務,請同時測試一個更便宜的模型。
程式碼工作流程模式
對於程式碼任務,Qwen3.8-Max 最好被視為一個長上下文專家,而不是一個通用的預設選擇。當儲存庫規模、架構筆記、先前的修補程式和測試失敗都需要同時被考量時,它最有意義。
將其用於以下工作負載:
- 儲存庫範圍的重構規劃
- 大型 PR 審查和摘要
- 跨多個檔案的除錯
- 包含長設計文件的遷移分析
- 依賴大量周圍上下文的程式碼生成任務
一個簡單的起始程式碼提示:
Review this service boundary change, identify the breaking API risks, and propose the smallest safe patch sequence before writing code.
如果您想要一個終端機代理設定而不是原始 API 呼叫,請將此模型與 How to Use Codex with Novita AI Models: Complete Setup Guide 配對使用。如需針對 Qwen 的程式碼端點比較,請參閱 Qwen3 Coder Next API on Novita AI for Coding Agents。
多模態輸入
Novita 將文字、圖片和影片列為 Qwen3.8-Max 支援的輸入模態。這意味著您可以透過相同的模型系列測試諸如螢幕截圖審查、文件理解或影片感知分析等工作流程。
一個使用 OpenAI 相容訊息格式的基本圖片輸入範例:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["NOVITA_API_KEY"],
base_url="https://api.novita.ai/openai",
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max",
messages=[
{"role": "system", "content": "You are a UI review assistant."},
{
"role": "user",
"content": [
{
"type": "text",
"text": "Describe the most obvious usability issues in this dashboard screenshot."
},
{
"type": "image_url",
"image_url": {"url": "https://example.com/dashboard.png"}
}
]
}
],
max_tokens=500,
)
print(response.choices[0].message.content)
將多模態輸入與您的純文字基準分開測試。端點系列和客戶端函式庫版本可能會影響負載支援,因此請驗證您計劃上線的確切請求格式。
常見錯誤
最常見的設定錯誤很直接:
- 使用顯示名稱而不是
qwen/qwen3.8-max - 將 SDK 指向錯誤的基礎 URL
- 在確認小型請求可行之前,就發送巨大的提示
- 在長上下文模型上未限制
max_tokens - 假設公佈的上下文限制意味著每個任務都應該使用接近最大值的上下文
第五個錯誤通常在生產環境中最為棘手。一個大的視窗讓您能夠保留重要的上下文。它並不能消除提示預算管理的需求。
生產環境檢查清單
在您將重要的流量導向 Qwen3.8-Max 之前,請測試以下情況:
- 用於身份驗證和延遲基準的短純文字提示
- 您實際工作規模的長上下文提示
- 正確答案為工具呼叫的函數呼叫提示
- 如果您的產品使用圖片或影片輸入,則進行多模態提示測試
- 失敗情況,例如無效金鑰、逾時或請求過大
同時追蹤:
- 平均提示 token 數
- 平均完成 token 數
- 如果您重複使用長且穩定的提示,則追蹤快取讀取使用量
- 在您預期並發層級下的延遲
- 在您自己的工作流程上的答案品質,而不僅僅是合成基準
常見問題
Qwen3.8-Max 可以透過 Novita AI 使用嗎?
可以。根據 2026 年 8 月 5 日的檢查,Novita 將 Qwen3.8-Max 列為無伺服器模型,API 模型 ID 為 qwen/qwen3.8-max。
我應該先使用哪個端點?
從 POST https://api.novita.ai/openai/v1/chat/completions 開始。這是第一個請求最簡單的路徑,並且符合標準的 OpenAI 風格客戶端流程。
Qwen3.8-Max 支援工具使用嗎?
支援。Novita 在模型頁面上將函數呼叫和結構化輸出列為支援的功能。
Qwen3.8-Max 是每個程式碼任務的最佳預設選擇嗎?
不是。當工作流程需要非常大的保留上下文時,它是最強大的。對於較小的程式碼任務,您應該將其與更便宜的模型進行比較,而不是假設旗艦選項自動是最佳的營運選擇。
推薦文章
- Qwen3.8-Max on Novita AI: 2.4T MoE, 1M Context, and Launch Pricing
- Qwen3 Coder Next API on Novita AI for Coding Agents
- How to Use Codex with Novita AI Models: Complete Setup Guide
資料來源檢查日期:2026 年 8 月 5 日:Qwen3.8 Max 模型頁面、Novita 聊天完成 API 參考、Novita 文件索引
