Qwen3.8-Max 聊天、智能体与编码工作流快速入门

Qwen3.8-Max 聊天、智能体与编码工作流快速入门

Qwen3.8-Max 已在 Novita AI 上线,模型 ID 为 qwen/qwen3.8-max,通过 https://api.novita.ai/openai 提供 OpenAI 兼容访问,上下文窗口为 1,000,000 个 token,最大输出上限为 131,072 个 token。如果你想要一个快速入门答案:当你的聊天、智能体或编码工作流确实受益于超大的保留上下文时使用它,然后从一个小的纯文本请求开始,再扩展到长提示、工具调用或多模态输入。有关更广泛的可用性和定价概述,请参阅 Qwen3.8-Max 在 Novita AI 上:2.4T MoE、1M 上下文与发布定价

Qwen3.8-Max API 设置

从四部分配置开始:

字段
API 密钥 将 Novita AI API 密钥存储在 NOVITA_API_KEY
OpenAI 兼容基础 URL https://api.novita.ai/openai
聊天补全端点 POST https://api.novita.ai/openai/v1/chat/completions
模型 ID qwen/qwen3.8-max

在 shell 中导出密钥:

export NOVITA_API_KEY="your_api_key"

如果你已经在使用 OpenAI SDK,集成的改动很小:保留客户端代码,将基础 URL 指向 Novita AI,并将模型切换为 qwen/qwen3.8-max

Qwen3.8-Max 定价、限制与特性

在代码中使用确切的模型 ID。在面向用户的文案中使用显示名称 “Qwen3.8 Max”。

字段 当前 Novita 值
显示名称 Qwen3.8 Max
API 模型 ID qwen/qwen3.8-max
模型系列 Qwen
模型页面描述 2.4T 参数的 MoE 旗舰模型,适用于编码和知识工作
端点系列 chat/completionsanthropicresponses
输入模态 文本、图像、视频
输出模态 文本
上下文窗口 1,000,000 个 token
最大输出 token 数 131,072
特性 Serverless API、推理、结构化输出、函数调用
显示的速率级别 T1 30 RPM / 50,000,000 TPM 至 T5 6000 RPM / 50,000,000 TPM

截至 2026 年 8 月 5 日 ,Novita 列出了 qwen/qwen3.8-max 的以下价格:

Token 类型 标价
输入 tokens $2 每 1M tokens
缓存读取输入 tokens $0.25 每 1M tokens
输出 tokens $6 每 1M tokens

这些数字足以用于规划,但不适合盲目预算。如果你反复发送过大的提示或让补全运行很长时间,1M 上下文的模型可能会迅速变得昂贵。在任何生产发布或面向客户的成本承诺之前,请重新查看 Qwen3.8 Max 模型页面Novita AI 定价页面

第一个 cURL 请求

从一个简短的纯文本请求开始。这可以在你涉及工具调用、图像或长提示之前,确认认证、路由和响应解析。

curl "https://api.novita.ai/openai/v1/chat/completions" \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${NOVITA_API_KEY}" \
  -d '{
    "model": "qwen/qwen3.8-max",
    "messages": [
      {
        "role": "system",
        "content": "You are a concise engineering assistant."
      },
      {
        "role": "user",
        "content": "Summarize the main risks in a multi-repository API migration in 5 bullet points."
      }
    ],
    "temperature": 0.2,
    "max_tokens": 400
  }'

成功响应返回标准的聊天补全结构,包括 choicesmessage.contentusage

使用此冒烟测试来验证:

  • API 密钥是否有效
  • 模型 ID 是否被接受
  • 客户端是否正确读取 choices[0].message.content
  • 是否从一开始就记录 token 用量

Python 示例

当你设置 Novita 基础 URL 时,OpenAI Python SDK 可以与 Novita AI 配合使用:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["NOVITA_API_KEY"],
    base_url="https://api.novita.ai/openai",
)

response = client.chat.completions.create(
    model="qwen/qwen3.8-max",
    messages=[
        {"role": "system", "content": "You are a concise engineering assistant."},
        {
            "role": "user",
            "content": "Review this rollout plan and point out the first three operational risks to test."
        },
    ],
    temperature=0.2,
    max_tokens=400,
)

print(response.choices[0].message.content)
print(response.usage)

在生产环境中,请显式设置 max_tokens。Qwen3.8-Max 可以生成非常长的答案,这对困难任务很有用,但如果让补全不受限制,很容易超支。

聊天工作流模式

对于聊天产品,当对话历史确实很大,或者助手必须在工作记忆中保留多份长文档时,Qwen3.8-Max 最为有用。如果你的工作负载是简短问答或轻量级支持,较小的模型可能更便宜且更容易调优。

一个实用的聊天发布模式如下:

  1. 从纯文本提示和适度的 max_tokens 上限开始。
  2. 添加真实的系统提示和策略文本。
  3. 测试反映实际产品的长历史对话,而不是理论上的 1M 上限。
  4. 在扩大使用之前,测量延迟、截断行为和平均补全长度。

需要避免的关键错误是,把 1M 上下文窗口当作目标,而不是容量上限。大上下文在防止信息丢失时很有用,但它并不天然高效。

智能体工作流模式

Novita 将函数调用和结构化输出列为支持的特性,这使得 Qwen3.8-Max 成为需要工具选择和大量保留状态的智能体工作流的合理候选。

当模型应该选择操作而不是用散文回答时,请使用函数调用:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["NOVITA_API_KEY"],
    base_url="https://api.novita.ai/openai",
)

tools = [
    {
        "type": "function",
        "function": {
            "name": "search_repo",
            "description": "Search a repository for files or symbols.",
            "parameters": {
                "type": "object",
                "properties": {
                    "query": {"type": "string"},
                    "path": {"type": "string"}
                },
                "required": ["query"]
            }
        }
    }
]

response = client.chat.completions.create(
    model="qwen/qwen3.8-max",
    messages=[
        {"role": "system", "content": "You are a repository analysis agent."},
        {
            "role": "user",
            "content": "Find where retry backoff is implemented and identify any hard-coded sleep values."
        },
    ],
    tools=tools,
    tool_choice="auto",
    temperature=0.1,
)

message = response.choices[0].message
print(message.tool_calls or message.content)

Qwen3.8-Max 并不是每个智能体的正确默认选择。当智能体必须在上下文中保留大型 issue 线程、设计说明、仓库摘要或长工具轨迹时,它非常适合。如果智能体主要处理短任务且工具循环紧凑,请同时测试更便宜的模型。

编码工作流模式

对于编码任务,最好将 Qwen3.8-Max 视为长上下文专家,而不是通用默认选择。当仓库规模、架构说明、先前补丁和测试失败都需要同时保持在视野中时,它最有意义。

将其用于如下工作负载:

  • 仓库级重构规划
  • 大型 PR 审查与总结
  • 跨多个文件的调试
  • 基于长设计文档的迁移分析
  • 依赖大量周围上下文的代码生成任务

一个简单的起始编码提示:

Review this service boundary change, identify the breaking API risks, and propose the smallest safe patch sequence before writing code.

如果你想要终端智能体设置而不是原始 API 调用,可以将此模型与 如何将 Codex 与 Novita AI 模型配合使用:完整设置指南 配合使用。有关专注于 Qwen 的编码端点比较,请参阅 Novita AI 上的 Qwen3 Coder Next API(面向编码智能体)

多模态输入

Novita 将文本、图像和视频列为 Qwen3.8-Max 支持的输入模态。这意味着你可以通过同一模型系列测试截图审查、文档理解或视频感知分析等工作流。

使用 OpenAI 兼容消息格式的基本图像输入示例:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["NOVITA_API_KEY"],
    base_url="https://api.novita.ai/openai",
)

response = client.chat.completions.create(
    model="qwen/qwen3.8-max",
    messages=[
        {"role": "system", "content": "You are a UI review assistant."},
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": "Describe the most obvious usability issues in this dashboard screenshot."
                },
                {
                    "type": "image_url",
                    "image_url": {"url": "https://example.com/dashboard.png"}
                }
            ]
        }
    ],
    max_tokens=500,
)

print(response.choices[0].message.content)

将多模态输入与纯文本基线分开测试。载荷支持可能因端点系列和客户端库版本而异,因此请验证你计划交付的确切请求结构。

常见错误

最常见的设置错误都很直接:

  • 使用显示名称而不是 qwen/qwen3.8-max
  • 将 SDK 指向错误的基础 URL
  • 在确认小请求正常之前发送巨大的提示
  • 在长上下文模型上不限制 max_tokens
  • 假设发布的上下文限制意味着每个任务都应使用接近最大值的上下文

第五个错误通常在生产环境中造成最大的伤害。大窗口让你保留重要上下文,但并不能消除对提示预算规划的需求。

生产检查清单

在将有意义的生产流量路由到 Qwen3.8-Max 之前,请测试以下场景:

  • 用于认证和延迟基线的短纯文本提示
  • 实际工作规模的长上下文提示
  • 正确答案是工具调用的函数调用提示
  • 如果你的产品使用图像或视频输入,则测试多模态提示
  • 失败场景,如无效密钥、超时或超大请求

同时跟踪:

  • 平均提示 tokens
  • 平均补全 tokens
  • 如果你重用长而稳定的提示,则跟踪缓存读取用量
  • 预期并发级别下的延迟
  • 自有工作流上的回答质量,而不仅仅是合成基准

常见问题

Qwen3.8-Max 可以通过 Novita AI 使用吗?

是的。截至 2026 年 8 月 5 日,Novita 将 Qwen3.8-Max 列为 serverless 模型,API 模型 ID 为 qwen/qwen3.8-max

我应该首先使用哪个端点?

POST https://api.novita.ai/openai/v1/chat/completions 开始。这是第一个请求最简单的路径,并且与标准的 OpenAI 风格客户端流程相匹配。

Qwen3.8-Max 是否支持工具使用?

是的。Novita 在模型页面上将函数调用和结构化输出列为支持的特性。

Qwen3.8-Max 是所有编码任务的最佳默认选择吗?

不是。当工作流需要非常大的保留上下文时,它最为强大。对于较小的编码任务,你应该将其与更便宜的模型进行比较,而不是假设旗舰选项自动是最佳运营选择。

推荐阅读

来源检查于 2026 年 8 月 5 日:Qwen3.8 Max 模型页面Novita 聊天补全 API 参考Novita 文档索引