Ling-3.0-flash 在 Novita AI 上:用于智能体推理的免费 API

Ling-3.0-flash 在 Novita AI 上:用于智能体推理的免费 API

Ling-3.0-flash 现已在 Novita AI Serverless API 上作为 限时免费模型 提供,截至 2026 年 7 月 27 日,输入和输出定价均为 $0。它是一个专为智能体推理构建的文本模型:总参数 1240 亿,每 token 约 51 亿活跃参数,262,144 token 的上下文窗口,支持推理,并通过兼容 OpenAI 的聊天补全工作流实现函数调用。对于测试长时间运行的智能体、工具使用或高容量自动化的开发者来说,直接的吸引力很简单:你可以在当前免费窗口期内免费评估一个大型稀疏模型,无需按 token 付费。

关键要点

  • API 目前免费。 Ling-3.0-flash 模型页面 显示每百万输入 token 和每百万输出 token 均为 $0,并带有截至 2026 年 7 月 27 日的“限时免费”标签。
  • 它是一个高度稀疏的 124B MoE 模型。 每 token 大约有 5.1B 参数活跃,约占参数总数的 4.1%。
  • 它专为智能体推理设计。 Novita 的模型列表强调 token 效率以及在生产规模的智能体工作负载下,在 token、延迟和服务成本约束下的表现。
  • 托管 API 支持长上下文和工具使用。 当前列表显示上下文窗口为 262,144 token,最大输出为 32,768 token,支持推理和函数调用。
  • 将免费价格视为评估窗口,而非永久承诺。 在估算生产成本或向用户承诺免费服务之前,请查看实时模型页面。

什么是 Ling-3.0-flash?

Ling-3.0-flash 是 InclusionAI 的一个稀疏混合专家语言模型。它不是为每个 token 激活所有 124B 参数,而是将每个 token 路由到大约 5.1B 的活跃参数。这种架构旨在保留大型模型的能力,同时限制每个推理步骤使用的计算量。

该模型在 Novita AI 上的当前描述侧重于一个实际目标,而非基准测试的标题:在 token、延迟和服务成本预算有限的情况下,完成更多有用的工作。这种定位使其特别适用于智能体系统,在该系统中,一个用户操作可能触发多个模型调用、工具调用、规划步骤和验证步骤。

Ling-3.0-flash 不应与 Ling-2.6-flash 混淆。新模型将总参数从 104B 增加到 124B,同时将活跃参数从 7.4B 减少到约 5.1B。两个模型都在 Novita AI 上提供长上下文,但 Ling-3.0-flash 在当前托管功能集中增加了推理支持,并以限时免费的 API 价格推出。

Ling-3.0-flash 如何在 Novita AI 上可用?

Novita AI 将 Ling-3.0-flash 作为无服务器文本生成模型托管。确切的模型 ID 是 inclusionai/ling-3.0-flash,支持的端点系列是聊天补全。该服务使用与 Novita 的 LLM 目录中相同的兼容 OpenAI 的请求模式,因此团队可以在无需创建专属部署或管理推理硬件的情况下评估模型。

截至 2026 年 7 月 27 日,该模型定价为 每百万输入 token $0,每百万输出 token $0。模型页面还将该优惠标记为 ** 限时免费**。这一区别很重要:Ling-3.0-flash 现在可以免费调用,但列表并未承诺价格将无限期保持为零。

最安全的做法是将此阶段视为收集自身证据的机会。运行代表性的智能体追踪,记录 token 使用和延迟,测试函数调用的可靠性,并将答案质量与当前模型进行比较。如果以后价格发生变化,你将拥有足够的数据来决定该模型是否仍适合该工作负载。

Ling-3.0-flash 规格与定价

字段 当前详情
显示名称 Ling-3.0-flash
模型 ID inclusionai/ling-3.0-flash
架构 124B 参数混合专家模型;每 token 约 5.1B 活跃参数
访问方式 Serverless API
API 格式 兼容 OpenAI 的聊天补全
基础 URL https://api.novita.ai/openai
端点 通过兼容 OpenAI 的基础 URL 使用 /v1/chat/completions
上下文窗口 262,144 token
最大输出 32,768 token
模态 文本输入和文本输出
托管功能 推理和函数调用
输入价格 每 1M token $0,限时免费
输出价格 每 1M token $0,限时免费
最佳适用场景 智能体评估、长上下文自动化、工具使用工作流、成本敏感型实验

模型可用性、规格、定价和 API 详情已于 2026 年 7 月 27 日根据 Novita AI 模型页面LLM API 文档 进行验证。

当前模型列表未提供 Ling-3.0-flash 的公开基准测试包、吞吐量保证或详细的训练报告。因此,本文不为其分配智能排名,也不声称其优于其他模型。对于生产选型,请使用你自己的提示和工具进行测试,而不是仅凭参数数量推断质量。

其价格与类似 MoE 模型相比如何?

Ling-3.0-flash 的不同之处在于其当前托管 token 价格为零。为了进行比“免费与付费”更有用的比较,下表包含了来自 Novita AI 实时目录中具有相似总参数或相似低活跃参数设计的稀疏模型。

Novita AI 上的模型 总参数 / 活跃参数 上下文 每 1M token 输入价格 每 1M token 输出价格
Ling-3.0-flash 124B / ~5.1B 262,144 $0.00 $0.00
Qwen3.5-122B-A10B 122B / 10B 262,144 $0.40 $3.20
Qwen3-Next-80B-A3B-Instruct 80B / ~3B 131,072 $0.15 $1.50
Ling-2.6-flash 104B / 7.4B 262,144 $0.10 $0.30

价格和托管限制于 2026 年 7 月 27 日根据 Novita AI 的实时模型列表进行核对。Ling-3.0-flash 被标记为限时免费,因此其行是快照,而非永久定价保证。

该表并未确定哪个模型“最好”。Qwen3.5-122B-A10B 在 Novita AI 上提供更大的最大输出限额和原生视觉能力。Qwen3-Next-80B-A3B-Instruct 是一个较小的稀疏模型,在当前列表中支持结构化输出。Ling-2.6-flash 有成熟的产品历史,即使在免费促销之外也保持廉价。Ling-3.0-flash 是目前在价格上最容易评估的模型,但能力和可靠性仍需针对特定工作负载进行测试。

为什么 124B/5.1B MoE 设计很重要?

总参数数和活跃参数数描述了 MoE 模型的不同部分。124B 的总数代表了模型整体的专家容量。大约 5.1B 的活跃数描述了为单个 token 选择了专家网络的多少部分。

对于开发者来说,重点不在于 5.1B 活跃参数会自动使模型变快。实际的 API 延迟还取决于服务硬件、批处理、提示长度、输出长度和平台负载。有用的信号是,Ling-3.0-flash 是围绕稀疏激活和 token 效率设计的,而不是为每个 token 运行整个参数集。

这种设计在智能体循环时尤其相关。一个支持智能体可能分类请求、检索上下文、调用工具、检查结果并起草响应。一个编码智能体可能搜索仓库、计划更改、编辑文件、运行测试并修复故障。在这两种情况下,一个“任务”的成本和延迟分布在多个推理轮次中。一个为高效重复推理设计的模型可能比一个仅针对单次响应优化的模型更有价值。

开发者可以用 Ling-3.0-flash 构建什么?

使用工具的助手

函数调用使 Ling-3.0-flash 成为选择工具、生成参数、检查工具结果并继续工作流的助手的候选。示例包括客户支持路由、账户查询、内部知识检索和运营仪表板。

长上下文文档工作流

262,144 token 的上下文窗口可以为合同审查、研究综合、转录分析或多文档提取提供大量工作上下文。大上下文窗口不能替代检索设计,但它为团队提供了更多空间来保留任务中的指令和相关证据。

编码和仓库智能体

推理和函数调用是代码搜索和代码更改循环的有用基础。Ling-3.0-flash 可能适用于仓库分类、问题分类、迁移规划、测试失败分析或受监督的编码智能体。在允许写入操作之前,尤其是当工具调用可能更改生产系统时,请仔细测试。

高容量评估管道

免费窗口降低了构建评估集的成本。团队可以重放真实提示,比较工具调用格式,检查故障模式,并确定该模型是否值得纳入路由逻辑。这比假设最便宜的模型应立即成为默认模型更好地利用了免费访问。

何时应该使用 Ling-3.0-flash?

当你的工作负载具有以下多个特征时,选择 Ling-3.0-flash 进行评估:

  • 基于文本并使用聊天补全。
  • 需要推理、函数调用或两者兼备。
  • 携带长指令、文档、记忆或工具结果。
  • 一个用户任务可能需要多个模型轮次。
  • 你希望在当前促销期间测试一个大型 MoE 模型而无需按 token 付费。
  • 你可以通过任务完成度、工具准确性、延迟和 token 使用量来衡量成功,而不是依赖公开排行榜。

该模型也是路由实验的实用候选。你可以将较低风险的智能体步骤发送给 Ling-3.0-flash,将结果与付费参考模型进行比较,并仅升级需要不同能力配置的任务。

何时应该选择其他模型?

Ling-3.0-flash 并非每个应用的自动选择。

如果你需要图像或音频输入,请选择其他模型,因为当前托管列表仅支持文本。如果严格的模式生成对你的生产合同至关重要,请考虑一个支持结构化输出的模型;Ling-3.0-flash 当前列出函数调用但未列出结构化输出。当你需要独立发布的基准证据、特定的延迟服务水平或长期预算的稳定付费价格时,其他模型也可能更可取。

32,768 token 的最大输出对于许多智能体任务来说已经足够,但低于某些当前长上下文模型的输出限制。如果你的应用经常在一次调用中生成非常大的工件,请在迁移前比较输出上限。

最后,不要构建一个依赖 API 保持免费的业务模型。零价格明确是限时的。生产规划应包括后备模型、路由控制以及在发布前进行最新的价格检查。

如何适应现有的 API 工作流?

Ling-3.0-flash 使用 Novita AI 的兼容 OpenAI 的 LLM 接口。在高级别上,现有的聊天补全应用需要三个配置值:

  1. 一个 Novita AI API 密钥。
  2. 兼容 OpenAI 的基础 URL:https://api.novita.ai/openai
  3. 模型 ID:inclusionai/ling-3.0-flash

然后请求通过聊天补全端点发送。对于工具使用工作流,可以包含函数定义,并且推理行为应使用你计划在生产中使用的相同提示和任务级检查进行评估。

本发布概述有意在集成边界处停止。它不包含完整的 SDK 教程、请求示例、参数调优或故障排除步骤;这些内容属于专门的快速入门指南。

结论

如果你正在构建基于文本的智能体,并且需要一个具有长上下文、推理和函数调用的大型稀疏模型,那么 Ling-3.0-flash 值得测试。当前限时免费价格消除了严肃评估的 token 成本障碍,而 124B 总参数和 5.1B 活跃参数的架构赋予了该模型清晰的效率导向设计。

正确的做法是利用免费窗口收集证据,而非做出假设。测量完整的智能体任务,包括重试和工具失败。将输出质量和延迟与你已在堆栈中信任的模型进行比较。在生产部署前确认实时价格。如果 Ling-3.0-flash 在这些测试中表现良好,Novita AI 提供了一个简单的无服务器路径,将其添加到兼容 OpenAI 的工作流中。

在 Novita AI 上评估 Ling-3.0-flash

常见问题

Ling-3.0-flash API 免费吗?

是的,截至 2026 年 7 月 27 日。Novita AI 将输入和输出均列为每百万 token $0,并将模型标记为“限时免费”。使用前请查看实时模型页面,因为促销活动可能发生变化。

Ling-3.0-flash 的模型 ID 是什么?

确切的 Novita AI 模型 ID 是 inclusionai/ling-3.0-flash

Ling-3.0-flash 有多大?

它是一个 124B 参数的混合专家模型,每 token 大约激活 5.1B 参数。

Ling-3.0-flash 支持什么上下文窗口?

当前的 Novita AI 列表显示上下文窗口为 262,144 token,最大输出为 32,768 token。

Ling-3.0-flash 支持函数调用吗?

是的。Novita AI 当前将函数调用和推理列为支持的功能。未列出结构化输出,因此请在你自己的测试中验证任何严格的 JSON 或模式要求。

Ling-3.0-flash 是多模态模型吗?

在当前的 Novita AI 端点上不是。托管列表显示文本输入和文本输出。

Ling-3.0-flash 比 Qwen3.5-122B-A10B 更好吗?

没有足够的经过验证的公开证据来做出一般的质量声明。Ling-3.0-flash 目前免费,每 token 激活的参数更少,而 Qwen3.5-122B-A10B 在 Novita AI 上支持视觉、结构化输出和更高的最大输出限制。请根据具体工作负载评估进行选择。

推荐文章