Ling-3.0-flash 在 Novita AI 上:Agentic 推理的免費 API

Ling-3.0-flash 在 Novita AI 上:Agentic 推理的免費 API

Ling-3.0-flash 現已透過 Novita AI 無伺服器 API 提供,作為 限時免費模型,於 2026 年 7 月 27 日列出零輸入與輸出定價。這是一款專為 agentic 推理建構的文字模型:總計 1240 億個參數,每個 token 約有 51 億個活躍參數,262,144 個 token 的上下文視窗,支援推理,並透過相容 OpenAI 的聊天完成工作流程進行函式呼叫。對於測試長時間運行的代理、工具使用或高容量自動化的開發者而言,其立即吸引力很簡單:您可以在當前的免費時段內評估一個大型稀疏模型,而無需為每個 token 付費。

重點摘要

  • API 目前免費。 Ling-3.0-flash 模型頁面 列出每百萬輸入 token 0 美元和每百萬輸出 token 0 美元,並在 2026 年 7 月 27 日標示為「限時免費」。
  • 這是一款高度稀疏的 124B MoE 模型。 每個 token 約有 5.1B 個參數處於活躍狀態,約佔總參數量的 4.1%。
  • 專為 agentic 推理設計。 Novita 的模型列表強調 token 效率以及在 token、延遲和服務成本限制下的生產規模代理工作負載。
  • 託管的 API 支援長上下文和工具使用。 目前的列表顯示 262,144 個 token 的上下文視窗、32,768 個 token 的最大輸出、推理和函式呼叫。
  • 將免費價格視為評估窗口,而非永久承諾。 在估算生產成本或向使用者承諾免費服務之前,請先查看即時模型頁面。

什麼是 Ling-3.0-flash?

Ling-3.0-flash 是來自 InclusionAI 的稀疏混合專家語言模型。它並非對每個 token 啟動所有 124B 個參數,而是將每個 token 路由到約 5.1B 個活躍參數。這種架構旨在保留大型模型的容量,同時限制每次推理步驟使用的計算量。

該模型在 Novita AI 上的描述重點在於一個實際目標,而非基準測試標題:在受限的 token、延遲和服務成本預算內完成更多有用的工作。這個定位使其與代理系統尤為相關,在代理系統中,一個使用者操作可能觸發多次模型呼叫、工具呼叫、規劃步驟和驗證步驟。

Ling-3.0-flash 不應與 Ling-2.6-flash 混淆。新模型將總參數從 104B 增加到 124B,同時將活躍參數從 7.4B 減少到大約 5.1B。兩個模型在 Novita AI 上都提供長上下文,但 Ling-3.0-flash 在當前託管的功能集中增加了推理支援,並以限時免費的 API 價格推出。

Ling-3.0-flash 如何在 Novita AI 上使用?

Novita AI 將 Ling-3.0-flash 作為無伺服器文字生成模型託管。確切模型 ID 是 inclusionai/ling-3.0-flash,支援的端點系列是聊天完成。該服務使用與 Novita 的 LLM 目錄中相同的相容 OpenAI 請求模式,因此團隊無需建立專用部署或管理推理硬體即可評估模型。

截至 2026 年 7 月 27 日,該模型定價為 **每百萬輸入 token 0 美元,每百萬輸出 token 0 美元 。模型頁面也將此優惠標示為 ** 限時免費。這個區別很重要:Ling-3.0-flash 現在可以免費呼叫,但列表並未承諾價格將無限期保持為零。

最安全的生產實踐是將此期間視為收集自身證據的機會。運行代表性的代理軌跡,記錄 token 使用量和延遲,測試函式呼叫的可靠性,並將答案品質與您當前的模型進行比較。如果稍後定價發生變化,您將有足夠的數據來決定該模型是否仍適用於該工作負載。

Ling-3.0-flash 規格與定價

欄位 當前詳細資訊
顯示名稱 Ling-3.0-flash
模型 ID inclusionai/ling-3.0-flash
架構 124B 參數混合專家;每個 token 約有 5.1B 活躍參數
存取方式 無伺服器 API
API 格式 相容 OpenAI 的聊天完成
基礎 URL https://api.novita.ai/openai
端點 透過相容 OpenAI 的基礎 URL 使用 /v1/chat/completions
上下文視窗 262,144 個 token
最大輸出 32,768 個 token
模態 文字輸入與文字輸出
託管功能 推理與函式呼叫
輸入價格 每 1M token 0 美元,限時免費
輸出價格 每 1M token 0 美元,限時免費
最佳適用場景 代理評估、長上下文自動化、工具使用工作流程、成本敏感型實驗

型號可用性、規格、定價和 API 詳細資訊已於 2026 年 7 月 27 日根據 Novita AI 模型頁面LLM API 文件 進行驗證。

目前模型列表未提供 Ling-3.0-flash 的公開基準測試套件、吞吐量保證或詳細的上游訓練報告。因此,本文不為其指定智慧排名,也不聲稱其優於其他模型。對於生產環境的選擇,請根據您自己的提示和工具進行測試,而不是僅根據參數數量推斷品質。

其價格與類似 MoE 模型相比如何?

Ling-3.0-flash 與眾不同,因為其目前的託管 token 價格為零。為了進行比「免費與付費」更有用的比較,下表包含了來自 Novita AI 即時目錄中具有相似總參數數量或相似低活躍參數設計的稀疏模型。

Novita AI 上的模型 總參數 / 活躍參數 上下文 每百萬輸入 token 價格 每百萬輸出 token 價格
Ling-3.0-flash 124B / ~5.1B 262,144 $0.00 $0.00
Qwen3.5-122B-A10B 122B / 10B 262,144 $0.40 $3.20
Qwen3-Next-80B-A3B-Instruct 80B / ~3B 131,072 $0.15 $1.50
Ling-2.6-flash 104B / 7.4B 262,144 $0.10 $0.30

價格和託管限制已於 2026 年 7 月 27 日根據 Novita AI 的即時模型列表進行檢查。Ling-3.0-flash 被標記為限時免費,因此其行是快照而非永久定價保證。

該表並未確定哪個模型「最好」。Qwen3.5-122B-A10B 在 Novita AI 上提供更大的最大輸出配額以及原生視覺能力。Qwen3-Next-80B-A3B-Instruct 是一個較小的稀疏模型,在當前列表中支援結構化輸出。Ling-2.6-flash 擁有成熟的產品歷史,即使在免費促銷之外也仍然價格低廉。Ling-3.0-flash 是當今價格上最容易評估的模型,但能力和可靠性仍需要針對特定工作負載進行測試。

為什麼 124B/5.1B MoE 設計很重要?

總參數數量和活躍參數數量描述了 MoE 模型的不同部分。124B 的總數代表了模型的整體專家容量。大約 5.1B 的活躍數字描述了對於單個 token 選擇了該專家網絡的多少部分。

對於開發者來說,重點不在於 5.1B 活躍參數會自動使模型變快。實際的 API 延遲還取決於服務硬體、批次處理、提示長度、輸出長度和平台負載。有用的信號是,Ling-3.0-flash 是圍繞稀疏激活和 token 效率設計的,而不是為每個 token 運行整個參數集。

這種設計在代理循環時尤為相關。支援代理可能分類請求、檢索上下文、呼叫工具、檢查結果並草擬回應。編碼代理可能搜尋儲存庫、規劃變更、編輯檔案、運行測試並修復失敗。在兩種情況下,一個「任務」的成本和延遲分佈在多次推理回合中。設計用於高效重複推理的模型可能比僅針對單一回應最佳化的模型更有價值。

開發者可以使用 Ling-3.0-flash 建構什麼?

使用工具的助手

函式呼叫使 Ling-3.0-flash 成為選擇工具、產生參數、檢查工具結果並繼續工作流程的助手的理想候選者。範例包括客戶支援路由、帳戶查詢、內部知識檢索和操作儀表板。

長上下文文件工作流程

262,144 個 token 的上下文視窗可以容納合約審查、研究綜合、文字記錄分析或多文件提取的大量工作上下文。大型上下文視窗不能取代檢索設計,但它為團隊提供了更多空間來在任務中保留指令和相關證據。

編碼和儲存庫代理

推理和函式呼叫是程式碼搜尋和程式碼變更循環的有用基礎。Ling-3.0-flash 可能適合儲存庫分類、問題分類、遷移規劃、測試失敗分析或受監督的編碼代理。在允許寫入操作之前仔細測試,尤其是當工具呼叫可以改變生產系統時。

高容量評估管道

免費窗口降低了建構評估集的成本。團隊可以重放真實提示、比較工具呼叫格式、檢查失敗模式,並確定該模型是否值得在路由邏輯中佔有一席之地。這比假設最便宜的模型應立即成為預設值更好地利用了免費存取。

何時應使用 Ling-3.0-flash?

當您的工作負載具有以下幾個特徵時,選擇 Ling-3.0-flash 進行評估:

  • 它是基於文字的,並使用聊天完成。
  • 它需要推理、函式呼叫或兩者。
  • 它攜帶長指令、文件、記憶或工具結果。
  • 一個使用者任務可能需要多次模型回合。
  • 您希望在當前促銷期間測試大型 MoE 模型而無需支付每個 token 的費用。
  • 您可以透過任務完成、工具準確性、延遲和 token 使用量來衡量成功,而不是依賴公開排行榜。

該模型也是路由實驗的實用候選者。您可以將風險較低的代理步驟發送給 Ling-3.0-flash,將結果與付費參考模型進行比較,並僅升級那些需要不同能力配置的任務。

何時應選擇其他模型?

Ling-3.0-flash 並非每個應用程式的自動選擇。

如果您需要影像或音訊輸入,請選擇其他模型,因為目前的託管列表僅限文字。如果嚴格的 schema 生成是您生產合約的核心,請考慮支援結構化輸出的模型;Ling-3.0-flash 目前列出函式呼叫但未列出結構化輸出。當您需要獨立發表的基準證據、特定的延遲服務等級或用於長期預算的穩定付費價格時,其他模型也可能更可取。

32,768 個 token 的最大輸出對於許多代理任務來說是充足的,但低於某些當前長上下文模型的輸出限制。如果您的應用程式在單次呼叫中定期生成非常大的產出,請在遷移前比較輸出上限。

最後,不要建立一個依賴 API 保持免費的商業模式。零價格明確是限時的。生產規劃應包括備用模型、路由控制和上線前的價格重新檢查。

如何融入現有 API 工作流程?

Ling-3.0-flash 使用 Novita AI 的相容 OpenAI 的 LLM 介面。在高層次上,現有的聊天完成應用程式需要三個配置值:

  1. Novita AI API 金鑰。
  2. 相容 OpenAI 的基礎 URL:https://api.novita.ai/openai
  3. 模型 ID:inclusionai/ling-3.0-flash

然後請求會透過聊天完成端點進行。可以包含函式定義以用於工具使用工作流程,並且應使用您計劃在生產中使用的相同提示和任務級別檢查來評估推理行為。

此發布概述有意在整合邊界處停止。它不包括完整的 SDK 教學、請求範例、參數調整或故障排除步驟;這些內容屬於專門的快速入門指南。

結論

如果您正在建構基於文字的代理,並且想要一個具有長上下文、推理和函式呼叫的大型稀疏模型,那麼 Ling-3.0-flash 值得測試。當前限時免費價格消除了認真評估的 token 成本障礙,而 124B 總數和 5.1B 活躍架構則賦予了該模型清晰的效率導向設計。

正確的決定是利用免費窗口來獲取證據,而不是假設。測量完整的代理任務,包括重試和工具失敗。將輸出品質和延遲與您堆疊中已信任的模型進行比較。在生產上線前確認即時價格。如果 Ling-3.0-flash 在這些測試中表現良好,Novita AI 提供了一條直接的無伺服器路徑,將其添加到相容 OpenAI 的工作流程中。

在 Novita AI 上評估 Ling-3.0-flash

常見問題

Ling-3.0-flash API 是免費的嗎?

是的,截至 2026 年 7 月 27 日。Novita AI 將輸入和輸出均列為每百萬 token 0 美元,並將模型標記為「限時免費」。使用前請檢查即時模型頁面,因為促銷活動可能發生變化。

Ling-3.0-flash 的模型 ID 是什麼?

確切的 Novita AI 模型 ID 是 inclusionai/ling-3.0-flash

Ling-3.0-flash 有多大?

這是一款 124B 參數的混合專家模型,每個 token 約有 5.1B 個參數被啟動。

Ling-3.0-flash 支援多大的上下文視窗?

目前的 Novita AI 列表顯示 262,144 個 token 的上下文視窗和 32,768 個 token 的最大輸出。

Ling-3.0-flash 支援函式呼叫嗎?

是的。Novita AI 目前將函式呼叫和推理列為支援的功能。未列出結構化輸出,因此請在您自己的測試中驗證任何嚴格的 JSON 或 schema 要求。

Ling-3.0-flash 是多模態模型嗎?

在當前的 Novita AI 端點上不是。託管列表顯示文字輸入和文字輸出。

Ling-3.0-flash 比 Qwen3.5-122B-A10B 更好嗎?

沒有足夠的已驗證公開證據可以做出一般的品質聲明。Ling-3.0-flash 目前免費,且每個 token 啟動的參數較少,而 Qwen3.5-122B-A10B 在 Novita AI 上支援視覺、結構化輸出和更高的最大輸出限制。請根據工作負載特定評估進行選擇。

推薦文章