Ling-3.0-flash は、Novita AI Serverless API を通じて、 ** 期間限定の無料モデル ** として利用可能になりました。2026年7月27日時点で、入力・出力ともに $0 の価格が設定されています。これはエージェント推論向けに構築されたテキストモデルで、総パラメータ数1240億、トークンあたりのアクティブパラメータは約51億、262,144トークンのコンテキス卜ウィンドウ、推論サポート、OpenAI 互換のチャット補完ワークフローによる関数呼び出しを備えています。長時間実行するエージェント、ツール使用、大量自動化をテストする開発者にとって、すぐに魅力を感じる点は単純です。現在の無料期間中は、トークンごとに支払うことなく、大規模なスパースモデルを評価できます。
重要ポイント
- ** APIは現在無料です。** Ling-3.0-flash モデルページ には、100万入力トークンあたり $0、100万出力トークンあたり $0 と表示され、2026年7月27日時点で「期間限定無料」とラベル付けされています。
- ** これは非常にスパースな124B MoE モデルです。** トークンあたり約5.1B のパラメータがアクティブであり、これは総パラメータ数の約4.1% に相当します。
- ** エージェント推論向けに設計されています。** Novita のモデルリストは、トークン効率と、トークン、レイテンシ、サービングコストの制約下でのプロダクション規模のエージェントワークロードを強調しています。
- ** ホスト型 API は長いコンテキストとツール使用をサポートしています。** 現在のリストには、262,144 トークンのコンテキストウィンドウ、32,768 トークンの最大出力、推論、関数呼び出しが含まれています。
- ** 無料価格は評価期間として扱い、恒久的なコミットメントと見なさないでください。** 本番コストを見積もったり、ユーザーに無料サービスを約束する前に、ライブモデルページを確認してください。
Ling-3.0-flash とは?
Ling-3.0-flash は、InclusionAI によるスパース Mixture-of-Experts 言語モデルです。すべてのトークンに対して124B のパラメータすべてを活性化する代わりに、各トークンを約5.1B のアクティブパラメータにルーティングします。このアークテクチャは、各推論ステップに使用される計算量を制限しながら、大規模モデルの容量を維持することを目的としています。
このモデルの現在の Novita AI の説明は、ベンチマークの見出しではなく、実用的な目標に焦点を当てています。制約のあるトークン、レイテンシ、サービングコスト予算内で、より有用な作業を完了することです。
Ling-3.0-flash は Ling-2.6-flash と混同しないでください。新しいモデルは総パラメータを104B から124B に増やし、アクティブパラメータを7.4B から約5.1B に減らしています。両モデルともに Novita AI で長いコンテキストを提供しますが、Ling-3.0-flash は現在のホスト機能セットに推論サポートを追加し、時間限定的な無料 API 価格で提供されます。
Novita AI での Ling-3.0-flash の提供方法
Novita AI は、Ling-3.0-flash をサーバーレステキスト生成モデルとしてホストしています。モデル ID は inclusionai/ling-3.0-flash で、サポートされているエンドポイントファミリーはチャット補完です。このサービスは、Novita の LLM カタログ全体で利用可能な同じ OpenAI 互換リクエストパターンを使用しているため、チームは専用のデプロイメントを作成したり、推論ハードウェアを管理したりすることなくモデルを評価できます。
2026年7月27日時点で、モデルは ** 100万入力トークンあたり $0、100万出力トークンあたり $0 ** でリストされています。モデルページには「期間限定無料」というラベルもあります。この区別は重要です。Ling-3.0-flash は現在無料で呼び出せますが、価格が無期限にゼロのままであるとは約束されていません。
最も安全な本番運用のプラクティスは、この期間を自分自身のエビデンスを収集する機会として扱うことです。代表的なエージェントトレースを実行し、トークン使用量とレイテンシを記録し、関数呼び出しの信頼性をテストし、回答品質を現在のモデルと比較してください。後で価格が変わった場合でも、そのワークロードに対してモデルがまだ適しているかどうかを判断するのに十分なデータが得られているでしょう。
Ling-3.0-flash の仕様と価格
| フィールド | 現在の詳細 |
|---|---|
| 表示名 | Ling-3.0-flash |
| モデル ID | inclusionai/ling-3.0-flash |
| アーキテクチャ | 124B パラメータの Mixture-of-Experts;トークンあたり約 5.1B のアクティブパラメータ |
| アクセス | サーバーレス API |
| API 形式 | OpenAI 互換のチャット補完 |
| ベース URL | https://api.novita.ai/openai |
| エンドポイント | OpenAI 互換のベース URL を通じて /v1/chat/completions |
| コンテキストウィンドウ | 262,144 トークン |
| 最大出力 | 32,768 トークン |
| モダリティ | テキスト入力、テキスト出力 |
| ホスト機能 | 推論、関数呼び出し |
| 入力価格 | 100万トークンあたり $0、期間限定無料 |
| 出力価格 | 100万トークンあたり $0、期間限定無料 |
| 最適な用途 | エージェント評価、長文コンテキスト自動化、ツール使用ワークフロー、コスト重視の実験 |
モデルの可用性、仕様、価格、API 詳細は、2026年7月27日時点で Novita AI モデルページ および LLM API ドキュメンテーション で確認されています。
現在のモデルリスティングでは、Ling-3.0-flash の公開ベンチマークパッケージ、スループット保証、詳細な上流トレーニングレポートは提供されていませ。この記事ではしたがって、知能ランキングを割り当てたり、他のモデルよりも優れていると主張したりしません。プロダクション選定の際には、パラメータ数だけから品質を推測するのではなく、実際のプロンプトやツルでテストしてください。
価格は類似の MoE モデルと比べてどらか?
Ling-3.0-flash は、現在のホスト型トークン価格がゼロである点で異例です。「無料対有料」よりも有用な比較として、以下の表には、同程度の総パラメータ数または類似の低アクティブパラメータ設計を持つスパースモデルを、Novita AI のライブカタログから含めています。
| Novita AI 上のモデル | 総 / アクティブパラメータ | コンテキスト | 入力(100万トークンあたり) | 出力(100万トークンあたり) |
|---|---|---|---|---|
| Ling-3.0-flash | 124B / ~5.1B | 262,144 | $0.00 | $0.00 |
| Qwen3.5-122B-A10B | 122B / 10B | 262,144 | $0.40 | $3.20 |
| Qwen3-Next-80B-A3B-Instruct | 80B / ~3B | 131,072 | $0.15 | $1.50 |
| Ling-2.6-flash | 104B / 7.4B | 262,144 | $0.10 | $0.30 |
価格とホスト制限は、2026年7月27日時点で Novita AI のライブモデルリスティングに対して確認されました。Ling-3.0-flash は期間限定無料とマークされているため、その行はスナップショットであり、恒久的な価格保証ではありません。
この表は、どのモデルが「最善」かを確定するものではありません。Qwen3.5-122B-A10B は Novita AI 上でより大きな最大出力許容とネイティブビジョン機能を提供します。Qwen3-Next-80B-A3B-Instruct は、現在のリスティングで構造化出力サポートを持つより小規模なスパースモデルです。Ling-2.6-flash は確立された製品履歴を持ち、無料キャンペーン以外でも低価格です。Ling-3.0-flash は今日価格面で最も評価しやすいモデルですが、機能と信頼性は依然としてワークロード固有のテストが必要です。
124B/5.1B の MoE 設計が重要な理由
総パラメータ数とアクティブパラメータ数は、MoE モデルの異なる部分を説明します。124B の総数はモデルの全体的なエキスパート容量を表します。約5.1B のアクティブ数は、個々のトークンに対してそのエキスパートネットワークのどの程度が選択されるかを示します。
開発者にとって重要な点は、5.1B のアクティブパラメータが自動的にモデルを高速にするわけではないことです。実際の API レイテンシは、サービングハードウェア、バッチ処理、プロンプト長、出力長、プラットフォーム負荷にも依存します。有用な信号は、Ling-3.0-flash がすべてのトークンに対してパラメータセット全体を実行するのではなく、スパース活性化とトークン効率を中心に設計されていることです。
その設計は、エージェントがループする場合に特に適しています。サポートエージェントはリクエストを分類し、コンテキストを取得し、ツールを呼び出し、結果を確認し、応答を下書きするかもしれません。コーディングエージェントはリポジトリを検索し、変更を計画し、ファイルを編集し、テストを実行し、障害を修復するかもしれません。どちらの場合も、1つの「タスク」のコストとレイテンシは多くの推論ターンに分散されます。効率的な繰り返し推論向けに設計されたモデルは、単一の応答のみに最適化されたものよりも価値がある可能性があります。
開発者は Ling-3.0-flash で何を構築できるか?
ツール使用アシスタント
関数呼び出しにより、Ling-3.0-flash はツールを選択し、引数を生成し、ツール結果を検査し、ワークフローを継続するアシスタントの候補となります。例としては、カスタマーサポートのルーティング、アカウント検索、内部ナレッジ検索、オペレーションダッシュボードなどがあります。
長文書ワークフロー
262,144 トークンのコンテキストウィンドウは、契約レビュー、研究統合、トランスクリプト分析、または複数文書抽出のための実質的な作業コンテキストを収容できます。大きなコンテキストウィンドウは検索設計の代わりにはなりませんが、タスク全体にわたって指示と関連証拠を保存する余裕をチームに提供します。
コーディングとリポジトリーエージェント
推論と関数呼び出しは、コード検索とコード変更ループのための有用な基盤です。Ling-3.0-flash は、リポジトリトリアージ、インシデント分類、移行計画、テスト失敗分析、または監視下のコーディングエージェントに適しているかもしれません。書き込みアクションを許可する前に、特にツール呼び出しがプロダクションシステムを変更できる場合は、注意深くテストしてください。
高量評価パイプライン
無料期間は評価セットを構築するコストを下げます。チームは実際のプロンプトを再生し、ツール呼び出し形式を比較し、障害モードを調べ、モデルがルーティングロジックに値するかどうかを判断できます。これは、最も安いモデルをすぐにデフォルトにする前提を置くよりも、無料アクセスのより良い使い方です。
Ling-3.0-flash を使用すべきタイミング
ワークロードが以下の特徴のいくつかを満たす場合、評価のために Ling-3.0-flash を選んでください:
- テキストベースで、チャット補完を使用する。
- 推論、関数呼び出し、またはその両方が必要。
- 長い指示、文書、メモリ、またはツール結果を扱う。
- 1つのユーザータスクに複数のモデルターンが必要になる可能性がある。
- 現在のプロモーション中にトークン課金なしで大規模 MoE モデルをテストしたい。
- タスク完了、ツール精度、レイテンシ、トークン使用量で成功を測定でき、公開リーダーボードに依存しない。
このモデルはルーティング実験の実用的な候補でもあります。リスクの低いエージェントステップを Ling-3.0-flash に送り、有料の参照モデルと結果を比較し、異なる機能プロファイルが必要なタスクのみをエスカレーションできます。
他のモデルを選ぶべきタイミング
Ling-3.0-flash はすべてのアプリケーションで自動的に最適な選択ではありません。
画像や音声入力が必要な場合は別のモデルを選んでください。現在のホストリスティングはテキストのみです。厳格なスキーマ生成がプロダクション契約の中心である場合は、構造化出力をサポートするモデルを検討してください。Ling-3.0-flash は現在関数呼び出しをリストしていますが、構造化出力はリストしていません。また、独立して公開されたベンチマーク証拠、特定のレイテンシサービスレベル、または長期的な予算計画のための安定した有料価格が必要な場合も、別のモデルが適しているかもしれません。
32,768 トークンの最大出力は多くのエージェントタスクには十分ですが、一部の現在の長コンテキストモデルの出力制限を下回ります。アプリケーションが1回の呼び出しで非常に大きな成果物を定期的に生成する場合は、移行前に出力上限を比較してください。
最後に、API が無料であり続けることに依存したビジネスモデルを構築しないでください。ゼロ価格は明確に期間限定です。本番計画には、代替モデル、ルーティング制御、およびローンチ前の最新価格確認を含めてください。
既存の API ワークフローへの統合方法
Ling-3.0-flash は Novita AI の OpenAI 互換 LLM インターフェースを使用します。高レベルでは、既存のチャット補完アプリケーションには3つの構成値が必要です:
- Novita AI API キー。
- OpenAI 互換のベース URL (
https://api.novita.ai/openai)。 - モデル ID (
inclusionai/ling-3.0-flash)。
リクエストはチャット補完エンドポイントを経由します。関数定義はツール使用ワークフローのために含めることができ、推論動作は本番で使用する予定の同じプロンプトとタスクレベルのチェックで評価する必要があります。
このローンチ概要は意図的に統合境界で停止しています。完全な SDK チュートリアル、リクエストサンプル、パラメータチューニング、またはトラブルシューティング手順は含まれていません。これらは専用のクイックスタートガイドに属します。
結論
Ling-3.0-flash は、テキストベースのエージェントを構築しており、長いコンテキスト、推論、関数呼び出しを備えた大規模スパースモデルを試したい場合にテストする価値があります。現在の期間限定無料価格は、深刻な評価からトークンコストの障壁を取り除きます。一方、124B の総数と5.1B のアクティブアーキテクチャは、モデルに明確な効率指向の設計を与えています。
正しい判断は、無料期間を前提ではなく証拠を得るために使用することです。リトライやツール障害を含む完全なエージェントタスクを測定してください。出力品質とレイテンシを、あなたのスタックですでに信頼されているモデルと比較してください。本番展開前にライブ価格を確認してください。Ling-3.0-flash がそれらのテストで良く機能する場合、Novita AI は OpenAI 互換ワークフローに追加するための率直なサーバーレスパスを提供します。
Ling-3.0-flash を Novita AI で評価す
FAQ
Ling-3.0-flash の API は無料ですか?
はい、2026年7月27日現時点では。Novita AI は入出力ともに100万トークンあたり $0 とリストし、モデルを「期間限定無料」とマークしています。プロモーションは変わることがあるため、使用前にライブモデルページを確認してください。
Ling-3.0-flash のモデル ID は何ですか?
正確な Novita AI モデル ID は inclusionai/ling-3.0-flash です。
Ling-3.0-flash の規模は?
124B パラメータの Mixture-of-Experts モデルで、トークンあたり約5.1B のパラメータが活性化されます。
Ling-3.0-flash がサポートするコンテキストウィンドウは?
現在の Novita AI リスティングでは、262,144 トークンのコンテキス卜ウィンドウと 32,768 トークンの最大出力が示されています。
Ling-3.0-flash は関数呼び出しをサポートしていますか?
はい。Novita AI は現在、関数呼び出しと推論をサポートされる機能としてリストしています。構造化出力はリストされていないため、厳格な JSON やスキーマ要件がある場合は、ご自身のテストで検証してください。
Ling-3.0-flash はマルチモーダルモデルですか?
現在の Novita AI エンドポイトでは違います。ホス卜リスティングはテキス卜入力とテキス卜出力を示しています。
Ling-3.0-flash は Qwen3.5-122B-A10B より優れていましか?
一般的な品質主張をするための検証された公開証拠は十分にありません。Ling-3.0-flash は現在無料で、トークンあたり活性化されるパラメータが少ない一方、Qwen3.5-122B-A10B はビジョン、構造化出力、および Novita AI 上でのより高い最大出力制限をサポートしています。ワークロード固有の評価で選択してください。