Ling-3.0-flash が、Novita AI Serverless API で 期間限定の無料モデル として利用可能になりました。2026 年 7 月 27 日時点で、入出力ともに $0 の価格設定が掲載されています。これはエージェント推論向けに構築されたテキストモデルです。合計 1240 億パラメータ、トークンあたり約 51 億のアクティブパラメータ、262,144 トークンのコンテキストウィンドウ、推論サポート、そして OpenAI 互換のチャット補完ワークフローを通じた関数呼び出しを備えています。長期実行エージェント、ツール使用、または大量自動化をテストしている開発者にとって、即座の魅力はシンプルです。現在の無料期間中は、トークンごとに支払うことなく、大規模なスパースモデルを評価できます。
主なポイント
- API は現在無料です。 Ling-3.0-flash モデルページ には、100 万入力トークンあたり $0、100 万出力トークンあたり $0 と記載され、2026 年 7 月 27 日時点で「期間限定無料」のラベルが付いています。
- これは非常にスパースな 124B MoE モデルです。 トークンあたり約 5.1B のパラメータがアクティブになり、これは総パラメータ数の約 4.1% です。
- エージェント推論用に設計されています。 Novita のモデル一覧では、トークン効率と、トークン、レイテンシ、サービングコストの制約下でのプロダクション規模のエージェントワークロードに重点が置かれています。
- ホスト型 API は長いコンテキストとツールの使用をサポートします。 現在の一覧では、262,144 トークンのコンテキストウィンドウ、32,768 トークンの最大出力、推論、関数呼び出しが示されています。
- 無料価格は評価期間として捉え、恒久的なコミットメントとしないでください。 プロダクションコストを見積もったり、ユーザーに無料サービスを約束したりする前に、ライブのモデルページを確認してください。
Ling-3.0-flash とは?
Ling-3.0-flash は、InclusionAI によるスパース Mixture-of-Experts 言語モデルです。すべてのトークンに対して 124B のパラメータすべてをアクティブにするのではなく、各トークンを約 5.1B のアクティブパラメータにルーティングします。このアーキテクチャは、大規模モデルの容量を維持しつつ、各推論ステップで使用される計算量を制限することを目的としています。
現在の Novita AI での説明は、ベンチマークの見出しではなく、実用的な目標に焦点を当てています。つまり、制約のあるトークン、レイテンシ、サービングコストの予算内で、より多くの有用な作業を完了することです。このポジショニングは、1 つのユーザーアクションが複数のモデル呼び出し、ツール呼び出し、計画のターン、検証ステップをトリガーする可能性があるエージェントシステムに特に関連します。
Ling-3.0-flash は、Ling-2.6-flash と混同しないでください。新しいモデルは、総パラメータ数を 104B から 124B に増やし、アクティブパラメータ数を 7.4B から約 5.1B に減らしています。どちらのモデルも Novita AI で長いコンテキストを提供しますが、Ling-3.0-flash は現在のホスト型機能セットに推論サポートを追加し、期間限定の無料 API 価格でローンチされます。
Novita AI で Ling-3.0-flash はどのように利用できますか?
Novita AI は、Ling-3.0-flash をサーバーレステキスト生成モデルとしてホストしています。正確なモデル ID は inclusionai/ling-3.0-flash で、サポートされるエンドポイントファミリーはチャット補完です。このサービスは、Novita の LLM カタログ全体で利用可能な同じ OpenAI 互換のリクエストパターンを使用するため、専用のデプロイメントを作成したり、推論ハードウェアを管理したりすることなく、チームはモデルを評価できます。
2026 年 7 月 27 日現在、このモデルは 100 万入力トークンあたり $0、100 万出力トークンあたり $0 でリストされています。モデルページには、** 期間限定無料** というラベルも付いています。この区別は重要です。Ling-3.0-flash は現在無料で呼び出せますが、価格が無期限にゼロのままであることを約束するものではありません。
最も安全なプロダクション慣行は、この期間を自分自身のエビデンスを収集する機会として扱うことです。代表的なエージェントトレースを実行し、トークン使用量とレイテンシを記録し、関数呼び出しの信頼性をテストし、回答品質を現在のモデルと比較します。後で価格が変更された場合でも、そのワークロードにモデルがまだ適しているかどうかを判断するのに十分なデータが得られます。
Ling-3.0-flash の仕様と価格
| フィールド | 現在の詳細 |
|---|---|
| 表示名 | Ling-3.0-flash |
| モデル ID | inclusionai/ling-3.0-flash |
| アーキテクチャ | 124B パラメータの Mixture-of-Experts。トークンあたり約 5.1B のアクティブパラメータ |
| アクセス | サーバーレス API |
| API 形式 | OpenAI 互換のチャット補完 |
| ベース URL | https://api.novita.ai/openai |
| エンドポイント | OpenAI 互換のベース URL 経由で /v1/chat/completions |
| コンテキストウィンドウ | 262,144 トークン |
| 最大出力 | 32,768 トークン |
| モダリティ | テキスト入力およびテキスト出力 |
| ホスト型機能 | 推論と関数呼び出し |
| 入力価格 | 100 万トークンあたり $0、期間限定無料 |
| 出力価格 | 100 万トークンあたり $0、期間限定無料 |
| 最適な用途 | エージェント評価、長いコンテキストの自動化、ツールを使用するワークフロー、コスト重視の実験 |
モデルの可用性、仕様、価格、API の詳細は、Novita AI モデルページ および LLM API ドキュメント を 2026 年 7 月 27 日に確認しました。
現在のモデル一覧には、Ling-3.0-flash の公開ベンチマークパッケージ、スループット保証、または詳細な上流トレーニングレポートは含まれていません。したがって、この記事ではインテリジェンスランキングを割り当てたり、別のモデルよりも優れていると主張したりしません。プロダクション選択のためには、パラメータ数のみから品質を推測するのではなく、独自のプロンプトとツールでテストしてください。
価格は類似の MoE モデルと比較してどうですか?
Ling-3.0-flash は、現在ホストされているトークン価格がゼロであるため、異例です。「無料対有料」よりも有用な比較として、以下の表には、Novita AI のライブカタログから、類似の総パラメータ数または同様の低アクティブパラメータ設計を持つスパースモデルが含まれています。
| Novita AI 上のモデル | 総パラメータ / アクティブパラメータ | コンテキスト | 100 万トークンあたりの入力価格 | 100 万トークンあたりの出力価格 |
|---|---|---|---|---|
| Ling-3.0-flash | 124B / ~5.1B | 262,144 | $0.00 | $0.00 |
| Qwen3.5-122B-A10B | 122B / 10B | 262,144 | $0.40 | $3.20 |
| Qwen3-Next-80B-A3B-Instruct | 80B / ~3B | 131,072 | $0.15 | $1.50 |
| Ling-2.6-flash | 104B / 7.4B | 262,144 | $0.10 | $0.30 |
価格とホスト制限は、2026 年 7 月 27 日に Novita AI のライブモデル一覧に対して確認されました。Ling-3.0-flash は期間限定無料とマークされているため、その行は永続的な価格保証ではなくスナップショットです。
この表は、どのモデルが「最良」かを確立するものではありません。Qwen3.5-122B-A10B は、Novita AI でより大きな最大出力許容量とネイティブのビジョン機能を提供します。Qwen3-Next-80B-A3B-Instruct は、現在の一覧で構造化出力サポートを持つ、より小規模なスパースモデルです。Ling-2.6-flash は確立された製品履歴を持ち、無料プロモーション以外でも低価格のままです。Ling-3.0-flash は、価格面で今日評価するのが最も簡単なモデルですが、機能と信頼性については、依然としてワークロード固有のテストが必要です。
なぜ 124B/5.1B MoE 設計が重要なのか?
総パラメータ数とアクティブパラメータ数は、MoE モデルの異なる部分を説明します。124B の総数は、モデルの全体的なエキスパート容量を表します。約 5.1B のアクティブ数は、個々のトークンに対してそのエキスパートネットワークのどの程度が選択されるかを表します。
開発者にとって重要な点は、5.1B のアクティブパラメータが自動的にモデルを高速にするわけではないということです。実際の API レイテンシは、サービングハードウェア、バッチ処理、プロンプト長、出力長、プラットフォームの負荷にも依存します。有用なシグナルは、Ling-3.0-flash がすべてのトークンに対してパラメータセット全体を実行するのではなく、スパースアクティベーションとトークン効率を中心に設計されていることです。
この設計は、エージェントがループする場合に特に重要です。サポートエージェントは、リクエストを分類し、コンテキストを取得し、ツールを呼び出し、結果を検査し、応答を作成する場合があります。コードエージェントは、リポジトリを検索し、変更を計画し、ファイルを編集し、テストを実行し、障害を修復する場合があります。どちらの場合も、1 つの「タスク」のコストとレイテンシは、多くの推論ターンに分散されます。効率的な反復推論用に設計されたモデルは、単一の応答のみに最適化されたモデルよりも価値が高くなる可能性があります。
開発者は Ling-3.0-flash で何を構築できますか?
ツールを使用するアシスタント
関数呼び出しにより、Ling-3.0-flash は、ツールを選択し、引数を生成し、ツール結果を検査し、ワークフローを継続するアシスタントの候補となります。例としては、カスタマーサポートのルーティング、アカウント検索、内部ナレッジ検索、運用ダッシュボードなどがあります。
長いコンテキストのドキュメントワークフロー
262,144 トークンのコンテキストウィンドウは、契約レビュー、研究統合、トランスクリプト分析、または複数ドキュメント抽出のための実質的な作業コンテキストに対応できます。大きなコンテキストウィンドウは検索設計の代わりにはなりませんが、チームはタスク全体にわたって指示と関連する証拠を保持する余地をより多く得られます。
コーディングおよびリポジトリエージェント
推論と関数呼び出しは、コード検索およびコード変更ループのための有用な基盤です。Ling-3.0-flash は、リポジトリトリアージ、課題分類、移行計画、テスト失敗分析、または監視付きコーディングエージェントに適合する可能性があります。特にツール呼び出しがプロダクションシステムを変更できる場合は、書き込みアクションを許可する前に注意深くテストしてください。
大量評価パイプライン
無料期間により、評価セットを構築するコストが削減されます。チームは実際のプロンプトを再生し、ツール呼び出し形式を比較し、障害モードを調査し、モデルがルーティングロジックに値するかどうかを判断できます。これは、最も安価なモデルをすぐにデフォルトにすることを前提とするよりも、無料アクセスをより有効に活用する方法です。
いつ Ling-3.0-flash を使用すべきですか?
ワークロードに以下の特徴のいくつかが当てはまる場合、評価のために Ling-3.0-flash を選択してください。
- テキストベースで、チャット補完を使用する。
- 推論、関数呼び出し、またはその両方を必要とする。
- 長い指示、ドキュメント、メモリ、またはツール結果を運ぶ。
- 1 つのユーザータスクに複数のモデルターンが必要になる場合がある。
- 現在のプロモーション中にトークンごとの課金なしで大規模な MoE モデルをテストしたい。
- 公開リーダーボードに頼るのではなく、タスク完了、ツール精度、レイテンシ、トークン使用量で成功を測定できる。
また、このモデルはルーティング実験の実用的な候補でもあります。リスクの低いエージェントステップを Ling-3.0-flash に送信し、有料の参照モデルと結果を比較し、異なる機能プロファイルが必要なタスクのみをエスカレーションできます。
いつ別のモデルを選択すべきですか?
Ling-3.0-flash は、すべてのアプリケーションにとって自動的な選択肢ではありません。
画像や音声入力が必要な場合は別のモデルを選択してください。現在のホスト型一覧はテキストのみです。厳密なスキーマ生成がプロダクション契約の中心である場合は、構造化出力をサポートするモデルを検討してください。Ling-3.0-flash は現在、関数呼び出しをリストしていますが、構造化出力はリストしていません。また、独立して公開されたベンチマークエビデンス、特定のレイテンシサービスレベル、または長期予算計画のための安定した有料価格が必要な場合も、別のモデルの方が望ましい場合があります。
32,768 トークンの最大出力は、多くのエージェントタスクには十分ですが、現在のいくつかの長いコンテキストモデルの出力制限を下回っています。アプリケーションが 1 回の呼び出しで非常に大きなアーティファクトを定期的に生成する場合は、移行前に出力上限を比較してください。
最後に、API が無料であり続けることに依存したビジネスモデルを構築しないでください。ゼロ価格は明示的に期間限定です。プロダクション計画には、フォールバックモデル、ルーティング制御、およびローンチ前の最新の価格確認を含める必要があります。
既存の API ワークフローにどのように適合しますか?
Ling-3.0-flash は、Novita AI の OpenAI 互換 LLM インターフェースを使用します。高レベルでは、既存のチャット補完アプリケーションは 3 つの設定値を必要とします。
- Novita AI API キー。
- OpenAI 互換のベース URL
https://api.novita.ai/openai。 - モデル ID
inclusionai/ling-3.0-flash。
その後、リクエストはチャット補完エンドポイントを通過します。ツールを使用するワークフローのために関数定義を含めることができ、推論動作は、プロダクションで使用する予定の同じプロンプトとタスクレベルのチェックで評価する必要があります。
このローンチ概要は、意図的に統合境界で停止しています。完全な SDK チュートリアル、リクエストサンプル、パラメータチューニング、トラブルシューティング手順は含まれていません。これらは専用のクイックスタートガイドに属します。
結論
Ling-3.0-flash は、テキストベースのエージェントを構築していて、長いコンテキスト、推論、関数呼び出しを備えた大規模でスパースなモデルを必要とする場合、テストする価値があります。現在の期間限定の無料価格は、真剣な評価からトークンコストの障壁を取り除き、124B の総パラメータと 5.1B のアクティブアーキテクチャは、モデルに明確な効率性指向の設計を与えています。
正しい判断は、無料期間を仮定ではなく証拠のために使用することです。再試行やツールの失敗を含む、完全なエージェントタスクを測定します。出力品質とレイテンシを、スタックですでに信頼しているモデルと比較します。プロダクション展開前に、ライブの価格を確認します。Ling-3.0-flash がこれらのテストで良好に機能する場合、Novita AI はそれを OpenAI 互換のワークフローに追加するための簡単なサーバーレスパスを提供します。
Novita AI で Ling-3.0-flash を評価する
FAQ
Ling-3.0-flash API は無料ですか?
はい、2026 年 7 月 27 日現在無料です。Novita AI は入出力ともに 100 万トークンあたり $0 とリストし、モデルを「期間限定無料」とマークしています。プロモーションは変更される可能性があるため、使用前にライブのモデルページを確認してください。
Ling-3.0-flash のモデル ID は何ですか?
正確な Novita AI モデル ID は inclusionai/ling-3.0-flash です。
Ling-3.0-flash のサイズはどのくらいですか?
124B パラメータの Mixture-of-Experts モデルで、トークンあたり約 5.1B のパラメータがアクティブになります。
Ling-3.0-flash はどのコンテキストウィンドウをサポートしていますか?
現在の Novita AI の一覧では、262,144 トークンのコンテキストウィンドウと 32,768 トークンの最大出力が示されています。
Ling-3.0-flash は関数呼び出しをサポートしていますか?
はい。Novita AI は現在、関数呼び出しと推論をサポートされる機能としてリストしています。構造化出力はリストされていないため、厳密な JSON やスキーマ要件については、ご自身のテストで検証してください。
Ling-3.0-flash はマルチモーダルモデルですか?
現在の Novita AI エンドポイントではそうではありません。ホスト型一覧はテキスト入力とテキスト出力を示しています。
Ling-3.0-flash は Qwen3.5-122B-A10B より優れていますか?
一般的な品質を主張するのに十分な検証済みの公開エビデンスはありません。Ling-3.0-flash は現在無料で、トークンあたりのアクティブパラメータが少ないのに対し、Qwen3.5-122B-A10B は Novita AI でビジョン、構造化出力、より高い最大出力制限をサポートしています。ワークロード固有の評価で選択してください。
