Ling-3.0-Flash-VL は、テキスト、画像、動画入力を 1 つの API ワークフローで扱う必要があるアプリケーション向けのサーバーレスマルチモーダルモデルとして Novita AI で利用できます。inclusionai/ling-3.0-flash-vl のホスト型掲載情報には、262,144 トークンのコンテキストウィンドウ、最大 32,768 トークンの出力、推論、関数呼び出し、そして 2026年9月23日 2:30 AM UTC までの入力・出力トークン無料が示されています。これは Ling-3.0-flash ファミリーの視覚言語モデルであり、別途画像からテキストへのパイプラインを必要とせず、ネイティブな視覚理解と視覚エージェント機能を追加します。
主なポイント
- Ling-3.0-Flash-VL はテキスト、画像、動画を受け付けます。 Novita はホスト型モデルについて、これら 3 つの入力モダリティとテキスト出力を掲載しています。
- Novita エンドポイントは 256K コンテキスト、32K 出力のデプロイです。 正確な上限は 262,144 コンテキストトークンと最大 32,768 出力トークンです。
- このモデルは大規模な総容量を持ちながらスパースです。 公式の InclusionAI モデルカードには、総パラメータ 124B、トークンあたり約 5.5B のアクティブパラメータが記載されています。
- トークン使用量は 2026年9月23日 2:30 AM UTC まで無料です。 それ以降は、本番トラフィックの予算を立てる前にモデルページを再確認してください。
- ベースの Ling-3.0-flash との主なユースケースの違いは視覚入力です。 テキストのみのファミリーの入口には Ling-3.0-flash の概要 を使用してください。このページでは
-VLバリアントに焦点を当てます。
Ling-3.0-Flash-VL とは?
Ling-3.0-Flash-VL は InclusionAI によるネイティブマルチモーダルモデルであり、Ling-3.0-flash の視覚言語拡張です。上流のモデルカードでは、視覚情報を理解、推論、計画、実行、検証に取り込むシステムとして説明されています。これは、テキスト専用言語モデルに画像キャプショナーを接続するよりも広い役割です。画像や動画は、モデルがタスクを処理している間も推論コンテキストの一部にとどまることができます。
モデルカードには、総パラメータ 124B、トークンあたり約 5.5B のアクティブパラメータが報告されています。これはスパースな Mixture-of-Experts 設計であるため、総パラメータ数とトークンあたりのアクティブパラメータは異なる特性を表します。前者はモデル全体の容量を示し、後者はトークンごとにルーティングされる計算量の概算を表します。どちらの数値も単独で、あなたのワークロードにおける特定のレイテンシや出力品質を保証するものではありません。
今回のローンチで重要な違いは視覚拡張です。ベースの Ling-3.0-flash は Novita の現在の掲載ではテキストモデルですが、Ling-3.0-Flash-VL はテキストに加えて画像と動画の入力を受け付けます。そのため、-VL ページは、インターフェース理解、ドキュメントやチャートの分析、視覚検査、動画質問応答、画面上の内容を解釈する必要があるエージェントに関連します。
Novita AI での利用方法
Novita は、正確なモデル ID inclusionai/ling-3.0-flash-vl を持つサーバーレスエンドポイントとしてこのモデルをホストしています。モデルページには chat/completions と Anthropic 互換のエンドポイントファミリー、さらに推論と関数呼び出し機能が掲載されています。既存の OpenAI 互換クライアントでは、Novita の API ベース URL を使用し、リクエスト設定で正確なモデル ID を選択してください。
モデルページは、ホスト型構成に関する信頼できる情報源です。特に、デプロイの制限を確認せずに、上流モデルカードのより大きなコンテキストの主張を Novita 統合にコピーしないでください。モデルカードではモデルレベルで最大 1M トークンと記載されていますが、Novita は現在、この掲載で 262,144 コンテキストトークンと最大 32,768 出力トークンを公開しています。
現在のカタログには、デフォルトティアで 30 リクエスト/分の制限も示されており、上位ティアの値は別途記載されています。これはカタログのクォータとして扱い、アプリケーション全体のスループット保証とは見なさないでください。アカウントティア、リクエストサイズ、同時実行数、リトライ、ツール実行はすべてエンドツーエンドのスループットに影響する可能性があります。
仕様と料金の概要
| 項目 | 詳細 |
|---|---|
| 表示名 | Ling 3.0 Flash VL |
| モデル ID | inclusionai/ling-3.0-flash-vl |
| アーキテクチャ | 総パラメータ 124B、トークンあたり約 5.5B のアクティブ、スパース MoE |
| 入力モダリティ | テキスト、画像、動画 |
| 出力モダリティ | テキスト |
| コンテキストウィンドウ | Novita デプロイでは 262,144 トークン |
| 最大出力 | 32,768 トークン |
| ホスト機能 | サーバーレス、関数呼び出し、推論 |
| エンドポイントファミリー | chat/completions、Anthropic 互換 |
| カタログ RPM | デフォルト掲載ティアで 30 RPM |
| 入力料金 | 2026年9月23日 2:30 AM UTC まで無料 |
| 出力料金 | 2026年9月23日 2:30 AM UTC まで無料 |
無料提供は、2026年9月23日 2:30 AM UTC までの評価に役立ちます。本番稼働の前に、現在の料金を記録し、予算ガードを追加し、プロモーション期間終了後にどのモデルまたはキューへトラフィックを送るかを決めてください。
開発者はこれで何を構築できるか?
ドキュメント、チャート、インターフェースを理解する
視覚入力は、ドキュメント、ダッシュボード、スクリーンショット、ソフトウェアインターフェースに必要な前処理の量を減らすことができます。開発者は、タスク指示と一緒にスクリーンショットを渡し、モデルにフィールドの特定、表示状態の要約、インタラクション対象の特定を依頼できます。ドキュメントやチャートについては、短いキャプション例だけで判断するのではなく、モデルが単位、凡例、表構造、空間関係を保持するかどうかをテストしてください。
画像と動画について推論する
上流アーキテクチャでは、視覚エンコーダと動画向けの時間位置処理を使用しています。これは、イベントがいつ発生するかの特定、クリップ内の 2 つの時点の比較、一連のアクションの抽出など、時間変化に依存する回答が必要な場合に関連します。長い動画には依然として慎重なサンプリングとプロンプト設計が必要です。大きなコンテキスト上限があっても、料金変更後にすべてのフレームが等しく有用または手頃になるわけではありません。
視覚エージェントをサポートする
このモデルの視覚エージェントとしての位置付けは、知覚がより大きなループの 1 段階にすぎないワークフローに適しています。エージェントは、ブラウザのスクリーンショットを検査し、次のアクションについて推論し、ツールを呼び出し、結果の画面を検証する場合があります。関数呼び出しはアクションの境界を提供し、視覚コンテキストは次に何をすべきかを決定するための証拠を提供できます。権限は狭く保ち、すべてのツール引数を検証してください。マルチモーダル理解があっても、アプリケーション側の安全チェックは不要になりません。
テキストと視覚が混在するワークロードをルーティングする
すでにテキストタスクを Ling-3.0-flash にルーティングしているチームは、視覚的証拠を含むリクエストに対して -VL バリアントを評価できます。実用的なルーターは、テキストのみのトラフィックをベースモデルに送り、画像、動画、スクリーンショット由来の状態を含むメッセージには視覚バリアントを割り当てることができます。画像準備、アップロード時間、モデルレイテンシ、リトライ、下流のツール呼び出しを含むルート全体を測定してください。
パフォーマンスのシグナルと評価
公式の InclusionAI モデルカードは、Artificial Analysis Intelligence Index v4.1.1 で 42 のスコアを報告し、理解、推論、行動を含むマルチモーダル能力の側面を説明しています。これは上流リリースに関する有用なシグナルであり、Novita ホスト型デプロイやあなたのプロンプト分布に対する保証ではありません。このページはまた、256K コンテキストの Terminal-Bench 評価構成にも言及しており、これはモデルカードの一般的な「最大 1M」という記述よりも、ホスト型のコンテキスト上限に近いものです。
意味のある評価には、製品を反映した小規模なタスクセットを使用してください。
- 視覚抽出: スクリーンショット、フォーム、表、チャートでのフィールド精度を測定します。
- 時間的推論: 短い動画で、回答が正しいイベントと時間範囲を特定できるかをテストします。
- エージェント実行: 選択されたツールと、ツール実行後の最終状態の両方を評価します。
- グラウンディング: 曖昧または無関係な詳細を含む画像を含め、根拠のない主張をチェックします。
- 運用: レイテンシ、トークン使用量、失敗率、レート制限の動作、リトライの影響を記録します。
上流のベンチマークスコアを、これらのアプリケーション検証の代わりにしないでください。モデルは公開ベンチマークで良好な成績を収めていても、本番インターフェースではプロンプト、前処理、ルーティングの変更が必要になる場合があります。
Ling-3.0-Flash-VL をいつ使うべきか
リクエストに視覚的証拠が含まれ、回答が単発のキャプション以上のものを必要とする場合は、Ling-3.0-Flash-VL を選択してください。以下を評価する有力な候補です。
- スクリーンショットとブラウザインターフェースの理解
- チャート、表、ドキュメントの質問応答
- 短い動画のイベント特定と要約
- 視覚ツールを使用するエージェント
- テキストと画像が混在するサポートワークフロー
2026年9月23日 2:30 AM UTC までの無料掲載により、有料ルーティング計画を確定する前に代表的なテストセットを構築することが実用的になります。それらのテストを実行したときの料金状態を記録し、コスト比較を再現可能にしてください。
別のモデルを選ぶべき場合
視覚入力が必要ないテキストのみのワークロードには、ベースの Ling-3.0-flash モデルページ を選択してください。テキストのみのルートは、ペイロード処理を簡素化し、不要なマルチモーダル処理を減らす場合があります。
恒久的に固定された料金、異なるコンテキストまたは出力上限、テスト済みのレイテンシサービスレベル、音声入力、あるいはこのデプロイに掲載されていない機能が必要な場合は、別のモデルを選択してください。また、アプリケーションが 2026年9月23日 2:30 AM UTC に終了する無料提供に依存している場合は、フォールバックを用意してください。最も安全な本番設計では、プロモーション料金とカタログクォータを変更可能な構成として扱い、ハードコードされた製品保証とは見なしません。
既存の API ワークフローにどう適合するか
大まかに言うと、既存の OpenAI 互換アプリケーションには、Novita API キー、Novita の OpenAI 互換ベース URL、そしてモデル ID として inclusionai/ling-3.0-flash-vl が必要です。リクエストでは、選択したエンドポイントがサポートするマルチモーダルメッセージ構造を使用し、ユーザーのテキスト指示と一緒に画像または動画コンテンツを含める必要があります。
視覚アセットはエンドポイントからアクセス可能にし、送信前にその形式を検証してください。エージェントワークフローでは、ツールを視覚コンテンツとは別に定義し、各ツールができることを制限し、モデルが選択したアクションと結果のアプリケーション状態をログに記録してください。専用のクイックスタート記事では、SDK 固有のリクエスト構築を扱えます。このローンチページは、可用性、位置付け、制限、料金に意図的に焦点を当てています。
最終的な推奨
Ling-3.0-Flash-VL は、視覚的証拠が推論やエージェント実行に関与する必要がある場合にテストすべき Ling-3.0-flash ファミリーのメンバーです。Novita の現在のサーバーレス掲載は、画像と動画入力、262K コンテキスト、32K 最大出力、推論、関数呼び出しを組み合わせており、2026年9月23日 2:30 AM UTC までの入力・出力トークン無料が評価の障壁を下げます。
ワークロード固有のテストセットから始め、既存のテキストのみのルートと比較し、回答品質だけでなく運用指標も記録してください。視覚精度とツール安全性の要件を満たす場合は、Novita のモデル ID と現在の料金を構成に保持し、将来のカタログ変更でコードの書き直しが不要になるようにしてください。
Novita AI で Ling-3.0-Flash-VL を試す
FAQ
Novita AI における Ling-3.0-Flash-VL のモデル ID は何ですか?
正確なモデル ID は inclusionai/ling-3.0-flash-vl です。
Ling-3.0-Flash-VL は画像と動画の入力に対応していますか?
はい。Novita の現在の掲載では、テキスト、画像、動画の入力に対応し、出力はテキストです。
Novita が提供するコンテキストウィンドウと出力上限は?
ホスト型掲載では、262,144 トークンのコンテキストウィンドウと最大 32,768 トークンの出力が示されています。これらは Novita デプロイの値であり、本番使用前に再確認する必要があります。
Ling-3.0-Flash-VL は Novita AI で無料ですか?
Novita は現在、2026年9月23日 2:30 AM UTC まで入力・出力トークンを無料で提供しています。その時刻以降に料金に依存する前に、ライブのモデルページを確認してください。
関数呼び出しと推論に対応していますか?
はい。Novita はホスト機能として関数呼び出しと推論の両方を掲載しています。
Ling-3.0-flash との違いは何ですか?
Ling-3.0-Flash-VL は、ネイティブな画像・動画入力と視覚エージェント機能を追加します。現在のベース Ling-3.0-flash ページはテキストのみのファミリー入口であるため、視覚的証拠がリクエストの一部である場合は -VL バリアントを使用してください。
上流モデルは 1M トークンのコンテキストに対応していますか?
公式の InclusionAI モデルカードでは、モデルレベルで最大 1M トークンと記載されています。Novita の現在のホスト型掲載では 262,144 トークンが公開されているため、Novita 経由でリクエストを設計する際はホスト側の値を使用してください。