Ling-3.0-Flash-VLは、テキスト・画像・動画の入力を1つのAPIワークフローで扱う必要があるアプリケーション向けに、Novita AIでサーバーレスのマルチモーダルモデルとして利用できます。ホストされている inclusionai/ling-3.0-flash-vl の表示には、262,144トークンのコンテキストウィンドウ、32,768トークンの最大出力、推論、関数呼び出しが示され、入力・出力とも100万トークンあたり$0で、期間限定無料のラベルが付いています(2026年9月9日時点)。これはLing-3.0-flashファミリーのビジュアル言語モデルであり、個別の画像変換パイプラインを用意しなくても、ネイティブな視覚理解とビジュアルエージェント機能を追加できます。
主なポイント
- Ling-3.0-Flash-VLはテキスト・画像・動画の入力に対応します。 Novitaはこのホストモデルについて、上記3つの入力モダリティとテキスト出力を掲載しています。
- Novitaのエンドポイントは256Kコンテキスト・32K出力のデプロイメントです。 正確な上限は、コンテキスト262,144トークン、最大出力32,768トークンです。
- このモデルは総容量が大きく、スパースなモデルです。 公式のInclusionAIモデルカードには、総パラメータ数124B、1トークンあたり約5.5Bの活性化パラメータと記載されています。
- 現在のトークン価格は$0です。 Novitaは入力・出力とも100万トークンあたり$0としており、期間限定無料と表示しています。本番トラフィックの予算を立てる前に、モデルページを再確認してください。
- ベースのLing-3.0-flashとの主なユースケースの違いは視覚入力です。 テキストのみのファミリーの入門情報はLing-3.0-flashの概要 を参照してください。本ページでは
-VLバリアントに焦点を当てます。
Ling-3.0-Flash-VLとは
Ling-3.0-Flash-VLは、InclusionAIによるネイティブなマルチモーダルモデルであり、Ling-3.0-flashのビジュアル言語拡張版です。アップストリームのモデルカードでは、視覚情報を理解・推論・計画・行動・検証に取り込むシステムとして説明されています。これは、テキストのみの言語モデルに画像キャプショナーを取り付けるのよりも広い役割です。タスクを処理している間も、画像や動画をモデルの推論コンテキストの一部として保持できます。
モデルカードによると、総パラメータ数は124B、1トークンあたりの活性化パラメータは約5.5Bです。これはスパースなMixture-of-Experts(MoE)設計であり、総パラメータ数とトークンごとの活性化パラメータは異なる性質を表します。前者はモデル全体の容量を示し、後者は各トークンに対してルーティングされる計算量のおおよそを示します。どちらか一方の数値だけで、特定のレイテンシーや、お使いのワークロードにおける出力品質が保証されるわけではありません。
今回のリリースの重要な違いはビジュアル拡張です。Novitaの現在の提供では、ベースのLing-3.0-flashはテキストモデルですが、Ling-3.0-Flash-VLはテキストに加えて画像と動画の入力も受け付けます。そのため、-VL のページは、インターフェース理解、文書・グラフ分析、視覚検査、動画の質問応答、画面上の内容を解釈する必要があるエージェントに関連します。
Novita AIでのアクセス方法
Novitaは、モデルID inclusionai/ling-3.0-flash-vl で、このモデルをサーバーレスエンドポイントとしてホストしています。モデルページには、chat/completions とAnthropic互換のエンドポイントファミリーに加えて、推論・関数呼び出しの機能が掲載されています。既存のOpenAI互換クライアントを使用する場合は、NovitaのAPIベースURLを使い、リクエスト設定で正確なモデルIDを選択してください。
ホストされる設定の正しい情報源はモデルページです。特に、デプロイメントの上限を確認せずに、アップストリームのモデルカードに記載された大きなコンテキストの記述をNovitaのインテグレーションに持ち込まないでください。モデルカードではモデルレベルで最大1Mトークンと説明されていますが、Novitaが現在このモデルに対して公開しているのは、262,144トークンのコンテキストと32,768トークンの最大出力です。
現在のカタログには、デフォルトティアの上限として1分あたり30リクエスト(30 RPM)も表示されており、上位ティアの値は別途掲載されています。これはカタログ上の割り当てであり、アプリケーション全体で保証されるスループットではありません。アカウントティア、リクエストサイズ、並行性、リトライ、ツール実行はすべて、エンドツーエンドのスループットに影響を与える可能性があります。
仕様と料金のまとめ
| フィールド | 詳細 | 出典 / 確認日 |
|---|---|---|
| 表示名 | Ling 3.0 Flash VL | Novitaモデルページ、2026年9月9日 |
| モデルID | inclusionai/ling-3.0-flash-vl |
Novitaモデルページ、2026年9月9日 |
| アーキテクチャ | 総パラメータ数124B、1トークンあたり約5.5Bの活性化パラメータ、スパースMoE | InclusionAI公式モデルカード、2026年9月9日 |
| 入力モダリティ | テキスト・画像・動画 | Novitaモデルページ、2026年9月9日 |
| 出力モダリティ | テキスト | Novitaモデルページ、2026年9月9日 |
| コンテキストウィンドウ | Novitaデプロイメント上では262,144トークン | Novitaモデルページ、2026年9月9日 |
| 最大出力 | 32,768トークン | Novitaモデルページ、2026年9月9日 |
| ホスト機能 | サーバーレス、関数呼び出し、推論 | Novitaモデルページ、2026年9月9日 |
| エンドポイントファミリー | chat/completions、Anthropic互換 |
Novitaモデルページ、2026年9月9日 |
| カタログRPM | デフォルトの掲載ティアで30 RPM | Novitaモデルページ、2026年9月9日 |
| 入力価格 | 100万トークンあたり$0、現在は期間限定無料と表示 | Novitaモデルページ、2026年9月9日 |
| 出力価格 | 100万トークンあたり$0、現在は期間限定無料と表示 | Novitaモデルページ、2026年9月9日 |
$0という価格は評価には便利ですが、検証していない本番環境の前提にすべきではありません。リリース前に現在の価格を記録し、予算ガードを追加し、プロモーション期間が終了した場合にどのモデルまたはキューがトラフィックを受け取るかを決めておいてください。
開発者は何を作れるのか
文書・グラフ・インターフェースを理解する
視覚入力により、文書、ダッシュボード、スクリーンショット、ソフトウェアのインターフェースに必要な前処理を減らせます。開発者は、タスクの指示と一緒にスクリーンショットを渡し、フィールドの特定、表示状態の要約、操作対象の位置の特定をモデルに依頼できます。文書やグラフについては、短いキャプションの例だけで判断するのではなく、単位、凡例、テーブル構造、空間的な関係をモデルが保持できるかをテストしてください。
画像と動画に対して推論する
アップストリームのアーキテクチャは、視覚エンコーダーと、動画における時間的位置の処理を使用します。これは、イベントが発生するタイミングの特定、クリップ内の2つの瞬間の比較、一連のアクションの抽出など、回答が時間の経過に依存する場合に関係します。長い動画では、フレームのサンプリングとプロンプト設計を慎重に行う必要があります。コンテキスト上限が大きいからといって、すべてのフレームが自動的に同じように有用になるわけではなく、価格変更後も同様に費用対効果が保たれるわけでもありません。
ビジュアルエージェントをサポートする
このモデルのビジュアルエージェントとしての位置づけは、知覚がより大きなループの中の1つの段階にすぎないワークフローに適しています。エージェントがブラウザのスクリーンショットを確認し、次のアクションを推論し、ツールを呼び出し、その結果の画面を検証する、といった流れが考えられます。関数呼び出しはアクションの境界を提供し、視覚コンテキストは次に何をするかを判断するための根拠を提供します。権限は狭く保ち、すべてのツール引数を検証してください。マルチモーダルな理解が可能でも、アプリケーション側の安全チェックの必要性はなくなりません。
テキストと視覚が混在するワークロードをルーティングする
すでにテキストタスクをLing-3.0-flashにルーティングしているチームは、視覚的な証拠を含むリクエストについて -VL バリアントを評価できます。実用的なルーターは、テキストのみのトラフィックをベースモデルに送り、画像・動画・スクリーンショット由来の状態を含むメッセージには視覚バリアントを割り当てられます。画像の準備、アップロード時間、モデルのレイテンシー、リトライ、後続のツール呼び出しを含むルート全体を測定してください。
パフォーマンスのシグナルと評価
公式のInclusionAIモデルカードは、Artificial Analysis Intelligence Index v4.1.1で42点を報告しており、理解・推論・行動を含むマルチモーダル能力の側面を説明しています。これはアップストリームのリリースに関する有益なシグナルですが、Novitaがホストするデプロイメントや、お使いのプロンプト分布での性能を保証するものではありません。また、モデルページには256KコンテキストのTerminal-Bench評価構成も記載されており、これはモデルカードの一般的な「最大1M」という記述よりも、ホスト環境のコンテキスト上限に近い値です。
意味のある評価を行うには、製品を反映した小規模なタスクセットを使用してください。
- ビジュアル抽出: スクリーンショット、フォーム、テーブル、グラフでフィールド精度を測定します。
- 時間的推論: 短い動画で、回答が正しいイベントと時間範囲を特定できるかをテストします。
- エージェント実行: 選択されたツールと、ツール実行後の最終状態の両方を評価します。
- グラウンディング: あいまいなディテールや無関係なディテールを含む画像を加え、裏付けのない主張がないか確認します。
- 運用面: レイテンシー、トークン使用量、失敗率、レート制限の動作、リトライの影響を記録します。
アップストリームのベンチマークスコアを、これらのアプリケーション上のチェックの代わりに使わないでください。公開ベンチマークで優れた結果を出しても、本番インターフェースではプロンプト、前処理、ルーティングの変更が必要になることがあります。
Ling-3.0-Flash-VLを使うべきケース
リクエストに視覚的な証拠が含まれ、ワンショットのキャプション以上の回答が必要な場合は、Ling-3.0-Flash-VLを選択してください。以下の用途で評価するのに適した候補です。
- スクリーンショットとブラウザインターフェースの理解
- グラフ・テーブル・文書の質問応答
- ショート動画のイベント位置特定と要約
- ツールを使用するビジュアルエージェント
- テキストと画像が混在するサポートワークフロー
現在は無料で提供されているため、有料のルーティングプランにコミットする前に、代表的なテストセットを構築することも現実的です。テストを実行する際は、日付と価格の状態を記録し、コスト比較を再現可能にしてください。
他のモデルを選ぶべきケース
視覚入力が不要で、テキストのみのワークロードには、ベースとなるLing-3.0-flashのモデルページ を選択してください。テキストのみのルートは、ペイロード処理を簡素化し、不要なマルチモーダル処理を減らせます。
恒久的に固定された価格、異なるコンテキスト・出力上限、検証済みのレイテンシーサービスレベル、音声入力、またはこのデプロイメントに記載されていない機能が必要な場合は、別のモデルを選択してください。また、アプリケーションが現在の期間限定無料オファーに依存する場合は、フォールバックも用意してください。最も安全な本番設計は、プロモーション価格とカタログ上の割り当てを変更可能な設定として扱い、ハードコードされた製品保証として扱わないことです。
既存のAPIワークフローへの組み込み方
大まかに言うと、既存のOpenAI互換アプリケーションには、Novita APIキー、NovitaのOpenAI互換ベースURL、モデルIDとして inclusionai/ling-3.0-flash-vl が必要です。リクエストは、選択したエンドポイントがサポートするマルチモーダルメッセージ構造を使用し、ユーザーのテキスト指示と一緒に画像・動画コンテンツを含める必要があります。
視覚アセットはエンドポイントからアクセスできる状態に保ち、送信前にフォーマットを検証してください。エージェントワークフローの場合は、ツールを視覚コンテンツとは別に定義し、各ツールが実行できることを制限し、モデルが選択したアクションと、その結果のアプリケーション状態をログに記録してください。SDK固有のリクエスト構築については、専用のクイックスタート記事で説明しています。このリリースページは、利用可能性、位置づけ、制限、料金に意図的に焦点を当てています。
最終的な推奨事項
Ling-3.0-Flash-VLは、推論やエージェント実行に視覚的な証拠を参加させる必要がある場合にテストすべき、Ling-3.0-flashファミリーのモデルです。Novitaの現在のサーバーレス提供は、画像・動画入力と262Kコンテキスト、32Kの最大出力、推論、関数呼び出しを組み合わせており、入力・出力とも$0という料金は、現在の期間限定の期間中、評価のハードルを下げています。
まずワークロード固有のテストセットから始め、既存のテキストのみのルートと比較し、回答品質だけでなく運用指標も記録してください。視覚的な正確性とツール安全性の要件を満たす場合は、NovitaのモデルIDと現在の価格を設定として保持し、将来カタログが変更されてもコードを書き換える必要がないようにしてください。
Novita AIでLing-3.0-Flash-VLを試す
FAQ
Novita AIにおけるLing-3.0-Flash-VLのモデルIDは?
正確なモデルIDは inclusionai/ling-3.0-flash-vl です。
Ling-3.0-Flash-VLは画像と動画の入力に対応していますか?
はい。Novitaの現在の提供は、テキスト・画像・動画の入力に対応し、出力はテキストです。
Novitaが提供するコンテキストウィンドウと出力上限は?
ホストされている提供では、262,144トークンのコンテキストウィンドウと32,768トークンの最大出力が表示されています。これらはNovitaデプロイメントの値であり、本番利用の前に再確認してください。
Ling-3.0-Flash-VLはNovita AIで無料ですか?
Novitaは現在、入力100万トークンあたり$0、出力100万トークンあたり$0と掲載し、期間限定無料とラベル付けしています。価格は変更される可能性があるため、利用前に実際のモデルページを確認してください。
関数呼び出しと推論に対応していますか?
はい。Novitaはホスト機能として、関数呼び出しと推論の両方を掲載しています。
Ling-3.0-flashとの違いは?
Ling-3.0-Flash-VLは、ネイティブな画像・動画入力とビジュアルエージェント機能を追加しています。現在のベースのLing-3.0-flashページはテキストのみのファミリーの入門情報なので、リクエストに視覚的な証拠が含まれる場合は -VL バリアントを使用してください。
アップストリームのモデルは1Mトークンのコンテキストに対応していますか?
公式のInclusionAIモデルカードには、モデルレベルで最大1Mトークンと記載されています。Novitaの現在のホスト提供では262,144トークンが公開されているため、Novita経由でリクエストを設計するときは、ホスト環境の値を使用してください。
関連記事
- Novita AIでのLing-3.0-flash:エージェント推論向け無料API
- Ling-3.0-flash APIクイックスタート:エージェントワークフローにおける関数呼び出しと推論
- Novita AIでのKling 2.6:ネイティブオーディオ付きシネマグレード動画
