Novita AI で Macaron V1 Venti:コーディング、エージェント、GenUI 向け 748B Mixture-of-LoRA フラッグシップ

Novita AI で Macaron V1 Venti:コーディング、エージェント、GenUI 向け 748B Mixture-of-LoRA フラッグシップ

Macaron V1 Venti が Novita AI で利用可能になりました。これにより、開発者は GLM-5.2 をベースにした 7480 億パラメータの Mixture-of-LoRA モデルにホスト型 API からアクセスできるようになります。このモデルは、単なるチャットを超えたワークロード、つまりソフトウェア開発、自律エージェント、そして生成ユーザーインターフェース(GenUI)を対象としています。

実用的な要点はシンプルです。Venti は、アプリケーションが非常に大規模なモデルと異常に長いコンテキストウィンドウの恩恵を受ける場合に評価する価値がありますが、すべての本番ワークロードに自動的に最適な選択肢となるわけではありません。小規模なモデルの方が、運用が容易で、短いプロンプトに対して高速で、厳密に範囲が定められたタスクに対してより予測可能であることが多いです。

Novita AI で Macaron V1 Venti を試す

Macaron V1 Venti とは何か?

Macaron V1 Venti は、Macaron V1 ファミリーのフラッグシップバリアントです。その最大のスペックは、Mixture of LoRA(MoL) アーキテクチャを使用した **748B の総パラメータ数 ** です。Novita のリストでは、**744B のベースモデル ** に 4 つの 1B LoRA スペシャリスト と、各リクエストに最適なスペシャリストを選択する L0 ルーターを備えていると説明されています。

Venti という名前が重要なのは、これが軽量なコーディングアシスタントではないからです。これは、モデルが大量のプロジェクトコンテキストを追跡し、複数のステップを調整し、自然言語のリクエストから構造化されたインターフェースを生成する必要があるタスク向けに位置づけられています。スペシャリストルーティングこそが、Macaron を、汎用的なプロンプトだけでなく、タスク固有の動作を考える開発者にとって関連性の高いものにしている理由です。

Macaron V1 Venti の仕様

以下の詳細は、2026 年 7 月 27 日 に確認した Novita AI のモデルリストに基づいています。

仕様 Macaron V1 Venti
モデル ID mindai/macaron-v1-venti
総パラメータ数 748B
アーキテクチャ GLM-5.2 上の Mixture of LoRA
コンテキストウィンドウ 1,048,576 トークン
入力タイプ テキスト
主な出力 テキスト
ホスティング Novita AI サーバーレス API

100 万トークンのコンテキストウィンドウは、アプリケーションビルダーにとって最もすぐに役立つ数値です。これにより、大規模なリポジトリ、長いエージェントトレース、製品要件、デザインリファレンス、または複数の関連ドキュメントを 1 つのセッションに収める余地が生まれます。ただし、すべての長いプロンプトが正しい回答を生成することを保証するものではありません。検索品質、プロンプト構成、ツール設計、出力制限が、アプリケーションの適切な動作を左右します。

開発者が注目する理由

実際のリポジトリ全体でのコーディング

短いコード生成プロンプトがソフトウェア作業の難しい部分であることはほとんどありません。より難しいのは、多数のファイルに分散した規約、依存関係、テストの失敗、インターフェース契約、変更を追跡し続けることです。大きなコンテキストウィンドウにより、コーディングワークフローはその背景情報を直接提供する余地が大きくなります。

Venti は、リポジトリレベルの分析、リファクタリング計画、移行作業、および積極的な要約が必要となるデバッグセッションの候補となります。チームは依然として、段階的に検査し、テストで変更を検証するように依頼する必要があります。コンテキストが増えるとトランケーションは減りますが、エンジニアリングレビューの必要性がなくなるわけではありません。

長時間実行エージェント

エージェントシステムは状態を蓄積します:ユーザーの意図、ツールの結果、中間計画、エラー、決定事項です。その状態が繰り返し圧縮されると、重要な制約が見えなくなる可能性があります。Venti のコンテキスト容量は、長期にわたる作業履歴を保持する必要がある研究エージェント、コーディングエージェント、運用アシスタントの実験に適しています。

トレードオフはシステム設計です。大規模なコンテキストは状態管理の代わりにはなりません。耐久性のある事実はプロンプトの外部に保存し、完了したブランチは要約し、範囲を限定したツールを公開してください。これらのプラクティスにより、動作のデバッグが容易になり、モデルがはるかに多くの入力を受け入れられる場合でも、トークン使用量を制御できます。

生成ユーザーインターフェース

GenUI アプリケーションは、モデルに意図をインターフェース構造(フォーム、ダッシュボード、ワークフロー、インタラクティブコンポーネント)に変換するよう求めます。これには、言語理解と、計画、スキーマ準拠、コード生成が組み合わされます。Venti は、詳細な製品要件をマルチスクリーンの UI コンセプトや構造化されたコンポーネントツリーに変換するプロトタイプに最適です。

本番環境の GenUI では、厳格なコンポーネントレジストリと検証レイヤーとモデルを組み合わせて使用してください。生成された任意のコードをユーザー向けアプリケーションに直接レンダリングしないでください。実行前にコンポーネント名、プロパティ、データアクセス、アクションを検証してください。

Novita AI での料金とアクセス

2026 年 7 月 27 日のリスト確認時点では、Novita AI は Macaron V1 Venti について 入力トークン 100 万あたり 0 ドル、出力トークン 100 万あたり 0 ドル と表示していました。料金と提供状況は変更される可能性があるため、本番環境のデプロイメントの予算を立てる前に、最新の Novita モデルページ を確認してください。

ホスト型での提供が主な運用上の利点です。開発者は、748B モデルをサービス提供するために必要なハードウェアを準備する代わりに、Novita のモデルエンドポイントを通じて Venti を評価し、既存のアプリケーションやエージェントフレームワークに接続できます。API ルート、認証要件、レート制限、およびアカウントレベルの使用ポリシーは、ローンチ前に現在の Novita のドキュメントとコンソールで確認する必要があります。

無料表示の料金は、恒久的なキャパシティ保証として扱われるべきではありません。重要なワークロードの場合は、想定するアカウントとトラフィック条件下で、レイテンシ、同時実行数、出力長、障害モード、実効コストを測定してください。製品がキューイングや一時的なモデル利用不可を許容できない場合は、より小規模なフォールバックモデルを用意しておいてください。

Macaron V1 Venti と小規模モデルの比較

Venti が最も効果を発揮するのは、タスクがコンテキスト集約型であるか、広範な計画の恩恵を受ける場合です。リクエストが短い場合、レイテンシに敏感な場合、または決定論的に検証が容易な場合には、通常、小規模なモデルの方が適切なデフォルトとなります。

次の場合に Venti を選択 次の場合に小規模モデルを選択
リポジトリ規模のコーディングコンテキストが必要な場合 高速な分類や抽出が必要な場合
長いエージェント履歴とツールトレースが必要な場合 高同時実行環境で予測可能なレイテンシが必要な場合
マルチステップの UI またはワークフロー生成が必要な場合 低コストで大量の短いプロンプトが必要な場合
非常に大規模なモデルをテストするホスト型の手段が必要な場合 ローカルインフラに適合するコンパクトなモデルが必要な場合

適切な比較は、パラメータ数だけではありません。Venti と現在のモデルで同じ代表的なタスクを実行してください。タスクの完了成功率、ツールコールの有効性、最初のトークンまでの時間、合計レイテンシ、コンテキスト消費量、人間による修正時間を追跡してください。これらの測定値により、Venti の追加容量がモデルカードだけでなく、製品自体を改善するかどうかがわかります。

誰が使用すべきか?

Macaron V1 Venti は、以下のようなケースで有力な候補です。

  • リポジトリを認識するコーディングアシスタントを構築している開発者。
  • 長いコンテキストを持つ研究用または運用エージェントをプロトタイピングしているチーム。
  • 自然言語からインターフェースへのワークフローを探求しているプロダクトエンジニア。
  • 非常に大規模な MoL モデルがホスト型 API を通じてどのように動作するかを評価している研究者。

一方、単純な FAQ ボット、ワンショットテキスト分類、またはほとんどのプロンプトが小さなコンテキストウィンドウに快適に収まるワークロードには、あまり魅力的ではありません。そのようなアプリケーションは、すべてのリクエストを 748B のフラッグシップに送信するよりも、小規模で高速なモデルと注意深い検索から恩恵を受けることが多いです。

結論

Macaron V1 Venti は、Novita AI に珍しい組み合わせをもたらします:748B の Mixture-of-LoRA フラッグシップ、1,048,576 トークンのコンテキストウィンドウ、そして基盤となるインフラを運用したくない開発者向けのホスト型 API パスです。その最も強力なユースケースは、コンテキストと計画が重要となるコーディング、長時間実行エージェント、GenUI ワークフローです。

限定的な評価から始めてください。代表的なリポジトリまたはエージェントタスクを使用し、成功基準を事前に定義し、すでにデプロイしているモデルと比較してください。Venti が、そのレイテンシと統合要件を正当化するのに十分な完了品質の向上をもたらすのであれば、Novita AI は実験からアプリケーションへの実用的なパスを提供します。

FAQ

Macaron V1 Venti は Novita AI で利用できますか?

はい。Novita AI は Macaron V1 Venti を、ホスト型 API を通じて利用可能なサーバーレスモデルとしてリストしています。本番環境で使用する前に、最新のモデルページとアカウントポリシーを確認してください。

コンテキストウィンドウはどのくらいですか?

Novita AI のリストには 1,048,576 トークンのコンテキストウィンドウと表示されています。実際のアプリケーションの動作は、プロンプト構造、出力制限、ツールオーケストレーション、およびアカウントで利用可能なサービング構成にも依存します。

このモデルは無料ですか?

2026 年 7 月 27 日に確認したリストでは、入出力トークン 100 万あたり 0 ドルと表示されていました。料金とアクセスポリシーは変更される可能性があるため、予算やローンチ計画を確定する前に、最新のリストを確認してください。

この記事には API クイックスタートは含まれていますか?

いいえ。この記事はローンチと公式情報の概要です。エンドポイント固有の統合手順については、最新の Novita AI ドキュメントとコンソールを参照してください。

おすすめ記事

Novita AI の MiniMax M2.7:トップクラスの知能、予算に優しい価格設定
別の大規模ホスト型モデルが、エージェントの信頼性、ツール使用、コスト意識の高いデプロイメントにどのように取り組んでいるかをご覧ください。

Novita AI の Ling-2.6-flash:340 トークン/秒、約 7 倍のトークン効率
エージェントワークロード向けの速度と効率重視の MoE モデルを比較します。

Novita AI の Qwen3.5-397B-A17B
別の大規模スパースモデルを探索し、そのデプロイメントプロファイルを比較ポイントとして使用します。