Novita AI LLM, Mises à jour

Ling-3.0-Flash-VL sur Novita AI : API multimodale native et tarification

Ling-3.0-Flash-VL sur Novita AI : API multimodale native et tarification

Ling-3.0-Flash-VL est disponible sur Novita AI en tant que modèle multimodal serverless pour les applications nécessitant du texte, des images et des vidéos dans un seul workflow API. La liste hébergée pour inclusionai/ling-3.0-flash-vl affiche une fenêtre de contexte de 262 144 tokens, une sortie maximale de 32 768 tokens, des capacités de raisonnement, d’appel de fonction, et des tokens d’entrée et de sortie gratuits jusqu’au 23 septembre 2026 à 2 h 30 UTC. Il s’agit du membre vision-langage de la famille Ling-3.0-flash, apportant une compréhension visuelle native et des capacités d’agent visuel sans nécessiter de pipeline séparé image-texte.

Points clés

  • Ling-3.0-Flash-VL accepte du texte, des images et des vidéos. Novita liste ces trois modalités d’entrée et la sortie texte pour le modèle hébergé.
  • Le point de terminaison Novita est un déploiement avec un contexte de 256K et une sortie de 32K. Les limites exactes sont de 262 144 tokens de contexte et de 32 768 tokens de sortie maximale.
  • Le modèle est sparse avec une grande capacité totale. La fiche officielle InclusionAI décrit 124B de paramètres totaux et environ 5,5B de paramètres activés par token.
  • L’utilisation des tokens est gratuite jusqu’au 23 septembre 2026 à 2 h 30 UTC. Après cette date, revérifiez la page du modèle avant de budgétiser le trafic de production.
  • La principale différence d’utilisation par rapport au Ling-3.0-flash de base est l’entrée visuelle. Utilisez la présentation de Ling-3.0-flash pour le point d’entrée de la famille texte uniquement ; cette page se concentre sur la variante -VL.

Qu’est-ce que Ling-3.0-Flash-VL ?

Ling-3.0-Flash-VL est un modèle multimodal natif d’InclusionAI et l’extension vision-langage de Ling-3.0-flash. La fiche du modèle en amont décrit un système qui intègre les informations visuelles dans la compréhension, le raisonnement, la planification, l’action et la vérification. Ce rôle est plus large que le simple ajout d’un descripteur d’images à un modèle de langage textuel : l’image ou la vidéo peut rester dans le contexte de raisonnement du modèle pendant qu’il exécute une tâche.

La fiche du modèle rapporte 124B de paramètres totaux et environ 5,5B de paramètres activés par token. Il s’agit d’une conception sparse de type Mixture-of-Experts, donc le nombre total de paramètres et les paramètres actifs par token décrivent des propriétés différentes. Le premier indique la capacité globale du modèle ; le second décrit la quantité approximative de calcul routé par token. Aucun de ces chiffres ne garantit une latence ou une qualité de sortie particulière pour votre charge de travail.

L’extension visuelle est la distinction importante pour ce lancement. Le Ling-3.0-flash de base est un modèle texte sur la liste actuelle de Novita, tandis que Ling-3.0-Flash-VL accepte les entrées d’images et de vidéos en plus du texte. Cela rend la page - VL pertinente pour la compréhension d’interfaces, l’analyse de documents et de graphiques, l’inspection visuelle, la réponse à des questions sur des vidéos, et les agents qui doivent interpréter ce qui est à l’écran.

Comment y accéder sur Novita AI

Novita héberge le modèle en tant que point de terminaison serverless avec l’ID de modèle exact inclusionai/ling-3.0-flash-vl. La page du modèle liste les familles de points de terminaison chat/completions et compatibles Anthropic, ainsi que les fonctionnalités de raisonnement et d’appel de fonction. Pour un client existant compatible OpenAI, utilisez l’URL de base de l’API Novita et sélectionnez l’ID de modèle exact dans votre configuration de requête.

La page du modèle est la source de vérité pour la configuration hébergée. En particulier, ne copiez pas la revendication de contexte plus large de la fiche du modèle amont dans une intégration Novita sans véifier les limites de déploiement : la fiche du modèle décrit jusqu’à 1M tokens au niveau du modèle, tandis que Novita expose actuellement 262 144 tokens de contexte et 32 768 tokens de sortie maximale pour cette liste.

Le catalogue actuel montre également une limite de 30 requêtes par minute pour le palier par défaut, avec des valeurs de palier supérieur listées séparément. Traitez cela comme un quota de catalogue, pas comme une garantie de débit d’application universel. Le palier de compte, la taille de la requête, la concurrence, les tentatives et l’exécution des outils peuvent tous affecter le débit de bout en bout.

Résumé des spécifications et de la tarification

Champ Détails
Nom d’affichage Ling 3.0 Flash VL
ID du modèle inclusionai/ling-3.0-flash-vl
Architecture 124B paramètres totaux ; environ 5,5B actifs par token ; sparse MoE
Modalités d’entrée Texte, image et vidéo
Modalité de sortie Texte
Fenêtre de contexte 262 144 tokens sur le déploiement Novita
Sortie maximale 32 768 tokens
Fonctionnalités hébergées Serverless, appel de fonction, raisonnement
Familles de points de terminaison chat/completions, compatible Anthropic
RPM du catalogue 30 RPM sur le palier de liste par défaut
Prix d’entrée Gratuit jusqu’au 23 septembre 2026 à 2h30 UTC
Prix de sortie Gratuit jusqu’au 23 septembre 2026 à 2h30 UTC

L’offre gratuite est utile pour l’évaluation jusqu’au 23 septembre 2026 à 2h30 UTC. Avant le lancement, enregistrez le prix actuel, ajoutez une garde budgétaire, et déciidez quel modèle ou file d’attente doit reprendre le trafic après la fin de la péiode promotinnelle.

Que peuvent construire les dévoloppeurs avec ?

Comprendre des documénts, des graphiques et des interfaçes

L’entée visuelle peut réduir la quantité de prétraitement nécessaire pour les documents, tableaux de bord, captures d’écran et interfaçes logicielles. Un dévoloppeur peut transmétre une capture d’écran avec une instruction de tâche et demander au modèle d’identifir des champs, de résumir l’état visble ou de locaiser une cible d’interacton. Pour les documents et graphiques, testez si le modèle conserve les unités, légendes, structre de tableaux et reltions spatiles plutôt que de juger à partir d’un court exemple de légende.

Raisonner sur des images et des vidéos

L’architectre en amont utilie un encodeur visuel et un traitment de positton temrels pour la vidéo. Ceci est pertnent quand la réonse dépent de l’évolution dans le temls, par exemple identifir quand un événement se prodit, comparer deux moments dans un clip, ou extrair une séquence d’actons. Les longues vidéos nécessitent toujours un échantillonnage et une conception de prmpt soigneux : une grande limite de contexe ne rend pas automatiquent chaque image également utile ou abordable après les chngeements de prix.

Supporter des agents visuels

Le positionnment d’agent visuel du modèle convient aux workflows où la percton n’est qu’une étape d’une boucle plus large. Un agent peut inspecter une capture d’écran de navigateur, raisoner sur la prochaine action, appeler un outil, et vérifier l’écran résultant. L’appel de fonction peut fournir la limite d’action, tandis que le contexte visuel fournit des preuves pour décider quelle action entreprendre. Gardez les autorisations restreintes et validez chaque argument d’outil ; la compréhension multimodale ne remplace pas le besoin de vérifications de sécurité côté application.

Acheminer des charges de travail mixtes texte et visuel

Les équipes qui acheminent déjà des tâches textuelles vers Ling-3.0-flash peuvent évaluer la variante - VL pour les requêtes contenant des éments visuels. Un routeur pratique peut envoyer le trafic textuel seul vers le modèle de base et réserver la variante visuelle pour les mesages contenant des images, des vidéos ou un état dérivé de capture d’écran. Mesurez le route complet, y compris la préparatio d’image, le temps de téléchargement, la latence du modèle, les tentatives, et les appels d’outil aval.

Signaux de perfomance et évaluaton

La fiche officielle du modèle InclusionAI rapporte un score de 42 sur l’Artificial Analysis Intelligence Index v4.1.1 et décrit des dimenions de capacité multimodale inclant la compréhénsion, le raisnnement et l’acton. C’est un signl utile sur la vrsion en amont, pas une garntie pour le déploiement hébergé par Novita ou pour votre distributon de prmpt. La page note églement une configuratio d’évaluatson Terminal-Bench avec un contexte de 256K, qui est plus proche de la limit du contexte hébergé que la déclaration générale « jusqu’à 1M » de la fiche du modèle.

Pour une évaluation signifcative, utilisez un petit ensemble de tâches qui reflète votre produit :

  • Extraction visuelle : mesurez la précision des champs sur les captures d’écran, formulaires, tableaux et graphiques.
  • Raisonnement temporel : testez si les réponses identifient le bon événement et la bonne plage de temps dans de courtes vidéos.
  • Exécution agent : notez à la fois l’outil choisi et l’état final après l’exécution de l’outil.
  • Ancrage : incluez des images avec des détails ambigus ou non pertinents et vérifiez les affirmations non étayées.
  • Opérations : enregistrez la latence, l’utilisation de tokens, le taux d’échec, le comportement de limitation de débit et l’effet des tentatives.

N’utilisez pas un score de référence en amont comme substitut à ces vérifications d’application. Un modèle peut bien performrer sur un repère public tout en nécessitant des changements de prmpt, de prétraitement ou de routage dans une interfaçe de production.

Quand utiliser Ling-3.0-Flash-VL

Chosissez Ling-3.0-Flash-VL lorsque votre requête contient des preves visuelles et que la répnse nécessite plus qu’une légende unique. C’est un bon canddat à évaluer pour :

  • la compréhénsion de captures d’écran et d’interfaçes de navigateur
  • les réponses à des questions sur des graphiques, tableaux et documents
  • la localisation et le résumé d’événements dans de courtes vidéos
  • les agents utilisant des outils visuels
  • les workflows de support mixtes texte et image

La liste gratuite jusqu’au 23 septembre 2026 à 2h30 UTC rend pratique la construction d’un ensemble de test représentatif avant de s’engager dans un plan de routage payant. Capturez l’état de la tarification lorsque vous effectuez ces tests afin que les comparaisons de coûts restent reproductibles.

Quand choisir un autre modèle

Chosissez le modèle de base Ling-3.0-flash pour les charges de travail textuelles uniquement si vous n’avez pas besoin d’entrées visuelles. Un route textuel seul peut simplifier la gestion des charges utiles et réduire le traitement multimodal inutile.

Chosissez un autre modèle si vous avez besoin d’un prix fixe permanent, d’un plafond de contexte ou de sortie différent, d’un niveau de service de latence testé, d’une entrée audio ou d’une capacité non listée pour ce déploiement. Gardez également une solution de repli si votre application dépend de l’offre gratuite se terminant le 23 septembre 2026 à 2h30 UTC. La conception de production la plus sûre traite le prix promotionnel et le quota du catalogue comme une configuration modifiable, pas comme des garanties de produit codées en dur.

Comment il s’intègre dans un workflow API existant

À haut niveau, une application existante compatible OpenAI a besoin d’une clé API Novita, de l’URL de base compatible OpenAI de Novita, et de inclusionai/ling-3.0-flash-vl comme ID de modèle. La requête doit utiliser la structure de message multimodale prise en charge par le point de terminaison sélectionné, avec du contenu image ou vidéo à côté de l’instruction textuelle de l’utilisateur.

Gardez les assets visuels accessibles au point de terminaison et validez leur format avant de les envoyer. Pour un workflow agent, définissez les outils séparément du contenu visuel, restreignez ce que chaque outil peut faire, et enregistrez l’action sélectionnée par le modèle et l’état d’application résultant. Un article de démarrage rapide dédié peut couvrir la construction de requêtes spécifique au SDK ; cette page de lancement se concentre délibérément sur la disponibilité, le positionnement, les limites et la tarification.

Recommandation finale

Ling-3.0-Flash-VL est le membre de la famille Ling-3.0-flash à tester lorsque des preuves visuelles doivent participer au raisonnement ou à l’exécution d’un agent. La liste serverless actuelle de Novita combine une entrée d’image et de vidéo avec un contexte de 262K, une sortie maximale de 32K, le raisonnement et l’appel de fonction, tandis que les tokens d’entrée et de sortie gratuits jusqu’au 23 septembre 2026 à 2h30 UTC abaissent la barrière à l’évaluation.

Commencez par un ensemble de test spécifique à la charge de travail, comparez-le avec votre route textuel existant, et enregistrez les métriques opérationnelles ainsi que la qualité des réponses. S’il répond à vos exigences de précision visuelle et de sécurité des outils, conservez l’ID de modèle Novita et la tarification actuelle dans la configuration afin qu’un futur changement de catalogue ne nécessite pas de réécriture de code.

Essayez Ling-3.0-Flash-VL sur Novita AI

FAQ

Quel est l’ID du modèle Ling-3.0-Flash-VL sur Novita AI ?

L’ID exact du modèle est inclusionai/ling-3.0-flash-vl.

Ling-3.0-Flash-VL prend-il en charge l’entrée d’images et de vidéos ?

Oui. La liste actuelle de Novita prend en charge les entrées texte, image et vidéo, avec une sortie texte.

Quelle fenêtre de contexte et quelle limite de sortie Novita fournit-il ?

La liste hébergée montre une fenêtre de contexte de 262 144 tokens et une sortie maximale de 32 768 tokens. Ce sont les valeurs du déploiement Novita et doivent être revérifiées avant une utilisation en production.

Ling-3.0-Flash-VL est-il gratuit sur Novita AI ?

Novita propose actuellement des tokens d’entrée et de sortie gratuits jusqu’au 23 septembre 2026 à 2h30 UTC. Confirmez la page du modèle en direct après cette date avant de vous fier au prix.

Prend-il en charge l’appel de fonction et le raisonnement ?

Oui. Novita liste à la fois l’appel de fonction et le raisonnement parmi les fonctionnalités hébergées.

En quoi est-il différent de Ling-3.0-flash ?

Ling-3.0-Flash-VL ajoute une entrée native d’images et de vidéos ainsi que des capacités d’agent visuel. La page actuelle de Ling-3.0-flash de base est un point d’entrée de la famille texte uniquement, donc utilisez la variante -VL lorsque des preuves visuelles font partie de la requête.

Le modèle en amont prend-il en charge un contexte de 1M de tokens ?

La fiche officielle du modèle InclusionAI décrit jusqu’à 1M de tokens au niveau du modèle. La liste hébergée actuelle de Novita expose 262 144 tokens, donc utilisez la valeur hébergée lors de la conception de requêtes via Novita.

Articles recommandés

Articles associés