Ling-3.0-Flash-VL na Novita AI: API multimodal nativa e preços

Ling-3.0-Flash-VL na Novita AI: API multimodal nativa e preços

O Ling-3.0-Flash-VL está disponível na Novita AI como um modelo multimodal serverless para aplicações que precisam de entrada de texto, imagem e vídeo em um único fluxo de trabalho de API. A listagem hospedada para inclusionai/ling-3.0-flash-vl mostra uma janela de contexto de 262.144 tokens, saída máxima de 32.768 tokens, raciocínio, chamada de funções e $0 por milhão de tokens de entrada e saída com um rótulo de gratuito por tempo limitado, verificado em 9 de setembro de 2026. É o membro de linguagem visual da família Ling-3.0-flash, adicionando compreensão visual nativa e capacidades de agente visual, em vez de exigir um pipeline separado de imagem para texto.

Principais conclusões

  • Ling-3.0-Flash-VL aceita texto, imagens e vídeos. A Novita lista essas três modalidades de entrada e saída de texto para o modelo hospedado.
  • O endpoint da Novita é uma implantação com contexto de 256K e saída de 32K. Os limites exatos são 262.144 tokens de contexto e 32.768 tokens máximos de saída.
  • O modelo é esparso com grande capacidade total. O cartão do modelo oficial da InclusionAI descreve 124B de parâmetros totais e cerca de 5,5B de parâmetros ativados por token.
  • O preço atual dos tokens é $0. A Novita marca tanto a entrada quanto a saída a $0 por milhão de tokens e rotula a oferta como por tempo limitado, portanto, verifique novamente a página do modelo antes de orçar o tráfego de produção.
  • A principal diferença de caso de uso em relação ao Ling-3.0-flash base é a entrada visual. Use a visão geral do Ling-3.0-flash para o ponto de entrada da família somente texto; esta página foca na variante -VL.

O que é o Ling-3.0-Flash-VL?

O Ling-3.0-Flash-VL é um modelo multimodal nativo da InclusionAI e a extensão de linguagem visual do Ling-3.0-flash. O cartão do modelo upstream descreve um sistema que traz informações visuais para compreensão, raciocínio, planejamento, ação e verificação. Esse é um papel mais amplo do que anexar um legendador de imagem a um modelo de linguagem somente texto: a imagem ou o vídeo podem permanecer parte do contexto de raciocínio do modelo enquanto ele trabalha em uma tarefa.

O cartão do modelo relata 124B de parâmetros totais e aproximadamente 5,5B de parâmetros ativados por token. Este é um design esparso de Mixture-of-Experts, portanto, a contagem total de parâmetros e os parâmetros ativos por token descrevem propriedades diferentes. O primeiro indica a capacidade geral do modelo; o segundo descreve a quantidade aproximada de computação roteada para cada token. Nenhum dos números garante uma latência ou qualidade de saída específica na sua carga de trabalho.

A extensão visual é a distinção importante para este lançamento. O Ling-3.0-flash base é um modelo de texto na listagem atual da Novita, enquanto o Ling-3.0-Flash-VL aceita entradas de imagem e vídeo, além de texto. Isso torna a página -VL relevante para compreensão de interfaces, análise de documentos e gráficos, inspeção visual, resposta a perguntas em vídeo e agentes que precisam interpretar o que está na tela.

Como acessá-lo na Novita AI

A Novita hospeda o modelo como um endpoint serverless com o ID exato do modelo inclusionai/ling-3.0-flash-vl. A página do modelo lista as famílias de endpoints chat/completions e compatíveis com Anthropic, além de recursos de raciocínio e chamada de funções. Para um cliente existente compatível com OpenAI, use a URL base da API da Novita e selecione o ID exato do modelo na configuração da sua requisição.

A página do modelo é a fonte da verdade para a configuração hospedada. Em particular, não copie a afirmação de contexto maior do cartão do modelo upstream para uma integração com a Novita sem verificar os limites da implantação: o cartão do modelo descreve até 1M de tokens no nível do modelo, enquanto a Novita atualmente expõe 262.144 tokens de contexto e 32.768 tokens máximos de saída para esta listagem.

O catálogo atual também mostra um limite de 30 requisições por minuto para o nível padrão, com valores de níveis superiores listados separadamente. Trate isso como uma cota do catálogo, não como uma garantia de throughput universal da aplicação. O nível da conta, o tamanho da requisição, a concorrência, as tentativas e a execução de ferramentas podem afetar o throughput de ponta a ponta.

Especificações e resumo de preços

Campo Detalhes Fonte / Data verificada
Nome de exibição Ling 3.0 Flash VL Página do modelo Novita, 9 de setembro de 2026
ID do modelo inclusionai/ling-3.0-flash-vl Página do modelo Novita, 9 de setembro de 2026
Arquitetura 124B parâmetros totais; aproximadamente 5,5B ativos por token; MoE esparso Cartão do modelo oficial InclusionAI, 9 de setembro de 2026
Modalidades de entrada Texto, imagem e vídeo Página do modelo Novita, 9 de setembro de 2026
Modalidade de saída Texto Página do modelo Novita, 9 de setembro de 2026
Janela de contexto 262.144 tokens na implantação Novita Página do modelo Novita, 9 de setembro de 2026
Saída máxima 32.768 tokens Página do modelo Novita, 9 de setembro de 2026
Recursos hospedados Serverless, chamada de funções, raciocínio Página do modelo Novita, 9 de setembro de 2026
Famílias de endpoints chat/completions, compatível com Anthropic Página do modelo Novita, 9 de setembro de 2026
RPM do catálogo 30 RPM no nível de listagem padrão Página do modelo Novita, 9 de setembro de 2026
Preço de entrada $0 por milhão de tokens, atualmente rotulado como gratuito por tempo limitado Página do modelo Novita, 9 de setembro de 2026
Preço de saída $0 por milhão de tokens, atualmente rotulado como gratuito por tempo limitado Página do modelo Novita, 9 de setembro de 2026

O preço de $0 é útil para avaliação, mas não deve se tornar uma suposição de produção não testada. Antes do lançamento, registre o preço atual, adicione um guarda de orçamento e decida qual modelo ou fila deve receber tráfego se a janela promocional terminar.

O que os desenvolvedores podem construir com ele?

Compreender documentos, gráficos e interfaces

A entrada visual pode reduzir a quantidade de pré-processamento necessária para documentos, painéis, capturas de tela e interfaces de software. Um desenvolvedor pode passar uma captura de tela junto com uma instrução de tarefa e pedir ao modelo para identificar campos, resumir o estado visível ou localizar um alvo de interação. Para documentos e gráficos, teste se o modelo preserva unidades, legendas, estruturas de tabela e relações espaciais, em vez de julgá-lo a partir de um exemplo curto de legendagem.

Raciocinar sobre imagens e vídeos

A arquitetura upstream usa um codificador visual e tratamento de posição temporal para vídeo. Isso é relevante quando a resposta depende de mudanças ao longo do tempo, como identificar quando um evento ocorre, comparar dois momentos em um clipe ou extrair uma sequência de ações. Vídeos longos ainda precisam de amostragem cuidadosa e design de prompt: um limite de contexto grande não torna automaticamente cada quadro igualmente útil ou acessível após mudanças de preço.

Suportar agentes visuais

O posicionamento do modelo como agente visual se encaixa em fluxos de trabalho onde a percepção é apenas um estágio de um loop maior. Um agente pode inspecionar uma captura de tela do navegador, raciocinar sobre a próxima ação, chamar uma ferramenta e verificar a tela resultante. A chamada de funções pode fornecer o limite da ação, enquanto o contexto visual fornece evidências para decidir o que fazer em seguida. Mantenha as permissões restritas e valide todos os argumentos da ferramenta; a compreensão multimodal não elimina a necessidade de verificações de segurança no lado da aplicação.

Roteirizar cargas de trabalho mistas de texto e visuais

Equipes que já roteiam tarefas de texto para o Ling-3.0-flash podem avaliar a variante -VL para requisições que contenham evidências visuais. Um roteador prático pode enviar tráfego somente texto para o modelo base e reservar a variante visual para mensagens contendo imagens, vídeos ou estado derivado de capturas de tela. Meça a rota completa, incluindo preparação de imagem, tempo de upload, latência do modelo, tentativas e chamadas de ferramentas downstream.

Sinais de desempenho e avaliação

O cartão do modelo oficial da InclusionAI relata uma pontuação de 42 no Artificial Analysis Intelligence Index v4.1.1 e descreve dimensões de capacidade multimodal incluindo compreensão, raciocínio e ação. Esse é um sinal útil sobre o lançamento upstream, não uma garantia para a implantação hospedada na Novita ou para sua distribuição de prompts. A página também observa uma configuração de avaliação Terminal-Bench de 256K de contexto, que está mais próxima do limite de contexto hospedado do que a afirmação geral do cartão do modelo de “até 1M”.

Para uma avaliação significativa, use um pequeno conjunto de tarefas que reflita seu produto:

  • Extração visual: meça a precisão do campo em capturas de tela, formulários, tabelas e gráficos.
  • Raciocínio temporal: teste se as respostas identificam o evento e o intervalo de tempo corretos em vídeos curtos.
  • Execução do agente: pontue tanto a ferramenta escolhida quanto o estado final após a execução da ferramenta.
  • Fundamentação: inclua imagens com detalhes ambíguos ou irrelevantes e verifique afirmações não suportadas.
  • Operações: registre latência, uso de tokens, taxa de falha, comportamento de limite de requisições e o efeito de tentativas.

Não use uma pontuação de benchmark upstream como substituto para essas verificações de aplicação. Um modelo pode ter um bom desempenho em um benchmark público enquanto ainda precisa de alterações de prompt, pré-processamento ou roteamento em uma interface de produção.

Quando usar o Ling-3.0-Flash-VL

Escolha o Ling-3.0-Flash-VL quando sua requisição contiver evidências visuais e a resposta exigir mais do que uma legenda única. É um bom candidato para avaliar em:

  • compreensão de capturas de tela e interfaces de navegador
  • resposta a perguntas sobre gráficos, tabelas e documentos
  • localização de eventos e sumarização em vídeos curtos
  • agentes visuais que usam ferramentas
  • fluxos de trabalho de suporte misto de texto e imagem

A listagem gratuita atual também torna prático construir um conjunto de testes representativo antes de se comprometer com um plano de roteamento pago. Capture a data e o estado do preço quando executar esses testes para que as comparações de custo permaneçam reproduzíveis.

Quando escolher outro modelo

Escolha a página do modelo Ling-3.0-flash base para cargas de trabalho somente texto se você não precisar de entradas visuais. Uma rota somente texto pode simplificar o tratamento de payloads e reduzir o processamento multimodal desnecessário.

Escolha outro modelo se você precisar de um preço fixo permanente, um teto de contexto ou saída diferente, um nível de serviço de latência testado, entrada de áudio ou uma capacidade que não esteja listada para esta implantação. Mantenha também um fallback se sua aplicação depender da oferta atual gratuita por tempo limitado. O design de produção mais seguro trata o preço promocional e a cota do catálogo como configuração mutável, não como garantias de produto codificadas.

Como se encaixa em um fluxo de trabalho de API existente

Em um nível alto, uma aplicação existente compatível com OpenAI precisa de uma chave de API da Novita, a URL base compatível com OpenAI da Novita e inclusionai/ling-3.0-flash-vl como ID do modelo. A requisição deve usar a estrutura de mensagem multimodal suportada pelo endpoint selecionado, com conteúdo de imagem ou vídeo junto com a instrução de texto do usuário.

Mantenha os ativos visuais acessíveis ao endpoint e valide seu formato antes de enviá-los. Para um fluxo de trabalho de agente, defina as ferramentas separadamente do conteúdo visual, restrinja o que cada ferramenta pode fazer e registre a ação selecionada pelo modelo e o estado resultante da aplicação. Um artigo dedicado de início rápido pode cobrir a construção de requisições específicas do SDK; esta página de lançamento é intencionalmente focada em disponibilidade, posicionamento, limites e preços.

Recomendação final

O Ling-3.0-Flash-VL é o membro da família Ling-3.0-flash a ser testado quando a evidência visual deve participar do raciocínio ou da execução do agente. A listagem serverless atual da Novita combina entrada de imagem e vídeo com um contexto de 262K, saída máxima de 32K, raciocínio e chamada de funções, enquanto o preço de $0 para entrada e saída reduz a barreira para avaliação durante a janela atual por tempo limitado.

Comece com um conjunto de testes específico da carga de trabalho, compare-o com sua rota somente texto existente e registre métricas operacionais além da qualidade da resposta. Se atender aos seus requisitos de precisão visual e segurança de ferramentas, mantenha o ID do modelo da Novita e o preço atual na configuração para que uma futura alteração no catálogo não exija uma reescrita de código.

Experimente o Ling-3.0-Flash-VL na Novita AI

FAQ

Qual é o ID do modelo Ling-3.0-Flash-VL na Novita AI?

O ID exato do modelo é inclusionai/ling-3.0-flash-vl.

O Ling-3.0-Flash-VL suporta entrada de imagem e vídeo?

Sim. A listagem atual da Novita suporta entrada de texto, imagem e vídeo, com saída de texto.

Qual janela de contexto e limite de saída a Novita fornece?

A listagem hospedada mostra uma janela de contexto de 262.144 tokens e uma saída máxima de 32.768 tokens. Esses são os valores da implantação Novita e devem ser verificados novamente antes do uso em produção.

O Ling-3.0-Flash-VL é gratuito na Novita AI?

A Novita atualmente lista $0 por milhão de tokens de entrada e $0 por milhão de tokens de saída e rotula o modelo como gratuito por tempo limitado. O preço pode mudar, portanto, confirme a página do modelo ao vivo antes de confiar nele.

Ele suporta chamada de funções e raciocínio?

Sim. A Novita lista tanto chamada de funções quanto raciocínio entre os recursos hospedados.

Como ele é diferente do Ling-3.0-flash?

O Ling-3.0-Flash-VL adiciona entrada nativa de imagem e vídeo, além de capacidades de agente visual. A página atual do Ling-3.0-flash base é um ponto de entrada da família somente texto, portanto, use a variante -VL quando a evidência visual fizer parte da requisição.

O modelo upstream suporta um contexto de 1M de tokens?

O cartão do modelo oficial da InclusionAI descreve até 1M de tokens no nível do modelo. A listagem hospedada atual da Novita expõe 262.144 tokens, portanto, use o valor hospedado ao projetar requisições através da Novita.

Artigos recomendados