Novita AI LLM, Atualizações

Ling-3.0-flash na Novita AI: API gratuita para inferência agêntica

Ling-3.0-flash na Novita AI: API gratuita para inferência agêntica

O Ling-3.0-flash já está disponível na API Serverless da Novita AI como um modelo gratuito por tempo limitado, com preço de US$ 0 listado para entrada e saída em 27 de julho de 2026. É um modelo de texto criado para inferência agêntica: 124 bilhões de parâmetros totais, cerca de 5,1 bilhões de parâmetros ativos por token, janela de contexto de 262.144 tokens, suporte a raciocínio e chamada de função por meio de um fluxo de chat completions compatível com OpenAI. Para desenvolvedores testando agentes de longa duração, uso de ferramentas ou automação de alto volume, o apelo imediato é simples: você pode avaliar um grande modelo esparso sem pagar por token durante a janela gratuita atual.

Principais conclusões

  • A API está gratuita no momento. A página do modelo Ling-3.0-flash lista US$ 0 por milhão de tokens de entrada e US$ 0 por milhão de tokens de saída, com o rótulo “gratuito por tempo limitado” em 27 de julho de 2026.
  • É um modelo MoE altamente esparso de 124B. Aproximadamente 5,1B de parâmetros estão ativos por token, o que representa cerca de 4,1% do total de parâmetros.
  • Ele foi projetado para inferência agêntica. A listagem da Novita enfatiza eficiência de tokens e cargas de trabalho de agentes em escala de produção sob restrições de tokens, latência e custos de serviço.
  • A API hospedada suporta contexto longo e uso de ferramentas. A listagem atual mostra janela de contexto de 262.144 tokens, saída máxima de 32.768 tokens, raciocínio e chamada de função.
  • Trate o preço gratuito como uma janela de avaliação, não como um compromisso permanente. Verifique a página atual do modelo antes de estimar custos de produção ou prometer um serviço gratuito aos seus usuários.

O que é o Ling-3.0-flash?

O Ling-3.0-flash é um modelo de linguagem esparso do tipo Mixture-of-Experts (MoE) da InclusionAI. Em vez de ativar todos os 124B de parâmetros para cada token, ele roteia cada token por aproximadamente 5,1B de parâmetros ativos. Essa arquitetura visa preservar a capacidade de um modelo grande enquanto limita a quantidade de computação usada em cada etapa de inferência.

A descrição atual do modelo na Novita AI foca em um objetivo prático, e não em um destaque de benchmark: concluir mais trabalho útil dentro de orçamentos restritos de tokens, latência e custos de serviço. Esse posicionamento o torna especialmente relevante para sistemas de agentes, em que uma única ação do usuário pode disparar várias chamadas de modelo, chamadas de ferramenta, etapas de planejamento e verificações.

O Ling-3.0-flash não deve ser confundido com o Ling-2.6-flash. O novo modelo aumenta os parâmetros totais de 104B para 124B, ao mesmo tempo que reduz os parâmetros ativos de 7,4B para cerca de 5,1B. Ambos os modelos expõem contexto longo na Novita AI, mas o Ling-3.0-flash adiciona suporte a raciocínio no conjunto atual de recursos hospedados e estreia com preço de API gratuita por tempo limitado.

Como o Ling-3.0-flash está disponível na Novita AI?

A Novita AI hospeda o Ling-3.0-flash como um modelo serverless de geração de texto. O ID exato do modelo é inclusionai/ling-3.0-flash, e a família de endpoints suportada é chat completions. O serviço usa o mesmo padrão de requisição compatível com OpenAI disponível em todo o catálogo de LLMs da Novita, então as equipes podem avaliar o modelo sem criar uma implantação dedicada ou gerenciar hardware de inferência.

Em 27 de julho de 2026, o modelo está listado a US$ 0 por milhão de tokens de entrada e US$ 0 por milhão de tokens de saída. A página do modelo também rotula a oferta como gratuita por tempo limitado. Essa distinção importa: o Ling-3.0-flash está gratuito para uso agora, mas a listagem não promete que o preço permanecerá em zero indefinidamente.

A prática mais segura para produção é tratar este período como uma oportunidade de coletar suas próprias evidências. Execute traços representativos de agentes, registre o uso de tokens e a latência, teste a confiabilidade das chamadas de função e compare a qualidade das respostas com seu modelo atual. Se os preços mudarem depois, você terá dados suficientes para decidir se o modelo ainda faz sentido para a carga de trabalho.

Especificações e preços do Ling-3.0-flash

Campo Detalhes atuais
Nome de exibição Ling-3.0-flash
ID do modelo inclusionai/ling-3.0-flash
Arquitetura Mixture-of-Experts de 124B de parâmetros; aproximadamente 5,1B de parâmetros ativos por token
Acesso API serverless
Formato da API chat completions compatível com OpenAI
URL base https://api.novita.ai/openai
Endpoint /v1/chat/completions por meio da URL base compatível com OpenAI
Janela de contexto 262.144 tokens
Saída máxima 32.768 tokens
Modalidades Entrada de texto e saída de texto
Recursos hospedados Raciocínio e chamada de função
Preço de entrada US$ 0 por 1M de tokens, gratuito por tempo limitado
Preço de saída US$ 0 por 1M de tokens, gratuito por tempo limitado
Melhor uso Avaliação de agentes, automação de contexto longo, fluxos com uso de ferramentas e experimentação sensível a custos

Disponibilidade, especificações, preços e detalhes da API foram verificados na página do modelo da Novita AI e na documentação da API de LLM em 27 de julho de 2026.

A listagem atual do modelo não fornece um pacote público de benchmarks, garantia de throughput ou relatório detalhado de treinamento upstream para o Ling-3.0-flash. Portanto, este artigo não lhe atribui uma classificação de inteligência nem afirma que ele supera outro modelo. Para seleção em produção, teste-o com seus próprios prompts e ferramentas, em vez de inferir qualidade apenas pela contagem de parâmetros.

Como o preço dele se compara com outros modelos MoE semelhantes?

O Ling-3.0-flash é incomum porque seu preço atual por token hospedado é zero. Para uma comparação mais útil do que “grátis versus pago”, a tabela abaixo inclui modelos esparsos com contagens totais de parâmetros semelhantes ou designs semelhantes de baixos parâmetros ativos do catálogo atual da Novita AI.

Modelo na Novita AI Total / Parâmetros ativos Contexto Entrada por 1M de tokens Saída por 1M de tokens
Ling-3.0-flash 124B / ~5,1B 262.144 US$ 0,00 US$ 0,00
Qwen3.5-122B-A10B 122B / 10B 262.144 US$ 0,40 US$ 3,20
Qwen3-Next-80B-A3B-Instruct 80B / ~3B 131.072 US$ 0,15 US$ 1,50
Ling-2.6-flash 104B / 7,4B 262.144 US$ 0,10 US$ 0,30

Os preços e os limites hospedados foram verificados nas listagens atuais de modelos da Novita AI em 27 de julho de 2026. O Ling-3.0-flash está marcado como gratuito por tempo limitado; portanto, sua linha é um instantâneo, e não uma garantia de preço permanente.

A tabela não estabelece qual modelo é o “melhor”. O Qwen3.5-122B-A10B oferece uma margem maior de saída máxima na Novita AI e recursos nativos de visão. O Qwen3-Next-80B-A3B-Instruct é um modelo esparso menor com suporte a saída estruturada na listagem atual. O Ling-2.6-flash tem histórico consolidado de produto e continua barato mesmo fora de uma promoção gratuita. O Ling-3.0-flash é o modelo mais fácil de avaliar pelo preço hoje, mas capacidade e confiabilidade ainda precisam de testes específicos por carga de trabalho.

Por que o design MoE de 124B/5,1B importa?

A contagem total de parâmetros e a contagem de parâmetros ativos descrevem partes diferentes de um modelo MoE. Os 124B totais representam a capacidade geral de especialistas do modelo. Os aproximadamente 5,1B ativos descrevem quanto dessa rede de especialistas é selecionado para cada token individual.

Para desenvolvedores, o ponto importante não é que 5,1B de parâmetros ativos tornam automaticamente o modelo rápido. A latência real da API também depende do hardware de servidor, do agrupamento de requisições (batching), do tamanho do prompt, do tamanho da saída e da carga da plataforma. O sinal útil é que o Ling-3.0-flash foi projetado em torno de ativação esparsa e eficiência de tokens, em vez de executar todo o conjunto de parâmetros para cada token.

Esse design é particularmente relevante quando um agente faz loops. Um agente de suporte pode classificar uma solicitação, recuperar contexto, chamar uma ferramenta, inspecionar o resultado e redigir uma resposta. Um agente de codificação pode buscar em um repositório, planejar uma mudança, editar arquivos, executar testes e corrigir falhas. Em ambos os casos, o custo e a latência de uma única “tarefa” são distribuídos por muitas etapas de inferência. Um modelo projetado para inferência repetida e eficiente pode ser mais valioso do que um otimizado apenas para uma única resposta.

O que os desenvolvedores podem construir com o Ling-3.0-flash?

Assistentes que usam ferramentas

A chamada de função torna o Ling-3.0-flash um candidato para assistentes que selecionam ferramentas, produzem argumentos, inspecionam resultados de ferramentas e continuam um fluxo de trabalho. Exemplos incluem roteamento de atendimento ao cliente, consulta de contas, recuperação de conhecimento interno e painéis de operações.

Fluxos de trabalho de documentos com contexto longo

A janela de contexto de 262.144 tokens pode acomodar contexto de trabalho substancial para revisão de contratos, síntese de pesquisas, análise de transcrições ou extração de múltiplos documentos. Uma janela de contexto grande não substitui um bom design de recuperação (retrieval), mas dá às equipes mais espaço para preservar instruções e evidências relevantes ao longo de uma tarefa.

Agentes de codificação e de repositório

Raciocínio e chamada de função são bases úteis para loops de busca e alteração de código. O Ling-3.0-flash pode se adequar a tarefas como triagem de repositórios, classificação de issues, planejamento de migração, análise de falhas de teste ou agentes de codificação supervisionados. Teste-o com cuidado antes de permitir ações de escrita, especialmente quando chamadas de ferramenta podem alterar sistemas de produção.

Pipelines de avaliação de alto volume

A janela gratuita reduz o custo de construir um conjunto de avaliação. As equipes podem reproduzir prompts reais, comparar formatos de chamada de ferramenta, examinar modos de falha e determinar se o modelo merece um lugar na lógica de roteamento. Esse é um uso melhor do acesso gratuito do que assumir que o modelo mais barato deve se tornar o padrão imediatamente.

Quando usar o Ling-3.0-flash?

Escolha o Ling-3.0-flash para avaliação quando sua carga de trabalho tiver várias destas características:

  • É baseada em texto e usa chat completions.
  • Precisa de raciocínio, chamada de função ou ambos.
  • Carrega instruções longas, documentos, memória ou resultados de ferramentas.
  • Uma única tarefa do usuário pode exigir várias etapas de modelo.
  • Você quer testar um grande modelo MoE sem custo por token durante a promoção atual.
  • Você consegue medir o sucesso por conclusão de tarefa, precisão das ferramentas, latência e uso de tokens, em vez de depender de um leaderboard público.

O modelo também é um candidato prático para experimentos de roteamento. Você pode enviar etapas de menor risco do agente ao Ling-3.0-flash, comparar os resultados com um modelo de referência pago e escalar apenas as tarefas que precisam de um perfil de capacidade diferente.

Quando escolher outro modelo?

O Ling-3.0-flash não é a escolha automática para toda aplicação.

Escolha outro modelo se você precisar de entrada de imagem ou áudio, porque a listagem hospedada atual é somente texto. Considere um modelo com suporte a saída estruturada se a geração estrita de esquemas for central para seu contrato de produção; o Ling-3.0-flash lista atualmente chamada de função, mas não saídas estruturadas. Outro modelo também pode ser preferível quando você precisa de evidências de benchmark publicadas de forma independente, de um nível de serviço de latência específico ou de um preço pago estável para orçamento de longo prazo.

A saída máxima de 32.768 tokens é generosa para muitas tarefas de agentes, mas fica abaixo dos limites de saída de alguns modelos atuais de contexto longo. Se sua aplicação gera regularmente artefatos muito grandes em uma única chamada, compare os tetos de saída antes de migrar.

Por fim, não crie um modelo de negócio que dependa de a API permanecer gratuita. O preço zero é explicitamente por tempo limitado. O planejamento de produção deve incluir um modelo reserva, controles de roteamento e uma nova verificação de preço antes do lançamento.

Como ele se encaixa em um fluxo de API existente?

O Ling-3.0-flash usa a interface de LLM compatível com OpenAI da Novita AI. Em linhas gerais, um aplicativo existente de chat completions precisa de três valores de configuração:

  1. Uma chave de API da Novita AI.
  2. A URL base compatível com OpenAI, https://api.novita.ai/openai.
  3. O ID do modelo, inclusionai/ling-3.0-flash.

A requisição passa então pelo endpoint de chat completions. Definições de função podem ser incluídas para fluxos de trabalho que usam ferramentas, e o comportamento de raciocínio deve ser avaliado com os mesmos prompts e verificações no nível de tarefa que você planeja usar em produção.

Esta visão geral de lançamento termina intencionalmente na fronteira da integração. Ela não inclui um tutorial completo de SDK, exemplos de requisição, ajuste de parâmetros ou etapas de solução de problemas; esses itens pertencem a um guia de início rápido dedicado.

Conclusão

O Ling-3.0-flash vale a pena ser testado se você está construindo agentes baseados em texto e quer um modelo grande e esparso com contexto longo, raciocínio e chamada de função. O preço gratuito atual por tempo limitado remove a barreira de custo por token para uma avaliação séria, enquanto a arquitetura de 124B totais e 5,1B ativos dá ao modelo um design claramente orientado a eficiência.

A decisão certa é usar a janela gratuita para evidências, não para suposições. Meça tarefas completas de agentes, incluindo novas tentativas e falhas de ferramentas. Compare a qualidade das respostas e a latência com um modelo já confiável em sua stack. Confirme o preço atual antes do lançamento em produção. Se o Ling-3.0-flash for bem nesses testes, a Novita AI oferece um caminho serverless simples para adicioná-lo a um fluxo compatível com OpenAI.

Avalie o Ling-3.0-flash na Novita AI

Perguntas frequentes

A API do Ling-3.0-flash é gratuita?

Sim, em 27 de julho de 2026. A Novita AI lista entrada e saída a US$ 0 por milhão de tokens e marca o modelo como “gratuito por tempo limitado”. Verifique a página atual do modelo antes de usar, porque a promoção pode mudar.

Qual é o ID do modelo Ling-3.0-flash?

O ID exato do modelo na Novita AI é inclusionai/ling-3.0-flash.

Qual é o tamanho do Ling-3.0-flash?

É um modelo Mixture-of-Experts de 124B de parâmetros com aproximadamente 5,1B de parâmetros ativados por token.

Qual janela de contexto o Ling-3.0-flash suporta?

A listagem atual da Novita AI mostra uma janela de contexto de 262.144 tokens e uma saída máxima de 32.768 tokens.

O Ling-3.0-flash suporta chamada de função?

Sim. A Novita AI lista atualmente chamada de função e raciocínio como recursos suportados. Saída estruturada não está listada, então valide qualquer exigência estrita de JSON ou esquema em seus próprios testes.

O Ling-3.0-flash é um modelo multimodal?

Não no endpoint atual da Novita AI. A listagem hospedada mostra entrada e saída de texto.

O Ling-3.0-flash é melhor que o Qwen3.5-122B-A10B?

Não há evidências públicas verificadas suficientes para fazer uma afirmação geral de qualidade. O Ling-3.0-flash está atualmente gratuito e ativa menos parâmetros por token, enquanto o Qwen3.5-122B-A10B suporta visão, saídas estruturadas e um limite máximo de saída maior na Novita AI. Escolha com avaliação específica por carga de trabalho.

Artigos recomendados

Posts relacionados