- Principais Conclusões
- Linha Ling-3.0 de Relance
- O que as Variantes Compartilham
- Escolha Ling-3.0-flash para a Base Geral
- Escolha Ling-3.0-flash-fin para Fluxos Financeiros
- Escolha Ling-3.0-flash-sante para Tarefas de Saúde e Medicina
- Escolha Ling-3.0-flash-vl para Solicitações com Imagem e Vídeo
- Uma Regra Prática de Roteamento
- Precifique a Decisão, Não o Nome
- FAQ
- Artigos Recomendados
Comece pela solicitação, não pelo nome do modelo. Use Ling-3.0-flash como o texto geral e a base para agentes, Ling-3.0-flash-fin para fluxos financeiros, Ling-3.0-flash-sante para saúde e medicina, e Ling-3.0-flash-VL quando a solicitação incluir imagens ou vídeos. Todos os quatro são endpoints de chat serverless na Novita AI com o mesmo contexto de 262.144 tokens e saída máxima de 32.768 tokens, mas as diferenças no ajuste de domínio, modalidades de entrada e preços atuais fazem com que o ID do modelo seja uma decisão de roteamento.
Os quatro modelos compartilham a mesma base Flash de 124B parâmetros. Eles ativam cerca de 5,1B parâmetros por token, exceto o Flash-VL com cerca de 5,5B. As variantes de domínio e capacidade não são, portanto, uma escada de pequeno para grande. São rotas através da mesma arquitetura.
Principais Conclusões
- Base para texto e uso de ferramentas:
ling-3.0-flashé adequado para cargas de trabalho agentivas e de contexto longo em texto. - Ajuste financeiro:
ling-3.0-flash-finé a opção a ser testada para fluxos de investimento, mercado e outros específicos de finanças. - Ajuste médico:
ling-3.0-flash-santeé a opção a ser testada para fluxos de raciocínio em saúde e medicina. - Rota multimodal:
ling-3.0-flash-vlé o único membro da família na Novita AI que atualmente aceita entrada de imagem e vídeo junto com texto.
Linha Ling-3.0 de Relance
O catálogo de modelos foi verificado em 9 de setembro de 2026. Preços e disponibilidade podem mudar, então verifique novamente a página do modelo ao vivo antes de definir uma estimativa ou rota de produção.
| ID do Modelo | Melhor adequação | Parâmetros totais / ativos | Modalidades | Contexto / saída máxima | Preço atual por 1M tokens |
|---|---|---|---|---|---|
inclusionai/ling-3.0-flash |
Inferência agentiva geral, raciocínio e uso de ferramentas | 124B / ~5,1B | Texto → texto | 262.144 / 32.768 | US$ 0,06 entrada; US$ 0,18 saída |
inclusionai/ling-3.0-flash-fin |
Raciocínio específico para finanças e fluxos de múltiplas etapas | 124B / ~5,1B | Texto → texto | 262.144 / 32.768 | US$ 0 entrada; US$ 0 saída |
inclusionai/ling-3.0-flash-sante |
Raciocínio em saúde e medicina mais capacidade geral | 124B / ~5,1B | Texto → texto | 262.144 / 32.768 | US$ 0 entrada; US$ 0 saída |
inclusionai/ling-3.0-flash-vl |
Capturas de tela, gráficos, documentos, vídeos e agentes visuais | 124B / ~5,5B | Texto + imagem + vídeo → texto | 262.144 / 32.768 | US$ 0 entrada; US$ 0 saída |
O catálogo também lista acesso serverless, raciocínio e chamada de função para cada modelo. ling-3.0-flash-vl e ling-3.0-flash-sante expõem adicionalmente um endpoint compatível com Anthropic; os outros dois listam chat/completions.
O que as Variantes Compartilham
Cada modelo é construído sobre o Ling-3.0-flash. O catálogo da Novita e o cartão do modelo Flash oficial descrevem a rota base Flash como um MoE de 124B parâmetros com cerca de 5,1B parâmetros ativos por token; Flash-VL também tem 124B, mas ativa cerca de 5,5B. Isso significa que a escolha entre as variantes Flash é principalmente sobre ênfase de domínio, modalidade de entrada, estado de precificação e comportamento de latência, não uma diferença na escala total da arquitetura.
Todas as quatro listagens atualmente mostram os mesmos limites de contexto e saída da Novita: 262.144 tokens de entrada e 32.768 tokens de saída. Essa igualdade torna o contexto um filtro inicial ruim. Adequação, modalidade, custo e latência medida são melhores maneiras de restringir a linha antes de você benchmark.
Escolha Ling-3.0-flash para a Base Geral
Use Ling-3.0-flash quando sua carga de trabalho for apenas texto e ainda não tiver uma especialização vertical clara. É o primeiro teste natural para chat, análise de documentos, agentes de múltiplas etapas, controles de raciocínio e chamadas de ferramentas. O quick start mostra o fluxo de solicitação compatível com OpenAI.
É também o modelo de controle justo para comparações. Se Fin ou Sante não melhorarem seus rastros específicos de tarefa, você tem evidências para manter a rota geral em vez de adicionar um ID de modelo extra.
Escolha Ling-3.0-flash-fin para Fluxos Financeiros
Use Ling-3.0-flash-fin quando a tarefa depender de vocabulário financeiro e raciocínio financeiro de múltiplas etapas. A listagem da Novita descreve o modelo como aprimorado para finanças e adequado para fluxos de investimento do mundo real, planejamento de longo prazo e execução, mantendo capacidade de raciocínio, codificação e matemática.
Não é um sistema de conformidade nem um substituto para seus controles de dados. Mantenha citações, documentos de origem, cálculos e etapas de aprovação na aplicação. Para análise de portfólio, revisão de lucros, síntese de pesquisa ou elaboração de processos de investimento, compare Fin com o modelo Flash geral em exemplos do seu domínio real.
Escolha Ling-3.0-flash-sante para Tarefas de Saúde e Medicina
Use Ling-3.0-flash-sante quando a solicitação envolver raciocínio de conhecimento médico, linguagem de segurança clínica, recuperação de evidências ou fluxos médicos de longo horizonte. A Novita descreve Sante como construído sobre Ling-3.0-flash, com 124B parâmetros totais e cerca de 5,1B parâmetros ativos. Um quick start de chat completions também está disponível.
O uso médico adiciona requisitos além da escolha do modelo: tratamento de privacidade, revisão humana, caminhos de escalonamento, proveniência e regras regulatórias locais. Sante é o membro da família a ser avaliado para fraseado e raciocínio médico, mas seu produto ainda deve verificar as saídas antes de qualquer ação clinicamente consequente.
Escolha Ling-3.0-flash-vl para Solicitações com Imagem e Vídeo
Use Ling-3.0-flash-VL quando o modelo precisar ver algo: capturas de tela, gráficos, formulários, documentos, imagens de produtos ou vídeos curtos. É a única variante na listagem atual da Novita que aceita entrada de imagem e vídeo com saída de texto.
O teste útil é se a evidência visual muda a ação que o sistema toma. Um agente de navegador pode ler uma tela, escolher um controle, chamar uma ferramenta e verificar o resultado; um assistente de relatórios pode extrair uma série de um gráfico. Para prompts apenas de texto, envie a solicitação para o modelo Flash base, a menos que seus testes mostrem um motivo para usar VL.
Uma Regra Prática de Roteamento
Use uma pequena configuração em vez de espalhar IDs de modelo pelo seu código:
model_routes = {
"general_text_agent": "inclusionai/ling-3.0-flash",
"finance_workflow": "inclusionai/ling-3.0-flash-fin",
"medical_workflow": "inclusionai/ling-3.0-flash-sante",
"image_or_video": "inclusionai/ling-3.0-flash-vl",
}
Em seguida, deixe os metadados da carga de trabalho escolherem a rota. Comece com Flash geral para trabalho de agente apenas com texto e VL sempre que conteúdo de imagem ou vídeo estiver presente. Adicione Fin ou Sante apenas quando seus rastros de domínio mostrarem que a rota especializada vale a sobrecarga extra de avaliação e operações.
Precifique a Decisão, Não o Nome
Os preços atuais do catálogo se dividem em dois padrões. O modelo Flash geral lista US$ 0,06 por milhão de tokens de entrada e US$ 0,18 por milhão de tokens de saída. Fin, Sante e VL listam US$ 0 para ambos. Essas listagens de preço zero são instantâneos promocionais ativos, não garantias permanentes.
Para estimativas reais de produção, registre o tamanho do prompt, tamanho da resposta, comportamento de cache, novas tentativas, frequência de chamadas de ferramentas e o número de turnos do modelo por ação do usuário. Uma rota com um preço de tabela mais alto pode ser mais barata se resolver uma tarefa em menos turnos ou menos retrabalho; uma listagem gratuita não remove o custo de testes, operações ou revisão de qualidade.
FAQ
Quantos modelos Ling-3.0 a Novita AI oferece?
O catálogo verificado lista quatro: ling-3.0-flash, ling-3.0-flash-fin, ling-3.0-flash-sante e ling-3.0-flash-vl.
Todos os quatro modelos têm a mesma janela de contexto?
Sim. As listagens atuais da Novita mostram 262.144 tokens de contexto e 32.768 tokens de saída máxima para cada modelo.
Qual modelo Ling-3.0 devo usar para capturas de tela ou vídeo?
Use inclusionai/ling-3.0-flash-vl. É o membro da família que a Novita atualmente lista com entrada de texto, imagem e vídeo.
Os preços gratuitos do Ling-3.0 são permanentes?
Não. Fin, Sante e VL atualmente listam US$ 0 de entrada e US$ 0 de saída, mas o preço é um valor de catálogo ao vivo. Verifique novamente antes do uso em produção.
