- Quando usar este início rápido
- Etapa 1: Obter sua chave de API da Novita
- Etapa 2: Confirmar o ID do modelo e o endpoint
- Etapa 3: Enviar sua primeira solicitação
- Etapa 4: Ler a resposta
- Etapa 5: Verificar preço, limites e erros comuns
- Exemplo em Python
- Exemplo em cURL
- Parâmetros principais
- Solução de problemas
- FAQ
- Artigos recomendados
Este início rápido mostra como enviar uma primeira solicitação de conclusões de chat de texto para o Ling 3.0 Flash Sante através da API compatível com OpenAI da Novita. Use https://api.novita.ai/openai como URL base, inclusionai/ling-3.0-flash-sante como ID do modelo e POST https://api.novita.ai/openai/v1/chat/completions como caminho da requisição. A listagem atual da Novita descreve um modelo de Mistura de Especialistas com 124B parâmetros, aproximadamente 5,1B parâmetros ativos por token, uma janela de contexto de 262.144 tokens, uma saída máxima de 32.768 tokens, entrada e saída de texto, raciocínio e chamada de funções. Para contexto de posicionamento e preço do modelo, consulte Ling 3.0 Flash Sante na Novita AI: Capacidades e Preços.
Quando usar este início rápido
Use esta página quando a pergunta prática for como autenticar, confirmar a rota do modelo, enviar uma pequena solicitação e analisar a resposta. Ela foi projetada para um primeiro teste de integração, não para escolher um fluxo de trabalho clínico ou validar um modelo para um caso de uso de alto impacto.
O Ling 3.0 Flash Sante é um modelo de texto. A listagem hospedada destaca conhecimento médico em raciocínio, segurança clínica, recuperação baseada em evidências e tarefas médicas de longo horizonte, além de listar raciocínio geral, codificação e capacidades de agente. Esses rótulos descrevem as áreas de capacidade pretendidas do modelo; eles não substituem a avaliação em seus dados, verificação de fontes, controles de privacidade ou revisão qualificada.
Etapa 1: Obter sua chave de API da Novita
Crie uma chave de API da Novita e mantenha-a fora do controle de versão. Para um teste local, exporte-a como uma variável de ambiente:
export NOVITA_API_KEY="sua_chave_api"
Não coloque a chave em um bundle de navegador, repositório público ou aplicação do lado do cliente. Para um serviço implantado, carregue-a do gerenciador de segredos do serviço e faça a rotação conforme a política de credenciais da sua equipe.
Etapa 2: Confirmar o ID do modelo e o endpoint
Antes de escrever código de aplicação, verifique a página do modelo Ling 3.0 Flash Sante ao vivo. Os valores abaixo foram verificados em 4 de setembro de 2026.
| Campo | Valor |
|---|---|
| ID do modelo | inclusionai/ling-3.0-flash-sante |
| URL base | https://api.novita.ai/openai |
| Endpoint de conclusões de chat | POST https://api.novita.ai/openai/v1/chat/completions |
| Janela de contexto | 262.144 tokens (exibido como 256K) |
| Saída máxima | 32.768 tokens (exibido como 32K) |
| Entrada e saída | Texto |
| Recursos listados | Chamada de funções, raciocínio |
| Taxa de requisições do catálogo | 30 requisições por minuto |
| Preço de entrada listado | $0 por 1M tokens |
| Preço de saída listado | $0 por 1M tokens |
Preço, limites e disponibilidade são valores do catálogo ao vivo. Reconfirme-os antes de orçar ou mover uma integração para produção. O valor da taxa de requisições do catálogo não é uma garantia de que toda conta ou carga de trabalho receberá a mesma taxa de transferência.
Etapa 3: Enviar sua primeira solicitação
Comece com um prompt curto e não sensível. Uma solicitação pequena isola erros de autenticação e roteamento antes de adicionar contexto longo, ferramentas ou dados específicos da aplicação.
curl "https://api.novita.ai/openai/v1/chat/completions" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${NOVITA_API_KEY}" \
-d '{
"model": "inclusionai/ling-3.0-flash-sante",
"messages": [
{
"role": "system",
"content": "Você é um assistente técnico conciso. Não forneça conselhos de diagnóstico ou tratamento."
},
{
"role": "user",
"content": "Retorne uma lista de verificação de três itens para testar uma API de classificação de texto."
}
],
"max_tokens": 256,
"temperature": 0.2
}'
A solicitação usa o array messages padrão e o ID exato do modelo. O valor max_tokens é deliberadamente pequeno para um teste de fumaça. Aumente-o somente após a requisição, análise de resposta, tratamento de timeout e tratamento de erros funcionarem de forma confiável.
Etapa 4: Ler a resposta
Uma conclusão de chat bem-sucedida retorna uma mensagem de assistente na primeira escolha. Em um cliente ou serviço, verifique o código de status antes de analisar JSON e, em seguida, trate a resposta de forma defensiva:
{
"choices": [
{
"message": {
"role": "assistant",
"content": "1. Preparar entradas rotuladas representativas.\n2. Medir a precisão da classificação e o comportamento de recusa.\n3. Inspecionar erros antes de aumentar o tráfego."
}
}
]
}
Para o primeiro teste, confirme que:
- a requisição retorna uma resposta HTTP bem-sucedida;
choices[0].message.contentcontém o texto do assistente;- o
modelretornado é o modelo esperado quando o campo está presente; - sua aplicação lida com conteúdo ausente, respostas não-200 e timeouts;
- os logs contêm metadados da requisição, mas nunca a chave de API ou entrada sensível desnecessária.
Não trate uma resposta HTTP bem-sucedida como evidência de que um fluxo de trabalho médico ou regulado está pronto. Ela apenas confirma que este caminho de requisição, credencial, ID do modelo e analisador de resposta básico funcionam juntos.
Etapa 5: Verificar preço, limites e erros comuns
Antes de usar tráfego real, verifique novamente a página do modelo ao vivo para preço, contexto, saída máxima, recursos suportados e informações de taxa de requisições. Em seguida, teste os limites que importam para sua aplicação: prompts longos, truncamento de saída, novas tentativas, requisições concorrentes e análise de chamadas de ferramentas.
As falhas mais comuns na primeira chamada são diretas:
- 401 ou erro de autenticação:
NOVITA_API_KEYnão está definida, expirou, malformada ou não está sendo enviada como token de portador. - Modelo não encontrado: a requisição usa um nome de exibição ou um erro de digitação em vez de
inclusionai/ling-3.0-flash-sante. - Erro de endpoint 404: o cliente duplicou ou omitiu o caminho
/v1/chat/completions. Use a URL base apenas na configuração do SDK, ou use a URL completa no cURL. - Erro de requisição 400: inspecione a sintaxe JSON e os campos suportados. Comece com
modelemessages, depois adicione parâmetros opcionais um de cada vez. - Resposta de limite de taxa 429: aplique backoff exponencial limitado, reduza a concorrência e compare seu tráfego com os limites atuais da conta e do catálogo.
- Resposta truncada: aumente
max_tokensquando a aplicação precisar de mais saída, mantendo-se dentro do máximo atual do modelo e do seu orçamento total de contexto.
Exemplo em Python
O SDK Python do OpenAI pode usar a URL base compatível da Novita. Instale o SDK em seu próprio ambiente, mantenha NOVITA_API_KEY definido e execute este exemplo a partir de um processo do lado do servidor:
import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.novita.ai/openai",
api_key=os.environ["NOVITA_API_KEY"],
)
response = client.chat.completions.create(
model="inclusionai/ling-3.0-flash-sante",
messages=[
{
"role": "system",
"content": "Você é um assistente técnico conciso. Não forneça conselhos de diagnóstico ou tratamento.",
},
{
"role": "user",
"content": "Explique como testar um analisador de resposta de API de texto em três etapas.",
},
],
max_tokens=256,
temperature=0.2,
)
print(response.choices[0].message.content)
Este exemplo usa apenas os campos comuns de conclusões de chat. Depois que funcionar, adicione instruções de sistema específicas da aplicação, manipulação de saída estruturada ou ferramentas e teste cada alteração de forma independente.
Exemplo em cURL
Para uma verificação de integração baseada em shell, mantenha a requisição em um script e falhe de forma ruidosa em erros HTTP:
curl --fail-with-body "https://api.novita.ai/openai/v1/chat/completions" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${NOVITA_API_KEY}" \
-d '{
"model": "inclusionai/ling-3.0-flash-sante",
"messages": [
{
"role": "user",
"content": "Liste três verificações para um analisador de resposta JSON confiável."
}
],
"max_tokens": 256,
"temperature": 0.2
}'
--fail-with-body faz o cURL retornar um status de falha para erros HTTP enquanto mantém o corpo da resposta para depuração. Não cole esse corpo em logs públicos se ele contiver prompts ou outros dados sensíveis.
Parâmetros principais
model: Use o ID exato do modelo hospedado,inclusionai/ling-3.0-flash-sante.messages: Forneça o histórico da conversa como objetos role/content. Mantenha as instruções do sistema específicas e torne o formato de saída esperado explícito.max_tokens: Defina um teto de saída apropriado para a tarefa. O máximo atual do catálogo é 32.768 tokens, mas valores menores tornam os testes iniciais mais fáceis de inspecionar.temperature: Um valor mais baixo pode tornar testes de extração ou classificação repetíveis mais fáceis de comparar. Meça o efeito em seus próprios prompts em vez de assumir que uma configuração é universalmente melhor.tools: A listagem inclui chamada de funções. Se você adicionar ferramentas, defina esquemas estreitos, valide argumentos em sua aplicação e mantenha a execução fora do modelo.- Controles de raciocínio: A listagem inclui raciocínio, mas não presuma que todo campo opcional de raciocínio é portátil entre SDKs. Confirme a referência atual da API e o comportamento do modelo antes de adicionar campos específicos do provedor.
Para texto relacionado à saúde, separe a geração da verificação. Forneça apenas os dados que sua aplicação está autorizada a processar, mantenha referências de fonte quando possível e encaminhe saídas de consequências para revisores qualificados. Este artigo não fornece orientação de diagnóstico ou tratamento.
Solução de problemas
Quando uma requisição falhar, reduza-a à menor chamada reproduzível: o ID exato do modelo, uma mensagem de usuário, um valor baixo de max_tokens e o cabeçalho de portador. Isso facilita distinguir um problema de conta de um problema de wrapper de cliente.
Se a chamada mínima em cURL for bem-sucedida, mas a chamada do SDK falhar, imprima a URL da requisição resolvida do SDK em um ambiente de depuração local seguro e compare-a com https://api.novita.ai/openai/v1/chat/completions. Não imprima cabeçalhos de autorização. Se ambas as chamadas forem bem-sucedidas, mas a saída da aplicação não for confiável, mantenha o teste de integração e acesso ao modelo separado da avaliação de qualidade da tarefa.
Para trabalho de contexto longo, comece abaixo do teto de contexto de 262.144 tokens. Conte as mensagens de entrada, definições de ferramentas e saída esperada juntos, depois teste o comportamento de truncamento e timeout com requisições representativas. Um contexto grande anunciado não garante que todo prompt será útil ou econômico.
FAQ
Qual ID de modelo devo enviar?
Envie inclusionai/ling-3.0-flash-sante. O nome de exibição, Ling 3.0 Flash Sante, não substitui o ID do modelo no corpo da requisição.
Qual endpoint o início rápido usa?
Ele usa a rota de conclusões de chat compatível com OpenAI em https://api.novita.ai/openai/v1/chat/completions. Na configuração do SDK, use https://api.novita.ai/openai como URL base e deixe o SDK anexar seu caminho versionado.
O modelo hospedado é multimodal?
A listagem atual da Novita identifica texto como a modalidade de entrada e saída. Não envie conteúdo de imagem ou áudio, a menos que a listagem ao vivo do modelo adicione suporte explicitamente.
Posso usar isso para decisões clínicas?
Este início rápido é um guia de integração de API, não uma orientação clínica. Uma resposta de API bem-sucedida não estabelece segurança clínica, precisão factual, adequação regulatória ou autorização para processar informações protegidas. Avalie qualquer uso proposto com especialistas de domínio qualificados e os controles exigidos para seu ambiente.
