Ling 3.0 Flash Sante: Inicio rápido para Chat Completions compatibles con OpenAI

Ling 3.0 Flash Sante: Inicio rápido para Chat Completions compatibles con OpenAI

Esta guía de inicio rápido muestra cómo enviar una primera solicitud de chat completions de texto a Ling 3.0 Flash Sante a través de la API compatible con OpenAI de Novita. Usa https://api.novita.ai/openai como URL base, inclusionai/ling-3.0-flash-sante como ID del modelo y POST https://api.novita.ai/openai/v1/chat/completions como ruta de la solicitud. La ficha actual de Novita describe un modelo de Mezcla de Expertos de 124 mil millones de parámetros con aproximadamente 5.1 mil millones de parámetros activos por token, una ventana de contexto de 262,144 tokens, una salida máxima de 32,768 tokens, entrada y salida de texto, razonamiento y llamada de funciones. Para conocer el posicionamiento del modelo y el contexto de precios, consulta Ling 3.0 Flash Sante en Novita AI: capacidades y precios.

Cuándo usar esta guía de inicio rápido

Usa esta página cuando la pregunta práctica sea cómo autenticarse, confirmar la ruta del modelo, enviar una solicitud pequeña y analizar la respuesta. Está pensada para una primera prueba de integración, no para elegir un flujo clínico ni para validar un modelo en un caso de uso de alto impacto.

Ling 3.0 Flash Sante es un modelo de texto. La ficha alojada destaca el razonamiento basado en conocimiento médico, la seguridad clínica, la recuperación basada en evidencia y las tareas médicas de horizonte largo, e incluye también capacidades generales de razonamiento, programación y agencia. Esas etiquetas describen las áreas de capacidad previstas del modelo; no sustituyen la evaluación con tus datos, la verificación de fuentes, los controles de privacidad ni la revisión calificada.

Paso 1: Obtén tu clave de API de Novita

Crea una clave de API de Novita y mantenla fuera del control de versiones. Para una prueba de humo local, expórtala como variable de entorno:

export NOVITA_API_KEY="your_api_key"

No pongas la clave en un bundle de navegador, en un repositorio público ni en una aplicación de cliente. Para un servicio en producción, cárgala desde el gestor de secretos del servicio y hazla rotar según la política de credenciales de tu equipo.

Paso 2: Confirma el ID del modelo y el endpoint

Antes de escribir código de aplicación, consulta la página actual del modelo Ling 3.0 Flash Sante. Los valores siguientes se comprobaron el 4 de septiembre de 2026.

Campo Valor
ID del modelo inclusionai/ling-3.0-flash-sante
URL base https://api.novita.ai/openai
Endpoint de chat completions POST https://api.novita.ai/openai/v1/chat/completions
Ventana de contexto 262,144 tokens (mostrado como 256K)
Salida máxima 32,768 tokens (mostrado como 32K)
Entrada y salida Texto
Funciones listadas Llamada de funciones, razonamiento
Tasa de solicitudes del catálogo 30 solicitudes por minuto
Precio de entrada listado $0 por 1M tokens
Precio de salida listado $0 por 1M tokens

Los precios, los límites y la disponibilidad son valores dinámicos del catálogo. Vuelve a verificarlos antes de presupuestar o de llevar una integración a producción. El valor de tasa de solicitudes del catálogo no es una promesa de que todas las cuentas o cargas de trabajo recibirán el mismo rendimiento.

Paso 3: Envía tu primera solicitud

Comienza con un prompt corto y no sensible. Una solicitud pequeña aísla los errores de autenticación y enrutamiento antes de añadir contexto largo, herramientas o datos específicos de la aplicación.

curl "https://api.novita.ai/openai/v1/chat/completions" \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${NOVITA_API_KEY}" \
  -d '{
    "model": "inclusionai/ling-3.0-flash-sante",
    "messages": [
      {
        "role": "system",
        "content": "You are a concise technical assistant. Do not provide diagnosis or treatment advice."
      },
      {
        "role": "user",
        "content": "Return a three-item checklist for testing a text classification API."
      }
    ],
    "max_tokens": 256,
    "temperature": 0.2
  }'

La solicitud usa el array messages estándar y el ID exacto del modelo. El valor de max_tokens es deliberadamente pequeño para una prueba de humo. Auméntalo solo después de que la solicitud, el análisis de la respuesta, el manejo de timeout y el manejo de errores funcionen de forma fiable.

Paso 4: Lee la respuesta

Una solicitud de chat completions correcta devuelve un mensaje del asistente en la primera opción. En un cliente o servicio, comprueba primero el código de estado antes de analizar el JSON y maneja la respuesta de forma defensiva:

{
  "choices": [
    {
      "message": {
        "role": "assistant",
        "content": "1. Prepare representative labeled inputs.\n2. Measure classification accuracy and refusal behavior.\n3. Inspect errors before increasing traffic."
      }
    }
  ]
}

Para la primera prueba, confirma que:

  • la solicitud devuelve una respuesta HTTP correcta;
  • choices[0].message.content contiene el texto del asistente;
  • el modelo devuelto en model es el esperado cuando el campo está presente;
  • tu aplicación maneja contenido ausente, respuestas distintas de 200 y timeouts;
  • los registros contienen metadatos de la solicitud, pero nunca la clave de API ni entradas sensibles innecesarias.

No trates una respuesta HTTP correcta como evidencia de que un flujo médico o regulado está listo. Solo confirma que esta ruta de solicitud, credencial, ID del modelo y analizador de respuestas básico funcionan juntos.

Paso 5: Revisa precios, límites y errores comunes

Antes de usar tráfico real, vuelve a consultar la página actual del modelo para ver precios, contexto, salida máxima, funciones compatibles e información sobre la tasa de solicitudes. Después prueba los límites que importan para tu aplicación: prompts largos, truncamiento de salida, reintentos, solicitudes concurrentes y análisis de llamadas a herramientas.

Los fallos más comunes en la primera llamada son sencillos de identificar:

  • Error 401 o de autenticación: NOVITA_API_KEY no está definida, caducó, está mal formada o no se envía como token bearer.
  • Modelo no encontrado: la solicitud usa un nombre visible o un error tipográfico en lugar de inclusionai/ling-3.0-flash-sante.
  • Error de endpoint 404: el cliente duplicó u omitió la ruta /v1/chat/completions. Usa solo la URL base en la configuración del SDK, o usa la URL completa en cURL.
  • Error de solicitud 400: revisa la sintaxis JSON y los campos admitidos. Comienza con model y messages, y añade los parámetros opcionales de uno en uno.
  • Respuesta 429 por límite de tasa: aplica backoff exponencial acotado, reduce la concurrencia y compara tu tráfico con los límites actuales de la cuenta y del catálogo.
  • Respuesta truncada: aumenta max_tokens cuando la aplicación necesite más salida, siempre dentro del máximo actual del modelo y de tu presupuesto total de contexto.

Ejemplo con Python

El SDK de OpenAI para Python puede usar la URL base compatible de Novita. Instala el SDK en tu propio entorno, mantén definida NOVITA_API_KEY y ejecuta este ejemplo desde un proceso de servidor:

import os

from openai import OpenAI


client = OpenAI(
    base_url="https://api.novita.ai/openai",
    api_key=os.environ["NOVITA_API_KEY"],
)

response = client.chat.completions.create(
    model="inclusionai/ling-3.0-flash-sante",
    messages=[
        {
            "role": "system",
            "content": "You are a concise technical assistant. Do not provide diagnosis or treatment advice.",
        },
        {
            "role": "user",
            "content": "Explain how to test a text API response parser in three steps.",
        },
    ],
    max_tokens=256,
    temperature=0.2,
)

print(response.choices[0].message.content)

Este ejemplo usa solo los campos habituales de chat completions. Cuando funcione, añade instrucciones de sistema específicas de la aplicación, manejo de salida estructurada o herramientas, y prueba cada cambio de forma independiente.

Ejemplo con cURL

Para una comprobación de integración en shell, conserva la solicitud en un script y haz que falle de forma visible ante errores HTTP:

curl --fail-with-body "https://api.novita.ai/openai/v1/chat/completions" \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${NOVITA_API_KEY}" \
  -d '{
    "model": "inclusionai/ling-3.0-flash-sante",
    "messages": [
      {
        "role": "user",
        "content": "List three checks for a reliable JSON response parser."
      }
    ],
    "max_tokens": 256,
    "temperature": 0.2
  }'

--fail-with-body hace que cURL devuelva un estado de error para errores HTTP y conserve el cuerpo de la respuesta para depurar. No pegues ese cuerpo en registros públicos si contiene prompts u otros datos sensibles.

Parámetros clave

  • model: Usa el ID exacto del modelo alojado, inclusionai/ling-3.0-flash-sante.
  • messages: Proporciona el historial de conversación como objetos role/content. Mantén las instrucciones de sistema específicas y haz explícito el formato de salida esperado.
  • max_tokens: Establece un límite de salida apropiado para la tarea. El máximo actual del catálogo es 32,768 tokens, pero valores menores facilitan la inspección de las primeras pruebas.
  • temperature: Un valor más bajo puede facilitar la comparación de pruebas repetibles de extracción o clasificación. Mide el efecto en tus propios prompts en lugar de asumir que un único valor es siempre el mejor.
  • tools: La ficha incluye llamada de funciones. Si añades herramientas, define esquemas estrechos, valida los argumentos en tu aplicación y mantén la ejecución fuera del modelo.
  • Controles de razonamiento: La ficha incluye razonamiento, pero no asumas que todos los campos opcionales de razonamiento son portables entre SDK. Confirma la referencia actual de la API y el comportamiento del modelo antes de añadir campos específicos del proveedor.

Para texto relacionado con la salud, separa la generación de la verificación. Proporciona únicamente los datos que tu aplicación esté autorizada a procesar, conserva las referencias de la fuente cuando sea posible y deriva los resultados de alto impacto a revisores calificados. Este artículo no ofrece diagnóstico ni orientación de tratamiento.

Solución de problemas

Cuando una solicitud falle, redúcela a la llamada reproducible más pequeña: el ID exacto del modelo, un mensaje de usuario, un valor bajo de max_tokens y el encabezado bearer. Esto facilita distinguir un problema de cuenta de un problema del envoltorio del cliente.

Si la llamada mínima con cURL funciona pero la llamada con el SDK falla, imprime la URL resuelta por el SDK en un entorno local seguro de depuración y compárala con https://api.novita.ai/openai/v1/chat/completions. No imprimas los encabezados de autorización. Si ambas llamadas funcionan pero la salida de la aplicación no es fiable, mantén separada la prueba de integración y acceso al modelo de la evaluación de calidad de la tarea.

Para trabajo con contexto largo, comienza por debajo del límite de contexto de 262,144 tokens. Cuenta juntos los mensajes de entrada, las definiciones de herramientas y la salida esperada, y luego prueba el truncamiento y el comportamiento de timeout con solicitudes representativas. Un contexto publicitado como grande no garantiza que todos los prompts sean útiles o económicos.

Preguntas frecuentes

¿Qué ID de modelo debo enviar?

Envía inclusionai/ling-3.0-flash-sante. El nombre visible, Ling 3.0 Flash Sante, no sustituye al ID del modelo en el cuerpo de la solicitud.

¿Qué endpoint usa esta guía de inicio rápido?

Usa la ruta de chat completions compatible con OpenAI en https://api.novita.ai/openai/v1/chat/completions. En la configuración del SDK, usa https://api.novita.ai/openai como URL base y deja que el SDK añada su ruta versionada.

¿El modelo alojado es multimodal?

La ficha actual de Novita identifica el texto como modalidad tanto de entrada como de salida. No envíes contenido de imagen ni audio a menos que la ficha del modelo en vivo agregue soporte de forma explícita.

¿Puedo usarlo para decisiones clínicas?

Esta guía es una guía de integración de API, no una guía clínica. Una respuesta correcta de la API no establece seguridad clínica, exactitud factual, idoneidad normativa ni autorización para procesar información protegida. Evalúa cualquier uso propuesto con expertos calificados en el dominio y con los controles que exija tu entorno.

Artículos recomendados