Novita AI LLM, Actualizaciones

Ling-3.0-flash en Novita AI: API gratuita para inferencia agéntica

Ling-3.0-flash en Novita AI: API gratuita para inferencia agéntica

Ling-3.0-flash ya está disponible a través de la API Serverless de Novita AI como un modelo gratuito por tiempo limitado, con precios de entrada y salida de $0 listados el 27 de julio de 2026. Es un modelo de texto diseñado para inferencia agéntica: 124 mil millones de parámetros totales, aproximadamente 5.1 mil millones de parámetros activos por token, una ventana de contexto de 262,144 tokens, soporte de razonamiento y llamada a funciones a través de un flujo de trabajo de finalización de chat compatible con OpenAI. Para desarrolladores que prueban agentes de larga duración, uso de herramientas o automatización de alto volumen, el atractivo inmediato es simple: puedes evaluar un modelo grande disperso sin pagar por token durante la ventana gratuita actual.

Puntos clave

  • La API actualmente es gratuita. La página del modelo Ling-3.0-flash muestra $0 por millón de tokens de entrada y $0 por millón de tokens de salida, con una etiqueta de “gratuito por tiempo limitado” a partir del 27 de julio de 2026.
  • Es un modelo MoE altamente disperso de 124B. Aproximadamente 5.1B de parámetros están activos por token, lo que es alrededor del 4.1% del total de parámetros.
  • Está diseñado para inferencia agéntica. La lista de modelos de Novita enfatiza la eficiencia de tokens y las cargas de trabajo de agentes a escala de producción bajo restricciones de tokens, latencia y costos de servicio.
  • La API alojada admite contexto largo y uso de herramientas. La lista actual muestra una ventana de contexto de 262,144 tokens, una salida máxima de 32,768 tokens, razonamiento y llamada a funciones.
  • Trata el precio gratuito como una ventana de evaluación, no un compromiso permanente. Consulta la página del modelo en vivo antes de estimar costos de producción o prometer un servicio gratuito a tus usuarios.

¿Qué es Ling-3.0-flash?

Ling-3.0-flash es un modelo de lenguaje disperso de Mixture-of-Experts de InclusionAI. En lugar de activar los 124B parámetros para cada token, enruta cada token a través de aproximadamente 5.1B de parámetros activos. Esa arquitectura pretende preservar la capacidad de un modelo grande mientras limita la cantidad de cómputo utilizada para cada paso de inferencia.

La descripción actual del modelo en Novita AI se centra en un objetivo práctico más que en un titular de referencia: completar más trabajo útil dentro de presupuestos limitados de tokens, latencia y costos de servicio. Ese posicionamiento lo hace especialmente relevante para sistemas de agentes, donde una sola acción del usuario puede desencadenar varias llamadas al modelo, llamadas a herramientas, turnos de planificación y pasos de verificación.

Ling-3.0-flash no debe confundirse con Ling-2.6-flash. El nuevo modelo aumenta los parámetros totales de 104B a 124B mientras reduce los parámetros activos de 7.4B a aproximadamente 5.1B. Ambos modelos exponen contexto largo en Novita AI, pero Ling-3.0-flash añade soporte de razonamiento en el conjunto de funciones alojadas actual y se lanza con un precio de API gratuito por tiempo limitado.

¿Cómo está disponible Ling-3.0-flash en Novita AI?

Novita AI aloja Ling-3.0-flash como un modelo de generación de texto sin servidor. El ID del modelo exacto es inclusionai/ling-3.0-flash, y la familia de endpoints compatible es finalización de chat. El servicio utiliza el mismo patrón de solicitud compatible con OpenAI disponible en todo el catálogo de LLM de Novita, por lo que los equipos pueden evaluar el modelo sin crear una implementación dedicada ni gestionar hardware de inferencia.

A partir del 27 de julio de 2026, el modelo se lista a $0 por millón de tokens de entrada y $0 por millón de tokens de salida. La página del modelo también etiqueta la oferta como gratuita por tiempo limitado. Esa distinción importa: Ling-3.0-flash es gratuito para llamar ahora, pero la lista no promete que el precio permanezca en cero indefinidamente.

La práctica de producción más segura es tratar este período como una oportunidad para recopilar tu propia evidencia. Ejecuta trazas de agentes representativas, registra el uso de tokens y la latencia, prueba la fiabilidad de la llamada a funciones y compara la calidad de las respuestas con tu modelo actual. Si el precio cambia más adelante, tendrás suficientes datos para decidir si el modelo sigue siendo adecuado para la carga de trabajo.

Especificaciones y precios de Ling-3.0-flash

Campo Detalles actuales
Nombre para mostrar Ling-3.0-flash
ID del modelo inclusionai/ling-3.0-flash
Arquitectura Mixture-of-Experts de 124B parámetros; aproximadamente 5.1B parámetros activos por token
Acceso API Serverless
Formato de API Finalizaciones de chat compatibles con OpenAI
URL base https://api.novita.ai/openai
Endpoint /v1/chat/completions a través de la URL base compatible con OpenAI
Ventana de contexto 262,144 tokens
Salida máxima 32,768 tokens
Modalidades Entrada de texto y salida de texto
Funciones alojadas Razonamiento y llamada a funciones
Precio de entrada $0 por 1M tokens, gratuito por tiempo limitado
Precio de salida $0 por 1M tokens, gratuito por tiempo limitado
Mejor ajuste Evaluación de agentes, automatización de contexto largo, flujos de trabajo con uso de herramientas y experimentación sensible al costo

La disponibilidad del modelo, especificaciones, precios y detalles de la API fueron verificados contra la página del modelo de Novita AI y la documentación de la API LLM el 27 de julio de 2026.

La lista actual del modelo no proporciona un paquete de referencia público, garantía de rendimiento ni informe de entrenamiento ascendente detallado para Ling-3.0-flash. Por lo tanto, este artículo no le asigna una clasificación de inteligencia ni afirma que supere a otro modelo. Para la selección de producción, pruébalo con tus propios mensajes y herramientas en lugar de inferir calidad solo a partir del número de parámetros.

¿Cómo se compara su precio con modelos MoE similares?

Ling-3.0-flash es inusual porque su precio de token alojado actual es cero. Para una comparación más útil que “gratis versus pago”, la tabla siguiente incluye modelos dispersos con recuentos de parámetros totales similares o diseños similares de pocos parámetros activos del catálogo en vivo de Novita AI.

Modelo en Novita AI Parámetros totales / activos Contexto Entrada por 1M tokens Salida por 1M tokens
Ling-3.0-flash 124B / ~5.1B 262,144 $0.00 $0.00
Qwen3.5-122B-A10B 122B / 10B 262,144 $0.40 $3.20
Qwen3-Next-80B-A3B-Instruct 80B / ~3B 131,072 $0.15 $1.50
Ling-2.6-flash 104B / 7.4B 262,144 $0.10 $0.30

Los precios y límites alojados se verificaron contra las listas de modelos en vivo de Novita AI el 27 de julio de 2026. Ling-3.0-flash está marcado como gratuito por tiempo limitado, por lo que su fila es una instantánea más que una garantía de precio permanente.

La tabla no establece qué modelo es “mejor”. Qwen3.5-122B-A10B ofrece un límite de salida máxima más grande en Novita AI y capacidades nativas de visión. Qwen3-Next-80B-A3B-Instruct es un modelo disperso más pequeño con soporte de salida estructurada en la lista actual. Ling-2.6-flash tiene un historial de producto establecido y sigue siendo económico incluso fuera de una promoción gratuita. Ling-3.0-flash es el modelo más fácil de evaluar por precio hoy, pero la capacidad y la fiabilidad aún requieren pruebas específicas de la carga de trabajo.

¿Por qué importa el diseño MoE de 124B/5.1B?

El recuento total de parámetros y el recuento de parámetros activos describen diferentes partes de un modelo MoE. La cifra total de 124B representa la capacidad general de expertos del modelo. La cifra activa de aproximadamente 5.1B describe cuánto de esa red de expertos se selecciona para un token individual.

Para los desarrolladores, el punto importante no es que 5.1B parámetros activos hagan automáticamente al modelo rápido. La latencia real de la API también depende del hardware de servicio, el batching, la longitud del mensaje, la longitud de salida y la carga de la plataforma. La señal útil es que Ling-3.0-flash fue diseñado en torno a la activación dispersa y la eficiencia de tokens, en lugar de ejecutar todo el conjunto de parámetros para cada token.

Ese diseño es particularmente relevante cuando un agente itera. Un agente de soporte puede clasificar una solicitud, recuperar contexto, llamar a una herramienta, inspeccionar el resultado y redactar una respuesta. Un agente de codificación puede buscar en un repositorio, planificar un cambio, editar archivos, ejecutar pruebas y reparar fallos. En ambos casos, el costo y la latencia de una “tarea” se distribuyen en muchos turnos de inferencia. Un modelo diseñado para una inferencia repetida eficiente puede ser más valioso que uno optimizado solo para una respuesta única.

¿Qué pueden construir los desarrolladores con Ling-3.0-flash?

Asistentes que usan herramientas

La llamada a funciones hace de Ling-3.0-flash un candidato para asistentes que seleccionan herramientas, producen argumentos, inspeccionan resultados de herramientas y continúan un flujo de trabajo. Los ejemplos incluyen enrutamiento de atención al cliente, búsqueda de cuentas, recuperación de conocimiento interno y paneles de operaciones.

Flujos de trabajo de documentos de contexto largo

La ventana de contexto de 262,144 tokens puede acomodar un contexto de trabajo sustancial para revisión de contratos, síntesis de investigaciones, análisis de transcripciones o extracción de múltiples documentos. Una ventana de contexto grande no es un sustituto de un buen diseño de recuperación, pero brinda a los equipos más espacio para preservar instrucciones y evidencia relevante a lo largo de una tarea.

Agentes de codificación y repositorios

El razonamiento y la llamada a funciones son bases útiles para bucles de búsqueda y modificación de código. Ling-3.0-flash puede ser adecuado para triaje de repositorios, clasificación de incidencias, planificación de migraciones, análisis de fallos de pruebas o agentes de codificación supervisados. Pruébalo con cuidado antes de permitir acciones de escritura, especialmente cuando las llamadas a herramientas pueden cambiar sistemas de producción.

Pipelines de evaluación de alto volumen

La ventana gratuita reduce el costo de construir un conjunto de evaluación. Los equipos pueden reproducir mensajes reales, comparar formatos de llamada a herramientas, examinar modos de fallo y determinar si el modelo merece un lugar en la lógica de enrutamiento. Este es un mejor uso del acceso gratuito que asumir que el modelo más barato debería convertirse en el predeterminado de inmediato.

¿Cuándo deberías usar Ling-3.0-flash?

Elige Ling-3.0-flash para evaluación cuando tu carga de trabajo tenga varias de estas características:

  • Está basada en texto y utiliza finalizaciones de chat.
  • Necesita razonamiento, llamada a funciones o ambos.
  • Lleva instrucciones largas, documentos, memoria o resultados de herramientas.
  • Una tarea de usuario puede requerir varios turnos del modelo.
  • Quieres probar un modelo MoE grande sin cargos por token durante la promoción actual.
  • Puedes medir el éxito con la finalización de tareas, precisión de herramientas, latencia y uso de tokens, en lugar de confiar en un leaderboard público.

El modelo también es un candidato práctico para experimentos de enrutamiento. Puedes enviar pasos de agente de menor riesgo a Ling-3.0-flash, comparar resultados con un modelo de referencia pago y escalar solo las tareas que necesitan un perfil de capacidad diferente.

¿Cuándo deberías elegir otro modelo?

Ling-3.0-flash no es la opción automática para todas las aplicaciones.

Elige otro modelo si necesitas entrada de imagen o audio, porque la lista alojada actual es solo texto. Considera un modelo con soporte de salida estructurada si la generación estricta de esquemas es central para tu contrato de producción; Ling-3.0-flash actualmente lista llamada a funciones pero no salidas estructuradas. También puede ser preferible otro modelo cuando necesites evidencia de referencia publicada de forma independiente, un nivel de servicio de latencia específico o un precio estable pagado para presupuestos a largo plazo.

La salida máxima de 32,768 tokens es generosa para muchas tareas de agentes, pero está por debajo de los límites de salida de algunos modelos de contexto largo actuales. Si tu aplicación genera regularmente artefactos muy grandes en una sola llamada, compara los techos de salida antes de migrar.

Finalmente, no construyas un modelo de negocio que dependa de que la API siga siendo gratuita. El precio cero es explícitamente por tiempo limitado. La planificación de producción debe incluir un modelo de respaldo, controles de enrutamiento y una verificación de precio actualizada antes del lanzamiento.

¿Cómo encaja en un flujo de trabajo de API existente?

Ling-3.0-flash utiliza la interfaz LLM compatible con OpenAI de Novita AI. A alto nivel, una aplicación existente de finalizaciones de chat necesita tres valores de configuración:

  1. Una clave API de Novita AI.
  2. La URL base compatible con OpenAI, https://api.novita.ai/openai.
  3. El ID del modelo, inclusionai/ling-3.0-flash.

La solicitud luego pasa por el endpoint de finalizaciones de chat. Las definiciones de funciones pueden incluirse para flujos de trabajo con uso de herramientas, y el comportamiento de razonamiento debe evaluarse con los mismos mensajes y verificaciones a nivel de tarea que planeas usar en producción.

Esta visión general de lanzamiento se detiene intencionalmente en el límite de integración. No incluye un tutorial completo de SDK, ejemplos de solicitudes, ajuste de parámetros o pasos de solución de problemas; esos pertenecen a una guía de inicio rápido dedicada.

Conclusión

Vale la pena probar Ling-3.0-flash si estás construyendo agentes basados en texto y deseas un modelo grande y disperso con contexto largo, razonamiento y llamada a funciones. El precio gratuito actual por tiempo limitado elimina la barrera del costo por token para una evaluación seria, mientras que la arquitectura de 124B total y 5.1B activos le da al modelo un diseño claramente orientado a la eficiencia.

La decisión correcta es usar la ventana gratuita para obtener evidencia, no suposiciones. Mide tareas de agente completas, incluidos reintentos y fallos de herramientas. Compara la calidad de salida y la latencia con un modelo ya confiable en tu pila. Confirma el precio en vivo antes del despliegue de producción. Si Ling-3.0-flash funciona bien en esas pruebas, Novita AI proporciona una ruta serverless directa para añadirlo a un flujo de trabajo compatible con OpenAI.

Evalúa Ling-3.0-flash en Novita AI

Preguntas frecuentes

¿La API de Ling-3.0-flash es gratuita?

Sí, a partir del 27 de julio de 2026. Novita AI lista tanto entrada como salida a $0 por millón de tokens y marca el modelo como “gratuito por tiempo limitado”. Consulta la página del modelo en vivo antes de usarlo porque la promoción puede cambiar.

¿Cuál es el ID del modelo Ling-3.0-flash?

El ID exacto del modelo en Novita AI es inclusionai/ling-3.0-flash.

¿Qué tamaño tiene Ling-3.0-flash?

Es un modelo Mixture-of-Experts de 124B parámetros con aproximadamente 5.1B parámetros activados por token.

¿Qué ventana de contexto soporta Ling-3.0-flash?

La lista actual de Novita AI muestra una ventana de contexto de 262,144 tokens y una salida máxima de 32,768 tokens.

¿Ling-3.0-flash soporta llamada a funciones?

Sí. Novita AI actualmente lista llamada a funciones y razonamiento como características soportadas. La salida estructurada no está listada, por lo que debes validar cualquier requisito estricto de JSON o esquema en tus propias pruebas.

¿Es Ling-3.0-flash un modelo multimodal?

No en el endpoint actual de Novita AI. La lista alojada muestra entrada de texto y salida de texto.

¿Es Ling-3.0-flash mejor que Qwen3.5-122B-A10B?

No hay suficiente evidencia pública verificada para hacer una afirmación de calidad general. Ling-3.0-flash es actualmente gratuito y activa menos parámetros por token, mientras que Qwen3.5-122B-A10B soporta visión, salidas estructuradas y un límite de salida máxima más alto en Novita AI. Elige con evaluación específica de la carga de trabajo.

Artículos recomendados

Publicaciones relacionadas