Ling-3.0-flash en Novita AI: API gratuita para inferencia de agentes

Ling-3.0-flash en Novita AI: API gratuita para inferencia de agentes

Ling-3.0-flash ya está disponible a través de la API Serverless de Novita AI como un modelo gratuito por tiempo limitado, con precios de entrada y salida de $0 listados el 27 de julio de 2026. Es un modelo de texto diseñado para inferencia de agentes: 124 mil millones de parámetros totales, aproximadamente 5.1 mil millones de parámetros activos por token, una ventana de contexto de 262,144 tokens, soporte de razonamiento y llamadas a funciones a través de un flujo de trabajo de completaciones de chat compatible con OpenAI. Para desarrolladores que prueban agentes de larga duración, uso de herramientas o automatización de alto volumen, el atractivo inmediato es simple: puedes evaluar un modelo disperso grande sin pagar por token durante la ventana gratuita actual.

Puntos clave

  • La API actualmente es gratuita. La página del modelo Ling-3.0-flash muestra $0 por millón de tokens de entrada y $0 por millón de tokens de salida, con una etiqueta de “gratuito por tiempo limitado” al 27 de julio de 2026.
  • Es un modelo MoE altamente disperso de 124B. Aproximadamente 5.1B de parámetros están activos por token, lo que es aproximadamente el 4.1% del total de parámetros.
  • Está diseñado para inferencia de agentes. La lista de modelos de Novita enfatiza la eficiencia de tokens y las cargas de trabajo de agentes a escala de producción bajo restricciones de tokens, latencia y costos de servicio.
  • La API alojada soporta contexto largo y uso de herramientas. La lista actual muestra una ventana de contexto de 262,144 tokens, una salida máxima de 32,768 tokens, razonamiento y llamadas a funciones.
  • Trata el precio gratuito como una ventana de evaluación, no como un compromiso permanente. Verifica la página del modelo en vivo antes de estimar costos de producción o prometer un servicio gratuito a tus usuarios.

¿Qué es Ling-3.0-flash?

Ling-3.0-flash es un modelo de lenguaje disperso de Mezcla de Expertos de InclusionAI. En lugar de activar los 124B parámetros para cada token, enruta cada token a través de aproximadamente 5.1B de parámetros activos. Esa arquitectura tiene la intención de preservar la capacidad de un modelo grande mientras limita la cantidad de computación utilizada para cada paso de inferencia.

La descripción actual del modelo en Novita AI se centra en un objetivo práctico más que en un titular de referencia: completar más trabajo útil dentro de presupuestos limitados de tokens, latencia y costos de servicio. Ese posicionamiento lo hace especialmente relevante para sistemas de agentes, donde una acción del usuario puede desencadenar varias llamadas al modelo, llamadas a herramientas, turnos de planificación y pasos de verificación.

Ling-3.0-flash no debe confundirse con Ling-2.6-flash. El nuevo modelo aumenta los parámetros totales de 104B a 124B mientras reduce los parámetros activos de 7.4B a aproximadamente 5.1B. Ambos modelos exponen contexto largo en Novita AI, pero Ling-3.0-flash agrega soporte de razonamiento en el conjunto de funciones alojadas actual y se lanza con un precio de API gratuito por tiempo limitado.

¿Cómo está disponible Ling-3.0-flash en Novita AI?

Novita AI aloja Ling-3.0-flash como un modelo de generación de texto sin servidor. El ID exacto del modelo es inclusionai/ling-3.0-flash, y la familia de endpoints compatible es completaciones de chat. El servicio utiliza el mismo patrón de solicitud compatible con OpenAI disponible en todo el catálogo de LLM de Novita, por lo que los equipos pueden evaluar el modelo sin crear una implementación dedicada ni gestionar hardware de inferencia.

Al 27 de julio de 2026, el modelo está listado a $0 por millón de tokens de entrada y $0 por millón de tokens de salida. La página del modelo también etiqueta la oferta como gratuita por tiempo limitado. Esa distinción importa: Ling-3.0-flash es gratuito para llamar ahora, pero la lista no promete que el precio permanecerá en cero indefinidamente.

La práctica de producción más segura es tratar este período como una oportunidad para recopilar tu propia evidencia. Ejecuta trazas de agente representativas, registra el uso de tokens y la latencia, prueba la confiabilidad de las llamadas a funciones y compara la calidad de las respuestas con tu modelo actual. Si el precio cambia más tarde, tendrás suficientes datos para decidir si el modelo sigue teniendo sentido para la carga de trabajo.

Especificaciones y precios de Ling-3.0-flash

Campo Detalles actuales
Nombre mostrado Ling-3.0-flash
ID del modelo inclusionai/ling-3.0-flash
Arquitectura Mezcla de Expertos de 124B parámetros; aproximadamente 5.1B parámetros activos por token
Acceso API Serverless
Formato de API Completaciones de chat compatibles con OpenAI
URL base https://api.novita.ai/openai
Endpoint /v1/chat/completions a través de la URL base compatible con OpenAI
Ventana de contexto 262,144 tokens
Salida máxima 32,768 tokens
Modalidades Entrada de texto y salida de texto
Funciones alojadas Razonamiento y llamadas a funciones
Precio de entrada $0 por 1M tokens, gratuito por tiempo limitado
Precio de salida $0 por 1M tokens, gratuito por tiempo limitado
Mejor uso Evaluación de agentes, automatización de contexto largo, flujos de trabajo con herramientas y experimentación sensible a costos

La disponibilidad del modelo, especificaciones, precios y detalles de la API se verificaron en la página del modelo de Novita AI y la documentación de la API LLM el 27 de julio de 2026.

La lista actual del modelo no proporciona un paquete de referencia público, garantía de rendimiento o informe de entrenamiento ascendente detallado para Ling-3.0-flash. Por lo tanto, este artículo no le asigna una clasificación de inteligencia ni afirma que supere a otro modelo. Para la selección de producción, pruébalo con tus propios prompts y herramientas en lugar de inferir calidad solo a partir del número de parámetros.

¿Cómo se compara su precio con modelos MoE similares?

Ling-3.0-flash es inusual porque su precio de token alojado actual es cero. Para una comparación más útil que “gratuito versus pago”, la tabla a continuación incluye modelos dispersos con recuentos de parámetros totales similares o diseños de baja activación similares del catálogo en vivo de Novita AI.

Modelo en Novita AI Parámetros totales / activos Contexto Entrada por 1M tokens Salida por 1M tokens
Ling-3.0-flash 124B / ~5.1B 262,144 $0.00 $0.00
Qwen3.5-122B-A10B 122B / 10B 262,144 $0.40 $3.20
Qwen3-Next-80B-A3B-Instruct 80B / ~3B 131,072 $0.15 $1.50
Ling-2.6-flash 104B / 7.4B 262,144 $0.10 $0.30

Los precios y límites alojados se verificaron en las listas de modelos en vivo de Novita AI el 27 de julio de 2026. Ling-3.0-flash está marcado como gratuito por tiempo limitado, por lo que su fila es una instantánea más que una garantía de precio permanente.

La tabla no establece qué modelo es “mejor”. Qwen3.5-122B-A10B ofrece una asignación de salida máxima más grande en Novita AI y capacidades de visión nativas. Qwen3-Next-80B-A3B-Instruct es un modelo disperso más pequeño con soporte de salida estructurada en la lista actual. Ling-2.6-flash tiene un historial de producto establecido y sigue siendo económico incluso fuera de una promoción gratuita. Ling-3.0-flash es el modelo más fácil de evaluar por precio hoy, pero la capacidad y la confiabilidad aún requieren pruebas específicas de la carga de trabajo.

¿Por qué es importante el diseño MoE de 124B/5.1B?

El recuento total de parámetros y el recuento de parámetros activos describen diferentes partes de un modelo MoE. La cifra total de 124B representa la capacidad general de expertos del modelo. La cifra activa de aproximadamente 5.1B describe cuánto de esa red de expertos se selecciona para un token individual.

Para los desarrolladores, el punto importante no es que 5.1B de parámetros activos hagan que el modelo sea automáticamente rápido. La latencia real de la API también depende del hardware de servicio, la agrupación por lotes, la longitud del prompt, la longitud de la salida y la carga de la plataforma. La señal útil es que Ling-3.0-flash fue diseñado en torno a la activación dispersa y la eficiencia de tokens en lugar de ejecutar todo el conjunto de parámetros para cada token.

Ese diseño es particularmente relevante cuando un agente realiza bucles. Un agente de soporte puede clasificar una solicitud, recuperar contexto, llamar a una herramienta, inspeccionar el resultado y redactar una respuesta. Un agente de codificación puede buscar un repositorio, planificar un cambio, editar archivos, ejecutar pruebas y reparar fallos. En ambos casos, el costo y la latencia de una “tarea” se distribuyen en muchos turnos de inferencia. Un modelo diseñado para una inferencia repetida eficiente puede ser más valioso que uno optimizado solo para una respuesta única.

¿Qué pueden construir los desarrolladores con Ling-3.0-flash?

Asistentes que usan herramientas

La llamada a funciones convierte a Ling-3.0-flash en un candidato para asistentes que seleccionan herramientas, producen argumentos, inspeccionan resultados de herramientas y continúan un flujo de trabajo. Los ejemplos incluyen enrutamiento de atención al cliente, búsqueda de cuentas, recuperación de conocimiento interno y paneles de operaciones.

Flujos de trabajo de documentos de contexto largo

La ventana de contexto de 262,144 tokens puede acomodar un contexto de trabajo sustancial para revisión de contratos, síntesis de investigación, análisis de transcripciones o extracción de múltiples documentos. Una ventana de contexto grande no es un sustituto del diseño de recuperación, pero le da a los equipos más espacio para preservar instrucciones y evidencia relevante a lo largo de una tarea.

Agentes de codificación y repositorio

El razonamiento y la llamada a funciones son bases útiles para bucles de búsqueda y cambio de código. Ling-3.0-flash puede ser adecuado para triaje de repositorios, clasificación de problemas, planificación de migraciones, análisis de fallos de pruebas o agentes de codificación supervisados. Pruébalo con cuidado antes de permitir acciones de escritura, especialmente cuando las llamadas a herramientas pueden cambiar sistemas de producción.

Tuberías de evaluación de alto volumen

La ventana gratuita reduce el costo de construir un conjunto de evaluación. Los equipos pueden reproducir prompts reales, comparar formatos de llamadas a herramientas, examinar modos de fallo y determinar si el modelo merece un lugar en la lógica de enrutamiento. Este es un mejor uso del acceso gratuito que asumir que el modelo más barato debería convertirse en el predeterminado de inmediato.

¿Cuándo deberías usar Ling-3.0-flash?

Elige Ling-3.0-flash para evaluación cuando tu carga de trabajo tenga varias de estas características:

  • Está basada en texto y utiliza completaciones de chat.
  • Necesita razonamiento, llamadas a funciones o ambos.
  • Conlleva instrucciones largas, documentos, memoria o resultados de herramientas.
  • Una tarea de usuario puede requerir varios turnos del modelo.
  • Deseas probar un modelo MoE grande sin cargos por token durante la promoción actual.
  • Puedes medir el éxito con la finalización de tareas, precisión de herramientas, latencia y uso de tokens en lugar de depender de una tabla de clasificación pública.

El modelo también es un candidato práctico para experimentos de enrutamiento. Puedes enviar pasos de agente de menor riesgo a Ling-3.0-flash, comparar resultados con un modelo de referencia de pago y escalar solo las tareas que necesitan un perfil de capacidad diferente.

¿Cuándo deberías elegir otro modelo?

Ling-3.0-flash no es la elección automática para cada aplicación.

Elige otro modelo si necesitas entrada de imagen o audio, porque la lista alojada actual es solo de texto. Considera un modelo con soporte de salida estructurada si la generación estricta de esquemas es central para tu contrato de producción; Ling-3.0-flash actualmente lista llamadas a funciones pero no salidas estructuradas. También puede ser preferible un modelo diferente cuando necesitas evidencia de referencia publicada de forma independiente, un nivel de servicio de latencia específico o un precio de pago estable para la presupuestación a largo plazo.

La salida máxima de 32,768 tokens es generosa para muchas tareas de agente, pero está por debajo de los límites de salida de algunos modelos de contexto largo actuales. Si tu aplicación genera regularmente artefactos muy grandes en una sola llamada, compara los techos de salida antes de migrar.

Finalmente, no construyas un modelo de negocio que dependa de que la API siga siendo gratuita. El precio cero es explícitamente por tiempo limitado. La planificación de producción debe incluir un modelo de respaldo, controles de enrutamiento y una verificación de precio actualizada antes del lanzamiento.

¿Cómo encaja en un flujo de trabajo de API existente?

Ling-3.0-flash utiliza la interfaz LLM compatible con OpenAI de Novita AI. A alto nivel, una aplicación de completaciones de chat existente necesita tres valores de configuración:

  1. Una clave de API de Novita AI.
  2. La URL base compatible con OpenAI, https://api.novita.ai/openai.
  3. El ID del modelo, inclusionai/ling-3.0-flash.

La solicitud luego pasa por el endpoint de completaciones de chat. Se pueden incluir definiciones de funciones para flujos de trabajo que usan herramientas, y el comportamiento de razonamiento debe evaluarse con los mismos prompts y verificaciones a nivel de tarea que planeas usar en producción.

Esta descripción general de lanzamiento se detiene intencionalmente en el límite de integración. No incluye un tutorial completo del SDK, ejemplos de solicitudes, ajuste de parámetros o pasos de solución de problemas; esos pertenecen a una guía de inicio rápido dedicada.

Conclusión

Vale la pena probar Ling-3.0-flash si estás construyendo agentes basados en texto y deseas un modelo grande y disperso con contexto largo, razonamiento y llamadas a funciones. El precio gratuito actual por tiempo limitado elimina la barrera del costo de tokens para una evaluación seria, mientras que la arquitectura de 124B totales y 5.1B activos le da al modelo un diseño claramente orientado a la eficiencia.

La decisión correcta es usar la ventana gratuita para obtener evidencia, no suposiciones. Mide tareas completas del agente, incluyendo reintentos y fallos de herramientas. Compara la calidad de salida y la latencia con un modelo ya confiable en tu stack. Confirma el precio en vivo antes del despliegue en producción. Si Ling-3.0-flash se desempeña bien en esas pruebas, Novita AI proporciona una ruta serverless directa para agregarlo a un flujo de trabajo compatible con OpenAI.

Evalúa Ling-3.0-flash en Novita AI

Preguntas frecuentes

¿La API de Ling-3.0-flash es gratuita?

Sí, al 27 de julio de 2026. Novita AI lista tanto la entrada como la salida a $0 por millón de tokens y marca el modelo como “gratuito por tiempo limitado”. Verifica la página del modelo en vivo antes de usarlo porque la promoción puede cambiar.

¿Cuál es el ID del modelo Ling-3.0-flash?

El ID exacto del modelo en Novita AI es inclusionai/ling-3.0-flash.

¿Qué tamaño tiene Ling-3.0-flash?

Es un modelo de Mezcla de Expertos de 124B parámetros con aproximadamente 5.1B parámetros activados por token.

¿Qué ventana de contexto soporta Ling-3.0-flash?

La lista actual de Novita AI muestra una ventana de contexto de 262,144 tokens y una salida máxima de 32,768 tokens.

¿Ling-3.0-flash soporta llamadas a funciones?

Sí. Novita AI actualmente lista llamadas a funciones y razonamiento como características compatibles. La salida estructurada no está listada, así que valida cualquier requisito estricto de JSON o esquema en tus propias pruebas.

¿Es Ling-3.0-flash un modelo multimodal?

No en el endpoint actual de Novita AI. La lista alojada muestra entrada de texto y salida de texto.

¿Es Ling-3.0-flash mejor que Qwen3.5-122B-A10B?

No hay suficiente evidencia pública verificada para hacer una afirmación general de calidad. Ling-3.0-flash es actualmente gratuito y activa menos parámetros por token, mientras que Qwen3.5-122B-A10B soporta visión, salidas estructuradas y un límite de salida máximo más alto en Novita AI. Elige con una evaluación específica de la carga de trabajo.

Artículos recomendados