Ling-3.0-Flash-VL en Novita AI: API multimodal nativa y precios

Ling-3.0-Flash-VL en Novita AI: API multimodal nativa y precios

Ling-3.0-Flash-VL ya está disponible en Novita AI como un modelo multimodal serverless para aplicaciones que necesitan entrada de texto, imagen y video en un único flujo de trabajo de API. El listado alojado para inclusionai/ling-3.0-flash-vl muestra una ventana de contexto de 262 144 tokens, una salida máxima de 32 768 tokens, razonamiento, llamada a funciones y $0 por millón de tokens de entrada y salida con una etiqueta de “gratuito por tiempo limitado”, verificado el 9 de septiembre de 2026. Es el miembro de lenguaje visual de la familia Ling-3.0-flash, que añade comprensión visual nativa y capacidades de agente visual en lugar de requerir un pipeline separado de imagen a texto.

Puntos clave

  • Ling-3.0-Flash-VL acepta texto, imágenes y videos. Novita lista esas tres modalidades de entrada y salida de texto para el modelo alojado.
  • El endpoint de Novita es un despliegue de 256 K de contexto y 32 K de salida. Los límites exactos son 262 144 tokens de contexto y 32 768 tokens máximos de salida.
  • El modelo es disperso con una gran capacidad total. La ficha técnica oficial de InclusionAI describe 124 B de parámetros totales y aproximadamente 5,5 B de parámetros activados por token.
  • El precio actual por token es $0. Novita marca tanto la entrada como la salida a $0 por millón de tokens y etiqueta la oferta como “por tiempo limitado”, por lo que debes volver a consultar la página del modelo antes de presupuestar tráfico de producción.
  • La principal diferencia de uso con respecto al Ling-3.0-flash base es la entrada visual. Utiliza la descripción general de Ling-3.0-flash para el punto de entrada de la familia solo texto; esta página se centra en la variante -VL.

¿Qué es Ling-3.0-Flash-VL?

Ling-3.0-Flash-VL es un modelo multimodal nativo de InclusionAI y la extensión de lenguaje visual de Ling-3.0-flash. La ficha técnica del modelo upstream describe un sistema que incorpora información visual en la comprensión, el razonamiento, la planificación, la actuación y la verificación. Ese es un papel más amplio que adjuntar un captioner de imágenes a un modelo de lenguaje solo de texto: la imagen o el video pueden permanecer como parte del contexto de razonamiento del modelo mientras trabaja en una tarea.

La ficha técnica informa de 124 B de parámetros totales y aproximadamente 5,5 B de parámetros activados por token. Este es un diseño de mezcla dispersa de expertos, por lo que el número total de parámetros y los parámetros activos por token describen propiedades diferentes. El primero indica la capacidad general del modelo; el segundo describe la cantidad aproximada de computación enrutada para cada token. Ninguno de los dos números garantiza por sí solo una latencia o calidad de salida particular en tu carga de trabajo.

La extensión visual es la distinción importante para este lanzamiento. El Ling-3.0-flash base es un modelo de texto en el listado actual de Novita, mientras que Ling-3.0-Flash-VL acepta entradas de imagen y video además de texto. Eso hace que la página -VL sea relevante para la comprensión de interfaces, análisis de documentos y gráficos, inspección visual, respuesta a preguntas sobre videos y agentes que necesitan interpretar lo que aparece en pantalla.

Cómo acceder a él en Novita AI

Novita aloja el modelo como un endpoint serverless con el ID de modelo exacto inclusionai/ling-3.0-flash-vl. La página del modelo lista chat/completions y familias de endpoints compatibles con Anthropic, además de funciones de razonamiento y llamada a funciones. Para un cliente existente compatible con OpenAI, usa la URL base de la API de Novita y selecciona el ID de modelo exacto en la configuración de tu solicitud.

La página del modelo es la fuente de verdad para la configuración alojada. En particular, no copies la afirmación de contexto más grande de la ficha técnica upstream en una integración de Novita sin verificar los límites del despliegue: la ficha técnica describe hasta 1 M de tokens a nivel de modelo, mientras que Novita expone actualmente 262 144 tokens de contexto y 32 768 tokens máximos de salida para este listado.

El catálogo actual también muestra un límite de 30 solicitudes por minuto para el nivel predeterminado, con valores de niveles superiores listados por separado. Trátalo como una cuota del catálogo, no como una garantía de rendimiento universal de la aplicación. El nivel de la cuenta, el tamaño de la solicitud, la concurrencia, los reintentos y la ejecución de herramientas pueden afectar el rendimiento de extremo a extremo.

Especificaciones y resumen de precios

Campo Detalles Fuente / Fecha verificada
Nombre mostrado Ling 3.0 Flash VL Página del modelo de Novita, 9 de septiembre de 2026
ID del modelo inclusionai/ling-3.0-flash-vl Página del modelo de Novita, 9 de septiembre de 2026
Arquitectura 124 B parámetros totales; aproximadamente 5,5 B activos por token; MoE disperso Ficha técnica oficial de InclusionAI, 9 de septiembre de 2026
Modalidades de entrada Texto, imagen y video Página del modelo de Novita, 9 de septiembre de 2026
Modalidad de salida Texto Página del modelo de Novita, 9 de septiembre de 2026
Ventana de contexto 262 144 tokens en el despliegue de Novita Página del modelo de Novita, 9 de septiembre de 2026
Salida máxima 32 768 tokens Página del modelo de Novita, 9 de septiembre de 2026
Funciones alojadas Serverless, llamada a funciones, razonamiento Página del modelo de Novita, 9 de septiembre de 2026
Familias de endpoints chat/completions, compatible con Anthropic Página del modelo de Novita, 9 de septiembre de 2026
RPM del catálogo 30 RPM en el nivel de listado predeterminado Página del modelo de Novita, 9 de septiembre de 2026
Precio de entrada $0 por millón de tokens, actualmente etiquetado como gratuito por tiempo limitado Página del modelo de Novita, 9 de septiembre de 2026
Precio de salida $0 por millón de tokens, actualmente etiquetado como gratuito por tiempo limitado Página del modelo de Novita, 9 de septiembre de 2026

El precio de $0 es útil para evaluación, pero no debería convertirse en una suposición de producción no probada. Antes del lanzamiento, registra el precio actual, añade un límite de presupuesto y decide qué modelo o cola debería recibir tráfico si finaliza el período promocional.

¿Qué pueden construir los desarrolladores con él?

Comprender documentos, gráficos e interfaces

La entrada visual puede reducir la cantidad de preprocesamiento necesaria para documentos, paneles, capturas de pantalla e interfaces de software. Un desarrollador puede pasar una captura de pantalla junto con una instrucción de tarea y pedirle al modelo que identifique campos, resuma el estado visible o localice un objetivo de interacción. Para documentos y gráficos, prueba si el modelo conserva unidades, leyendas, estructura de tablas y relaciones espaciales en lugar de juzgarlo a partir de un ejemplo breve de subtitulado.

Razonar sobre imágenes y video

La arquitectura upstream utiliza un codificador visual y un manejo de posición temporal para video. Esto es relevante cuando la respuesta depende del cambio a lo largo del tiempo, como identificar cuándo ocurre un evento, comparar dos momentos en un clip o extraer una secuencia de acciones. Los videos largos aún necesitan un muestreo cuidadoso y un diseño de prompt: un límite de contexto grande no hace que automáticamente cada fotograma sea igualmente útil o asequible después de cambios de precio.

Apoyar agentes visuales

El posicionamiento del modelo como agente visual se ajusta a flujos de trabajo donde la percepción es solo una etapa de un bucle más grande. Un agente podría inspeccionar una captura de pantalla del navegador, razonar sobre la siguiente acción, llamar a una herramienta y verificar la pantalla resultante. La llamada a funciones puede proporcionar el límite de acción, mientras que el contexto visual proporciona evidencia para decidir qué hacer a continuación. Mantén los permisos restringidos y valida cada argumento de la herramienta; la comprensión multimodal no elimina la necesidad de controles de seguridad del lado de la aplicación.

Enrutar cargas de trabajo mixtas de texto y visuales

Los equipos que ya enrutan tareas de texto a Ling-3.0-flash pueden evaluar la variante -VL para solicitudes que contengan evidencia visual. Un enrutador práctico puede enviar tráfico solo de texto al modelo base y reservar la variante visual para mensajes que contengan imágenes, videos o estado derivado de capturas de pantalla. Mide la ruta completa, incluida la preparación de imágenes, el tiempo de carga, la latencia del modelo, los reintentos y las llamadas a herramientas posteriores.

Señales de rendimiento y evaluación

La ficha técnica oficial de InclusionAI reporta una puntuación de 42 en el Artificial Analysis Intelligence Index v4.1.1 y describe dimensiones de capacidad multimodal que incluyen comprensión, razonamiento y actuación. Esa es una señal útil sobre el lanzamiento upstream, no una garantía para el despliegue alojado en Novita o para tu distribución de prompts. La página también señala una configuración de evaluación Terminal-Bench de 256 K de contexto, que está más cerca del límite de contexto alojado que la declaración general de la ficha técnica de “hasta 1 M”.

Para una evaluación significativa, utiliza un pequeño conjunto de tareas que refleje tu producto:

  • Extracción visual: mide la precisión de campos en capturas de pantalla, formularios, tablas y gráficos.
  • Razonamiento temporal: prueba si las respuestas identifican el evento correcto y el rango de tiempo en videos cortos.
  • Ejecución de agente: puntúa tanto la herramienta elegida como el estado final después de que la herramienta se ejecute.
  • Grounding: incluye imágenes con detalles ambiguos o irrelevantes y verifica afirmaciones no respaldadas.
  • Operaciones: registra latencia, uso de tokens, tasa de fallos, comportamiento de límite de velocidad y el efecto de los reintentos.

No uses una puntuación de referencia upstream como sustituto de estas comprobaciones de aplicación. Un modelo puede rendir bien en un benchmark público y aun así necesitar cambios de prompt, preprocesamiento o enrutamiento en una interfaz de producción.

Cuándo usar Ling-3.0-Flash-VL

Elige Ling-3.0-Flash-VL cuando tu solicitud contenga evidencia visual y la respuesta requiera más que un subtítulo único. Es un buen candidato para evaluar en:

  • comprensión de capturas de pantalla e interfaces de navegador
  • respuesta a preguntas sobre gráficos, tablas y documentos
  • localización y resumen de eventos en videos cortos
  • agentes visuales que usan herramientas
  • flujos de trabajo que combinan soporte de texto e imagen

El listado gratuito actual también hace práctico construir un conjunto de pruebas representativo antes de comprometerse con un plan de enrutamiento pago. Captura la fecha y el estado del precio cuando ejecutes esas pruebas para que las comparaciones de costos sigan siendo reproducibles.

Cuándo elegir otro modelo

Elige la página del modelo base Ling-3.0-flash para cargas de trabajo solo de texto si no necesitas entradas visuales. Una ruta solo de texto puede simplificar el manejo de la carga útil y reducir el procesamiento multimodal innecesario.

Elige otro modelo si necesitas un precio fijo permanente, un límite de contexto o salida diferente, un nivel de servicio de latencia probado, entrada de audio o una capacidad que no esté listada para este despliegue. También mantén un plan de contingencia si tu aplicación depende de la oferta actual gratuita por tiempo limitado. El diseño de producción más seguro trata el precio promocional y la cuota del catálogo como configuración modificable, no como garantías de producto codificadas.

Cómo encaja en un flujo de trabajo de API existente

A alto nivel, una aplicación existente compatible con OpenAI necesita una clave de API de Novita, la URL base compatible con OpenAI de Novita y inclusionai/ling-3.0-flash-vl como ID del modelo. La solicitud debe usar la estructura de mensajes multimodales soportada por el endpoint seleccionado, con contenido de imagen o video junto con la instrucción de texto del usuario.

Mantén los activos visuales accesibles para el endpoint y valida su formato antes de enviarlos. Para un flujo de trabajo de agente, define las herramientas por separado del contenido visual, restringe lo que cada herramienta puede hacer y registra la acción seleccionada por el modelo y el estado resultante de la aplicación. Un artículo dedicado de inicio rápido puede cubrir la construcción de solicitudes específicas del SDK; esta página de lanzamiento se centra intencionalmente en la disponibilidad, el posicionamiento, los límites y los precios.

Recomendación final

Ling-3.0-Flash-VL es el miembro de la familia Ling-3.0-flash que debes probar cuando la evidencia visual deba participar en el razonamiento o la ejecución de agentes. El listado serverless actual de Novita combina entrada de imagen y video con un contexto de 262 K, una salida máxima de 32 K, razonamiento y llamada a funciones, mientras que el precio de $0 de entrada y salida reduce la barrera para la evaluación durante la ventana actual de tiempo limitado.

Comienza con un conjunto de pruebas específico de tu carga de trabajo, compáralo con tu ruta existente solo de texto y registra métricas operativas además de la calidad de las respuestas. Si cumple con tus requisitos de precisión visual y seguridad de herramientas, mantén el ID del modelo de Novita y el precio actual en la configuración para que un cambio futuro en el catálogo no requiera una reescritura del código.

Prueba Ling-3.0-Flash-VL en Novita AI

Preguntas frecuentes

¿Cuál es el ID del modelo Ling-3.0-Flash-VL en Novita AI?

El ID exacto del modelo es inclusionai/ling-3.0-flash-vl.

¿Ling-3.0-Flash-VL admite entrada de imagen y video?

Sí. El listado actual de Novita admite entrada de texto, imagen y video, con salida de texto.

¿Qué ventana de contexto y límite de salida proporciona Novita?

El listado alojado muestra una ventana de contexto de 262 144 tokens y una salida máxima de 32 768 tokens. Estos son los valores del despliegue de Novita y deben verificarse nuevamente antes del uso en producción.

¿Ling-3.0-Flash-VL es gratuito en Novita AI?

Novita actualmente lista $0 por millón de tokens de entrada y $0 por millón de tokens de salida y etiqueta el modelo como gratuito por tiempo limitado. El precio puede cambiar, así que confirma la página del modelo en vivo antes de depender de él.

¿Admite llamada a funciones y razonamiento?

Sí. Novita lista tanto la llamada a funciones como el razonamiento entre las funciones alojadas.

¿En qué se diferencia de Ling-3.0-flash?

Ling-3.0-Flash-VL añade entrada nativa de imagen y video más capacidades de agente visual. La página actual del Ling-3.0-flash base es un punto de entrada de la familia solo de texto, así que usa la variante -VL cuando la evidencia visual sea parte de la solicitud.

¿El modelo upstream admite un contexto de 1 M de tokens?

La ficha técnica oficial de InclusionAI describe hasta 1 M de tokens a nivel de modelo. El listado alojado actual de Novita expone 262 144 tokens, así que usa el valor alojado al diseñar solicitudes a través de Novita.

Artículos recomendados