Novita AI LLM, Actualizaciones

Ling-3.0-Flash-VL en Novita AI: API multimodal nativa y precios

Ling-3.0-Flash-VL en Novita AI: API multimodal nativa y precios

Ling‑3.0‑Flash‑VL está disponible en Novita AI como un modelo multimodal serverless para aplicaciones que necesitan entrada de texto, imagen y video en un único flujo de trabajo de API. La ficha del modelo alojado inclusionai/ling-3.0-flash-vl muestra una ventana de contexto de 262 144 tokens, una salida máxima de 32 768 tokens, capacidad de razonamiento, llamada a funciones y tokens de entrada y salida gratuitos hasta el 23 de septiembre de 2026 a las 2:30 UTC. Es el miembro de lenguaje visual de la familia Ling‑3.0‑flash, que añade capacidades nativas de comprensión visual y agente visual en lugar de requerir un pipeline separado de imagen a texto.

Puntos clave

  • Ling‑3.0‑Flash‑VL acepta texto, imágenes y videos. Novita enumera esas tres modalidades de entrada y salida de texto para el modelo alojado.
  • El endpoint de Novita es una implementación de 256K de contexto y 32K de salida. Los límites exactos son 262 144 tokens de contexto y 32 768 tokens de salida máxima.
  • El modelo es disperso con una gran capacidad total. La ficha oficial del modelo de InclusionAI describe 124 mil millones de parámetros totales y aproximadamente 5.5 mil millones de parámetros activados por token.
  • El uso de tokens es gratuito hasta el 23 de septiembre de 2026 a las 2:30 UTC. Después de esa fecha, vuelve a consultar la página del modelo antes de presupuestar tráfico de producción.
  • La principal diferencia de caso de uso con respecto a Ling‑3.0‑flash base es la entrada visual. Usa la visión general de Ling‑3.0‑flash para el punto de entrada de la familia solo texto; esta página se centra en la variante -VL.

¿Qué es Ling‑3.0‑Flash‑VL?

Ling‑3.0‑Flash‑VL es un modelo multimodal nativo de InclusionAI y la extensión de lenguaje visual de Ling‑3.0‑flash. La ficha del modelo upstream describe un sistema que integra información visual en comprensión, razonamiento, planificación, acción y verificación. Este rol va más allá de acoplar un captionador de imágenes a un modelo de lenguaje solo de texto: la imagen o el video pueden permanecer como parte del contexto de razonamiento del modelo mientras trabaja en una tarea.

La ficha del modelo reporta 124 mil millones de parámetros totales y aproximadamente 5.5 mil millones de parámetros activados por token. Se trata de un diseño disperso de Mixture‑of‑Experts, por lo que el número total de parámetros y los parámetros activos por token describen propiedades diferentes. El primero indica la capacidad total del modelo; el segundo describe la cantidad aproximada de cómputo enrutado por token. Ninguno de los dos números garantiza una latencia o calidad de salida particular en tu carga de trabajo.

La extensión visual es la distinción importante de este lanzamiento. Ling‑3.0‑flash base es un modelo de texto en la ficha actual de Novita, mientras que Ling‑3.0‑Flash‑VL acepta entradas de imagen y video además de texto. Esto hace que la página -VL sea relevante para la comprensión de interfaces, análisis de documentos y gráficos, inspección visual, respuesta a preguntas sobre video y agentes que necesitan interpretar lo que hay en pantalla.

Cómo acceder a él en Novita AI

Novita aloja el modelo como un endpoint serverless con el ID de modelo exacto inclusionai/ling-3.0-flash-vl. La página del modelo enumera las familias de endpoints chat/completions y compatibles con Anthropic, además de funciones de razonamiento y llamada a funciones. Para un cliente existente compatible con OpenAI, usa la URL base de la API de Novita y selecciona el ID de modelo exacto en la configuración de tu solicitud.

La página del modelo es la fuente de verdad para la configuración alojada. En particular, no copies la afirmación de contexto más grande de la ficha del modelo upstream en una integración con Novita sin verificar los límites de la implementación: la ficha del modelo describe hasta 1 millón de tokens a nivel de modelo, mientras que Novita actualmente expone 262 144 tokens de contexto y 32 768 tokens de salida máxima para esta lista.

El catálogo actual también muestra un límite de 30 solicitudes por minuto para el nivel predeterminado, con valores de nivel superiores listados por separado. Trátalo como una cuota del catálogo, no como una garantía de rendimiento universal de la aplicación. El nivel de la cuenta, el tamaño de la solicitud, la concurrencia, los reintentos y la ejecución de herramientas pueden afectar el rendimiento de extremo a extremo.

Resumen de especificaciones y precios

Campo Detalles
Nombre visible Ling 3.0 Flash VL
ID del modelo inclusionai/ling-3.0-flash-vl
Arquitectura 124 mil millones de parámetros totales; aproximadamente 5.5 mil millones activos por token; MoE disperso
Modalidades de entrada Texto, imagen y video
Modalidad de salida Texto
Ventana de contexto 262 144 tokens en la implementación de Novita
Salida máxima 32 768 tokens
Funciones alojadas Serverless, llamada a funciones, razonamiento
Familias de endpoints chat/completions, compatible con Anthropic
RPM del catálogo 30 RPM en el nivel de listado predeterminado
Precio de entrada Gratis hasta el 23 de septiembre de 2026 a las 2:30 UTC
Precio de salida Gratis hasta el 23 de septiembre de 2026 a las 2:30 UTC

La oferta gratuita es útil para evaluación hasta el 23 de septiembre de 2026 a las 2:30 UTC. Antes del lanzamiento, registra el precio actual, añade un guardia de presupuesto y decide qué modelo o cola debe recibir tráfico después de que finalice la ventana promocional.

¿Qué pueden construir los desarrolladores con él?

Comprender documentos, gráficos e interfaces

La entrada visual puede reducir la cantidad de preprocesamiento necesario para documentos, paneles, capturas de pantalla e interfaces de software. Un desarrollador puede pasar una captura de pantalla junto con una instrucción de tarea y pedir al modelo que identifique campos, resuma el estado visible o localice un objetivo de interacción. Para documentos y gráficos, prueba si el modelo conserva unidades, leyendas, estructura de tablas y relaciones espaciales en lugar de juzgarlo con un breve ejemplo de captioning.

Razonar sobre imágenes y video

La arquitectura upstream utiliza un codificador visual y un manejo de posición temporal para video. Esto es relevante cuando la respuesta depende del cambio a lo largo del tiempo, como identificar cuándo ocurre un evento, comparar dos momentos en un clip o extraer una secuencia de acciones. Los videos largos aún necesitan un muestreo cuidadoso y un diseño de prompt: un límite de contexto grande no hace que cada fotograma sea igualmente útil o asequible después de los cambios de precio.

Apoyar agentes visuales

El posicionamiento de agente visual del modelo se adapta a flujos de trabajo donde la percepción es solo una etapa de un bucle más grande. Un agente podría inspeccionar una captura de pantalla del navegador, razonar sobre la siguiente acción, llamar a una herramienta y verificar la pantalla resultante. La llamada a funciones puede proporcionar el límite de la acción, mientras que el contexto visual proporciona evidencia para decidir qué hacer a continuación. Mantén permisos restringidos y valida cada argumento de herramienta; la comprensión multimodal no elimina la necesidad de controles de seguridad en el lado de la aplicación.

Enrutar cargas de trabajo mixtas de texto y visual

Los equipos que ya enrutan tareas de texto a Ling‑3.0‑flash pueden evaluar la variante -VL para solicitudes que contienen evidencia visual. Un enrutador práctico puede enviar tráfico solo de texto al modelo base y reservar la variante visual para mensajes que contengan imágenes, videos o estado derivado de capturas de pantalla. Mide la ruta completa, incluyendo preparación de imagen, tiempo de subida, latencia del modelo, reintentos y llamadas a herramientas posteriores.

Señales de rendimiento y evaluación

La ficha oficial del modelo de InclusionAI reporta una puntuación de 42 en el Artificial Analysis Intelligence Index v4.1.1 y describe dimensiones de capacidad multimodal que incluyen comprensión, razonamiento y acción. Esa es una señal útil sobre la versión upstream, no una garantía para la implementación alojada en Novita ni para tu distribución de prompts. La página también señala una configuración de evaluación Terminal-Bench de 256K de contexto, que está más cerca del límite de contexto alojado que la declaración general “hasta 1M” de la ficha del modelo.

Para una evaluación significativa, usa un conjunto de tareas pequeño que refleje tu producto:

  • Extracción visual: mide la precisión de campos en capturas de pantalla, formularios, tablas y gráficos.
  • Razonamiento temporal: prueba si las respuestas identifican el evento correcto y el rango de tiempo en videos cortos.
  • Ejecución del agente: evalúa tanto la herramienta elegida como el estado final después de que la herramienta se ejecute.
  • Fundamentación: incluye imágenes con detalles ambiguos o irrelevantes y verifica afirmaciones no respaldadas.
  • Operaciones: registra latencia, uso de tokens, tasa de fallos, comportamiento de límite de velocidad y el efecto de los reintentos.

No uses una puntuación de referencia upstream como sustituto de estas verificaciones de aplicación. Un modelo puede rendir bien en un benchmark público y aun así necesitar cambios de prompt, preprocesamiento o enrutamiento en una interfaz de producción.

Cuándo usar Ling‑3.0‑Flash‑VL

Elige Ling‑3.0‑Flash‑VL cuando tu solicitud contenga evidencia visual y la respuesta requiera más que un caption de una sola toma. Es un buen candidato para evaluar en:

  • comprensión de capturas de pantalla e interfaces de navegador
  • respuesta a preguntas sobre gráficos, tablas y documentos
  • localización y resumen de eventos en videos cortos
  • agentes visuales que usan herramientas
  • flujos de trabajo mixtos de texto e imagen

La lista gratuita hasta el 23 de septiembre de 2026 a las 2:30 UTC hace práctico construir un conjunto de pruebas representativo antes de comprometerse con un plan de enrutamiento pago. Captura el estado del precio cuando ejecutes esas pruebas para que las comparaciones de costos sigan siendo reproducibles.

Cuándo elegir otro modelo

Elige la página del modelo base Ling‑3.0‑flash para cargas de trabajo solo de texto si no necesitas entradas visuales. Una ruta solo de texto puede simplificar el manejo de payloads y reducir el procesamiento multimodal innecesario.

Elige otro modelo si necesitas un precio fijo permanente, un techo de contexto o salida diferente, un nivel de latencia probado, entrada de audio o una capacidad que no esté listada para esta implementación. También mantén un fallback si tu aplicación depende de la oferta gratuita que finaliza el 23 de septiembre de 2026 a las 2:30 UTC. El diseño de producción más seguro trata el precio promocional y la cuota del catálogo como configuración modificable, no como garantías de producto codificadas.

Cómo encaja en un flujo de trabajo de API existente

A alto nivel, una aplicación existente compatible con OpenAI necesita una clave de API de Novita, la URL base compatible con OpenAI de Novita y inclusionai/ling-3.0-flash-vl como ID del modelo. La solicitud debe usar la estructura de mensajes multimodal compatible con el endpoint seleccionado, con contenido de imagen o video junto con la instrucción de texto del usuario.

Mantén los activos visuales accesibles para el endpoint y valida su formato antes de enviarlos. Para un flujo de trabajo de agente, define las herramientas por separado del contenido visual, restringe lo que cada herramienta puede hacer y registra la acción seleccionada por el modelo y el estado de la aplicación resultante. Un artículo de inicio rápido dedicado puede cubrir la construcción de solicitudes específica del SDK; esta página de lanzamiento se centra intencionadamente en la disponibilidad, posicionamiento, límites y precios.

Recomendación final

Ling‑3.0‑Flash‑VL es el miembro de la familia Ling‑3.0‑flash que debes probar cuando la evidencia visual deba participar en el razonamiento o la ejecución del agente. La lista serverless actual de Novita combina entrada de imagen y video con un contexto de 262K, salida máxima de 32K, razonamiento y llamada a funciones, mientras que los tokens de entrada y salida gratuitos hasta el 23 de septiembre de 2026 a las 2:30 UTC reducen la barrera para la evaluación.

Comienza con un conjunto de pruebas específico de la carga de trabajo, compáralo con tu ruta solo de texto existente y registra métricas operativas además de la calidad de las respuestas. Si cumple con tus requisitos de precisión visual y seguridad de herramientas, mantén el ID del modelo de Novita y el precio actual en la configuración para que un cambio futuro en el catálogo no requiera una reescritura del código.

Prueba Ling‑3.0‑Flash‑VL en Novita AI

Preguntas frecuentes

¿Cuál es el ID del modelo Ling‑3.0‑Flash‑VL en Novita AI?

El ID del modelo exacto es inclusionai/ling-3.0-flash-vl.

¿Ling‑3.0‑Flash‑VL admite entrada de imagen y video?

Sí. La lista actual de Novita admite entrada de texto, imagen y video, con salida de texto.

¿Qué ventana de contexto y límite de salida proporciona Novita?

La lista alojada muestra una ventana de contexto de 262 144 tokens y una salida máxima de 32 768 tokens. Estos son los valores de la implementación de Novita y deben verificarse nuevamente antes del uso en producción.

¿Ling‑3.0‑Flash‑VL es gratuito en Novita AI?

Novita actualmente ofrece tokens de entrada y salida gratuitos hasta el 23 de septiembre de 2026 a las 2:30 UTC. Confirma la página del modelo en vivo después de esa hora antes de confiar en el precio.

¿Admite llamada a funciones y razonamiento?

Sí. Novita enumera tanto la llamada a funciones como el razonamiento entre las características alojadas.

¿En qué se diferencia de Ling‑3.0‑flash?

Ling‑3.0‑Flash‑VL añade entrada nativa de imagen y video, además de capacidades de agente visual. La página actual de Ling‑3.0‑flash base es un punto de entrada de la familia solo texto, por lo que debes usar la variante -VL cuando la evidencia visual sea parte de la solicitud.

¿El modelo upstream admite un contexto de 1 millón de tokens?

La ficha oficial del modelo de InclusionAI describe hasta 1 millón de tokens a nivel de modelo. La lista alojada actual de Novita expone 262 144 tokens, así que usa el valor alojado al diseñar solicitudes a través de Novita.

Artículos recomendados

Publicaciones relacionadas