DeepSeek V4 Flash Vision Exp ya está disponible en Novita AI como una versión experimental con visión de DeepSeek V4 Flash 0731. La lista alojada para deepseek/deepseek-v4-flash-vision-exp añade entrada de imágenes a un modelo descrito como equivalente al modelo Flash base en capacidades de texto como agentes, razonamiento y conocimiento del mundo. Actualmente expone una ventana de contexto de 1,048,576 tokens, un límite de salida de 393,216 tokens, capacidad de llamada a funciones, salidas estructuradas y un precio de $0.44 por cada 1M de tokens de entrada y $1.32 por cada 1M de tokens de salida. Si tu agente necesita razonar sobre capturas de pantalla, gráficos o documentos con imágenes, esta es la variante de DeepSeek V4 Flash que debes evaluar; si tu carga de trabajo es solo texto, la descripción general de DeepSeek V4 Flash sigue siendo la entrada base de menor costo.
Conclusiones Clave
- DeepSeek V4 Flash Vision Exp añade comprensión de imágenes a la familia Flash 0731. Novita lista entrada de texto e imágenes y salida de texto para el despliegue alojado.
- La etiqueta experimental es explícita. Trátalo como un modelo de evaluación y puesta en escena hasta que tus pruebas específicas de la carga de trabajo sean exitosas; no asumas la misma madurez de producción que un endpoint de disponibilidad general.
- Novita expone 1M de contexto de entrada y 384K de salida. Los valores actuales del modelo son 1,048,576 tokens de contexto y 393,216 tokens máximos de salida.
- Los precios difieren de DeepSeek V4 Flash base. Según lo verificado el 15 de septiembre de 2026, la variante con visión lista $0.44/$1.32 por cada 1M de tokens de entrada/salida, en comparación con $0.14/$0.28 para la base solo texto.
- Mantiene la superficie de API de agente Flash. Novita lista llamada a funciones, salidas estructuradas, razonamiento y las familias de endpoints
chat/completions, Anthropic y Responses.
¿Qué es DeepSeek V4 Flash Vision Exp?
DeepSeek V4 Flash Vision Exp es el miembro experimental con capacidades visuales de la familia DeepSeek V4 Flash. La descripción del modelo de Novita lo enmarca como una adición de comprensión de imágenes que iguala a DeepSeek V4 Flash 0731 en capacidades de texto, incluyendo agentes, razonamiento y conocimiento del mundo. Esa redacción es útil, pero es una afirmación de capacidad sobre la familia del modelo, no un resultado de referencia ni una promesa de que cada prompt de texto se comportará de manera idéntica. Ejecuta tus prompts existentes a través de la variante con visión antes de asumir equivalencia de intercambio directo.
El sufijo “-exp” y la descripción de Novita marcan esto como una variante experimental. Esa distinción importa en la planificación. Puede ser el modelo adecuado para una prueba de concepto de agente visual, un piloto de comprensión de documentos o una ruta de respaldo detrás de tu modelo de texto existente, pero el despliegue en producción debe basarse en tus propias verificaciones de precisión, uso de herramientas, latencia y costo.
Acceso a la API de DeepSeek V4 Flash Vision Exp en Novita AI
Novita aloja el modelo como una API serverless con el ID exacto deepseek/deepseek-v4-flash-vision-exp. La página del modelo lista las familias de endpoints chat/completions, compatible con Anthropic y Responses, además de llamada a funciones y salidas estructuradas. Para un cliente compatible con OpenAI, usa la URL base de Novita y coloca el ID exacto del modelo en la configuración de tu solicitud; no reutilices el ID del modelo Flash base cuando necesites entrada de imágenes.
Para la autenticación y la sintaxis de las solicitudes, usa la documentación actual de Novita AI para crear finalizaciones de chat en lugar de copiar ejemplos de un artículo anterior. La página del modelo es la fuente de verdad para modalidades, límites, cuotas y precios, ya que cualquiera de ellos puede cambiar independientemente de esta publicación.
El catálogo muestra un valor de 30 solicitudes por minuto para el nivel predeterminado, con valores más altos de RPM y TPM listados para otros niveles. Trátalo como una cuota de catálogo, no como una garantía de rendimiento: el tamaño de la solicitud, la concurrencia, los reintentos, la ejecución de herramientas y el nivel de la cuenta pueden afectar el rendimiento real.
Resumen de Especificaciones y Precios
Los valores a continuación provienen de la página del modelo de Novita verificada el 15 de septiembre de 2026:
| Campo | Detalles |
|---|---|
| Nombre mostrado | DeepSeek V4 Flash Vision Exp |
| ID del modelo | deepseek/deepseek-v4-flash-vision-exp |
| Acceso | API serverless de Novita AI |
| Modalidades de entrada | Texto, imagen |
| Modalidad de salida | Texto |
| Ventana de contexto | 1,048,576 tokens |
| Salida máxima | 393,216 tokens |
| Arquitectura | Sparse MoE; 284B total / 13B parámetros activos |
| Funciones alojadas | Serverless, llamada a funciones, salidas estructuradas, razonamiento |
| Familias de endpoints | chat/completions, Anthropic, Responses |
| RPM de catálogo predeterminado | 30 |
| Precio de entrada | $0.44 por cada 1M de tokens |
| Precio de lectura de caché | $0.028 por cada 1M de tokens |
| Precio de salida | $1.32 por cada 1M de tokens |
| Lanzamiento en la plataforma | 24 de agosto de 2026 |
En comparación con la página actual del modelo DeepSeek V4 Flash, la base solo texto lista $0.14 por cada 1M de tokens de entrada y $0.28 por cada 1M de tokens de salida, compartiendo los límites de contexto de 1,048,576 tokens y de salida de 393,216 tokens. La entrada visual de la variante con visión es, por lo tanto, la diferencia funcional central; sus precios de tokens de entrada y salida son materialmente más altos.
Señales de Rendimiento y Benchmarks
No hay resultados de benchmarks en la página del modelo de Novita para DeepSeek V4 Flash Vision Exp, y este artículo no proyecta las puntuaciones del modelo Flash base sobre la variante con visión. Trata el rendimiento de texto como una razón para probar, no como una prueba de comportamiento idéntico. Tu evaluación debe medir las cosas que determinan el éxito en producción:
- precisión de respuestas en capturas de pantalla, documentos escaneados o con muchas imágenes, tablas y gráficos
- validez de las salidas estructuradas bajo el esquema exacto utilizado por tu aplicación
- selección de llamada a funciones y calidad de argumentos en turnos representativos de agentes
- latencia y rendimiento de extremo a extremo con el tamaño de solicitud esperado
- consumo de tokens de entrada y salida, incluyendo la contabilización de tokens de imagen
- tasas de rechazo, truncamiento, reintento y respaldo
Si necesitas un marco de puntuación formal, construye un conjunto etiquetado a partir de tráfico real antes de comparar endpoints. Una prueba rápida de prompt con algunos ejemplos no es suficiente para calificar un agente multimodal o un flujo de trabajo de extracción de documentos.
Capacidades Clave para Desarrolladores
Comprensión de imágenes más texto
El modelo acepta entrada de imágenes y texto, por lo que la evidencia visual puede enviarse con la instrucción en lugar de reducirse primero a un resumen de texto con pérdida de información. Esto es útil cuando la señal relevante es el diseño, una relación en un gráfico, un estado de captura de pantalla o texto detallado dentro de una imagen.
Razonamiento y salidas estructuradas
Novita lista razonamiento y salidas estructuradas para el despliegue alojado. Estos son relevantes cuando una observación visual debe convertirse en un resultado tipado, una decisión de enrutamiento, un campo de ticket o un payload JSON validado, en lugar de un pie de foto libre.
Llamada a funciones para agentes multimodales
La llamada a funciones significa que el modelo puede participar en un bucle de herramientas. Un patrón útil es: recibir una captura de pantalla o imagen de documento, identificar el estado relevante, llamar a la herramienta de la aplicación y luego devolver texto que explique el resultado. Mantén las herramientas con un alcance limitado, valida los argumentos antes de la ejecución y registra tanto la acción del modelo como el estado resultante para poder auditar el comportamiento del agente multimodal.
Contexto largo para evidencia mixta
El límite de contexto de 1M de tokens da espacio para transcripciones largas, documentos de políticas, trazas de agentes o muchas imágenes de página. El límite no es un objetivo: las solicitudes más cortas suelen ser más baratas y fáciles de depurar, y el presupuesto efectivo de la solicitud depende de la representación de imagen utilizada por la API. Comienza con la evidencia mínima necesaria para la tarea y expande solo cuando la calidad falle.
Cuándo Usar DeepSeek V4 Flash Vision Exp
Úsalo cuando una tarea necesite tanto el razonamiento al estilo DeepSeek V4 Flash como la entrada visual:
- revisión de documentos y facturas donde importan el texto impreso y el diseño
- interpretación de gráficos, paneles y tablas
- triage de capturas de pantalla de productos o UI
- respuesta a preguntas visuales sobre imágenes proporcionadas por los usuarios
- flujos de trabajo de agentes mixtos de texto e imagen que necesiten llamadas a herramientas o salidas estructuradas
- flujos de trabajo de soporte que combinen una transcripción de usuario con capturas de pantalla
También es un candidato práctico para equipos que ya están evaluando DeepSeek V4 Flash y quieren añadir una ruta visual sin introducir una familia de modelos separada.
Cuándo No Usarlo
No lo uses como opción predeterminada para trabajo puramente textual. La entrada base de DeepSeek V4 Flash actualmente lista precios de entrada y salida más bajos y es la opción más directa para tareas de texto de alto volumen.
Reconsidera la variante con visión cuando tu carga de trabajo requiera disponibilidad general garantizada, un nivel de servicio de latencia fijo, entrada de audio, entrada de video, ajuste fino a nivel de modelo u OCR especializado que necesite cuadros delimitadores o coordenadas de píxeles. La lista de Novita no establece esas capacidades, por lo que puede ser necesario un modelo diferente. También evita codificar suposiciones de modelo experimental en un plan de facturación o fiabilidad; mantén el ID del modelo, los límites y los precios en la configuración y vuelve a verificar la página en vivo antes de cambios en producción.
Cómo Encaja en tu Flujo de Trabajo de API
Una configuración existente de la API de Novita necesita tres cambios: usar el ID exacto del modelo con visión, enviar el contenido de la imagen en el formato de mensaje multimodal compatible con el endpoint seleccionado y validar que la imagen esté en un formato aceptado y sea accesible para el endpoint. La referencia de la API cubre la autenticación, la construcción de solicitudes y el manejo de respuestas.
Para una evaluación, mantén la primera solicitud solo texto para aislar errores de endpoint y autenticación, luego añade una imagen y limita la salida. Registra los ID de solicitud y el uso de tokens, luego expande a casos multimodales representativos. Esto facilita distinguir un problema de acceso de un problema de entrada visual o un fallo de esquema/uso de herramientas.
Esta página de lanzamiento se detiene intencionalmente a nivel de flujo de trabajo. Una guía de inicio rápido separada debería encargarse de los cuerpos de solicitud específicos del SDK y el manejo de errores después de que la forma de solicitud multimodal compatible se haya verificado en la documentación actual de Novita.
Recomendación Final
DeepSeek V4 Flash Vision Exp es la opción de la familia DeepSeek V4 Flash para probar cuando la evidencia visual debe participar en el razonamiento o la ejecución de agentes. La lista actual de Novita combina entrada de imágenes con 1M de contexto, 384K de salida, llamada a funciones, salidas estructuradas, razonamiento y precios de $0.44/$1.32 por cada 1M de tokens de entrada/salida. El estado experimental y el precio más alto que la base significan que debe entrar como una ruta específica, no como un reemplazo predeterminado del modelo Flash solo texto.
Comienza con un conjunto de pruebas específico de la carga de trabajo, compara la precisión y el costo con tu ruta actual solo texto y mantén el ID exacto del modelo y los límites actuales en la configuración. Si el modelo cumple con tus requisitos de precisión visual y seguridad de herramientas, puedes promocionarlo de una ruta de puesta en escena a producción para los casos de uso donde la comprensión de imágenes se amortiza por sí sola.
Prueba DeepSeek V4 Flash Vision Exp en Novita AI
FAQ
¿Cuál es el ID del modelo DeepSeek V4 Flash Vision Exp?
Usa deepseek/deepseek-v4-flash-vision-exp en Novita AI.
¿DeepSeek V4 Flash Vision Exp admite entrada de imágenes?
Sí. La lista actual de Novita admite entrada de texto e imágenes, con salida de texto.
¿Cuáles son los precios actuales de entrada y salida?
Según lo verificado el 15 de septiembre de 2026, Novita lista $0.44 por cada 1M de tokens de entrada, $0.028 por cada 1M de tokens de lectura de caché y $1.32 por cada 1M de tokens de salida. Vuelve a verificar la página del modelo antes de la planificación presupuestaria de producción.
¿Qué tan grandes son los límites de contexto y salida?
Novita actualmente lista una ventana de contexto de 1,048,576 tokens y una salida máxima de 393,216 tokens.
¿Admite llamada a funciones y salidas estructuradas?
Sí. Novita lista llamada a funciones, salidas estructuradas, razonamiento y acceso serverless entre las funciones alojadas.
¿En qué se diferencia de DeepSeek V4 Flash?
La variante con visión añade entrada de imágenes y actualmente cuesta más por token. También está etiquetada como experimental. La página base de DeepSeek V4 Flash sigue siendo el punto de entrada de la familia solo texto.
¿Está listo para producción?
Novita identifica el modelo como experimental, por lo que la preparación para producción depende de tu propia evaluación. Prueba la precisión, la fiabilidad del esquema y las llamadas a herramientas, la latencia, el manejo de fallos y el costo antes de enrutar tráfico real.
Artículos Recomendados
- DeepSeek-V4-Flash en Novita AI: Razonamiento rápido a menor costo
- DeepSeek V4 Pro vs Flash en Novita AI: Calidad, costo y enrutamiento de API
- Guía de Contexto Largo de DeepSeek V4 Pro: Contexto de 512K y documentos largos
Fuentes
- Página del modelo DeepSeek V4 Flash Vision Exp de Novita AI, verificada el 15 de septiembre de 2026
- Página del modelo DeepSeek V4 Flash de Novita AI, verificada el 15 de septiembre de 2026
- Documentación de Novita AI para crear finalizaciones de chat, verificada el 15 de septiembre de 2026