- Puntos clave
- ¿Qué es DeepSeek V4 Flash Vision Exp?
- Acceso a la API de DeepSeek V4 Flash Vision Exp en Novita AI
- Resumen de especificaciones y precios
- Señales de benchmark y rendimiento
- Capacidades clave para desarrolladores
- Cuándo usar DeepSeek V4 Flash Vision Exp
- Cuándo no usarlo
- Cómo encaja en tu flujo de trabajo de API
- Recomendación final
- Preguntas frecuentes
- Artículos recomendados
DeepSeek V4 Flash Vision Exp ya está disponible en Novita AI como una versión experimental con capacidad de visión de DeepSeek V4 Flash 0731. La lista alojada para deepseek/deepseek-v4-flash-vision-exp añade entrada de imágenes a un modelo descrito como equivalente al modelo Flash base en capacidades de texto, como agentes, razonamiento y conocimiento del mundo. Actualmente expone una ventana de contexto de 1 048 576 tokens, un límite de salida de 393 216 tokens, llamadas a funciones, salidas estructuradas y un precio de $0.44 por cada 1M de tokens de entrada y $1.32 por cada 1M de tokens de salida. Si tu agente necesita razonar sobre capturas de pantalla, gráficos o documentos con imágenes, esta es la variante de DeepSeek V4 Flash a evaluar; si tu carga de trabajo es solo texto, la descripción general de DeepSeek V4 Flash sigue siendo la entrada base de menor costo.
Puntos clave
- DeepSeek V4 Flash Vision Exp añade comprensión de imágenes a la familia Flash 0731. Novita lista entrada de texto e imágenes y salida de texto para el despliegue alojado.
- La etiqueta experimental es explícita. Trátalo como un modelo de evaluación y preparación hasta que tus pruebas específicas de carga de trabajo sean exitosas; no asumas la misma madurez de producción que un endpoint de disponibilidad general.
- Novita expone 1M de contexto de entrada y 384K de salida. Los valores actuales del modelo son 1 048 576 tokens de contexto y 393 216 tokens máximos de salida.
- El precio difiere del DeepSeek V4 Flash base. Según lo verificado el 10 de septiembre de 2026, la variante de visión lista $0.44/$1.32 por cada 1M de tokens de entrada/salida, en comparación con $0.14/$0.28 para la base solo texto.
- Conserva la superficie de API agente de Flash. Novita lista llamadas a funciones, salidas estructuradas, razonamiento y las familias de endpoints
chat/completions, Anthropic y Responses.
¿Qué es DeepSeek V4 Flash Vision Exp?
DeepSeek V4 Flash Vision Exp es el miembro experimental con capacidad de visión de la familia DeepSeek V4 Flash. La descripción del modelo de Novita lo presenta como una incorporación de comprensión de imágenes que iguala a DeepSeek V4 Flash 0731 en capacidades de texto, incluyendo agentes, razonamiento y conocimiento del mundo. Esa redacción es útil, pero se trata de una afirmación de capacidad sobre la familia de modelos, no de un resultado de benchmark ni una promesa de que cada prompt de texto se comportará de forma idéntica. Ejecuta tus prompts existentes a través de la variante de visión antes de asumir una equivalencia de intercambio directo.
La arquitectura es un diseño de mezcla dispersa de expertos con 284B de parámetros totales y 13B de parámetros activos por token. Los parámetros totales describen la capacidad del modelo; los parámetros activos describen el cómputo enrutado utilizado para cada token. Ninguno de los dos números predice por sí solo la latencia, el rendimiento o la calidad en tu corpus, así que úsalos para entender el diseño en lugar de como un sustituto de las pruebas de carga de trabajo.
El sufijo “-exp” y la descripción de Novita marcan esto como una variante experimental. Esa distinción importa en la planificación. Puede ser el modelo adecuado para una prueba de concepto de agente visual, un piloto de comprensión de documentos o una ruta de respaldo detrás de tu modelo de texto existente, pero el despliegue en producción debe basarse en tus propias comprobaciones de precisión, uso de herramientas, latencia y costo.
Acceso a la API de DeepSeek V4 Flash Vision Exp en Novita AI
Novita aloja el modelo como una API sin servidor con el ID exacto deepseek/deepseek-v4-flash-vision-exp. La página del modelo lista las familias de endpoints chat/completions, compatible con Anthropic y Responses, además de llamadas a funciones y salidas estructuradas. Para un cliente compatible con OpenAI, usa la URL base de Novita y coloca el ID exacto del modelo en la configuración de tu solicitud; no reutilices el ID del modelo Flash base cuando quieras entrada de imágenes.
Para la autenticación y la sintaxis de las solicitudes, utiliza la documentación actual de Novita AI para crear finalizaciones de chat en lugar de copiar ejemplos de un artículo anterior. La página del modelo es la fuente de verdad para modalidades, límites, cuotas y precios, ya que cualquiera de ellos puede cambiar independientemente de esta publicación.
El catálogo muestra un valor de 30 solicitudes por minuto para el nivel predeterminado, con valores de RPM y TPM más altos listados para otros niveles. Trátalo como una cuota del catálogo, no como una garantía de rendimiento: el tamaño de la solicitud, la concurrencia, los reintentos, la ejecución de herramientas y el nivel de la cuenta pueden afectar el rendimiento real.
Resumen de especificaciones y precios
Los valores a continuación provienen de la página del modelo de Novita verificada el 10 de septiembre de 2026:
| Campo | Detalles | Fuente / Fecha de verificación |
|---|---|---|
| Nombre mostrado | DeepSeek V4 Flash Vision Exp | Página del modelo de Novita; 10 de septiembre de 2026 |
| ID del modelo | deepseek/deepseek-v4-flash-vision-exp |
Página del modelo de Novita; 10 de septiembre de 2026 |
| Acceso | API sin servidor de Novita AI | Página del modelo de Novita; 10 de septiembre de 2026 |
| Modalidades de entrada | Texto, imagen | Página del modelo de Novita; 10 de septiembre de 2026 |
| Modalidad de salida | Texto | Página del modelo de Novita; 10 de septiembre de 2026 |
| Ventana de contexto | 1 048 576 tokens | Página del modelo de Novita; 10 de septiembre de 2026 |
| Salida máxima | 393 216 tokens | Página del modelo de Novita; 10 de septiembre de 2026 |
| Arquitectura | MoE dispersa; 284B totales / 13B parámetros activos | Descripción del modelo de Novita; 10 de septiembre de 2026 |
| Funciones alojadas | Sin servidor, llamadas a funciones, salidas estructuradas, razonamiento | Página del modelo de Novita; 10 de septiembre de 2026 |
| Familias de endpoints | chat/completions, Anthropic, Responses |
Página del modelo de Novita; 10 de septiembre de 2026 |
| RPM del catálogo predeterminado | 30 | Página del modelo de Novita; 10 de septiembre de 2026 |
| Precio de entrada | $0.44 por 1M de tokens | Página del modelo de Novita; 10 de septiembre de 2026 |
| Precio de lectura de caché | $0.028 por 1M de tokens | Página del modelo de Novita; 10 de septiembre de 2026 |
| Precio de salida | $1.32 por 1M de tokens | Página del modelo de Novita; 10 de septiembre de 2026 |
| Lanzamiento en la plataforma | 24 de agosto de 2026 | Catálogo de API de Novita; 10 de septiembre de 2026 |
En comparación con la página actual del modelo DeepSeek V4 Flash, la base solo texto lista $0.14 por 1M de tokens de entrada y $0.28 por 1M de tokens de salida, compartiendo los límites de 1 048 576 tokens de contexto y 393 216 tokens de salida. La entrada visual de la variante de visión es, por lo tanto, la diferencia funcional central; sus precios de token de entrada y salida son materialmente más altos.
Señales de benchmark y rendimiento
No hay resultados de benchmark en la página del modelo de Novita para DeepSeek V4 Flash Vision Exp, y este artículo no proyecta las puntuaciones del modelo Flash base sobre la variante de visión. Trata el rendimiento de texto como una razón para probar, no como una prueba de comportamiento idéntico. Tu evaluación debe medir las cosas que determinan el éxito en producción:
- precisión de respuestas en capturas de pantalla, documentos escaneados o con muchas imágenes, tablas y gráficos
- validez de salidas estructuradas bajo el esquema exacto utilizado por tu aplicación
- selección de llamadas a funciones y calidad de argumentos en turnos representativos de agentes
- latencia y rendimiento de extremo a extremo con el tamaño de solicitud esperado
- consumo de tokens de entrada y salida, incluyendo la contabilidad de tokens de imagen
- tasas de rechazo, truncamiento, reintento y respaldo
Si necesitas un marco de puntuación formal, construye un conjunto etiquetado a partir de tráfico real antes de comparar endpoints. Una prueba rápida con algunos ejemplos no es suficiente para calificar un agente multimodal o un flujo de extracción de documentos.
Capacidades clave para desarrolladores
Comprensión de imágenes más texto
El modelo acepta entrada de texto e imágenes, por lo que la evidencia visual puede enviarse con la instrucción en lugar de reducirse primero a un resumen de texto con pérdida. Eso es útil cuando la señal relevante es el diseño, una relación en un gráfico, el estado de una captura de pantalla o texto detallado dentro de una imagen.
Razonamiento y salidas estructuradas
Novita lista razonamiento y salidas estructuradas para el despliegue alojado. Estos son relevantes cuando una observación visual debe convertirse en un resultado tipificado, una decisión de enrutamiento, un campo de ticket o una carga JSON validada en lugar de un pie de foto libre.
Llamada a funciones para agentes multimodales
La llamada a funciones significa que el modelo puede participar en un bucle de herramientas. Un patrón útil es: recibir una captura de pantalla o imagen de documento, identifcar el estado relevante, llamar a la herramienta de la aplicación y luego devolver texto que explice el resultado. Mantén las herramientas con un alcance estrecho, valida los argumentos antes de la ejecucción y registra tanto la accción del modelo como el estado resultante para poder auditar el comportamiento del agente multimodal.
Contexto largo para evidencia mixta
El techo de 1M de tokens de contexto da espacio para transcripciones largas, documentos de políticas, rastros de agentes o muchas imágenes de páginas. El techo no es un objetivo: las solicitudes más cortas suelen ser más baratas y fáciles de depurar, y el presupuesto efectivo de la solicitud depende de la representación de imágenes utilizada por la API. Comienza con la evidencia mínima necesaria para la tarea y amplía solo cuando la calidad falle.
Cuándo usar DeepSeek V4 Flash Vision Exp
Úsalo cuando una tarea necesite tanto razonamiento al estilo DeepSeek V4 Flash como entrada visual:
- revisión de documentos y facturas donde el texto impreso y el diseño importan
- interpretación de gráficos, paneles y tablas
- triaje de capturas de pantalla de productos o interfaces de usuario
- respuesta visual a preguntas sobre imágenes proporcionadas por usuarios
- flujos de trabajo de agentes mixtos de texto e imagen que necesiten llamadas a herramientas o salidas estructuradas
- flujos de trabajo de soporte que combinen una transcripción de usuario con capturas de pantalla
También es un candidato práctico para equipos que ya están evaluando DeepSeek V4 Flash y desean agregar una ruta visual sin introducir una familia de modelos separada.
Cuándo no usarlo
No lo uses como predeterminado para trabajo puramente textual. La entrada base de DeepSeek V4 Flash actualmente lista precios de entrada y salida más bajos y es la opción más directa para tareas de texto de alto volumen.
Reconsidera la variante de visión cuando tu carga de trabajo requiera disponibilidad general garantizada, un nivel de servicio de latencia fija, entrada de audio, entrada de video, ajuste fino a nivel de modelo u OCR especializado que necesite cuadros delimitadores o coordenadas de píxeles. La lista de Novita no establece esas capacidades, por lo que puede ser necesario un modelo diferente. También evita codificar suposiciones de modelo experimental en un plan de facturación o confiabilidad; mantén el ID del modelo, los límites y los precios en la configuración y vuelve a verificar la página en vivo antes de realizar cambios en producción.
Cómo encaja en tu flujo de trabajo de API
Una configuración existente de la API de Novita necesita tres cambios: usar el ID exacto del modelo de visión, enviar contenido de imagen en el formato de mensaje multimodal compatible con tu endpoint seleccionado y validar que la imagen esté en un formato aceptado y sea accesible para el endpoint. La referencia de la API cubre la autenticación, la construcción de solicitudes y el manejo de respuestas.
Para una evaluación, mantén la primera solicitud solo de texto para aislar errores de endpoint y autenticación, luego agrega una imagen y limita la salida. Registra los IDs de solicitud y el uso de tokens, luego amplía a casos multimodales representativos. Esto facilita distingir un problema de acceso de un problema de entrada visual o una falla de esquema/uso de herramientas.
Esta página de lanzamiento se detiene intencionalmente a nivel de flujo de trabajo. Una guía de inicio rápidido separada debe manejar los cuerpos de solicitud específicos del SDK y el manejo de errores después de que la forma de solicitud multimodal compatible haya sido verifcada en la documentación actual de Novita.
Recomendación final
DeepSeek V4 Flash Vision Exp es la opción de la familia DeepSeek V4 Flash para probar cuando la evidencia visual tiene que participar en el razonamiento o la ejecución del agente. La lista actual de Novita combina entrada de imágenes con 1M de contexto, 384K de salida, llamadas a funciones, salidas estructuradas, razonamiento y un precio de $0.44/$1.32 por cada 1M de tokens de entrada/salida. El estatus experimental y el precio superior al base significan que debe entrar como una ruta dirigida, no como un reemplazo predeterminado para el modelo Flash solo texto.
Comienza con un conjunto de pruebas específico de la carga de trabajo, compara la precisión y el costo con tu ruta actual solo de texto y mantén el ID exacto del modelo y los límites actuales en la configuración. Si el modelo cumple con tus requisitos de precisión visual y seguridad de herramientas, puedes pasar de una ruta de preparación a producción para los casos de uso donde la comprensión de imágenes se amortiza por sí sola.
Prueba DeepSeek V4 Flash Vision Exp en Novita AI
Preguntas frecuentes
¿Cuál es el ID del modelo DeepSeek V4 Flash Vision Exp?
Usa deepseek/deepseek-v4-flash-vision-exp en Novita AI.
¿DeepSeek V4 Flash Vision Exp admite entrada de imágenes?
Sí. La lista actual de Novita admite entrada de texto e imágenes, con salida de texto.
¿Cuáles son los precios actuales de entrada y salida?
Según lo verificado el 10 de septiembre de 2026, Novita lista $0.44 por cada 1M de tokens de entrada, $0.028 por cada 1M de tokens de lectura de caché y $1.32 por cada 1M de tokens de salida. Vuelve a verifcar la página del modelo antes de presupuestar para producción.
¿Qué tan grandes son los límites de contexto y salida?
Novita actulmente lista una ventana de contexto de 1 048 576 tokens y una salida máxima de 393 216 tokens.
¿Admite llamadas a funciones y salidas estructuradas?
Sí. Novita lista llamadas a funciones, salidas estructuradas, razonamiento y acceso sin servidor entre las funcionalidades alojadas.
¿En qué se diferencia de DeepSeek V4 Flash?
La variante de visión añade entrada de imágenes y actualmente cuesta más por token. También está etiquetada como experimental. La página base de DeepSeek V4 Flash sigue siendo el punto de entrada para la familia solo texto.
¿Está listo para producción?
Novita identifica el modelo como experimental, por lo que la preparación para producción depende de tu propia evaluación. Prueba la precisión, la confiabilidad del esquema y las llamadas a herramientas, la latencia, el manejo de fallas y el costo antes de enrutar tráfico real.
Artículos recomendados
- DeepSeek-V4-Flash en Novita AI: Razonamiento rápidp a menor costo
- DeepSeek V4 Pro vs Flash en Novita AI: Calidad, costo y enrutamiento de API
- Guía de contexto largo de DeepSeek V4 Pro: 512K de contexto y documentos largos
Fuentes
- Página del modelo DeepSeek V4 Flash Vision Exp de Novita AI, verificada el 10 de septiembre de 2026
- Página del modelo DeepSeek V4 Flash de Novita AI, verificada el 10 de septiembre de 2026
- Documentación de Novita AI para crear finalizaciones de chat, verifcada el 10 de septiembre de 2026
