- ¿Qué es DeepSeek-V4-Flash?
- ¿Qué hay de nuevo en la actualización del 31 de julio de 2026?
- Características clave: por qué DeepSeek-V4-Flash se destaca
- Rendimiento en benchmarks
- Cómo usar DeepSeek-V4-Flash mediante Novita AI
- Precios de DeepSeek-V4-Flash
- Casos de uso recomendados
- Empieza a usar DeepSeek-V4-Flash hoy
- Preguntas frecuentes
- Artículos recomendados
La mayoría de los modelos de código abierto con capacidades de razonamiento imponen un equilibrio: ventanas de contexto pequeñas, rendimiento lento o precios que superan $1/M de tokens en cuanto activas el pensamiento extendido. DeepSeek-V4-Flash sigue evitando ese equilibrio en su actualización del 31 de julio de 2026: el mismo diseño de Mezcla de Expertos (MoE) de 284B de parámetros con solo 13B activados por inferencia, la misma ventana de contexto nativa de 1.048.576 tokens y el mismo precio de entrada de $0.14/M en Novita AI.
En resumen: DeepSeek-V4-Flash sigue siendo la misma familia de modelos en Novita AI después de la revisión posterior al reentrenamiento 0731. La actualización importa porque actualiza la versión servida sin obligar a los desarrolladores a cambiar los ID de modelo, reescribir prompts o recalcular las suposiciones de costos.
Abrir DeepSeek-V4-Flash en la consola de modelos de Novita AI
¿Qué es DeepSeek-V4-Flash?
DeepSeek-V4-Flash es un modelo de lenguaje de Mezcla de Expertos (MoE) de DeepSeek AI, lanzado como parte de la serie DeepSeek-V4 junto con el más grande DeepSeek-V4-Pro. El modelo tiene 284B de parámetros totales con 13B activados en la inferencia, lo que mantiene bajo el costo de cómputo por token mientras conserva la capacidad de parámetros de un modelo mucho más grande.
Capacidades clave de un vistazo:
- 284B totales / 13B de parámetros activados — arquitectura MoE, bajo costo de inferencia
- Ventana de contexto de 1.048.576 tokens (1M de tokens) — habilitada por la arquitectura híbrida de atención
- Tres modos de razonamiento: Non-think (rápido), Think (paso a paso), Think Max (presupuesto de razonamiento máximo)
- Soporte de función de llamada — uso de herramientas, salidas estructuradas, modo JSON
- Entrenado con más de 32T tokens con post-entrenamiento en múltiples etapas (SFT, RL con GRPO, destilación on-policy)
- Licencia MIT — pesos disponibles para descargar en HuggingFace; uso comercial permitido
- Precisión mixta FP4 + FP8 — pesos de expertos MoE en FP4, capas restantes en FP8
¿Qué hay de nuevo en la actualización del 31 de julio de 2026?
La versión corta: esto es una actualización de revisión, no un lanzamiento separado.
La actualización posterior al reentrenamiento de finales de julio de DeepSeek mantiene la misma identidad pública de producto en Novita AI:
- Mismo ID de modelo:
deepseek/deepseek-v4-flash - Misma arquitectura: 284B de parámetros totales, 13B activados por inferencia
- Misma ventana de contexto: 1.048.576 tokens
- Mismos precios de Novita AI: $0.14/M de entrada, $0.28/M de salida, $0.028/M de lecturas de caché
Eso significa que las integraciones existentes no necesitan cambios de endpoint, reescrituras de tablas de precios ni migraciones de formato de prompts. Si ya enrutabas tráfico a DeepSeek-V4-Flash, la actualización 0731 se entiende mejor como una actualización de capacidad y post-entrenamiento entre bastidores, no como una SKU nueva.
Para los desarrolladores, esa distinción importa. Una actualización de revisión normalmente significa que puedes volver a probar el modelo con tus propios prompts, conjuntos de evaluación y tareas de agentes, manteniendo el mismo contrato de despliegue: mismo nombre, misma ruta de API, mismo presupuesto de contexto y misma economía de tokens.
Características clave: por qué DeepSeek-V4-Flash se destaca
Profundidad de razonamiento seleccionable sin cambiar de modelo
La mayoría de los modelos te bloquean en un único modo de inferencia: razonamiento activado o desactivado. DeepSeek-V4-Flash te ofrece tres modos de funcionamiento distintos en el mismo endpoint de API:
| Modo | Características | Ideal para |
|---|---|---|
| Non-think | Rápido, sin cadena de pensamiento | Tareas de alto volumen, chat, resúmenes |
| Think | Razonamiento paso a paso, equilibrado | Preguntas y respuestas complejas, generación de código, análisis |
| Think Max | Presupuesto de razonamiento máximo | Competencias de matemáticas, tareas de código difíciles, benchmarks |
La brecha entre modos es significativa: en GPQA Diamond, V4-Flash Non-think puntúa 71.2 frente a 87.4 en Think y 88.1 en Think Max. En LiveCodeBench, Think Max alcanza 91.6 frente a 55.2 de Non-think. Tú eliges costo frente a calidad por solicitud, sin necesidad de cambios de infraestructura.
Arquitectura híbrida de atención para contexto de 1M de tokens
El contexto nativo de un millón de tokens es más difícil de lo que parece. DeepSeek-V4-Flash lo logra mediante una arquitectura híbrida de atención diseñada específicamente que combina dos mecanismos:
- Atención dispersa comprimida (CSA) — reduce drásticamente el presupuesto de cómputo de atención para secuencias largas
- Atención fuertemente comprimida (HCA) — comprime la huella de caché KV para inferencia con contexto de 1M
El resultado: inferencia sobre entradas de 1M de tokens con un costo de FLOP y memoria manejable. Para cargas de trabajo como análisis de bases de código, revisión de documentos legales o agentes de sesión larga, esta arquitectura marca la diferencia entre lo factible y lo prohibitivo.
Eficiencia MoE: 13B activados a escala de 284B
La proporción 284B/13B activados es de donde proviene la eficiencia de costos. Solo 13B de parámetros están activos por pase hacia adelante, manteniendo la latencia y el costo por token cerca de un modelo denso de 13B, mientras que el conjunto completo de 284B de parámetros proporciona una capacidad de conocimiento comparable a una red densa mucho más grande. La precisión mixta FP4 + FP8 reduce aún más la presión sobre el ancho de banda de memoria en los pesos de los expertos.
Potente pipeline de post-entrenamiento
DeepSeek-V4-Flash sigue un proceso de post-entrenamiento en dos etapas: primero, el cultivo de expertos específicos del dominio mediante SFT y aprendizaje por refuerzo con GRPO; luego, la consolidación unificada del modelo mediante destilación on-policy. Esto produce un único modelo con perfiles de capacidad diferenciados en codificación, razonamiento y conocimiento general, no un seguidor de instrucciones genérico.
Rendimiento en benchmarks
La historia de los benchmarks para DeepSeek-V4-Flash se centra en la selección del modo de razonamiento. En modo Non-think, se comporta como un modelo eficiente con 13B activados. Sube a Think Max y alcanza un nivel completamente diferente.

Rendimiento de DeepSeek-V4-Flash entre modos frente a modelos frontera [Fuente: DeepSeek AI / HuggingFace]
Rendimiento según el modo de razonamiento
A continuación se muestran las puntuaciones de V4-Flash en benchmarks clave, comparando los tres modos de funcionamiento:
| Benchmark | V4-Flash Non-Think | V4-Flash Think | V4-Flash Think Max |
|---|---|---|---|
| LiveCodeBench (Pass@1) | 55.2 | 88.4 | 91.6 |
| GPQA Diamond (Pass@1) | 71.2 | 87.4 | 88.1 |
| HMMT 2026 Feb (Pass@1) | 40.8 | 91.9 | 94.8 |
| IMOAnswerBench (Pass@1) | 41.9 | 85.1 | 88.4 |
| Codeforces Rating | — | 2816 | 3052 |
| SWE Verified (Resolved) | 73.7 | 78.6 | 79.0 |
| MRCR 1M (MMR) | 37.5 | 76.9 | 78.7 |
| MCPAtlas (Pass@1) | 64.0 | 67.4 | 69.0 |
| MMLU-Pro (EM) | 83.0 | 86.4 | 86.2 |
Última verificación: 2026-04-27. Fuente: informe técnico de DeepSeek-V4 y ficha del modelo en HuggingFace.
Cómo se compara V4-Flash con la competencia
V4-Flash Think Max (79.0 SWE Verified, 91.6 LiveCodeBench) compite con modelos que operan a un costo por token mucho más alto. No encabeza todos los rankings (V4-Pro Max lidera la mayoría de los benchmarks frontera), pero para los desarrolladores que miran el costo por tarea en lugar del rendimiento máximo bruto, el equilibrio es favorable:
Si estás eligiendo entre las dos APIs de DeepSeek V4 para el enrutamiento en producción, usa la guía de precios y enrutamiento de DeepSeek V4 Pro vs Flash para comparar cuándo Flash debería manejar el tráfico base y cuándo Pro justifica el precio de token más alto.
| Benchmark | V4-Flash Max | V4-Pro Max | Claude Opus 4.6 Max | Gemini 3.1 Pro High |
|---|---|---|---|---|
| LiveCodeBench (Pass@1) | 91.6 | 93.5 | 88.8 | 91.7 |
| GPQA Diamond (Pass@1) | 88.1 | 90.1 | 91.3 | 94.3 |
| SWE Verified (Resolved) | 79.0 | 80.6 | 80.8 | 80.6 |
| HMMT 2026 Feb (Pass@1) | 94.8 | 95.2 | 96.2 | 94.7 |
| MRCR 1M (MMR) | 78.7 | 83.5 | 92.9 | 76.3 |
Última verificación: 2026-04-27. Las cifras de Claude Opus 4.6 Max y Gemini 3.1 Pro High provienen del informe técnico de DeepSeek-V4 (tabla de comparación frontera de V4-Pro). Estas puntuaciones no se midieron cara a cara contra V4-Flash en ese informe.
En particular, V4-Flash Think Max en MRCR 1M (78.7) supera a Gemini 3.1 Pro High (76.3) en la tarea de recuperación de contexto largo, el benchmark que más directamente se asocia con los casos de uso de contexto de 1M. En SWE Verified, los cuatro modelos se agrupan entre 79 y 81, lo que hace que V4-Flash sea competitivo en la categoría de agentes de codificación del mundo real a una fracción del precio de los modelos cerrados.
Cómo usar DeepSeek-V4-Flash mediante Novita AI
Opción 1: Playground (sin código)
Prueba el modelo directamente en tu navegador en la consola de modelos de Novita AI. No se requiere clave de API para comenzar: cambia entre los modos Non-think, Think y Think Max mediante la interfaz de chat.
Opción 2: API (Python)
DeepSeek-V4-Flash utiliza la API compatible con OpenAI. Usa el ID de modelo deepseek/deepseek-v4-flash con la URL base de Novita:
from openai import OpenAI
client = OpenAI(
base_url="https://api.novita.ai/v3/openai",
api_key="YOUR_NOVITA_API_KEY",
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash",
messages=[{"role": "user", "content": "Your prompt here"}]
)
print(response.choices[0].message.content)
Para habilitar el modo Think o Think Max, pasa el parámetro reasoning en el cuerpo de la solicitud:
from openai import OpenAI
client = OpenAI(
base_url="https://api.novita.ai/v3/openai",
api_key="YOUR_NOVITA_API_KEY",
)
# Think Max mode — maximum reasoning budget
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash",
messages=[{"role": "user", "content": "Solve: x^4 - 5x^2 + 4 = 0"}],
extra_body={"reasoning": {"effort": "high"}} # "low" = Think, "high" = Think Max
)
print(response.choices[0].message.content)
Obtén tu clave de API en novita.ai/settings.
Opción 3: Herramientas de terceros
Debido a que Novita AI expone un endpoint compatible con OpenAI, DeepSeek-V4-Flash funciona de inmediato con:
- LangChain / LlamaIndex — usa
ChatOpenAIconbase_url="https://api.novita.ai/v3/openai" - OpenWebUI — agrégalo como un endpoint personalizado compatible con OpenAI
- Continue.dev / Cursor — configúralo como un modelo personalizado con la URL base de Novita
Precios de DeepSeek-V4-Flash
Los precios de DeepSeek-V4-Flash en Novita AI no cambian en la actualización del 31 de julio de 2026. Todas las cifras siguientes son por millón de tokens, verificadas por última vez el 2026-08-03:
| Proveedor | Entrada ($/M) | Salida ($/M) | Lectura de caché ($/M) | Contexto máximo |
|---|---|---|---|---|
| Novita AI | $0.14 | $0.28 | $0.028 | 1,048,576 tokens |
| DeepSeek Official | $0.14 | $0.28 | $0.028 | 131,072 tokens |
| SiliconFlow | $0.14 | $0.28 | $0.028 | 65,536 tokens |
| DeepInfra | $0.14 | $0.28 | — | 16,384 tokens |
La tarifa por token sigue siendo la misma después de la actualización 0731, pero el contexto máximo sigue variando significativamente según el proveedor. Novita AI ofrece la ventana de contexto completa de 1M de tokens. DeepInfra tiene un límite de 16.384 tokens. Si tu carga de trabajo involucra documentos largos, bases de código o agentes de múltiples turnos, Novita es la opción práctica.
Casos de uso recomendados
Agentes autónomos de codificación
La ventana de contexto de 1M de V4-Flash significa que un agente puede cargar una base de código completa en el contexto sin dividirla en fragmentos. Combinado con 79.0 en SWE Verified en modo Think Max, maneja refactorizaciones de varios archivos y depuración sin perder el estado entre turnos.
Preguntas y respuestas sobre documentos largos y RAG
MRCR 1M (recuperación de contexto de múltiples rondas) al 78.7% en Think Max: el benchmark mide la precisión de recuperación sobre una ventana genuina de 1M de tokens. Para indexar documentos legales, artículos académicos o especificaciones técnicas largas, V4-Flash recupera con precisión donde la mayoría de los modelos se degradan después de 32K tokens.
Razonamiento matemático y científico
94.8% en HMMT 2026 de febrero (matemáticas de competencia) con Think Max. El modo de pensamiento con presupuesto te permite ajustar costo frente a precisión: usa Think para problemas estándar y Think Max para los difíciles. Una sola solicitud no consume un presupuesto de cómputo fijo; tú eliges.
APIs de producción con caché
Con lecturas de caché a $0.028/M, los prompts de sistema repetidos y los esquemas de herramientas prácticamente no cuestan nada a escala. Los productos de chatbot y los wrappers de API que reinyectan el mismo contexto en cada llamada se benefician del precio de lectura de caché frente al precio de entrada bruto.
Para una configuración de modelos mixtos, mantén Flash como opción predeterminada para llamadas de producción repetidas y escala los prompts difíciles de contexto largo o agentes de codificación a Pro. La guía de contexto largo de DeepSeek V4 Pro muestra cómo configurar el ID del modelo Pro, la URL base, la forma de las solicitudes y los controles de costos para esas rutas de mayor dificultad.
Empieza a usar DeepSeek-V4-Flash hoy
DeepSeek-V4-Flash sigue disponible mediante Novita AI después de la actualización del 31 de julio, con la ventana de contexto completa de 1M, los mismos precios competitivos y cero sobrecarga de infraestructura. Tú eliges el modo de razonamiento; Novita se encarga del resto.
→ Prueba DeepSeek-V4-Flash con el respaldo de Novita AI
→ Documentación de la API LLM de Novita AI
Preguntas frecuentes
¿Qué cambió en la revisión 0731 de DeepSeek-V4-Flash?
En Novita AI, el contrato de despliegue visible sigue siendo el mismo: el ID de modelo permanece como deepseek/deepseek-v4-flash, los precios se mantienen en $0.14/M de entrada y $0.28/M de salida, y la ventana de contexto completa de 1.048.576 tokens sigue disponible. La actualización 0731 es una actualización de la revisión servida, no una familia de modelos separada.
¿Qué es DeepSeek-V4-Flash?
DeepSeek-V4-Flash es un modelo de lenguaje de Mezcla de Expertos de 284B de parámetros desarrollado por DeepSeek AI, lanzado el 2026-04-23. Activa solo 13B de parámetros por pase hacia adelante, lo que lo hace significativamente más rápido y económico que los modelos densos de capacidad comparable. Admite una ventana de contexto de 1.048.576 tokens y tres modos de razonamiento: Non-thinking (rápido), Budget Thinking (pensamiento con presupuesto) y Extended Thinking (Think Max).
¿En qué se diferencia DeepSeek-V4-Flash de DeepSeek-V4-Pro?
V4-Flash es la variante más ligera y rápida, optimizada para velocidad y costo. V4-Pro es el modelo insignia con puntuaciones máximas más altas en benchmarks (por ejemplo, 93.5 frente a 91.6 en LiveCodeBench Think Max). V4-Flash «logra un rendimiento de razonamiento comparable al de la versión Pro cuando se le da un mayor presupuesto de pensamiento»; en la práctica, V4-Flash Think Max cierra la mayor parte de la brecha frente a V4-Pro Think Max a un menor costo por token.
Si necesitas una regla de enrutamiento en producción, compara ambos modelos en la guía de decisión de API DeepSeek V4 Pro vs Flash antes de mover todo el tráfico a un solo modelo.
¿Qué significa «Flash» en el nombre del modelo?
«Flash» indica una variante optimizada para velocidad, coherente con el uso que Google hace del término para Gemini Flash. DeepSeek-V4-Flash prioriza una menor latencia y costo sobre la precisión máxima bruta, con los modos de pensamiento disponibles cuando necesitas cerrar la brecha de rendimiento.
¿DeepSeek-V4-Flash admite una ventana de contexto de 1M respaldada por Novita AI?
Sí. Novita AI expone la ventana de contexto completa de 1.048.576 tokens, la más grande disponible entre todos los proveedores actuales para este modelo. El máximo de tokens de finalización en Novita es 393.216.
¿Cómo cambio los modos de razonamiento mediante la API?
Pasa el parámetro extra_body={"reasoning": {"effort": "low"}} para Budget Thinking, o "effort": "high" para Think Max. Omite el parámetro por completo para el modo Non-thinking (rápido). La API es compatible con OpenAI: no se requieren cambios de SDK.
¿Cuál es el precio de DeepSeek-V4-Flash con el respaldo de Novita AI?
Al 2026-08-03: $0.14/M por tokens de entrada, $0.28/M por tokens de salida, $0.028/M por tokens de lectura de caché. Esto coincide con los precios oficiales de DeepSeek y es coherente entre proveedores; el diferenciador en Novita es la ventana de contexto completa de 1M y la disponibilidad confiable.
¿DeepSeek-V4-Flash es de código abierto?
Sí. Los pesos del modelo están disponibles en HuggingFace bajo la Licencia MIT (confirmado en el repositorio oficial de DeepSeek-V4). El autoalojamiento y el uso comercial están permitidos bajo los términos de MIT. Usarlo mediante la API de Novita AI no requiere autoalojamiento en absoluto.
