DeepSeek-V4-Flash en Novita AI: razonamiento rápido a menor costo

DeepSeek-V4-Flash en Novita AI: razonamiento rápido a menor costo

La mayoría de los modelos de código abierto con capacidades de razonamiento imponen un equilibrio: ventanas de contexto pequeñas, rendimiento lento o precios que superan $1/M de tokens en cuanto activas el pensamiento extendido. DeepSeek-V4-Flash sigue evitando ese equilibrio en su actualización del 31 de julio de 2026: el mismo diseño de Mezcla de Expertos (MoE) de 284B de parámetros con solo 13B activados por inferencia, la misma ventana de contexto nativa de 1.048.576 tokens y el mismo precio de entrada de $0.14/M en Novita AI.

En resumen: DeepSeek-V4-Flash sigue siendo la misma familia de modelos en Novita AI después de la revisión posterior al reentrenamiento 0731. La actualización importa porque actualiza la versión servida sin obligar a los desarrolladores a cambiar los ID de modelo, reescribir prompts o recalcular las suposiciones de costos.

Abrir DeepSeek-V4-Flash en la consola de modelos de Novita AI

¿Qué es DeepSeek-V4-Flash?

DeepSeek-V4-Flash es un modelo de lenguaje de Mezcla de Expertos (MoE) de DeepSeek AI, lanzado como parte de la serie DeepSeek-V4 junto con el más grande DeepSeek-V4-Pro. El modelo tiene 284B de parámetros totales con 13B activados en la inferencia, lo que mantiene bajo el costo de cómputo por token mientras conserva la capacidad de parámetros de un modelo mucho más grande.

Capacidades clave de un vistazo:

  • 284B totales / 13B de parámetros activados — arquitectura MoE, bajo costo de inferencia
  • Ventana de contexto de 1.048.576 tokens (1M de tokens) — habilitada por la arquitectura híbrida de atención
  • Tres modos de razonamiento: Non-think (rápido), Think (paso a paso), Think Max (presupuesto de razonamiento máximo)
  • Soporte de función de llamada — uso de herramientas, salidas estructuradas, modo JSON
  • Entrenado con más de 32T tokens con post-entrenamiento en múltiples etapas (SFT, RL con GRPO, destilación on-policy)
  • Licencia MIT — pesos disponibles para descargar en HuggingFace; uso comercial permitido
  • Precisión mixta FP4 + FP8 — pesos de expertos MoE en FP4, capas restantes en FP8

¿Qué hay de nuevo en la actualización del 31 de julio de 2026?

La versión corta: esto es una actualización de revisión, no un lanzamiento separado.

La actualización posterior al reentrenamiento de finales de julio de DeepSeek mantiene la misma identidad pública de producto en Novita AI:

  • Mismo ID de modelo: deepseek/deepseek-v4-flash
  • Misma arquitectura: 284B de parámetros totales, 13B activados por inferencia
  • Misma ventana de contexto: 1.048.576 tokens
  • Mismos precios de Novita AI: $0.14/M de entrada, $0.28/M de salida, $0.028/M de lecturas de caché

Eso significa que las integraciones existentes no necesitan cambios de endpoint, reescrituras de tablas de precios ni migraciones de formato de prompts. Si ya enrutabas tráfico a DeepSeek-V4-Flash, la actualización 0731 se entiende mejor como una actualización de capacidad y post-entrenamiento entre bastidores, no como una SKU nueva.

Para los desarrolladores, esa distinción importa. Una actualización de revisión normalmente significa que puedes volver a probar el modelo con tus propios prompts, conjuntos de evaluación y tareas de agentes, manteniendo el mismo contrato de despliegue: mismo nombre, misma ruta de API, mismo presupuesto de contexto y misma economía de tokens.

Características clave: por qué DeepSeek-V4-Flash se destaca

Profundidad de razonamiento seleccionable sin cambiar de modelo

La mayoría de los modelos te bloquean en un único modo de inferencia: razonamiento activado o desactivado. DeepSeek-V4-Flash te ofrece tres modos de funcionamiento distintos en el mismo endpoint de API:

Modo Características Ideal para
Non-think Rápido, sin cadena de pensamiento Tareas de alto volumen, chat, resúmenes
Think Razonamiento paso a paso, equilibrado Preguntas y respuestas complejas, generación de código, análisis
Think Max Presupuesto de razonamiento máximo Competencias de matemáticas, tareas de código difíciles, benchmarks

La brecha entre modos es significativa: en GPQA Diamond, V4-Flash Non-think puntúa 71.2 frente a 87.4 en Think y 88.1 en Think Max. En LiveCodeBench, Think Max alcanza 91.6 frente a 55.2 de Non-think. Tú eliges costo frente a calidad por solicitud, sin necesidad de cambios de infraestructura.

Arquitectura híbrida de atención para contexto de 1M de tokens

El contexto nativo de un millón de tokens es más difícil de lo que parece. DeepSeek-V4-Flash lo logra mediante una arquitectura híbrida de atención diseñada específicamente que combina dos mecanismos:

  • Atención dispersa comprimida (CSA) — reduce drásticamente el presupuesto de cómputo de atención para secuencias largas
  • Atención fuertemente comprimida (HCA) — comprime la huella de caché KV para inferencia con contexto de 1M

El resultado: inferencia sobre entradas de 1M de tokens con un costo de FLOP y memoria manejable. Para cargas de trabajo como análisis de bases de código, revisión de documentos legales o agentes de sesión larga, esta arquitectura marca la diferencia entre lo factible y lo prohibitivo.

Eficiencia MoE: 13B activados a escala de 284B

La proporción 284B/13B activados es de donde proviene la eficiencia de costos. Solo 13B de parámetros están activos por pase hacia adelante, manteniendo la latencia y el costo por token cerca de un modelo denso de 13B, mientras que el conjunto completo de 284B de parámetros proporciona una capacidad de conocimiento comparable a una red densa mucho más grande. La precisión mixta FP4 + FP8 reduce aún más la presión sobre el ancho de banda de memoria en los pesos de los expertos.

Potente pipeline de post-entrenamiento

DeepSeek-V4-Flash sigue un proceso de post-entrenamiento en dos etapas: primero, el cultivo de expertos específicos del dominio mediante SFT y aprendizaje por refuerzo con GRPO; luego, la consolidación unificada del modelo mediante destilación on-policy. Esto produce un único modelo con perfiles de capacidad diferenciados en codificación, razonamiento y conocimiento general, no un seguidor de instrucciones genérico.

Rendimiento en benchmarks

La historia de los benchmarks para DeepSeek-V4-Flash se centra en la selección del modo de razonamiento. En modo Non-think, se comporta como un modelo eficiente con 13B activados. Sube a Think Max y alcanza un nivel completamente diferente.

Gráfico comparativo de benchmarks de DeepSeek-V4-Flash que muestra el rendimiento entre modos de razonamiento

Rendimiento de DeepSeek-V4-Flash entre modos frente a modelos frontera [Fuente: DeepSeek AI / HuggingFace]

Rendimiento según el modo de razonamiento

A continuación se muestran las puntuaciones de V4-Flash en benchmarks clave, comparando los tres modos de funcionamiento:

Benchmark V4-Flash Non-Think V4-Flash Think V4-Flash Think Max
LiveCodeBench (Pass@1) 55.2 88.4 91.6
GPQA Diamond (Pass@1) 71.2 87.4 88.1
HMMT 2026 Feb (Pass@1) 40.8 91.9 94.8
IMOAnswerBench (Pass@1) 41.9 85.1 88.4
Codeforces Rating 2816 3052
SWE Verified (Resolved) 73.7 78.6 79.0
MRCR 1M (MMR) 37.5 76.9 78.7
MCPAtlas (Pass@1) 64.0 67.4 69.0
MMLU-Pro (EM) 83.0 86.4 86.2

Última verificación: 2026-04-27. Fuente: informe técnico de DeepSeek-V4 y ficha del modelo en HuggingFace.

Cómo se compara V4-Flash con la competencia

V4-Flash Think Max (79.0 SWE Verified, 91.6 LiveCodeBench) compite con modelos que operan a un costo por token mucho más alto. No encabeza todos los rankings (V4-Pro Max lidera la mayoría de los benchmarks frontera), pero para los desarrolladores que miran el costo por tarea en lugar del rendimiento máximo bruto, el equilibrio es favorable:

Si estás eligiendo entre las dos APIs de DeepSeek V4 para el enrutamiento en producción, usa la guía de precios y enrutamiento de DeepSeek V4 Pro vs Flash para comparar cuándo Flash debería manejar el tráfico base y cuándo Pro justifica el precio de token más alto.

Benchmark V4-Flash Max V4-Pro Max Claude Opus 4.6 Max Gemini 3.1 Pro High
LiveCodeBench (Pass@1) 91.6 93.5 88.8 91.7
GPQA Diamond (Pass@1) 88.1 90.1 91.3 94.3
SWE Verified (Resolved) 79.0 80.6 80.8 80.6
HMMT 2026 Feb (Pass@1) 94.8 95.2 96.2 94.7
MRCR 1M (MMR) 78.7 83.5 92.9 76.3

Última verificación: 2026-04-27. Las cifras de Claude Opus 4.6 Max y Gemini 3.1 Pro High provienen del informe técnico de DeepSeek-V4 (tabla de comparación frontera de V4-Pro). Estas puntuaciones no se midieron cara a cara contra V4-Flash en ese informe.

En particular, V4-Flash Think Max en MRCR 1M (78.7) supera a Gemini 3.1 Pro High (76.3) en la tarea de recuperación de contexto largo, el benchmark que más directamente se asocia con los casos de uso de contexto de 1M. En SWE Verified, los cuatro modelos se agrupan entre 79 y 81, lo que hace que V4-Flash sea competitivo en la categoría de agentes de codificación del mundo real a una fracción del precio de los modelos cerrados.

Cómo usar DeepSeek-V4-Flash mediante Novita AI

Opción 1: Playground (sin código)

Prueba el modelo directamente en tu navegador en la consola de modelos de Novita AI. No se requiere clave de API para comenzar: cambia entre los modos Non-think, Think y Think Max mediante la interfaz de chat.

Opción 2: API (Python)

DeepSeek-V4-Flash utiliza la API compatible con OpenAI. Usa el ID de modelo deepseek/deepseek-v4-flash con la URL base de Novita:

from openai import OpenAI

client = OpenAI(
    base_url="https://api.novita.ai/v3/openai",
    api_key="YOUR_NOVITA_API_KEY",
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4-flash",
    messages=[{"role": "user", "content": "Your prompt here"}]
)
print(response.choices[0].message.content)

Para habilitar el modo Think o Think Max, pasa el parámetro reasoning en el cuerpo de la solicitud:

from openai import OpenAI

client = OpenAI(
    base_url="https://api.novita.ai/v3/openai",
    api_key="YOUR_NOVITA_API_KEY",
)

# Think Max mode — maximum reasoning budget
response = client.chat.completions.create(
    model="deepseek/deepseek-v4-flash",
    messages=[{"role": "user", "content": "Solve: x^4 - 5x^2 + 4 = 0"}],
    extra_body={"reasoning": {"effort": "high"}}  # "low" = Think, "high" = Think Max
)
print(response.choices[0].message.content)

Obtén tu clave de API en novita.ai/settings.

Opción 3: Herramientas de terceros

Debido a que Novita AI expone un endpoint compatible con OpenAI, DeepSeek-V4-Flash funciona de inmediato con:

  • LangChain / LlamaIndex — usa ChatOpenAI con base_url="https://api.novita.ai/v3/openai"
  • OpenWebUI — agrégalo como un endpoint personalizado compatible con OpenAI
  • Continue.dev / Cursor — configúralo como un modelo personalizado con la URL base de Novita

Precios de DeepSeek-V4-Flash

Los precios de DeepSeek-V4-Flash en Novita AI no cambian en la actualización del 31 de julio de 2026. Todas las cifras siguientes son por millón de tokens, verificadas por última vez el 2026-08-03:

Proveedor Entrada ($/M) Salida ($/M) Lectura de caché ($/M) Contexto máximo
Novita AI $0.14 $0.28 $0.028 1,048,576 tokens
DeepSeek Official $0.14 $0.28 $0.028 131,072 tokens
SiliconFlow $0.14 $0.28 $0.028 65,536 tokens
DeepInfra $0.14 $0.28 16,384 tokens

La tarifa por token sigue siendo la misma después de la actualización 0731, pero el contexto máximo sigue variando significativamente según el proveedor. Novita AI ofrece la ventana de contexto completa de 1M de tokens. DeepInfra tiene un límite de 16.384 tokens. Si tu carga de trabajo involucra documentos largos, bases de código o agentes de múltiples turnos, Novita es la opción práctica.

Casos de uso recomendados

Agentes autónomos de codificación

La ventana de contexto de 1M de V4-Flash significa que un agente puede cargar una base de código completa en el contexto sin dividirla en fragmentos. Combinado con 79.0 en SWE Verified en modo Think Max, maneja refactorizaciones de varios archivos y depuración sin perder el estado entre turnos.

Preguntas y respuestas sobre documentos largos y RAG

MRCR 1M (recuperación de contexto de múltiples rondas) al 78.7% en Think Max: el benchmark mide la precisión de recuperación sobre una ventana genuina de 1M de tokens. Para indexar documentos legales, artículos académicos o especificaciones técnicas largas, V4-Flash recupera con precisión donde la mayoría de los modelos se degradan después de 32K tokens.

Razonamiento matemático y científico

94.8% en HMMT 2026 de febrero (matemáticas de competencia) con Think Max. El modo de pensamiento con presupuesto te permite ajustar costo frente a precisión: usa Think para problemas estándar y Think Max para los difíciles. Una sola solicitud no consume un presupuesto de cómputo fijo; tú eliges.

APIs de producción con caché

Con lecturas de caché a $0.028/M, los prompts de sistema repetidos y los esquemas de herramientas prácticamente no cuestan nada a escala. Los productos de chatbot y los wrappers de API que reinyectan el mismo contexto en cada llamada se benefician del precio de lectura de caché frente al precio de entrada bruto.

Para una configuración de modelos mixtos, mantén Flash como opción predeterminada para llamadas de producción repetidas y escala los prompts difíciles de contexto largo o agentes de codificación a Pro. La guía de contexto largo de DeepSeek V4 Pro muestra cómo configurar el ID del modelo Pro, la URL base, la forma de las solicitudes y los controles de costos para esas rutas de mayor dificultad.

Empieza a usar DeepSeek-V4-Flash hoy

DeepSeek-V4-Flash sigue disponible mediante Novita AI después de la actualización del 31 de julio, con la ventana de contexto completa de 1M, los mismos precios competitivos y cero sobrecarga de infraestructura. Tú eliges el modo de razonamiento; Novita se encarga del resto.

Prueba DeepSeek-V4-Flash con el respaldo de Novita AI

Documentación de la API LLM de Novita AI

Preguntas frecuentes

¿Qué cambió en la revisión 0731 de DeepSeek-V4-Flash?

En Novita AI, el contrato de despliegue visible sigue siendo el mismo: el ID de modelo permanece como deepseek/deepseek-v4-flash, los precios se mantienen en $0.14/M de entrada y $0.28/M de salida, y la ventana de contexto completa de 1.048.576 tokens sigue disponible. La actualización 0731 es una actualización de la revisión servida, no una familia de modelos separada.

¿Qué es DeepSeek-V4-Flash?

DeepSeek-V4-Flash es un modelo de lenguaje de Mezcla de Expertos de 284B de parámetros desarrollado por DeepSeek AI, lanzado el 2026-04-23. Activa solo 13B de parámetros por pase hacia adelante, lo que lo hace significativamente más rápido y económico que los modelos densos de capacidad comparable. Admite una ventana de contexto de 1.048.576 tokens y tres modos de razonamiento: Non-thinking (rápido), Budget Thinking (pensamiento con presupuesto) y Extended Thinking (Think Max).

¿En qué se diferencia DeepSeek-V4-Flash de DeepSeek-V4-Pro?

V4-Flash es la variante más ligera y rápida, optimizada para velocidad y costo. V4-Pro es el modelo insignia con puntuaciones máximas más altas en benchmarks (por ejemplo, 93.5 frente a 91.6 en LiveCodeBench Think Max). V4-Flash «logra un rendimiento de razonamiento comparable al de la versión Pro cuando se le da un mayor presupuesto de pensamiento»; en la práctica, V4-Flash Think Max cierra la mayor parte de la brecha frente a V4-Pro Think Max a un menor costo por token.

Si necesitas una regla de enrutamiento en producción, compara ambos modelos en la guía de decisión de API DeepSeek V4 Pro vs Flash antes de mover todo el tráfico a un solo modelo.

¿Qué significa «Flash» en el nombre del modelo?

«Flash» indica una variante optimizada para velocidad, coherente con el uso que Google hace del término para Gemini Flash. DeepSeek-V4-Flash prioriza una menor latencia y costo sobre la precisión máxima bruta, con los modos de pensamiento disponibles cuando necesitas cerrar la brecha de rendimiento.

¿DeepSeek-V4-Flash admite una ventana de contexto de 1M respaldada por Novita AI?

Sí. Novita AI expone la ventana de contexto completa de 1.048.576 tokens, la más grande disponible entre todos los proveedores actuales para este modelo. El máximo de tokens de finalización en Novita es 393.216.

¿Cómo cambio los modos de razonamiento mediante la API?

Pasa el parámetro extra_body={"reasoning": {"effort": "low"}} para Budget Thinking, o "effort": "high" para Think Max. Omite el parámetro por completo para el modo Non-thinking (rápido). La API es compatible con OpenAI: no se requieren cambios de SDK.

¿Cuál es el precio de DeepSeek-V4-Flash con el respaldo de Novita AI?

Al 2026-08-03: $0.14/M por tokens de entrada, $0.28/M por tokens de salida, $0.028/M por tokens de lectura de caché. Esto coincide con los precios oficiales de DeepSeek y es coherente entre proveedores; el diferenciador en Novita es la ventana de contexto completa de 1M y la disponibilidad confiable.

¿DeepSeek-V4-Flash es de código abierto?

Sí. Los pesos del modelo están disponibles en HuggingFace bajo la Licencia MIT (confirmado en el repositorio oficial de DeepSeek-V4). El autoalojamiento y el uso comercial están permitidos bajo los términos de MIT. Usarlo mediante la API de Novita AI no requiere autoalojamiento en absoluto.

Artículos recomendados