추론 기능을 갖춘 대부분의 오픈소스 모델은 작은 컨텍스트 윈도우, 느린 처리량, 또는 확장 추론을 활성화하는 순간 $1/M 토큰을 넘는 가격 중 하나를 강제합니다. DeepSeek-V4-Flash는 2026년 7월 31일 업데이트에서도 이러한 트레이드오프를 피합니다: 동일한 284B 파라미터 Mixture-of-Experts 설계, 추론당 13B만 활성화, 동일한 기본 1,048,576 토큰 컨텍스트 윈도우, 그리고 Novita AI에서 동일한 $0.14/M 입력 가격을 유지합니다.
요약하자면: DeepSeek-V4-Flash는 0731 재포스트 훈련 개정 이후에도 Novita AI에서 동일한 모델 제품군으로 남아 있습니다. 이 업데이트가 중요한 이유는 개발자가 모델 ID를 변경하거나, 프롬프트를 다시 작성하거나, 비용 가정을 다시 계산할 필요 없이 서빙 버전을 새로 고친다는 점입니다.
Novita AI 모델 콘솔에서 DeepSeek-V4-Flash 열기
DeepSeek-V4-Flash란 무엇인가요?
DeepSeek-V4-Flash는 DeepSeek AI의 Mixture-of-Experts (MoE) 언어 모델로, 더 큰 DeepSeek-V4-Pro와 함께 DeepSeek-V4 시리즈의 일부로 출시되었습니다. 이 모델은 총 284B 파라미터에 추론 시 13B가 활성화되어 — 토큰당 계산 비용을 낮게 유지하면서도 훨씬 더 큰 모델의 파라미터 용량을 보유합니다.
한눈에 보는 주요 기능:
- 총 284B / 활성화 13B 파라미터 — MoE 아키텍처, 낮은 추론 비용
- 1,048,576 토큰 컨텍스트 윈도우 (1M 토큰) — Hybrid Attention Architecture 지원
- 세 가지 추론 모드: Non-think (빠름), Think (단계별), Think Max (최대 추론 예산)
- 함수 호출 지원 — 도구 사용, 구조화된 출력, JSON 모드
- 32T+ 토큰으로 훈련 — 다단계 포스트 트레이닝 (SFT, GRPO를 사용한 RL, 온폴리시 증류)
- MIT 라이선스 — HuggingFace에서 가중치 다운로드 가능; 상업적 사용 허용
- FP4 + FP8 혼합 정밀도 — MoE 전문가 가중치는 FP4, 나머지 레이어는 FP8
2026년 7월 31일 업데이트의 새로운 점은 무엇인가요?
간단히 말해: 이는 별도의 출시가 아닌 개정 새로고침입니다.
DeepSeek의 7월 말 재포스트 훈련 업데이트는 Novita AI에서 동일한 공개 제품 정체성을 유지합니다:
- 동일한 모델 ID:
deepseek/deepseek-v4-flash - 동일한 아키텍처: 총 284B 파라미터, 추론당 13B 활성화
- 동일한 컨텍스트 윈도우: 1,048,576 토큰
- 동일한 Novita AI 가격: $0.14/M 입력, $0.28/M 출력, $0.028/M 캐시 읽기
즉, 기존 통합은 엔드포인트 변경, 가격표 재작성, 또는 프롬프트 형식 마이그레이션이 필요하지 않습니다. 이미 DeepSeek-V4-Flash로 트래픽을 라우팅하고 있었다면, 0731 업데이트는 완전히 새로운 SKU라기보다는 내부 기능 및 포스트 트레이닝 업데이트로 이해하는 것이 가장 좋습니다.
개발자에게 이 차이는 중요합니다. 개정 새로고침은 일반적으로 동일한 배포 계약(동일한 이름, 동일한 API 경로, 동일한 컨텍스트 예산, 동일한 토큰 경제)을 유지하면서 자체 프롬프트, 평가 세트 및 에이전트 작업에서 모델을 다시 테스트할 수 있음을 의미합니다.
주요 기능: DeepSeek-V4-Flash가 두드러지는 이유
모델 전환 없이 선택 가능한 추론 깊이
대부분의 모델은 단일 추론 모드(추론 켜짐 또는 꺼짐)로 고정됩니다. DeepSeek-V4-Flash는 동일한 API 엔드포인트에서 세 가지 뚜렷한 작동 모드를 제공합니다:
| 모드 | 특징 | 최적 용도 |
|---|---|---|
| Non-think | 빠름, 체인 오브 생각 없음 | 대량 작업, 채팅, 요약 |
| Think | 단계별 추론, 균형 잡힘 | 복잡한 Q&A, 코드 생성, 분석 |
| Think Max | 최대 추론 예산 | 수학 경시, 어려운 코딩 작업, 벤치마크 |
모드 간 차이는 상당합니다: GPQA Diamond에서 V4-Flash Non-think는 71.2점, Think는 87.4점, Think Max는 88.1점입니다. LiveCodeBench에서 Think Max는 91.6점에 도달하는 반면 Non-think는 55.2점입니다. 요청당 비용 대비 품질을 선택하면 됩니다 — 인프라 변경이 필요하지 않습니다.
1M 토큰 컨텍스트를 위한 Hybrid Attention Architecture
기본 백만 토큰 컨텍스트는 생각보다 어렵습니다. DeepSeek-V4-Flash는 두 가지 메커니즘을 결합한 목적 기반 Hybrid Attention Architecture를 통해 이를 달성합니다:
- Compressed Sparse Attention (CSA) — 긴 시퀀스에 대한 어텐션 계산 예산을 크게 줄입니다
- Heavily Compressed Attention (HCA) — 1M 컨텍스트 추론을 위한 KV 캐시 풋프린트를 압축합니다
결과: 관리 가능한 FLOP 및 메모리 비용으로 1M 토큰 입력에 대한 추론이 가능합니다. 코드베이스 분석, 법률 문서 검토 또는 긴 세션 에이전트와 같은 워크로드의 경우 이 아키텍처는 실행 가능과 불가능 사이의 차이를 만듭니다.
MoE 효율성: 284B 규모에서 13B 활성화
284B/13B 활성화 비율이 비용 효율성의 원천입니다. 순방향 패스당 13B 파라미터만 활성화되어 대기 시간과 토큰당 비용을 13B 밀집 모델에 가깝게 유지하는 반면, 전체 284B 파라미터 풀은 훨씬 더 큰 밀집 네트워크에 필적하는 지식 용량을 제공합니다. FP4 + FP8 혼합 정밀도는 전문가 가중치에 대한 메모리 대역폭 압력을 더욱 줄입니다.
강력한 포스트 트레이닝 파이프라인
DeepSeek-V4-Flash는 2단계 포스트 트레이닝 프로세스를 따릅니다: 먼저 SFT 및 GRPO를 사용한 강화 학습을 통한 도메인별 전문가 양성, 그 다음 온폴리시 증류를 통한 통합 모델 통합입니다. 이는 일반적인 명령 수행자가 아닌 코딩, 추론 및 일반 지식 전반에 걸쳐 차별화된 기능 프로필을 가진 단일 모델을 생성합니다.
벤치마크 성능
DeepSeek-V4-Flash의 벤치마크 스토리는 추론 모드 선택에 관한 것입니다. Non-think 모드에서는 효율적인 13B 활성화 모델처럼 동작합니다. Think Max로 올리면 완전히 다른 계층에 도달합니다.

모드별 DeepSeek-V4-Flash 성능 대 프론티어 모델 [출처: DeepSeek AI / HuggingFace]
추론 모드별 성능
다음은 주요 벤치마크에서 세 가지 작동 모드를 모두 비교한 V4-Flash 점수입니다:
| 벤치마크 | V4-Flash Non-Think | V4-Flash Think | V4-Flash Think Max |
|---|---|---|---|
| LiveCodeBench (Pass@1) | 55.2 | 88.4 | 91.6 |
| GPQA Diamond (Pass@1) | 71.2 | 87.4 | 88.1 |
| HMMT 2026 Feb (Pass@1) | 40.8 | 91.9 | 94.8 |
| IMOAnswerBench (Pass@1) | 41.9 | 85.1 | 88.4 |
| Codeforces Rating | — | 2816 | 3052 |
| SWE Verified (Resolved) | 73.7 | 78.6 | 79.0 |
| MRCR 1M (MMR) | 37.5 | 76.9 | 78.7 |
| MCPAtlas (Pass@1) | 64.0 | 67.4 | 69.0 |
| MMLU-Pro (EM) | 83.0 | 86.4 | 86.2 |
최종 확인: 2026-04-27. 출처: DeepSeek-V4 기술 보고서 및 HuggingFace 모델 카드.
V4-Flash와 경쟁 모델 비교
V4-Flash Think Max (SWE Verified 79.0, LiveCodeBench 91.6)는 훨씬 더 높은 토큰당 비용으로 실행되는 모델과 경쟁합니다. 모든 리더보드에서 1위를 차지하지는 않지만(대부분의 프론티어 벤치마크에서 V4-Pro Max가 선두), 원시 최고 성능보다 작업당 비용을 보는 개발자에게는 트레이드오프가 유리합니다:
프로덕션 라우팅을 위해 두 DeepSeek V4 API 중에서 선택하는 경우, DeepSeek V4 Pro vs Flash 가격 및 라우팅 가이드를 참조하여 Flash가 기준 트래픽을 처리해야 하는 시기와 Pro가 더 높은 토큰 가격을 감수할 만한 시기를 비교하세요.
| 벤치마크 | V4-Flash Max | V4-Pro Max | Claude Opus 4.6 Max | Gemini 3.1 Pro High |
|---|---|---|---|---|
| LiveCodeBench (Pass@1) | 91.6 | 93.5 | 88.8 | 91.7 |
| GPQA Diamond (Pass@1) | 88.1 | 90.1 | 91.3 | 94.3 |
| SWE Verified (Resolved) | 79.0 | 80.6 | 80.8 | 80.6 |
| HMMT 2026 Feb (Pass@1) | 94.8 | 95.2 | 96.2 | 94.7 |
| MRCR 1M (MMR) | 78.7 | 83.5 | 92.9 | 76.3 |
최종 확인: 2026-04-27. Claude Opus 4.6 Max 및 Gemini 3.1 Pro High 수치는 DeepSeek-V4 기술 보고서 (V4-Pro 프론티어 비교 표)에서 가져왔습니다. 이 점수는 해당 보고서에서 V4-Flash와 직접 비교 측정된 것은 아닙니다.
특히, MRCR 1M에서 V4-Flash Think Max (78.7)는 긴 컨텍스트 검색 작업에서 Gemini 3.1 Pro High (76.3)를 능가합니다 — 이 벤치마크는 1M 컨텍스트 사용 사례에 가장 직접적으로 매핑됩니다. SWE Verified에서는 네 모델 모두 79–81 사이에 모여 있어 V4-Flash가 폐쇄형 모델 가격의 일부로 실제 코딩 에이전트 범주에서 경쟁력이 있음을 보여줍니다.
Novita AI를 통해 DeepSeek-V4-Flash 사용하는 방법
옵션 1: 플레이그라운드 (코드 불필요)
Novita AI 모델 콘솔에서 브라우저에서 직접 모델을 테스트하세요. 시작하는 데 API 키가 필요하지 않습니다 — 채팅 인터페이스를 통해 Non-think, Think, Think Max 모드 간에 전환하세요.
옵션 2: API (Python)
DeepSeek-V4-Flash는 OpenAI 호환 API를 사용합니다. Novita 기본 URL과 함께 모델 ID deepseek/deepseek-v4-flash를 사용하세요:
from openai import OpenAI
client = OpenAI(
base_url="https://api.novita.ai/v3/openai",
api_key="YOUR_NOVITA_API_KEY",
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash",
messages=[{"role": "user", "content": "Your prompt here"}]
)
print(response.choices[0].message.content)
Think 또는 Think Max 모드를 활성화하려면 요청 본문에 reasoning 매개변수를 전달하세요:
from openai import OpenAI
client = OpenAI(
base_url="https://api.novita.ai/v3/openai",
api_key="YOUR_NOVITA_API_KEY",
)
# Think Max 모드 — 최대 추론 예산
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash",
messages=[{"role": "user", "content": "Solve: x^4 - 5x^2 + 4 = 0"}],
extra_body={"reasoning": {"effort": "high"}} # "low" = Think, "high" = Think Max
)
print(response.choices[0].message.content)
API 키는 novita.ai/settings에서 받으세요.
옵션 3: 서드파티 도구
Novita AI가 OpenAI 호환 엔드포인트를 노출하므로 DeepSeek-V4-Flash는 다음 도구에서 즉시 작동합니다:
- LangChain / LlamaIndex —
base_url="https://api.novita.ai/v3/openai"와 함께ChatOpenAI사용 - OpenWebUI — 사용자 정의 OpenAI 호환 엔드포인트로 추가
- Continue.dev / Cursor — Novita 기본 URL을 사용하여 사용자 정의 모델로 구성
DeepSeek-V4-Flash 가격
2026년 7월 31일 업데이트에서 Novita AI의 DeepSeek-V4-Flash 가격은 변경되지 않았습니다. 아래 모든 수치는 백만 토큰당이며, 2026-08-03에 마지막으로 확인했습니다:
| 제공자 | 입력 ($/M) | 출력 ($/M) | 캐시 읽기 ($/M) | 최대 컨텍스트 |
|---|---|---|---|---|
| Novita AI | $0.14 | $0.28 | $0.028 | 1,048,576 토큰 |
| DeepSeek 공식 | $0.14 | $0.28 | $0.028 | 131,072 토큰 |
| SiliconFlow | $0.14 | $0.28 | $0.028 | 65,536 토큰 |
| DeepInfra | $0.14 | $0.28 | — | 16,384 토큰 |
0731 업데이트 후 토큰당 요금은 동일하게 유지되지만, 최대 컨텍스트는 제공자에 따라 여전히 크게 다릅니다. Novita AI는 전체 1M 토큰 컨텍스트 윈도우를 제공합니다. DeepInfra는 16,384 토큰으로 제한됩니다. 워크로드에 긴 문서, 코드베이스 또는 다중 턴 에이전트가 포함된 경우 Novita가 실용적인 선택입니다.
권장 사용 사례
자율 코딩 에이전트
V4-Flash의 1M 컨텍스트 윈도우는 에이전트가 청킹 없이 전체 코드베이스를 컨텍스트에 로드할 수 있음을 의미합니다. Think Max 모드에서 79.0 SWE Verified와 결합하여 상태를 잃지 않고 다중 파일 리팩터링 및 디버깅을 처리합니다.
긴 문서 QA 및 RAG
MRCR 1M (Multi-Round Context Retrieval) Think Max 78.7% — 이 벤치마크는 실제 1M 토큰 윈도우에 대한 검색 정확도를 측정합니다. 법률 문서, 학술 논문 또는 긴 기술 사양을 색인화하는 경우 V4-Flash는 대부분의 모델이 32K 토큰 이후에 저하되는 곳에서 정확하게 검색합니다.
수학 및 과학 추론
Think Max로 HMMT 2026 2월 (경시 수학) 94.8%. 예산 생각 모드를 사용하면 비용 대비 정확도를 조정할 수 있습니다 — 표준 문제에는 Think, 어려운 문제에는 Think Max를 사용하세요. 단일 요청이 고정 계산 예산을 소모하지 않습니다. 선택할 수 있습니다.
캐싱을 사용한 프로덕션 API
$0.028/M 캐시 읽기로 반복되는 시스템 프롬프트와 도구 스키마는 대규모로 사실상 비용이 들지 않습니다. 모든 호출에 동일한 컨텍스트를 다시 주입하는 챗봇 제품 및 API 래퍼는 원시 입력 가격보다 캐시 읽기 가격의 이점을 누립니다.
혼합 모델 설정의 경우 Flash를 반복 프로덕션 호출의 기본값으로 유지하고 어려운 긴 컨텍스트 또는 코딩 에이전트 프롬프트를 Pro로 에스컬레이션하세요. DeepSeek V4 Pro 긴 컨텍스트 가이드는 이러한 더 높은 난이도 경로에 대한 Pro 모델 ID, 기본 URL, 요청 형태 및 비용 제어를 구성하는 방법을 보여줍니다.
지금 DeepSeek-V4-Flash 사용 시작하기
DeepSeek-V4-Flash는 7월 31일 업데이트 이후에도 Novita AI를 통해 전체 1M 컨텍스트 윈도우, 동일한 경쟁력 있는 가격, 제로 인프라 오버헤드로 계속 사용할 수 있습니다. 추론 모드를 선택하면 Novita가 나머지를 처리합니다.
→ Novita AI가 지원하는 DeepSeek-V4-Flash 사용해보기
FAQ
DeepSeek-V4-Flash 0731 개정에서 무엇이 변경되었나요?
Novita AI에서 가시적인 배포 계약은 동일하게 유지됩니다: 모델 ID는 deepseek/deepseek-v4-flash로 유지되고, 가격은 입력 $0.14/M 및 출력 $0.28/M으로 유지되며, 전체 1,048,576 토큰 컨텍스트 윈도우를 계속 사용할 수 있습니다. 0731 업데이트는 별도의 모델 제품군이 아닌 서빙 개정의 새로고침입니다.
DeepSeek-V4-Flash란 무엇인가요?
DeepSeek-V4-Flash는 DeepSeek AI가 개발한 284B 파라미터 Mixture-of-Experts 언어 모델로, 2026-04-23에 출시되었습니다. 순방향 패스당 13B 파라미터만 활성화하여 비슷한 성능의 밀집 모델보다 훨씬 빠르고 저렴합니다. 1,048,576 토큰 컨텍스트 윈도우와 세 가지 추론 모드(Non-thinking (빠름), Budget Thinking, Extended Thinking (Think Max))를 지원합니다.
DeepSeek-V4-Flash와 DeepSeek-V4-Pro의 차이점은 무엇인가요?
V4-Flash는 속도와 비용에 최적화된 더 가볍고 빠른 변형입니다. V4-Pro는 더 높은 최고 벤치마크 점수(예: LiveCodeBench Think Max 93.5 vs 91.6)를 가진 플래그십 모델입니다. V4-Flash는 “더 큰 생각 예산이 주어질 때 Pro 버전에 필적하는 추론 성능을 달성합니다” — 실제로 V4-Flash Think Max는 더 낮은 토큰당 비용으로 V4-Pro Think Max와의 격차를 대부분 좁힙니다.
프로덕션 라우팅 규칙이 필요한 경우, 모든 트래픽을 한 모델로 이동하기 전에 DeepSeek V4 Pro vs Flash API 결정 가이드에서 두 모델을 비교하세요.
모델 이름에서 "Flash"는 무엇을 의미하나요?
Flash는 Google이 Gemini Flash에 사용하는 용어와 일관되게 속도 최적화 변형을 나타냅니다. DeepSeek-V4-Flash는 성능 격차를 좁혀야 할 때 생각 모드를 사용할 수 있으면서 원시 최대 정확도보다 낮은 대기 시간과 비용을 우선시합니다.
DeepSeek-V4-Flash는 Novita AI가 지원하는 1M 컨텍스트 윈도우를 지원하나요?
예. Novita AI는 전체 1,048,576 토큰 컨텍스트 윈도우를 노출합니다 — 현재 이 모델에 대해 모든 제공자 중 가장 큰 규모입니다. Novita의 최대 완료 토큰은 393,216입니다.
API를 통해 추론 모드를 어떻게 전환하나요?
Budget Thinking의 경우 extra_body={"reasoning": {"effort": "low"}} 매개변수를 전달하고, Think Max의 경우 "effort": "high"를 전달하세요. Non-thinking (빠른) 모드의 경우 매개변수를 완전히 생략하세요. API는 OpenAI 호환 — SDK 변경이 필요하지 않습니다.
Novita AI가 지원하는 DeepSeek-V4-Flash의 가격은 어떻게 되나요?
2026-08-03 기준: 입력 토큰 $0.14/M, 출력 토큰 $0.28/M, 캐시 읽기 토큰 $0.028/M. 이는 DeepSeek의 공식 가격과 일치하며 제공자 간에 일관됩니다 — Novita의 차별점은 전체 1M 컨텍스트 윈도우와 안정적인 가동 시간입니다.
DeepSeek-V4-Flash는 오픈소스인가요?
예. 모델 가중치는 HuggingFace에서 MIT 라이선스 로 제공됩니다 — 공식 DeepSeek-V4 저장소에서 확인됨. MIT 조건에 따라 자체 호스팅 및 상업적 사용이 허용됩니다. Novita AI의 API를 통해 사용하는 경우 자체 호스팅이 전혀 필요하지 않습니다.
