DeepSeek-V4-Flash on Novita AI: 빠른 추론, 더 저렴한 비용

DeepSeek-V4-Flash on Novita AI: 빠른 추론, 더 저렴한 비용

추론 기능을 갖춘 대부분의 오픈소스 모델은 작은 컨텍스트 윈도우, 느린 처리량, 또는 확장 추론을 활성화하는 순간 $1/M 토큰을 넘는 가격 중 하나를 강제합니다. DeepSeek-V4-Flash는 2026년 7월 31일 업데이트에서도 이러한 트레이드오프를 피합니다: 동일한 284B 파라미터 Mixture-of-Experts 설계, 추론당 13B만 활성화, 동일한 기본 1,048,576 토큰 컨텍스트 윈도우, 그리고 Novita AI에서 동일한 $0.14/M 입력 가격을 유지합니다.

요약하자면: DeepSeek-V4-Flash는 0731 재포스트 훈련 개정 이후에도 Novita AI에서 동일한 모델 제품군으로 남아 있습니다. 이 업데이트가 중요한 이유는 개발자가 모델 ID를 변경하거나, 프롬프트를 다시 작성하거나, 비용 가정을 다시 계산할 필요 없이 서빙 버전을 새로 고친다는 점입니다.

Novita AI 모델 콘솔에서 DeepSeek-V4-Flash 열기

DeepSeek-V4-Flash란 무엇인가요?

DeepSeek-V4-Flash는 DeepSeek AI의 Mixture-of-Experts (MoE) 언어 모델로, 더 큰 DeepSeek-V4-Pro와 함께 DeepSeek-V4 시리즈의 일부로 출시되었습니다. 이 모델은 총 284B 파라미터에 추론 시 13B가 활성화되어 — 토큰당 계산 비용을 낮게 유지하면서도 훨씬 더 큰 모델의 파라미터 용량을 보유합니다.

한눈에 보는 주요 기능:

  • 총 284B / 활성화 13B 파라미터 — MoE 아키텍처, 낮은 추론 비용
  • 1,048,576 토큰 컨텍스트 윈도우 (1M 토큰) — Hybrid Attention Architecture 지원
  • 세 가지 추론 모드: Non-think (빠름), Think (단계별), Think Max (최대 추론 예산)
  • 함수 호출 지원 — 도구 사용, 구조화된 출력, JSON 모드
  • 32T+ 토큰으로 훈련 — 다단계 포스트 트레이닝 (SFT, GRPO를 사용한 RL, 온폴리시 증류)
  • MIT 라이선스HuggingFace에서 가중치 다운로드 가능; 상업적 사용 허용
  • FP4 + FP8 혼합 정밀도 — MoE 전문가 가중치는 FP4, 나머지 레이어는 FP8

2026년 7월 31일 업데이트의 새로운 점은 무엇인가요?

간단히 말해: 이는 별도의 출시가 아닌 개정 새로고침입니다.

DeepSeek의 7월 말 재포스트 훈련 업데이트는 Novita AI에서 동일한 공개 제품 정체성을 유지합니다:

  • 동일한 모델 ID: deepseek/deepseek-v4-flash
  • 동일한 아키텍처: 총 284B 파라미터, 추론당 13B 활성화
  • 동일한 컨텍스트 윈도우: 1,048,576 토큰
  • 동일한 Novita AI 가격: $0.14/M 입력, $0.28/M 출력, $0.028/M 캐시 읽기

즉, 기존 통합은 엔드포인트 변경, 가격표 재작성, 또는 프롬프트 형식 마이그레이션이 필요하지 않습니다. 이미 DeepSeek-V4-Flash로 트래픽을 라우팅하고 있었다면, 0731 업데이트는 완전히 새로운 SKU라기보다는 내부 기능 및 포스트 트레이닝 업데이트로 이해하는 것이 가장 좋습니다.

개발자에게 이 차이는 중요합니다. 개정 새로고침은 일반적으로 동일한 배포 계약(동일한 이름, 동일한 API 경로, 동일한 컨텍스트 예산, 동일한 토큰 경제)을 유지하면서 자체 프롬프트, 평가 세트 및 에이전트 작업에서 모델을 다시 테스트할 수 있음을 의미합니다.

주요 기능: DeepSeek-V4-Flash가 두드러지는 이유

모델 전환 없이 선택 가능한 추론 깊이

대부분의 모델은 단일 추론 모드(추론 켜짐 또는 꺼짐)로 고정됩니다. DeepSeek-V4-Flash는 동일한 API 엔드포인트에서 세 가지 뚜렷한 작동 모드를 제공합니다:

모드 특징 최적 용도
Non-think 빠름, 체인 오브 생각 없음 대량 작업, 채팅, 요약
Think 단계별 추론, 균형 잡힘 복잡한 Q&A, 코드 생성, 분석
Think Max 최대 추론 예산 수학 경시, 어려운 코딩 작업, 벤치마크

모드 간 차이는 상당합니다: GPQA Diamond에서 V4-Flash Non-think는 71.2점, Think는 87.4점, Think Max는 88.1점입니다. LiveCodeBench에서 Think Max는 91.6점에 도달하는 반면 Non-think는 55.2점입니다. 요청당 비용 대비 품질을 선택하면 됩니다 — 인프라 변경이 필요하지 않습니다.

1M 토큰 컨텍스트를 위한 Hybrid Attention Architecture

기본 백만 토큰 컨텍스트는 생각보다 어렵습니다. DeepSeek-V4-Flash는 두 가지 메커니즘을 결합한 목적 기반 Hybrid Attention Architecture를 통해 이를 달성합니다:

  • Compressed Sparse Attention (CSA) — 긴 시퀀스에 대한 어텐션 계산 예산을 크게 줄입니다
  • Heavily Compressed Attention (HCA) — 1M 컨텍스트 추론을 위한 KV 캐시 풋프린트를 압축합니다

결과: 관리 가능한 FLOP 및 메모리 비용으로 1M 토큰 입력에 대한 추론이 가능합니다. 코드베이스 분석, 법률 문서 검토 또는 긴 세션 에이전트와 같은 워크로드의 경우 이 아키텍처는 실행 가능과 불가능 사이의 차이를 만듭니다.

MoE 효율성: 284B 규모에서 13B 활성화

284B/13B 활성화 비율이 비용 효율성의 원천입니다. 순방향 패스당 13B 파라미터만 활성화되어 대기 시간과 토큰당 비용을 13B 밀집 모델에 가깝게 유지하는 반면, 전체 284B 파라미터 풀은 훨씬 더 큰 밀집 네트워크에 필적하는 지식 용량을 제공합니다. FP4 + FP8 혼합 정밀도는 전문가 가중치에 대한 메모리 대역폭 압력을 더욱 줄입니다.

강력한 포스트 트레이닝 파이프라인

DeepSeek-V4-Flash는 2단계 포스트 트레이닝 프로세스를 따릅니다: 먼저 SFT 및 GRPO를 사용한 강화 학습을 통한 도메인별 전문가 양성, 그 다음 온폴리시 증류를 통한 통합 모델 통합입니다. 이는 일반적인 명령 수행자가 아닌 코딩, 추론 및 일반 지식 전반에 걸쳐 차별화된 기능 프로필을 가진 단일 모델을 생성합니다.

벤치마크 성능

DeepSeek-V4-Flash의 벤치마크 스토리는 추론 모드 선택에 관한 것입니다. Non-think 모드에서는 효율적인 13B 활성화 모델처럼 동작합니다. Think Max로 올리면 완전히 다른 계층에 도달합니다.

추론 모드별 DeepSeek-V4-Flash 벤치마크 비교 차트

모드별 DeepSeek-V4-Flash 성능 대 프론티어 모델 [출처: DeepSeek AI / HuggingFace]

추론 모드별 성능

다음은 주요 벤치마크에서 세 가지 작동 모드를 모두 비교한 V4-Flash 점수입니다:

벤치마크 V4-Flash Non-Think V4-Flash Think V4-Flash Think Max
LiveCodeBench (Pass@1) 55.2 88.4 91.6
GPQA Diamond (Pass@1) 71.2 87.4 88.1
HMMT 2026 Feb (Pass@1) 40.8 91.9 94.8
IMOAnswerBench (Pass@1) 41.9 85.1 88.4
Codeforces Rating 2816 3052
SWE Verified (Resolved) 73.7 78.6 79.0
MRCR 1M (MMR) 37.5 76.9 78.7
MCPAtlas (Pass@1) 64.0 67.4 69.0
MMLU-Pro (EM) 83.0 86.4 86.2

최종 확인: 2026-04-27. 출처: DeepSeek-V4 기술 보고서 및 HuggingFace 모델 카드.

V4-Flash와 경쟁 모델 비교

V4-Flash Think Max (SWE Verified 79.0, LiveCodeBench 91.6)는 훨씬 더 높은 토큰당 비용으로 실행되는 모델과 경쟁합니다. 모든 리더보드에서 1위를 차지하지는 않지만(대부분의 프론티어 벤치마크에서 V4-Pro Max가 선두), 원시 최고 성능보다 작업당 비용을 보는 개발자에게는 트레이드오프가 유리합니다:

프로덕션 라우팅을 위해 두 DeepSeek V4 API 중에서 선택하는 경우, DeepSeek V4 Pro vs Flash 가격 및 라우팅 가이드를 참조하여 Flash가 기준 트래픽을 처리해야 하는 시기와 Pro가 더 높은 토큰 가격을 감수할 만한 시기를 비교하세요.

벤치마크 V4-Flash Max V4-Pro Max Claude Opus 4.6 Max Gemini 3.1 Pro High
LiveCodeBench (Pass@1) 91.6 93.5 88.8 91.7
GPQA Diamond (Pass@1) 88.1 90.1 91.3 94.3
SWE Verified (Resolved) 79.0 80.6 80.8 80.6
HMMT 2026 Feb (Pass@1) 94.8 95.2 96.2 94.7
MRCR 1M (MMR) 78.7 83.5 92.9 76.3

최종 확인: 2026-04-27. Claude Opus 4.6 Max 및 Gemini 3.1 Pro High 수치는 DeepSeek-V4 기술 보고서 (V4-Pro 프론티어 비교 표)에서 가져왔습니다. 이 점수는 해당 보고서에서 V4-Flash와 직접 비교 측정된 것은 아닙니다.

특히, MRCR 1M에서 V4-Flash Think Max (78.7)는 긴 컨텍스트 검색 작업에서 Gemini 3.1 Pro High (76.3)를 능가합니다 — 이 벤치마크는 1M 컨텍스트 사용 사례에 가장 직접적으로 매핑됩니다. SWE Verified에서는 네 모델 모두 79–81 사이에 모여 있어 V4-Flash가 폐쇄형 모델 가격의 일부로 실제 코딩 에이전트 범주에서 경쟁력이 있음을 보여줍니다.

Novita AI를 통해 DeepSeek-V4-Flash 사용하는 방법

옵션 1: 플레이그라운드 (코드 불필요)

Novita AI 모델 콘솔에서 브라우저에서 직접 모델을 테스트하세요. 시작하는 데 API 키가 필요하지 않습니다 — 채팅 인터페이스를 통해 Non-think, Think, Think Max 모드 간에 전환하세요.

옵션 2: API (Python)

DeepSeek-V4-Flash는 OpenAI 호환 API를 사용합니다. Novita 기본 URL과 함께 모델 ID deepseek/deepseek-v4-flash를 사용하세요:

from openai import OpenAI

client = OpenAI(
    base_url="https://api.novita.ai/v3/openai",
    api_key="YOUR_NOVITA_API_KEY",
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4-flash",
    messages=[{"role": "user", "content": "Your prompt here"}]
)
print(response.choices[0].message.content)

Think 또는 Think Max 모드를 활성화하려면 요청 본문에 reasoning 매개변수를 전달하세요:

from openai import OpenAI

client = OpenAI(
    base_url="https://api.novita.ai/v3/openai",
    api_key="YOUR_NOVITA_API_KEY",
)

# Think Max 모드 — 최대 추론 예산
response = client.chat.completions.create(
    model="deepseek/deepseek-v4-flash",
    messages=[{"role": "user", "content": "Solve: x^4 - 5x^2 + 4 = 0"}],
    extra_body={"reasoning": {"effort": "high"}}  # "low" = Think, "high" = Think Max
)
print(response.choices[0].message.content)

API 키는 novita.ai/settings에서 받으세요.

옵션 3: 서드파티 도구

Novita AI가 OpenAI 호환 엔드포인트를 노출하므로 DeepSeek-V4-Flash는 다음 도구에서 즉시 작동합니다:

  • LangChain / LlamaIndexbase_url="https://api.novita.ai/v3/openai"와 함께 ChatOpenAI 사용
  • OpenWebUI — 사용자 정의 OpenAI 호환 엔드포인트로 추가
  • Continue.dev / Cursor — Novita 기본 URL을 사용하여 사용자 정의 모델로 구성

DeepSeek-V4-Flash 가격

2026년 7월 31일 업데이트에서 Novita AI의 DeepSeek-V4-Flash 가격은 변경되지 않았습니다. 아래 모든 수치는 백만 토큰당이며, 2026-08-03에 마지막으로 확인했습니다:

제공자 입력 ($/M) 출력 ($/M) 캐시 읽기 ($/M) 최대 컨텍스트
Novita AI $0.14 $0.28 $0.028 1,048,576 토큰
DeepSeek 공식 $0.14 $0.28 $0.028 131,072 토큰
SiliconFlow $0.14 $0.28 $0.028 65,536 토큰
DeepInfra $0.14 $0.28 16,384 토큰

0731 업데이트 후 토큰당 요금은 동일하게 유지되지만, 최대 컨텍스트는 제공자에 따라 여전히 크게 다릅니다. Novita AI는 전체 1M 토큰 컨텍스트 윈도우를 제공합니다. DeepInfra는 16,384 토큰으로 제한됩니다. 워크로드에 긴 문서, 코드베이스 또는 다중 턴 에이전트가 포함된 경우 Novita가 실용적인 선택입니다.

권장 사용 사례

자율 코딩 에이전트

V4-Flash의 1M 컨텍스트 윈도우는 에이전트가 청킹 없이 전체 코드베이스를 컨텍스트에 로드할 수 있음을 의미합니다. Think Max 모드에서 79.0 SWE Verified와 결합하여 상태를 잃지 않고 다중 파일 리팩터링 및 디버깅을 처리합니다.

긴 문서 QA 및 RAG

MRCR 1M (Multi-Round Context Retrieval) Think Max 78.7% — 이 벤치마크는 실제 1M 토큰 윈도우에 대한 검색 정확도를 측정합니다. 법률 문서, 학술 논문 또는 긴 기술 사양을 색인화하는 경우 V4-Flash는 대부분의 모델이 32K 토큰 이후에 저하되는 곳에서 정확하게 검색합니다.

수학 및 과학 추론

Think Max로 HMMT 2026 2월 (경시 수학) 94.8%. 예산 생각 모드를 사용하면 비용 대비 정확도를 조정할 수 있습니다 — 표준 문제에는 Think, 어려운 문제에는 Think Max를 사용하세요. 단일 요청이 고정 계산 예산을 소모하지 않습니다. 선택할 수 있습니다.

캐싱을 사용한 프로덕션 API

$0.028/M 캐시 읽기로 반복되는 시스템 프롬프트와 도구 스키마는 대규모로 사실상 비용이 들지 않습니다. 모든 호출에 동일한 컨텍스트를 다시 주입하는 챗봇 제품 및 API 래퍼는 원시 입력 가격보다 캐시 읽기 가격의 이점을 누립니다.

혼합 모델 설정의 경우 Flash를 반복 프로덕션 호출의 기본값으로 유지하고 어려운 긴 컨텍스트 또는 코딩 에이전트 프롬프트를 Pro로 에스컬레이션하세요. DeepSeek V4 Pro 긴 컨텍스트 가이드는 이러한 더 높은 난이도 경로에 대한 Pro 모델 ID, 기본 URL, 요청 형태 및 비용 제어를 구성하는 방법을 보여줍니다.

지금 DeepSeek-V4-Flash 사용 시작하기

DeepSeek-V4-Flash는 7월 31일 업데이트 이후에도 Novita AI를 통해 전체 1M 컨텍스트 윈도우, 동일한 경쟁력 있는 가격, 제로 인프라 오버헤드로 계속 사용할 수 있습니다. 추론 모드를 선택하면 Novita가 나머지를 처리합니다.

Novita AI가 지원하는 DeepSeek-V4-Flash 사용해보기

Novita AI LLM API 문서

FAQ

DeepSeek-V4-Flash 0731 개정에서 무엇이 변경되었나요?

Novita AI에서 가시적인 배포 계약은 동일하게 유지됩니다: 모델 ID는 deepseek/deepseek-v4-flash로 유지되고, 가격은 입력 $0.14/M 및 출력 $0.28/M으로 유지되며, 전체 1,048,576 토큰 컨텍스트 윈도우를 계속 사용할 수 있습니다. 0731 업데이트는 별도의 모델 제품군이 아닌 서빙 개정의 새로고침입니다.

DeepSeek-V4-Flash란 무엇인가요?

DeepSeek-V4-Flash는 DeepSeek AI가 개발한 284B 파라미터 Mixture-of-Experts 언어 모델로, 2026-04-23에 출시되었습니다. 순방향 패스당 13B 파라미터만 활성화하여 비슷한 성능의 밀집 모델보다 훨씬 빠르고 저렴합니다. 1,048,576 토큰 컨텍스트 윈도우와 세 가지 추론 모드(Non-thinking (빠름), Budget Thinking, Extended Thinking (Think Max))를 지원합니다.

DeepSeek-V4-Flash와 DeepSeek-V4-Pro의 차이점은 무엇인가요?

V4-Flash는 속도와 비용에 최적화된 더 가볍고 빠른 변형입니다. V4-Pro는 더 높은 최고 벤치마크 점수(예: LiveCodeBench Think Max 93.5 vs 91.6)를 가진 플래그십 모델입니다. V4-Flash는 “더 큰 생각 예산이 주어질 때 Pro 버전에 필적하는 추론 성능을 달성합니다” — 실제로 V4-Flash Think Max는 더 낮은 토큰당 비용으로 V4-Pro Think Max와의 격차를 대부분 좁힙니다.

프로덕션 라우팅 규칙이 필요한 경우, 모든 트래픽을 한 모델로 이동하기 전에 DeepSeek V4 Pro vs Flash API 결정 가이드에서 두 모델을 비교하세요.

모델 이름에서 "Flash"는 무엇을 의미하나요?

Flash는 Google이 Gemini Flash에 사용하는 용어와 일관되게 속도 최적화 변형을 나타냅니다. DeepSeek-V4-Flash는 성능 격차를 좁혀야 할 때 생각 모드를 사용할 수 있으면서 원시 최대 정확도보다 낮은 대기 시간과 비용을 우선시합니다.

DeepSeek-V4-Flash는 Novita AI가 지원하는 1M 컨텍스트 윈도우를 지원하나요?

예. Novita AI는 전체 1,048,576 토큰 컨텍스트 윈도우를 노출합니다 — 현재 이 모델에 대해 모든 제공자 중 가장 큰 규모입니다. Novita의 최대 완료 토큰은 393,216입니다.

API를 통해 추론 모드를 어떻게 전환하나요?

Budget Thinking의 경우 extra_body={"reasoning": {"effort": "low"}} 매개변수를 전달하고, Think Max의 경우 "effort": "high"를 전달하세요. Non-thinking (빠른) 모드의 경우 매개변수를 완전히 생략하세요. API는 OpenAI 호환 — SDK 변경이 필요하지 않습니다.

Novita AI가 지원하는 DeepSeek-V4-Flash의 가격은 어떻게 되나요?

2026-08-03 기준: 입력 토큰 $0.14/M, 출력 토큰 $0.28/M, 캐시 읽기 토큰 $0.028/M. 이는 DeepSeek의 공식 가격과 일치하며 제공자 간에 일관됩니다 — Novita의 차별점은 전체 1M 컨텍스트 윈도우와 안정적인 가동 시간입니다.

DeepSeek-V4-Flash는 오픈소스인가요?

예. 모델 가중치는 HuggingFace에서 MIT 라이선스 로 제공됩니다 — 공식 DeepSeek-V4 저장소에서 확인됨. MIT 조건에 따라 자체 호스팅 및 상업적 사용이 허용됩니다. Novita AI의 API를 통해 사용하는 경우 자체 호스팅이 전혀 필요하지 않습니다.

추천 문서