2026년 7월 20일 GA · 피크·오프피크 요금 · 100만 토큰 컨텍스트 · SWE-bench 80.6% · 7월 24일 API 마이그레이션
요약: 3개월간의 프리뷰 접근 이후, DeepSeek V4 패밀리가 2026년 7월 20일 정식 출시(GA)에 들어갔습니다. 이번 정식 버전은 에이전트 작업, 수학, 코딩 전반에서 실질적인 성능 향상을 가져왔고, DeepSeek이 처음 도입한 시간대별 피크 요금도 함께 공개되었습니다. 본문에서는 전체 타임라인, CSA/HCA 아키텍처, 벤치마크 표, GPT-5.6·Claude Fable 5와의 비교, 피크·오프피크 요금, 7월 24일 API 마이그레이션 마감까지 정리합니다.
| 날짜 | 마일스톤 |
|---|---|
| 2026년 4월 24일 | V4 프리뷰 + MIT 오픈웨이트 공개(V4-Pro 1.6T, V4-Flash 284B) |
| 2026년 5월 | 프로덕션 튜닝 Flash & Pro, API 일반 공개 |
| 2026년 6월 | V4-Pro 출력 요금 영구 75% 인하 → $0.87/M 토큰 |
| 2026년 6월 29일 | 전체 API 사용자 이메일: 7월 중 GA + 최초 피크·오프피크 요금 공지 |
| 2026년 7월 19일 | 선정 개발자 그레이 출시; 언론 「내일 정식 출시」 보도 |
| 2026년 7월 20일 | GA 정식 출시 |
| 2026년 7월 24일 | deepseek-chat 및 deepseek-reasoner 영구 폐기 |
레거시 엔드포인트 만료: deepseek-chat은 7월 24일 종료 — 구 모델명을 쓰는 프로덕션 코드는 중단됩니다
피크 요금 복잡성: 업무 시간대 요금 2배; 예약 없는 배치 작업은 비용이 급증합니다
폐쇄형 모델 비용 상한: GPT-5.6 Sol과 Claude Fable 5는 출력 $15–50/M — 대규모 운영에서 정당화하기 어렵습니다
100만 토큰 컨텍스트 경제성: 대부분 모델은 KV 캐시 비용 때문에 백만 토큰 윈도를 실용적으로 제공하지 못합니다
| 스펙 | V4-Pro | V4-Flash |
|---|---|---|
| 총 파라미터 | 1.6조 | 2840억 |
| 토큰당 활성 파라미터 | 490억(3%) | 130억(4.6%) |
| 레이어 | 61 | 43 |
| 컨텍스트 윈도 | 1,000,000 토큰 | 1,000,000 토큰 |
| 최대 출력 | 384K | 384K |
| 정밀도 | FP4(MoE expert)+ FP8 | 동일 |
| 학습 데이터 | 33T+ 토큰 | 32T+ 토큰 |
| 라이선스 | MIT | MIT |
V4는 V2/V3의 MLA를 이중 트랙 하이브리드로 교체했습니다:
100만 토큰 기준: V3.2 대비 추론 FLOPs 27%; KV 캐시 메모리는 V3.2의 10%(Flash: 7%).
Manifold-Constrained Hyper-Connections(mHC)는 이중 확률 행렬로 제어되는 4채널 잔차 스트림을 사용해 61개 레이어를 통과해도 그래디언트가 안정적입니다. Muon 옵티마이저(AdamW 아님)는 Newton-Schulz 직교화로 더 빠르고 안정적인 학습을 제공합니다.
| 모드 | 설명 | 사용 시점 |
|---|---|---|
| Non-think | 빠른 응답, 사고 체인 없음 | 라우팅, 분류, 단순 Q&A |
| Think High | 명시적 추론 블록 | 디버깅, 중간 복잡도 |
| Think Max | 최대 노력(384K+ 컨텍스트) | 복잡한 수학, 다단계 에이전트 |
권장 샘플링: 모든 모드에서 temperature=1.0, top_p=1.0.
| 벤치마크 | V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% 오픈웨이트 최고 | 96.0% | N/A | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench(Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
실제 GitHub 버그 수정(SWE-bench Verified)에서 V4-Pro의 80.6%는 오픈웨이트 최고 점수로, Gemini 3.1 Pro와 동률입니다. Claude Fable 5는 Verified 96%, 더 어려운 SWE-bench Pro 80.3%로 여전히 전체 1위입니다.
성능 격차 24%에도 116배 저렴 — 프로덕션 볼륨에서는 무시하기 어렵습니다.
| V4-Pro | GPT-5.6 Sol | Claude Fable 5 | |
|---|---|---|---|
| 오픈웨이트 / 셀프호스팅 | 가능(MIT) | 불가 | 불가 |
| 100만 컨텍스트 | 가능 | 미확인 | 가능 |
| 종합 코딩 최고 | 2티어 | 2티어 | SWE-bench Pro 1위 |
| 알고리즘·수학 최고 | LiveCodeBench 1위 | 강력 | — |
| 출력 비용(오프피크) | $0.87/M | ~$15/M | ~$50/M |
| 출력 비용(피크) | $1.74/M | — | — |
| 데이터 주권 | 셀프호스팅 가능 | 불가 | 불가 |
V4-Pro를 선택할 때: 셀프호스팅, 대량 API 호출, 코딩 에이전트, 예산 내 문서 분석이 필요할 때. Fable 5를 선택할 때: 다중 파일 레포 작업의 절대 성능이 최우선이고 예산이 부차적일 때. GPT-5.6을 선택할 때: 터미널·셸 에이전트 워크플로(Terminal-Bench 2.1 1위)나 Microsoft 365 / Azure 깊은 연동이 필요할 때.
| 모델 | 항목 | 오프피크 | 피크 |
|---|---|---|---|
| V4-Pro | 입력(캐시 히트) | $0.0035/1M | 2× |
| 입력(캐시 미스) | $0.435/1M | $0.87/1M | |
| 출력 | $0.87/1M | $1.74/1M | |
| V4-Flash | 입력(캐시 히트) | $0.0028/1M | 2× |
| 입력(캐시 미스) | $0.14/1M | $0.28/1M | |
| 출력 | $0.28/1M | $0.56/1M |
피크 시간(베이징 시간): 평일 09:00–12:00, 14:00–18:00.
배치 작업을 오프피크(베이징 18:00 이후 또는 09:00 이전)에 예약
캐시 히트 극대화 — 정적 시스템 프롬프트를 메시지 스택 최상단에 배치
단순 쿼리는 V4-Flash로 라우팅; 복잡한 추론만 Pro로 에스컬레이션
24시간 전 요금 변경 공지 이메일 모니터링
cron/큐로 비실시간 작업을 오프피크 윈도에 고정
피크 시간에도 V4-Pro 출력 $1.74/M은 Claude Opus 4.8($15/M)보다 8.6배 저렴합니다.
마감: 2026년 7월 24일 15:59 UTC. 레거시 모델명 deepseek-chat과 deepseek-reasoner는 영구 비활성화됩니다.
| 구 모델명 | 신규 대응 | 비고 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(non-thinking) | 대부분 채팅에 드롭인 대체 |
deepseek-reasoner | deepseek-v4-flash(thinking)또는 deepseek-v4-pro | Pro에서 더 강한 추론 |
# 구버전(7월 24일 종료)
response = client.chat.completions.create(model="deepseek-chat", messages=[...])
# 신규
response = client.chat.completions.create(
model="deepseek-v4-pro", # 또는 deepseek-v4-flash
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)V4는 OpenAI 호환 API와 Anthropic Messages API를 모두 지원합니다 — 동일한 base_url에 model만 업데이트하면 됩니다.
짧은 답: 예 — 특히 비용, 개방성, 데이터 통제가 중요하다면. SWE-bench Verified 오픈웨이트 최고(80.6%), 경제적으로 실용적인 100만 컨텍스트, 피크 시간에도 모든 폐쇄형 경쟁사를 이기는 요금, 속도와 깊이를 조절하는 다중 추론 모드를 제공합니다.
피크 요금은 24/7 파이프라인에 운영 복잡성을 더하지만, 오프피크 요금은 여전히 공격적으로 저렴하고 완화 전략도 단순합니다.
에이전트, 수학, 코드 성능이 개선되었고 피크·오프피크 요금이 도입되었습니다. 4월과 동일한 MoE 아키텍처이지만 이제 프로덕션급입니다.
베이징 시간 평일 09:00–12:00, 14:00–18:00. 요금 2배 적용.
예 — 2026년 7월 24일 영구 비활성화. deepseek-v4-flash 또는 deepseek-v4-pro로 마이그레이션하세요.
DeepSeek V4 GA는 오픈웨이트 가성비의 새 기준을 세웠지만, 프로덕션 배포는 여전히 API 마이그레이션, 피크 시간 스케줄링, 실제 개발 환경에서의 에이전트 오케스트레이션을 요구합니다. Windows나 Linux를 주로 쓰면서 OpenClaw 멀티모델 라우팅 검증, SWE-bench 벤치마크, 7월 24일 전 설정 변경 배치 테스트를 위해 네이티브 macOS GUI 세션이 필요하다면 Mac 구매는 비용이 크고 SSH만으로는 시스템 권한 대화상자를 처리할 수 없습니다. VNCMac 원격 Mac 임대로 격리된 노드에서 시간 단위 VNC 접속으로 V4 API 연동, 장문 컨텍스트 에이전트 작업, 마이그레이션 검증을 마친 뒤 스프린트가 끝나면 과금을 중단할 수 있습니다. Mac 임대 플랜에서 시작하세요.