오픈소스 LLM 2026년 7월 20일 약 22분 DeepSeek V4 피크 요금

DeepSeek V4 정식 출시
가격·벤치마크·GPT-5.6과의 비교

2026년 7월 20일 GA · 피크·오프피크 요금 · 100만 토큰 컨텍스트 · SWE-bench 80.6% · 7월 24일 API 마이그레이션

DeepSeek V4 정식 출시 오픈웨이트 AI 모델

요약: 3개월간의 프리뷰 접근 이후, DeepSeek V4 패밀리가 2026년 7월 20일 정식 출시(GA)에 들어갔습니다. 이번 정식 버전은 에이전트 작업, 수학, 코딩 전반에서 실질적인 성능 향상을 가져왔고, DeepSeek이 처음 도입한 시간대별 피크 요금도 함께 공개되었습니다. 본문에서는 전체 타임라인, CSA/HCA 아키텍처, 벤치마크 표, GPT-5.6·Claude Fable 5와의 비교, 피크·오프피크 요금, 7월 24일 API 마이그레이션 마감까지 정리합니다.

01

GA 출시와 프리뷰의 차이

날짜마일스톤
2026년 4월 24일V4 프리뷰 + MIT 오픈웨이트 공개(V4-Pro 1.6T, V4-Flash 284B)
2026년 5월프로덕션 튜닝 Flash & Pro, API 일반 공개
2026년 6월V4-Pro 출력 요금 영구 75% 인하 → $0.87/M 토큰
2026년 6월 29일전체 API 사용자 이메일: 7월 중 GA + 최초 피크·오프피크 요금 공지
2026년 7월 19일선정 개발자 그레이 출시; 언론 「내일 정식 출시」 보도
2026년 7월 20일GA 정식 출시
2026년 7월 24일deepseek-chatdeepseek-reasoner 영구 폐기

전환 전에 알아둘 점

  1. 01

    레거시 엔드포인트 만료: deepseek-chat은 7월 24일 종료 — 구 모델명을 쓰는 프로덕션 코드는 중단됩니다

  2. 02

    피크 요금 복잡성: 업무 시간대 요금 2배; 예약 없는 배치 작업은 비용이 급증합니다

  3. 03

    폐쇄형 모델 비용 상한: GPT-5.6 Sol과 Claude Fable 5는 출력 $15–50/M — 대규모 운영에서 정당화하기 어렵습니다

  4. 04

    100만 토큰 컨텍스트 경제성: 대부분 모델은 KV 캐시 비용 때문에 백만 토큰 윈도를 실용적으로 제공하지 못합니다

02

아키텍처: DeepSeek이 100만 토큰을 실용적으로 만드는 방법

스펙V4-ProV4-Flash
총 파라미터1.6조2840억
토큰당 활성 파라미터490억(3%)130억(4.6%)
레이어6143
컨텍스트 윈도1,000,000 토큰1,000,000 토큰
최대 출력384K384K
정밀도FP4(MoE expert)+ FP8동일
학습 데이터33T+ 토큰32T+ 토큰
라이선스MITMIT

Compressed Sparse Attention(CSA)+ Heavily Compressed Attention(HCA)

V4는 V2/V3의 MLA를 이중 트랙 하이브리드로 교체했습니다:

  • CSA: softmax 게이트 풀링으로 KV 4× 압축; FP4 「lightning indexer」가 top-k 블록 선택(Pro: 1024, Flash: 512); 최근 컨텍스트용 128토큰 슬라이딩 윈도
  • HCA: 128× 압축 후 dense 글로벌 어텐션으로 CSA가 놓칠 수 있는 장거리 패턴 처리

100만 토큰 기준: V3.2 대비 추론 FLOPs 27%; KV 캐시 메모리는 V3.2의 10%(Flash: 7%).

mHC와 Muon

Manifold-Constrained Hyper-Connections(mHC)는 이중 확률 행렬로 제어되는 4채널 잔차 스트림을 사용해 61개 레이어를 통과해도 그래디언트가 안정적입니다. Muon 옵티마이저(AdamW 아님)는 Newton-Schulz 직교화로 더 빠르고 안정적인 학습을 제공합니다.

세 가지 추론 모드

모드설명사용 시점
Non-think빠른 응답, 사고 체인 없음라우팅, 분류, 단순 Q&A
Think High명시적 추론 블록디버깅, 중간 복잡도
Think Max최대 노력(384K+ 컨텍스트)복잡한 수학, 다단계 에이전트

권장 샘플링: 모든 모드에서 temperature=1.0, top_p=1.0.

03

벤치마크 수치: 강점과 약점

벤치마크V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80.6% 오픈웨이트 최고96.0%N/A~69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench(Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

실제 GitHub 버그 수정(SWE-bench Verified)에서 V4-Pro의 80.6%는 오픈웨이트 최고 점수로, Gemini 3.1 Pro와 동률입니다. Claude Fable 5는 Verified 96%, 더 어려운 SWE-bench Pro 80.3%로 여전히 전체 1위입니다.

비용 대비 성능 현실(Artificial Analysis)

  • Claude Fable 5: 50점, 작업당 $3.48
  • DeepSeek V4-Pro: 38점, 작업당 $0.03

성능 격차 24%에도 116배 저렴 — 프로덕션 볼륨에서는 무시하기 어렵습니다.

04

DeepSeek V4 vs GPT-5.6 vs Claude Fable 5

V4-ProGPT-5.6 SolClaude Fable 5
오픈웨이트 / 셀프호스팅가능(MIT)불가불가
100만 컨텍스트가능미확인가능
종합 코딩 최고2티어2티어SWE-bench Pro 1위
알고리즘·수학 최고LiveCodeBench 1위강력
출력 비용(오프피크)$0.87/M~$15/M~$50/M
출력 비용(피크)$1.74/M
데이터 주권셀프호스팅 가능불가불가

V4-Pro를 선택할 때: 셀프호스팅, 대량 API 호출, 코딩 에이전트, 예산 내 문서 분석이 필요할 때. Fable 5를 선택할 때: 다중 파일 레포 작업의 절대 성능이 최우선이고 예산이 부차적일 때. GPT-5.6을 선택할 때: 터미널·셸 에이전트 워크플로(Terminal-Bench 2.1 1위)나 Microsoft 365 / Azure 깊은 연동이 필요할 때.

05

피크·오프피크 요금 설명

모델항목오프피크피크
V4-Pro입력(캐시 히트)$0.0035/1M
입력(캐시 미스)$0.435/1M$0.87/1M
출력$0.87/1M$1.74/1M
V4-Flash입력(캐시 히트)$0.0028/1M
입력(캐시 미스)$0.14/1M$0.28/1M
출력$0.28/1M$0.56/1M

피크 시간(베이징 시간): 평일 09:00–12:00, 14:00–18:00.

비용 절감 5단계

  1. 01

    배치 작업을 오프피크(베이징 18:00 이후 또는 09:00 이전)에 예약

  2. 02

    캐시 히트 극대화 — 정적 시스템 프롬프트를 메시지 스택 최상단에 배치

  3. 03

    단순 쿼리는 V4-Flash로 라우팅; 복잡한 추론만 Pro로 에스컬레이션

  4. 04

    24시간 전 요금 변경 공지 이메일 모니터링

  5. 05

    cron/큐로 비실시간 작업을 오프피크 윈도에 고정

피크 시간에도 V4-Pro 출력 $1.74/M은 Claude Opus 4.8($15/M)보다 8.6배 저렴합니다.

06

마이그레이션 가이드: 7월 24일까지

마감: 2026년 7월 24일 15:59 UTC. 레거시 모델명 deepseek-chatdeepseek-reasoner는 영구 비활성화됩니다.

구 모델명신규 대응비고
deepseek-chatdeepseek-v4-flash(non-thinking)대부분 채팅에 드롭인 대체
deepseek-reasonerdeepseek-v4-flash(thinking)또는 deepseek-v4-proPro에서 더 강한 추론
Python · OpenAI SDK
# 구버전(7월 24일 종료)
response = client.chat.completions.create(model="deepseek-chat", messages=[...])

# 신규
response = client.chat.completions.create(
    model="deepseek-v4-pro",  # 또는 deepseek-v4-flash
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4는 OpenAI 호환 API와 Anthropic Messages API를 모두 지원합니다 — 동일한 base_urlmodel만 업데이트하면 됩니다.

07

결론: 2026년 DeepSeek V4는 쓸 만한가?

짧은 답: 예 — 특히 비용, 개방성, 데이터 통제가 중요하다면. SWE-bench Verified 오픈웨이트 최고(80.6%), 경제적으로 실용적인 100만 컨텍스트, 피크 시간에도 모든 폐쇄형 경쟁사를 이기는 요금, 속도와 깊이를 조절하는 다중 추론 모드를 제공합니다.

피크 요금은 24/7 파이프라인에 운영 복잡성을 더하지만, 오프피크 요금은 여전히 공격적으로 저렴하고 완화 전략도 단순합니다.

인용할 핵심 수치

  • SWE-bench Verified: 80.6%(오픈웨이트 최고)
  • 100만 컨텍스트 KV 메모리: V3.2의 10%
  • V4-Pro 오프피크 출력: $0.87/M; 피크 $1.74/M
  • API 마이그레이션 마감: 2026년 7월 24일 15:59 UTC
08

FAQ

에이전트, 수학, 코드 성능이 개선되었고 피크·오프피크 요금이 도입되었습니다. 4월과 동일한 MoE 아키텍처이지만 이제 프로덕션급입니다.

베이징 시간 평일 09:00–12:00, 14:00–18:00. 요금 2배 적용.

예 — 2026년 7월 24일 영구 비활성화. deepseek-v4-flash 또는 deepseek-v4-pro로 마이그레이션하세요.

마무리

DeepSeek V4 GA는 오픈웨이트 가성비의 새 기준을 세웠지만, 프로덕션 배포는 여전히 API 마이그레이션, 피크 시간 스케줄링, 실제 개발 환경에서의 에이전트 오케스트레이션을 요구합니다. Windows나 Linux를 주로 쓰면서 OpenClaw 멀티모델 라우팅 검증, SWE-bench 벤치마크, 7월 24일 전 설정 변경 배치 테스트를 위해 네이티브 macOS GUI 세션이 필요하다면 Mac 구매는 비용이 크고 SSH만으로는 시스템 권한 대화상자를 처리할 수 없습니다. VNCMac 원격 Mac 임대로 격리된 노드에서 시간 단위 VNC 접속으로 V4 API 연동, 장문 컨텍스트 에이전트 작업, 마이그레이션 검증을 마친 뒤 스프린트가 끝나면 과금을 중단할 수 있습니다. Mac 임대 플랜에서 시작하세요.