2026년 8월 12–17일 · 피크 인상 1100% 초과 · 2.4조 가중치 공개 · 동일 기반 후학습
도입: 8월 12일부터 17일까지 닷새 동안 중국 대형 모델 진영은 모순처럼 보이면서도 맞물리는 세 수를 두었습니다. DeepSeek는 일부 구간 API를 최대 1100% 넘게 올렸고, 알리는 한 번도 공개하지 않았던 Qwen-Max급 2.4조 파라미터 가중치를 풀었으며, 지푸는 같은 기반으로 후학습만으로 코딩 점수를 수 배 끌어올렸습니다. 세 회사, 세 전략은 같은 신호를 가리킵니다. 국산 모델은 가격 경쟁에서 가격 지배권 경쟁으로 옮기고 있습니다. 타임라인·요금표·세 논리와 검증 절차를 사이트 내 V4-Flash 평가, Qwen3.8-Max 해설, GPT-5.6 인하와 함께 읽으십시오.
헤드라인 인상률은 청구서 인상률이 아닙니다. 1100% 초과는 V4-Pro 피크 캐시 적중 입력만입니다. 실청구를 움직이는 것은 출력 350%와 캐시 미스 입력입니다.
공식가가 더 이상 자동 최저가가 아닙니다. 피크 공식 API는 GMI Cloud·Novita 등 일부 재판매보다 높아졌습니다.
가중치 공개는 Apache 2.0이 아닙니다. Qwen3.8-Max는 맞춤 라이선스로 대형 고객 수익을 남깁니다.
「국산=최저가」가 무너지고 있습니다. 비피크 DeepSeek는 아직 Claude Opus 5보다 싸지만, Qwen 국제와 Luna는 적어도 한 축에서 더 쌉니다.
| 날짜 | 사건 |
|---|---|
| 7월 16일 | 문샷 Kimi K3(2.8조 파라미터) 공개. 이미 미측 안보 관심을 불렀음 |
| 8월 2–3일 | 알리 Qwen3.8-Max 예고 후 클라우드 API 오픈 |
| 8월 10일 | Meta Muse Glimmer(300억, Apache 2.0) 공개, 플래그십 Muse Spark 1.2 가중치 「곧 공개」 예고 |
| 8월 12일 | 알리가 ModelScope/Hugging Face에 Qwen3.8-2.4T-A95B 공개. 같은 날 xAI Grok 4.6 |
| 8월 13일 | DeepSeek-V4-Pro 정식판, 8월 17일부터 인상 공지. 구글은 인하한 Gemini 3.7 Flash |
| 8월 14일 | 지푸 GLM-5.3 공개. 기반은 GLM-5.2와 같은 7430억 |
| 8월 17일 0시(베이징) | DeepSeek 신요금 발효 |
더 멀리 보면 7월 30일 OpenAI는 최저 구간 GPT-5.6 Luna를 80% 내렸고, 8월 6–7일에는 무료 사용자 기본 모델로 두고 텍스트를 무제한으로 열었습니다. 중국 진영이 인상과 개원을 더하는 같은 주에 미국 진영은 무료와 인하를 더했습니다. 우연이 아니라 같은 가격 전쟁의 양면입니다.
| 과금 항목(100만 tokens) | 인상 전 | 비피크(신) | 피크(신) | 피크 상승 |
|---|---|---|---|---|
| V4-Flash 캐시 적중 입력 | ¥0.02 | ¥0.05 | ¥0.10 | 약 400% |
| V4-Flash 캐시 미스 입력 | ¥1.0 | ¥1.5 | ¥3.0 | 200% |
| V4-Flash 출력 | ¥2.0 | ¥4.5 | ¥9.0 | 350% |
| V4-Pro 캐시 적중 입력 | ¥0.025 | ¥0.15 | ¥0.30 | 약 1100% |
| V4-Pro 캐시 미스 입력 | ¥3.0 | ¥4.5 | ¥9.0 | 200% |
| V4-Pro 출력 | ¥6.0 | ¥13.5 | ¥27.0 | 350% |
출처는 DeepSeek 공식 공지를 华尔街见闻·IT之家·V2EX 등과 교차 확인한 것입니다. 적중 입력 상승이 가장 크지만(약 12배/1100%+) 절대액은 작고, 헤비 호출에 더 아픈 것은 출력 350%와 미스 입력입니다. 제3자 시산으로는 월 약 8400만 tokens·비피크 위주·적중 약 절반인 헤비 사용의 실청구가 약 1.8배입니다.
| 항목 | 내용 |
|---|---|
| 파라미터 | 총 2.4조, 활성 950억(MoE, 전문가 512, 라우팅 10+공유 1) |
| 컨텍스트 | 공개 가중치 원생 26.2만 tokens, 약 101만까지 확장. 클라우드 Max 기본 100만 |
| 공개 리듬 | 8월 2일 예고→3일 API→12일 가중치 |
| 국제 API | 입력 $2 / 출력 $6(100만 tokens) |
| 라이선스 | Apache 2.0이 아닌 맞춤 Qwen3.8-Max License |
| 의미 | 알리 최초 Max급 플래그십 공개. 3.5/3.6/3.7 Max는 API만 |
| 벤치마크 | GLM-5.2 | GLM-5.3 | 변화 |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 |
| DeepSWE v1.1 | 46.2% | 66.9% | +20.7 |
| Agents' Last Exam(CLI) | 23.8% | 28.5% | +4.7 |
| CyberGym | 77.2% | 84.5% | +7.3 |
| AutomationBench | 26.2% | 48.2% | +22.0 |
지푸 자체 측정이며 제3자 재실행은 없습니다. Terminal-Bench 3.0에서 GPT-5.6 Sol 34.6%, Claude Fable 5 33.7%에 아직 못 미치며 「개원 1군」입니다.
「따라 올리기」로 읽기 쉽지만, 구조는 연산 청구서를 처음 드러낸 움직임에 가깝습니다. 예전 일률 저가는 사용자를 모으고 적중률과 비피크로 원가를 희석했습니다. 호출이 지수로 늘고 GPU가 못 따라가면 버틸 수 없습니다. 공지의 「더 유연한 워크로드 스케줄링을 권장」은 「피크 연산이 부족하니 부하를 옮기라」는 뜻입니다.
피크 공식가가 GMI Cloud·Novita 등 일부 재판매보다 높아진 점은 해외 보도가 거의 놓칩니다. 「공식이 항상 최저」라는 평판 전제가 처음 깨졌습니다.
Qwen3.8-Max 공개는 단순한 자선이 아닙니다. 2.4조 체크포인트를 무료 배포하면서 Apache 2.0이 아닌 맞춤 라이선스를 붙였습니다. 최근 12개월 5천만 달러 초과의 모델 애즈 어 서비스 또는 AI 업무 도우미는 별도 상용 협상이 필요하고, MAU 1억 초과 또는 월매출 2천만 달러 초과는 모델명 명시를 요구합니다.
개발자 마음(특히 해외)을 얻되, 추론 사업을 세울 수 있는 대형 고객에게는 협상력을 남기는 이중 구조입니다. 완전 Apache 2.0인 Muse Glimmer와 「개원 정도」가 다릅니다. 미·EU·영·한 다운로드 금지 소문은 거짓이며 공식 본문에 지역 조항이 없습니다.
점수가 아니라 얻는 방식이 핵심입니다. 기반은 GLM-5.2와 같은 7430억이고 재사전학습은 없으며, 강화학습 환경을 넓힌 후학습만으로 Terminal-Bench 3.0을 4.6%에서 28.3%로 약 6배 올렸습니다. 사전학습 한계수익이 둔화하는 지금, 후학습 RL 규모화는 새 레버이고 천억급 기반 재학습보다 문턱이 낮습니다. 중견 랩도 「인테리어」로 따라붙을 수 있다는 함의입니다.
| 모델 | 입력(100만 tokens) | 출력(100만 tokens) | 가중치 공개 |
|---|---|---|---|
| DeepSeek V4-Pro(피크) | ¥9.0(약 $1.26) | ¥27.0(약 $3.78) | 없음 |
| DeepSeek V4-Pro(비피크) | ¥4.5(약 $0.63) | ¥13.5(약 $1.89) | 없음 |
| Qwen3.8-Max(국제) | $2 | $6 | 있음(맞춤 라이선스) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | 없음 |
| Claude Opus 5(알리 공개 배수 추정) | 약 $5 | 약 $25 | 없음 |
환율은 약 ¥7.15/$1 참고입니다. 비피크 V4-Pro는 아직 Opus 5보다 싸지만 전장 최저가는 아닙니다. Qwen 국제와 Luna가 비피크를 밑돕니다. 「국산=최저가」는 2025년과 2026년 초까지 맞았지만 더는 안전한 가정이 아닙니다.
지난 한 달 중국 선두 랩은 국내 금융 매체가 「一周三更」이라 부르는 밀도로 출고했습니다. DeepSeek·알리·지푸에 더해 7월 16일 Kimi K3(2.8조 공개)와 MiniMax H3도 이어졌습니다. 국내 보도는 「중국 개원이 세계 AI 가격을 다시 매긴다」고 강하게 프레이밍합니다.
미국 진영은 반대입니다. OpenAI는 7월 30일 최저 구간을 80% 내리고 다음 주 무료·무제한으로 만들었으며, 구글은 8월 13일 3주 전 선행 모델의 반값으로 Gemini 3.7 Flash를 냈습니다. 중국은 플래그십 공개와 단계 인상, 미국은 소비단 무료와 인하. 둘 다 진짜 전략이며 깔때기의 다른 층을 최적화합니다.
지정학 층도 있습니다. Kimi K3 공개는 이미 미측 심사 관심을 불렀고, 이 창에서 2.4조 플래그십을 푸는 알리의 선택은 「규제가 조여지기 전 국제 마음과 기술 대등 서사를 굳힌다」는 해석이 있습니다. 확정 사실이 아니라 해석이지만, 영어권 제품 뉴스만 보면 잘 안 보이는 맥락입니다.
헤드라인 인상률이 적중 입력·미스 입력·출력 중 어디인지 요금표로 가른다
배치 가능한 Agent·평가·회귀를 베이징 9–12시·14–18시 밖으로 옮긴다
시스템 프롬프트를 고정하고 긴 접두를 재사용해 적중률을 올리고 미스+출력 이중 과금을 피한다
Qwen3.8-Max 라이선스를 읽는다. 개인·내부는 대체로 괜찮고, MaaS/AI 도우미 연매출 5천만 달러 초과는 별도 협상
코딩 Agent를 기반 크기만으로 고르지 않는다. GLM-5.3은 동일 기반 후학습으로 Terminal-Bench를 약 6배 올렸다
독립 원격 Mac GUI에서 OpenClaw로 DeepSeek 비피크·Qwen 국제·GLM을 같은 워크플로로 일주일 맞춰 본 뒤 기본 모델을 잠근다
장면마다 다릅니다. 베이징 시간 9–12시·14–18시 밖 비피크가 많고 캐시 적중률이 높은 헤비 사용자라면 헤드라인 350%·1100%보다 실청구 상승은 작고, 제3자 시산은 약 1.8배입니다. 피크 집중·적중률이 낮으면 헤드라인에 가까워집니다.
개인·내부 사용은 대체로 영향이 없습니다. 다만 모델 애즈 어 서비스 또는 AI 업무 도우미로 최근 12개월 해당 사업 매출이 5천만 달러를 넘으면 알리와 별도 상용 라이선스가 필요합니다. MAU 1억 초과 또는 월매출 2천만 달러 초과 제품은 모델명을 눈에 띄게 표시해야 합니다.
기반은 같은 7430억 파라미터이며 재사전학습은 없습니다. 후학습에서 강화학습 환경을 크게 넓힌 결과입니다. 지금은 후학습 규모화 자체가 독립 레버입니다.
아닙니다. 공식 본문에 지역 제한이 없습니다. 제한은 매출 규모에 묶인 상용 조항이며 소재지와 무관합니다.
부분 회귀일 뿐입니다. Glimmer는 300억 증류 모델이고 플래그십 Muse Spark 1.2는 아직 비공개입니다. 저커버그는 가중치 공개를 예고한 상태이며, 실현돼야 미국 플래그십 개원이라 부를 수 있습니다.
시간대별 요금이 발효되면 노트북이나 장기 보유 머신의 Agent는 두 약점을 드러냅니다. 피크를 비키기 어렵고, 세 회사 청구를 같은 GUI 세션에서 나란히 보기 어렵습니다. 헤드라인 1100%만 쫓거나 공개 가중치를 「마음대로 상용」으로 읽으면 숨은 비용이 다음 달 청구가 됩니다. DeepSeek/Qwen/GLM 라우팅, 캐시 접두, 비피크 작업은 실험이 끝나면 끌 수 있는 원격 Mac에 나누는 편이 분명합니다. VNCMac 원격 Mac에서 OpenClaw를 돌리고 비피크와 피크를 맞춘 뒤 기본값을 잠그십시오. Mac 플랜에서 시작하고, 연산 청구가 가격으로 어떻게 전달되는지는 DeepSeek 2차 라운드 자금도 참고하십시오.
출처: DeepSeek 공식 요금 공지(华尔街见闻, IT之家, AIGC.cn, V2EX 교차), 알리 Qwen 공식 저장소(Hugging Face/ModelScope)와 SCMP 라이선스 보도, 지푸(Z.ai) GLM-5.3 공식 페이지 및 VentureBeat·StableLearn, Meta AI Research 공식과 VentureBeat의 Muse Glimmer 보도, 第一财经·搜狐财经 등. 가격·라이선스·벤치는 공개 정보 정리입니다. 재게시 전 공식을 재확인하고, 국산 칩·Cursor 취약점·수출 규제 풍문은 미검증으로 다루십시오.