8/3 GA · 950B 활성 · 천문办公 · Kimi K3 / DeepSeek V4 비교 · 「오픈소스」 라벨 논쟁
누가: 알리바바(阿里巴巴). 언제: 2026년 8월 3일. 무엇을: 플래그십 대형언어모델 천문(千问) Qwen3.8-Max 정식 출시(GA)와 Agent 제품 「천문办公(千问办公)」 동시 상线. 규모: 총 파라미터 2.4조, 활성 950B, 100만 토큰 컨텍스트. 결론: Arena 텍스트 상위 8위 중 유일한 비(非) Anthropic 모델이지만, 벤치마크는 벤더 자체 측정·가중치는 아직 미공개 — 본문은 공개 자료만으로 타임라인, 핵심 수치, Kimi K3·DeepSeek V4 횡비, 「오픈소스」 라벨 쟁점, 5단계 도입, FAQ를 정리하고, OpenClaw / Qoder 등 Agent 연동을 원격 Mac에서 검증하는 현실 경로를 설명합니다.
「오픈소스」 라벨이 가중치보다 먼저: qwen.ai에 Open-Source 표기가 있으나 Hugging Face / ModelScope 저장소·라이선스·확정일은 없고 「다음 주」 약속만 존재
벤치마크는 전부 vendor-run: PaperBench, QwenSWEBench, RecreationBench 등 알리 자체 프레임워크; Arena 순위는 Preliminary(예비) 표기
활성 파라미터 공개 지연: 7월 프리뷰는 활성량·벤치 미공개; GA에서야 950B 보충 — 독립 평가 기관이 투명성 부족을 지적
전체 버전 로컬 배포 비현실: 2.4T 총 파라미터는 MoE여도 다중 노드 데이터센터 필요; 개인·팀은 API 또는 Qwen3.8-27B 대기가 현실적
Agent 검증은 GUI 필요: OpenClaw, Claude Code, Qoder CLI 연동 시 macOS 권한 팝업·브라우저 OAuth는 순수 SSH로 처리 불가
| 날짜 | 이벤트 |
|---|---|
| 2026-07-16 | 월지암면(Moonshot) Kimi K3(2.8T, 896 expert 중 16 활성) 출시 — 독립 벤치·기술 보고서 강조 |
| 2026-07-19 | Qwen3.8-Max 프리뷰 개방, 정가 10% 요금; 활성 파라미터·벤치 미공개, ToS는 자동화 프로덕션 호출 금지 |
| 2026-07-27 | Kimi K3 약속대로 Hugging Face 가중치 공개, MoonEP 등 인프라 동시 오픈 |
| 2026-07-31 | DeepSeek V4-Flash 정식판 — 파라미터 동일, 9개 Agent/코딩 벤치에서 V4-Pro 상회 |
| 2026-08-03 | Qwen3.8-Max GA, 전체 벤치 표 공개; 「천문办公」 상线; 알리 홍콩 주가 약 +7%, 미국 약 +4.5% |
| 예상 8월 10일 전후 | Qwen3.8-Max·Qwen3.8-27B 가중치 Hugging Face / ModelScope 계획(집필 시점 미상线) |
| 항목 | Qwen3.8-Max |
|---|---|
| 출시일 | 2026년 8월 3일(GA) |
| 총 / 활성 파라미터 | 2.4조 / 950B |
| 아키텍처 | Qwen3.5 기반 스파스 MoE + 혼합 어텐션 |
| 컨텍스트 | 100만 토큰(사고 모드 약 98.3만, 출력 상한 13.1만) |
| 입력 모달리티 | 텍스트 / 이미지 / 동영상 |
| API 요금 | 입력 $2/M, 출력 $6/M(암시 캐시 $0.25, 명시 캐시 쓰기 $2.5·읽기 $0.17) |
| 국내 요금 | 입력 12元/M, 출력 36元/M, 캐시 히트 최저 1.5元 |
| Arena 텍스트(8/1 스냅샷) | 5위, 1496점(Preliminary); 상위 8 중 유일 비 Anthropic |
| Arena 비전 | 2위 — Claude Fable 5에 이어 |
| PaperBench(알리 자체) | 93.0(전代 +28.2) |
| SWE-bench Pro(알리 자체) | 67.7 — Fable 5 80.0에 열세 |
| 가중치 오픈 | 「다음 주」 약속, 집필 시점 미공개 |
인용 가능한 수치: 2.4T/950B · $2/$6 per M · Arena Text #5 (Preliminary) · OpenAI + Anthropic 호환 API.
Qwen3.8-Max는 Qwen3.5 스파스 MoE를 계승합니다. 총 2.4조 파라미터 중 토큰당 활성 950B — 추론 비용은 총량이 아니라 활성량을 따르므로 API 단가는 Claude Opus 5($5/$25), Fable 5($10/$50)보다 낮습니다.
reasoning_effort 3단계(low / medium / xhigh, 기본 xhigh)는 enable_thinking 또는 Anthropic 호환 reasoning.effort로 속도·깊이를 조절 — Agent 모델의 표준 비용 다이얼입니다.
장기 자율 태스크가 이번 핵심: 16일 무인 개입 코딩, 500+ 스텝 칩 설계 최적화, 자체 RecreationBench(블랙박스 실앱 복원). 일부 과정은 GitHub qwen-code-dev-bot/oh-my-cli에서 확인 가능하나, 평가 세트는 알리 자체 — 제3자 감사 아님.
생태계: 「천문办公」 동시 연동, API는 OpenAI·Anthropic 프로토콜 호환 — Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw 등 주류 Agent 도구链에 바로 연결.
| 모델 | 총/활성 | 컨텍스트 | 요금(入/出 per M) | 가중치 | 독립 평가 |
|---|---|---|---|---|---|
| Qwen3.8-Max | 2.4T / 950B | 1M | $2 / $6 | 미공개(약속 중) | 없음 |
| Kimi K3 | 2.8T / ~500B | ~1.05M | $3 / $15 | 공개(7/27) | AA Index ≈57.1 |
| DeepSeek V4-Pro | 1.6T / 490B | 1M | 미전면 공개 | 공개 | SWE-bench Verified 80.6% |
| DeepSeek V4-Flash | V4-Pro 동일 | 1M | 미전면 공개 | 공개 | 9개 벤치 V4-Pro 상회 |
| Claude Fable 5 | 미공개 | 1M | $10 / $50 | 클로즈드 | Arena Text #1 |
유일하게 비교 가능한 독립 블라인드 테스트(269개 파일 실제 아키텍처 과제): Kimi K3 83점, Qwen3.8-Max 프리뷰 80점 — 동급·호각 승부이지 일방적 압도가 아닙니다. K3는 가중치·제3자 데이터가 이미 있고, Qwen은 API가 더 저렴하고 네이티브 멀티모달 범위가 넓습니다. 상세는 Kimi K3 오픈 웨이트를 참고하세요.
공식 사이트 Open-Source 표기 vs Hugging Face / ModelScope 저장소·라이선스·확정일 부재
공개 벤치 전부 알리 자체 프레임워크; Artificial Analysis·Arena 공식팀 GA판 독립 재현 없음
비교표 각주에 「Fable 5 결과 fallback 가능성」 언급하나, 자사 테스트 방법론은 재현 수준까지 공개되지 않음
프리뷰 ToS는 자동화 프로덕션 호출 금지, model card·안전 평가 없음 — 여러 기관이 즉시 프로덕션 이전 비권장
주의: 성능 부재를 의미하지는 않습니다 — 독립 블라인드 테스트에서 Kimi K3와 동급입니다. 다만 「GPT-5.6 Sol 상회」 등 결론은 현재 알리 일방 주장이며, 가중치 공개·제3자 재현을 기다려야 합니다.
QwenCloud / Model Studio에서 API 개통, OpenAI 또는 Anthropic 호환 엔드포인트로 기본 대화·reasoning.effort 3단계 검증
SWE-bench Pro, Arena 예비 순위 대조 — 내 워크로드가 강점(장기 Agent, 멀티모달)인지 약점(HLE 43.6)인지 확인
OpenClaw / Qoder 설정에서 base URL·API Key 전환, 소량 프로브로 Kimi K3 / DeepSeek 대비 지연·비용 비교
Hugging Face Qwen3.8-27B 오픈소스 진행 추적 — 온프레미스 필요 시 2.4T보다 27B가 현실적
실제 macOS GUI에서 OAuth, 브라우저 DevTools, 시스템 권한 검수(아래 VNCMac 시나리오)
{
"model": "qwen3.8-max",
"reasoning": { "effort": "xhigh" },
"enable_thinking": true,
"max_tokens": 8192
}
API는 QwenCloud에서 OpenAI·Anthropic 호환으로 이용 가능합니다. 가중치는 아직 미공개이며 8월 10일 전후 Hugging Face / ModelScope 저장소·라이선스 공개 예정입니다.
권위 있는 단일 헤드투헤드 없음. 독립 블라인드 테스트 K3 83점 vs Qwen 프리뷰 80점 — 동급. K3는 가중치·제3자 벤치 보유; Qwen은 API 저렴·멀티모달 넓음.
MoE 활성 950B — API 비용은 천억급 수준. 전체 2.4T 로컬은 데이터센터급. 현실적 대안: API 또는 Qwen3.8-27B.
참고용. 알리 자체 프레임워크 결과, Arena는 Preliminary. 제3자 재현 또는 자체 A/B 권장.
중국 Apple Intelligence는 압축 Qwen 온디바이스. 개발자는 $2/$6 API로 OpenClaw 등 Agent 도구链에 저렴하게 연결.
Qwen3.8-Max는 국산 대형모델을 Arena 텍스트 5위에 올리고, $2/$6 API·OpenClaw 호환 프로토콜로 Agent 이전 장벽을 낮췄습니다 — 그러나 가중치 미공개·벤치 제3자 미검증 상태에서 「오픈소스」 라벨은 현재 의도를 설명할 뿐, 납품된 산출물은 아닙니다. Windows/Linux 메인 머신을 쓰면서 실제 macOS GUI에서 천문办公·OpenClaw 다중 모델 라우팅, iOS 빌드·Agent 벤치 병행 검증이 필요하면 Mac 구매는 비싸고 순수 SSH는 OAuth·시스템 팝업을 못 누릅니다.
VNCMac 원격 Mac 임대로 VNC 데스크톱을 시간 단위 개통, 격리 노드에서 Qwen3.8-Max API·Agent 워크플로를 검수하세요. Mac 임대 요금, Kimi K3 오픈 웨이트, OpenClaw VNC 그래픽 배포에서 배경을 확인하세요.
출처: 알리바바 공식 블로그, Arena.ai, Apidog, TechNode, Apple Intelligence 중국版 관련 보도 등. 최신 정보는 공식 공지를 확인하세요.