가중치 공개까지 5일 · Modified MIT · 2.8T MoE · 100만 토큰 · 4-bit 약 1.4TB · API $3/$15
핵심 답변: Moonshot AI(월지암면)는 2.8조 파라미터 MoE 모델 Kimi K3의 전체 가중치를 2026년 7월 27일 Modified MIT 라이선스로 Hugging Face에 공개합니다. 컨텍스트는 1,048,576 토큰입니다. API와 Kimi 제품군은 7월 16일부터 가동 중입니다. 본문은 7/16~7/27 타임라인, Claude Fable 5·GPT-5.6 Sol 대비 승패, 캐시 포함 API 실비용, 1.4TB/64+ GPU 자체 호스팅 현실, 공개일 체크리스트, 업계 의미를 — 노트북 착각 없이 — 정리합니다.
한 줄: K3는 「Fable 5 킬러」가 아닙니다. AA Intelligence Index 3위(57.1 vs 59.9 / 58.9)이지만, 비용은 약 1/3 수준으로 프론티어급에 근접합니다. 클로즈드 모델에 없는 100만 토큰과 다운로드 가능한 가중치가 차별점입니다.
이중 출시: API 가동 ≠ 가중치 DL 가능.
「로컬 실행」 과장: 4-bit 약 1.4TB, 64+ 가속기 — Ollama-on-노트북 급이 아님.
클로즈드 프리미엄: Fable 5 태스크 단가 AA 기준 K3 대비 약 65.8% 높음(K3 $0.94/태스크).
장컨텍스트 KV 비용: 긴 창을 광고해도 프로덕션에서 못 쓰는 모델이 많은 가운데 K3는 1M을 설계상 지원.
규제 리스크: 클로즈드 가중치는 중단 가능. 공개된 오픈 웨이트는 「취소」 불가.
| 날짜 | 이벤트 |
|---|---|
| 2026-07-16 | API + Kimi 스택 가동; Artificial Analysis 벤치 공개 |
| 2026-07-17 | WAIC; 국산 AI 마일스톤 보도 |
| 2026-07-27 | Hugging Face 가중치 DL + 기술 보고서 |
kimi k3 공개일, kimi k3 다운로드, kimi k3 hugging face 검색은 7월 27일 전후로 급증합니다. 공개 후 수 시간 내 dateModified를 갱신하고 「예정」을 「공개됨」으로 바꾸세요.
| 항목 | 값 |
|---|---|
| 파라미터 | 2.8조(현재 최대급 오픈 웨이트) |
| 아키텍처 | 스파스 MoE: Stable LatentMoE, 896 expert 중 16 활성/token |
| 어텐션 | Kimi Delta Attention(KDA) + AttnRes + Gated MLA |
| 컨텍스트 | 1,048,576 토큰 |
| 모달리티 | 네이티브 비전(텍스트+이미지; 제품에서 동영상); 텍스트 출력 |
| 가중치 형식 | MXFP4 가중치 + MXFP8 활성화(저정밀 네이티브 학습) |
| K2 대비 스케일 효율 | 동일 연산량에서 약 2.5배 |
| 장컨텍스트 decode | 1M 토큰에서 최대 6.3배 빠름(KDA) |
| 모델 | AA Intelligence Index |
|---|---|
| Claude Fable 5 | 59.9 |
| GPT-5.6 Sol | 58.9 |
| Kimi K3 | 57.1(189개 중 3위) |
Moonshot은 총합에서 Fable 5·Sol에 못 미친다고 드물게 공개했으며, 하네스 민감도와 모호한 의도에 대한 과잉 반응을 이유로 들었습니다. 평가일 2026-07-16, 하네스는 모델마다 다릅니다 — 독립 재평가 전까지 방향성 참고로 보세요.
| 항목 | 100만 토큰당 |
|---|---|
| 입력(캐시 미스) | $3.00 |
| 입력(캐시 히트·자동) | $0.30 |
| 출력 | $15.00 |
제목·스니펫에는 오픈 웨이트를 쓰고 「오픈소스」 단독 표현은 피하세요. K3는 Modified MIT로 가중치 + 기술 보고서를 공개하며, 학습 코드·데이터는 포함되지 않습니다. r/LocalLLaMA와 HN에서 이 구분이 핵심 논점입니다.
7월 27일 예상: Moonshot HF 조직 업로드, LICENSE 전문, vLLM KDA/prefix-cache 지원, K2 패턴에 이은 Ollama/GGUF 양자화(며칠~수주 지연).
솔직히: 소비자 GPU로는 불가능합니다.
HF 저장소 완전성(shard, index, config)
LICENSE 전문(Modified MIT 조항)
양자화 산출물(MXFP4 / GGUF)
vLLM / SGLang 실행 명령과 최소 HW 메모
독립 기관 장컨텍스트·BrowseComp 재평가
프론티어 격차 축소: AA 스프레드 수 포인트 — 능력만으로 클로즈드 프리미엄 정당화 어려움.
지정학: WAIC 타이밍; 미국이 Anthropic Fable/Mythos 일시 delist(7월 1일 복귀) — 규제는 API는 막지만 공개 가중치는 못 막음.
중국 물결: GLM-5.2, DeepSeek V4 Pro(1.6T), MiniMax — K3는 오픈 웨이트 push의 정점.
Moonshot 부활: DeepSeek R1 이후 침체에서 K2 → K2.5 → K3 오픈 웨이트 cadence로.
| 시나리오 | 권장 | 이유 |
|---|---|---|
| 지금 시험 / 코딩 Agent | API 또는 Kimi Code | 7월 16일부터 가동; 캐시로 비용 절감 |
| 7/27 이후 fine-tune / residency | 자체 호스트(64+ GPU) | 전체 가중치 + 컴플라이언스 필요 |
| 비용 최우선 | DeepSeek V4 Pro API | 출력 $3.48/M |
| 장기 추론·종합 지수 | Claude Fable 5 | GDPval / 종합 index 리드 |
| Ollama/GGUF 대기 | K2 후속 추적 | 소비자 양자화는 HF 공개보다 늦음 |
출처: kimi.com/en/blog/kimi-k3, platform.kimi.ai, Artificial Analysis(7월 16일), VentureBeat, Northflank, r/LocalLLaMA, Hacker News.
2026년 7월 27일 Hugging Face에 기술 보고서와 함께. API는 7월 16일부터 이용 가능.
Modified MIT 오픈 웨이트 — 완전 오픈소스(학습 스택·데이터 미공개)는 아닙니다.
$3 / 캐시 $0.30 / 출력 $15 per 1M tokens. AA 테스트 약 $0.94/태스크.
불가 — 4-bit 약 1.4TB, 64+ 가속기 권장. API 이용이 현실적.
종합 지수 57.1 vs 59.9로 열세. 코딩/UI 계열 여러 승리. 태스크당 비용은 훨씬 저렴.
Modified MIT — 7월 27일 Hugging Face LICENSE에서 정확한 조항 확인.
7월 27일 오픈 웨이트 공개로 2.8T 모델이 책상 GPU에 올라가지는 않습니다. 대부분은 API, Kimi Code, OpenRouter로 K3를 씁니다. 자체 호스팅은 엔터프라이즈 규모의 베팅입니다. 워크플로에 실제 macOS GUI — Kimi Code Agent, OpenClaw 라우팅, SSH로는 누를 수 없는 Xcode 서명 대화상자 — 가 필요하면 하드 구매는 비싸고 유휴 노드는 감가상각됩니다. VNCMac 원격 Mac 임대로 VNC 데스크톱에서 장컨텍스트 코딩과 Agent 플로우를 검증하고 스프린트 후 중지하세요. Mac 임대 요금, 7월 17일 Kimi K3 심층 평가에서 아키텍처 상세를 확인하세요.