오픈 웨이트 2026년 7월 22일 약 22분 Kimi K3 7월 27일

Kimi K3 오픈 웨이트 공개:
일정·벤치마크·실행 현실

가중치 공개까지 5일 · Modified MIT · 2.8T MoE · 100만 토큰 · 4-bit 약 1.4TB · API $3/$15

Kimi K3와 Claude Fable 5 오픈 웨이트 공개 벤치마크 비교 개념도

핵심 답변: Moonshot AI(월지암면)는 2.8조 파라미터 MoE 모델 Kimi K3의 전체 가중치를 2026년 7월 27일 Modified MIT 라이선스로 Hugging Face에 공개합니다. 컨텍스트는 1,048,576 토큰입니다. API와 Kimi 제품군은 7월 16일부터 가동 중입니다. 본문은 7/16~7/27 타임라인, Claude Fable 5·GPT-5.6 Sol 대비 승패, 캐시 포함 API 실비용, 1.4TB/64+ GPU 자체 호스팅 현실, 공개일 체크리스트, 업계 의미를 — 노트북 착각 없이 — 정리합니다.

01

요약: 7월 27일에 달라지는 것

  • 7월 16일: API, Kimi App, Kimi Work, Kimi Code 출시. Artificial Analysis 독립 점수 57.1 공개.
  • 7월 17일: 상하이 WAIC 개막. 국영 매체가 K3를 국산 AI 이정표로 보도.
  • 7월 27일: 완전 오픈 웨이트 + 기술 보고서(아키텍처·학습·평가).

한 줄: K3는 「Fable 5 킬러」가 아닙니다. AA Intelligence Index 3위(57.1 vs 59.9 / 58.9)이지만, 비용은 약 1/3 수준으로 프론티어급에 근접합니다. 클로즈드 모델에 없는 100만 토큰과 다운로드 가능한 가중치가 차별점입니다.

도입 전 알아둘 함정

  1. 01

    이중 출시: API 가동 ≠ 가중치 DL 가능.

  2. 02

    「로컬 실행」 과장: 4-bit 약 1.4TB, 64+ 가속기 — Ollama-on-노트북 급이 아님.

  3. 03

    클로즈드 프리미엄: Fable 5 태스크 단가 AA 기준 K3 대비 약 65.8% 높음(K3 $0.94/태스크).

  4. 04

    장컨텍스트 KV 비용: 긴 창을 광고해도 프로덕션에서 못 쓰는 모델이 많은 가운데 K3는 1M을 설계상 지원.

  5. 05

    규제 리스크: 클로즈드 가중치는 중단 가능. 공개된 오픈 웨이트는 「취소」 불가.

02

공개 일정: API vs 오픈 웨이트

날짜이벤트
2026-07-16API + Kimi 스택 가동; Artificial Analysis 벤치 공개
2026-07-17WAIC; 국산 AI 마일스톤 보도
2026-07-27Hugging Face 가중치 DL + 기술 보고서

kimi k3 공개일, kimi k3 다운로드, kimi k3 hugging face 검색은 7월 27일 전후로 급증합니다. 공개 후 수 시간 내 dateModified를 갱신하고 「예정」을 「공개됨」으로 바꾸세요.

03

Kimi K3란: 핵심 스펙

항목
파라미터2.8조(현재 최대급 오픈 웨이트)
아키텍처스파스 MoE: Stable LatentMoE, 896 expert 중 16 활성/token
어텐션Kimi Delta Attention(KDA) + AttnRes + Gated MLA
컨텍스트1,048,576 토큰
모달리티네이티브 비전(텍스트+이미지; 제품에서 동영상); 텍스트 출력
가중치 형식MXFP4 가중치 + MXFP8 활성화(저정밀 네이티브 학습)
K2 대비 스케일 효율동일 연산량에서 약 2.5배
장컨텍스트 decode1M 토큰에서 최대 6.3배 빠름(KDA)
04

벤치마크: Claude Fable 5·GPT-5.6 Sol 승패

모델AA Intelligence Index
Claude Fable 559.9
GPT-5.6 Sol58.9
Kimi K357.1(189개 중 3위)

K3가 이기는 영역

  • Frontend Code Arena 1위(개발자 블라인드 선호 Fable·Sol 상회)
  • Automation Bench, SpreadsheetBench 2 1위
  • BrowseComp 91.2 1위(1M 비압축 전략 ~90.4+)
  • SWE Marathon 42.0 — 장시간 코딩(GPT-5.5 / GLM-5.2는 teens로 붕괴)
  • Terminal Bench 2.1 88.3 — Sol 88.8에 근접
  • Program Bench 77.8 — Sol 77.6 소폭 상회
  • FrontierSWE 81.2 — Sol 71.3 크게 상회(Fable 86.6에는 못 미침)

아직 부족한 점

  • GDPval v2 Elo 1668–1687 vs Fable 1760 / Sol 1748
  • DeepSWE 67.5 vs Sol 73.0
  • 환각률 K2.6 대비 상승(Moonshot 인정); Reddit에서도 상위 클로즈드 대비 지적
  • 다듬기 품질·세션 편차 Fable 5 / Sol에 못 미침

Moonshot은 총합에서 Fable 5·Sol에 못 미친다고 드물게 공개했으며, 하네스 민감도와 모호한 의도에 대한 과잉 반응을 이유로 들었습니다. 평가일 2026-07-16, 하네스는 모델마다 다릅니다 — 독립 재평가 전까지 방향성 참고로 보세요.

05

API 가격: 캐시 포함 실비용

항목100만 토큰당
입력(캐시 미스)$3.00
입력(캐시 히트·자동)$0.30
출력$15.00
  • 중국 벤더 중 최상위 대역이지만 Western 품질 tier와 유사 — Claude Opus 4.8 태스크 단가보다는 낮음.
  • AA 측정 $0.94/태스크: GPT-5.6 Sol 대비 9.4% 저렴, Claude Fable 5 대비 65.8% 저렴.
  • 코딩 워크로드에서 캐시 히트율 90%+ 보고 — 실효 입력 단가는 표보다 훨씬 낮음.
06

오픈소스인가? 오픈 웨이트 vs 오픈소스

제목·스니펫에는 오픈 웨이트를 쓰고 「오픈소스」 단독 표현은 피하세요. K3는 Modified MIT가중치 + 기술 보고서를 공개하며, 학습 코드·데이터는 포함되지 않습니다. r/LocalLLaMA와 HN에서 이 구분이 핵심 논점입니다.

7월 27일 예상: Moonshot HF 조직 업로드, LICENSE 전문, vLLM KDA/prefix-cache 지원, K2 패턴에 이은 Ollama/GGUF 양자화(며칠~수주 지연).

07

로컬 실행 가능? 하드웨어 요구사항

솔직히: 소비자 GPU로는 불가능합니다.

  • 4-bit 약 1.4TB; Moonshot은 64+ 가속기 슈퍼노드(expert + tensor 병렬) 권장.
  • 참고: K2.7 Code(1T) INT4 약 577GB VRAM; K3는 2.8배 규모.
  • 자체 호스팅이 타당한 경우는 데이터 residency, fine-tune, API 월 비용이 철값을 넘을 때뿐 — 그 외는 API($3/$15) 또는 클라우드 추론.

공개일 체크리스트

  1. 01

    HF 저장소 완전성(shard, index, config)

  2. 02

    LICENSE 전문(Modified MIT 조항)

  3. 03

    양자화 산출물(MXFP4 / GGUF)

  4. 04

    vLLM / SGLang 실행 명령과 최소 HW 메모

  5. 05

    독립 기관 장컨텍스트·BrowseComp 재평가

08

7월 27일 공개의 업계적 의미

  1. 01

    프론티어 격차 축소: AA 스프레드 수 포인트 — 능력만으로 클로즈드 프리미엄 정당화 어려움.

  2. 02

    지정학: WAIC 타이밍; 미국이 Anthropic Fable/Mythos 일시 delist(7월 1일 복귀) — 규제는 API는 막지만 공개 가중치는 못 막음.

  3. 03

    중국 물결: GLM-5.2, DeepSeek V4 Pro(1.6T), MiniMax — K3는 오픈 웨이트 push의 정점.

  4. 04

    Moonshot 부활: DeepSeek R1 이후 침체에서 K2 → K2.5 → K3 오픈 웨이트 cadence로.

선택 매트릭스

시나리오권장이유
지금 시험 / 코딩 AgentAPI 또는 Kimi Code7월 16일부터 가동; 캐시로 비용 절감
7/27 이후 fine-tune / residency자체 호스트(64+ GPU)전체 가중치 + 컴플라이언스 필요
비용 최우선DeepSeek V4 Pro API출력 $3.48/M
장기 추론·종합 지수Claude Fable 5GDPval / 종합 index 리드
Ollama/GGUF 대기K2 후속 추적소비자 양자화는 HF 공개보다 늦음

출처: kimi.com/en/blog/kimi-k3, platform.kimi.ai, Artificial Analysis(7월 16일), VentureBeat, Northflank, r/LocalLLaMA, Hacker News.

09

자주 묻는 질문(FAQ)

2026년 7월 27일 Hugging Face에 기술 보고서와 함께. API는 7월 16일부터 이용 가능.

Modified MIT 오픈 웨이트 — 완전 오픈소스(학습 스택·데이터 미공개)는 아닙니다.

$3 / 캐시 $0.30 / 출력 $15 per 1M tokens. AA 테스트 약 $0.94/태스크.

불가 — 4-bit 약 1.4TB, 64+ 가속기 권장. API 이용이 현실적.

종합 지수 57.1 vs 59.9로 열세. 코딩/UI 계열 여러 승리. 태스크당 비용은 훨씬 저렴.

Modified MIT — 7월 27일 Hugging Face LICENSE에서 정확한 조항 확인.

마무리

7월 27일 오픈 웨이트 공개로 2.8T 모델이 책상 GPU에 올라가지는 않습니다. 대부분은 API, Kimi Code, OpenRouter로 K3를 씁니다. 자체 호스팅은 엔터프라이즈 규모의 베팅입니다. 워크플로에 실제 macOS GUI — Kimi Code Agent, OpenClaw 라우팅, SSH로는 누를 수 없는 Xcode 서명 대화상자 — 가 필요하면 하드 구매는 비싸고 유휴 노드는 감가상각됩니다. VNCMac 원격 Mac 임대로 VNC 데스크톱에서 장컨텍스트 코딩과 Agent 플로우를 검증하고 스프린트 후 중지하세요. Mac 임대 요금, 7월 17일 Kimi K3 심층 평가에서 아키텍처 상세를 확인하세요.