TLDR: Moonshot AI가 2026년 7월 16일 Kimi K3를 출시했습니다 – 2.8조 파라미터의 혁신적인 오픈 웨이트 모델(3T급 최초)로, 네이티브 멀티모달리티, 1M 토큰 컨텍스트, 그리고 코딩, 에이전트 과업, 프론트엔드 개발, 지식 작업에서 Claude Fable 5와 GPT-5.6 Sol 같은 상용 최상위 모델에 필적하거나 능가하는 프런티어 성능을 제공합니다.
핵심 요약
- 규모와 혁신: 2.8T 파라미터, MoE(토큰당 활성 전문가 16/896), Kimi Delta Attention(KDA), Attention Residuals – K2 대비 약 2.5배 스케일링 효율, Kimi K3 - Kimi API 플랫폼
- 성능: Artificial Analysis Intelligence Index 약 57(상위 4위권, Claude Opus 4.8 앞섬), 프론트엔드 Code Arena 선도, Terminal-Bench(88.3%), BrowseComp(91.2%), GPQA-Diamond(93.5%) 강세. 전체적으로 Fable 5/Sol에 다소 뒤지나 대부분을 상회; Arena.ai Frontend Code Arena에서 1위(1,679 Elo, Fable 5 제침), X의 Arena 게시물 및 Tom's Hardware 보도.
- 기능: 네이티브 비전/비디오, 대규모 리포/코드베이스를 위한 1M 컨텍스트, 에이전트형 코딩, 3D 추론, 비디오 편집, 리서치 대시보드.
- 접근: kimi.com, API(kimi-k3 모델, 접근 가이드)로 즉시 사용 가능; 오픈 웨이트 곧 공개. 수요 급증으로 Moonshot이 일시적으로 Kimi K3 신규 구독을 중단. CometAPI로 손쉬운 통합.
- 가치: 작업당 비용 절감(일부 평가에서 약 $0.94), 거부율 감소, 코딩/비전 워크플로에 적합.
Kimi K3 기술 블로그는 Kimi K3를 “Open Frontier Intelligence, Kimi K3는 AI 민주화의 중대한 분기점”이라고 설명합니다. 중국 Moonshot 같은 연구소가 연산 제약에도 경계를 확장하며, 이 오픈 모델은 미국의 클로즈드 프런티어 우위를 흔들고 전 세계 개발자를 역량 강화합니다.
Kimi K3란? Moonshot AI의 오픈 3T급 모델
베이징 기반 스타트업 Moonshot AI는 2026년 7월 16일 Kimi K3를 플래그십 모델로 출시했습니다. 명시적으로 “약 3조 파라미터 클래스에서 최초의 오픈 모델”로 포지셔닝되었으며, 스파스 Mixture-of-Experts(MoE) 아키텍처에서 총 2.8조 파라미터를 탑재합니다. 토큰당 896명의 전문가 중 16명이 활성화되어 거대한 규모와 효율을 균형 있게 달성합니다.
이는 이미 코딩과 멀티모달에서 입지를 다진 Kimi K2 시리즈(K2.5, K2.6 등)를 기반으로 구축되었습니다. K3는 아키텍처 혁신을 도입합니다: Kimi Delta Attention(KDA)과 Attention Residuals(AttnRes), Stable LatentMoE, 그리고 정량화 인지형 학습(quantization-aware training, SFT 단계부터 MXFP4 가중치, MXFP8 활성화). 이로 인해 K2 대비 약 2.5배 더 나은 스케일링 효율과 최대 6.3배 더 빠른 디코딩을 달성했습니다.
주요 사양(Kimi K3 Technical Specifications):
- 파라미터: 총 2.8T(스파스 MoE).
- 컨텍스트 윈도우: 1,048,576 토큰(약 1M).
- 모달리티: 네이티브 텍스트 + 이미지 + 비디오 이해; 출력은 텍스트.
- 최대 출력: 기본 131k 토큰, 최대 컨텍스트 한도까지.
- 추론: 출시 시 기본 최대 노력 모드; 낮음/높음 모드 예정.
- 오픈 웨이트: 2026년 7월 27일 공개 약속(K2 전례에 따른 수정 MIT 스타일).
K3는 단순한 빠른 답변이 아닌, 시각적 피드백을 포함한 에이전트 워크플로(“Vision in the Loop”)로 복잡한 엔지니어링, 연구, 에이전트 과업을 완수하는 장기 과업에 초점을 맞춥니다. 데모에는 GPU 컴파일러 자율 구축(트라이턴에 필적), 45nm 공정 칩 설계, 신속한 천체물리 연구가 포함됩니다.
수요가 이미 용량을 압박
초기 반응이 강해 용량 압박이 발생했습니다. Moonshot은 X에 게시하여 직전 48시간 동안의 수요가 현재 GPU 한계에 근접했으며, 용량을 증설하는 동안 신규 구독을 일시 중단한다고 밝혔습니다. Business Insider도 동일한 용량 중단을 보도했고 기존 구독자는 영향을 받지 않는다고 전했습니다.
이는 프로덕션 계획에서 중요합니다. 모델이 뛰어나도 수요가 연산을 앞서면 가용성 제약을 겪을 수 있습니다. Kimi K3를 평가하는 팀은 단일 공급자 의존을 피하고, 지연 시간과 오류율을 모니터링하며, 가능하다면 CometAPI 같은 통합 공급자를 통한 폴백 라우팅을 활용해야 합니다.
코딩 벤치마크: Kimi K3가 가장 돋보이는 영역
Kimi K3의 코딩 프로파일은 개발자들이 주목하는 핵심 이유입니다. Terminal-Bench 2.1에서 GPT-5.6 Sol과 거의 비등하며, Program Bench에서는 GPT-5.6 Sol과 Claude Fable 5를 앞서고, FrontierSWE에서는 GPT-5.6 Sol을 의미 있게 앞섭니다. 또한 OpenLM 테이블의 SWE Marathon에서도 비교 모델을 상회합니다.
Arena 프론트엔드 결과는 실용적인 신호를 더합니다. Arena는 Frontend Code Arena에서 Kimi K3가 1679점을 기록해 Claude Fable 5를 앞섰다고 보고했습니다. 이 벤치마크는 프론트엔드 작업이 종종 유닛 테스트가 아닌 인간 선호로 평가된다는 점에서 중요합니다. 프롬프트만으로 깔끔하고 시각적으로 일관된 UI를 만들어내는 코딩 어시스턴트는 프로덕트 팀, 에이전시, SaaS 빌더, 내부 도구에 매우 가치가 있습니다.
종합 리더보드
- Artificial Analysis AI Leaderboard: #3 데뷔. Intelligence Index 점수로 경쟁력 입증(예: 일부 평가에서 약 57.1).
- 비공개 장기 지식 작업 평가: Elo 1547(K2.6 대비 +732), Fable 5 바로 뒤.
코딩 및 에이전트 벤치마크(자체 보고 및 독립)
K3는 규모와 아키텍처를 활용해 지속적인 에이전트 성능에서 강점을 보입니다.
- Frontend Code Arena(Arena.ai): 1,679점으로 1위, Fable 5와 GPT-5.6 Sol 제침. 웹 개발 분야의 블라인드 개발자 선호에서 우수.
- DeepSWE: 67.3–67.5(견조, KimiCode 하네스 사용).
- Program Bench: 77.8로 1위.
- SWE Marathon: 일부 하네스에서 42.0으로 1위.
- Terminal-Bench 2.1: 경쟁력, GPT-5.6 Sol과 근접.
비전 및 멀티모달
네이티브 학습(외부 부착형 아님)으로 견고한 결과:
- MMMU-Pro: 81.6%
- MathVision: 일부 보고에서 높은 90%대
- OmniDocBench: 91.1%(선도)
스크린샷, 다이어그램, 비디오를 지원해 UI 개선이나 게임 개발 같은 클로즈드 루프 과업에 적합합니다.
비교 표: Kimi K3 vs. 리딩 모델(보고서 종합/대략; 명시 없는 경우 최대 노력)
| 벤치마크 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | 비고/출처 |
|---|---|---|---|---|
| Frontend Code Arena | 1,679 (#1) | 더 낮음 | 더 낮음 | Arena.ai |
| DeepSWE | 67.3–67.5 | 경쟁적 | - | Moonshot/KimiCode |
| Program Bench | 77.8 (#1) | - | 근접 | Vals.ai |
| Intelligence Index (AA) | 약 57.1 | 약 59.9 | 약 58.9 | Artificial Analysis |
| Long-Horizon Elo | 1547 | 더 높음 | - | Internal Moonshot |
| Cost per Task (Evals) | 약 $0.94 | 더 높음 | 더 높음 | Independent |
출처: Moonshot의 기술 블로그, 독립 리더보드 및 분석. 하네스/노력 수준에 따라 결과는 달라질 수 있으니 최신 정보를 확인하세요.
K3는 민감 주제에서 거부가 더 적고 에이전트 플로우에서 일관성이 강합니다. 독립 테스트(예: YouTube 평가, Vals AI)도 실전 코딩에서 가장 강력한 오픈 모델 중 하나임을 확인합니다.
Kimi K3로 무엇을 할 수 있나? 코딩, 비전 그 너머
코딩 & 에이전트 엔지니어링
K3는 최소 감독으로 긴 세션을 유지합니다: 거대한 리포를 탐색하고, 도구를 사용하며, 스크린샷으로 디버깅(“vision in the loop”).
예시:
- 커널 최적화 & 컴파일러 개발: 미니 트라이턴(MiniTriton)급 컴파일러를 제로에서 구축, 최적화 스택에 필적. GPU 커널을 Fable 5와 경쟁적으로 최적화.
- 게임 개발: 개념/이미지/비디오를 반복 개선으로 플레이 가능한 3D/멀티플레이어 경험으로 전환.
- 칩 설계: 48시간 자율 실행으로 나노급 모델 칩 설계.
- 프론트엔드: 웹 앱, 풀스택 과업에서 리더보드 상위.
비전 & 멀티모달
네이티브 이미지/비디오 이해로 다음을 지원:
- 비디오 편집: 56개 클립에서 자체 티저를 편집(선정, 컷, 동기화, 수정) – 수시간 작업을 분 단위로.
- 3D 추론, 모션 그래픽, 인터랙티브 대시보드.
- 스크린샷 기반 코드 반복을 위한 “vision in the loop”.
Kimi API 문서는 base64 데이터 URL을 통한 이미지 입력과 업로드된 파일(ms:// 참조)을 통한 비디오 입력을 보여줍니다. 또한 비전 입력에서 공개 이미지 URL은 지원하지 않으므로, 개발자는 base64 또는 업로드 파일 참조를 보내고 메시지 콘텐츠를 객체 배열로 구성해야 한다고 경고합니다. 이는 중요한 구현 세부사항입니다: 이미지와 텍스트를 섞은 메시지를 하나의 평문 문자열로 직렬화하지 마세요.
지식 작업 & 연구
기업에겐 일반 챗봇보다 더 가치가 클 수 있습니다. 이 모델은 계획을 유지하고, 도구를 호출하며, 중간 결과를 처리해 최종 산출물을 만드는 “에이전트형” 작업을 위해 설계되었습니다. 예: 시장 조사 보고서, 데이터 정리 어시스턴트, 컴플라이언스 요약, 고객지원 지식베이스 유지보수, 내부 엔지니어링 코파일럿.
- 컨설팅급 보고서, 인터랙티브 시각화, 대시보드 생성(예: 수천 개 소스 기반 42년 ASIC 산업 분석).
- 과학 파이프라인: 천체물리 관계 재현, 서브 에이전트로 중력파 분석.
- Kimi Work의 위젯/대시보드로 지속적 데이터 기반 뷰 제공.
K3는 문헌과 실행 가능한 코드를 연결해, 출판급 산출물을 효율적으로 만들어냅니다.
Kimi K3 vs 기타 프런티어 모델: 실전 비교
| 모델 | 최적 용도 | 강점 | 유의사항 | CometAPI 권장 사항 |
|---|---|---|---|---|
| Kimi K3 | 장문 컨텍스트 코딩, 지식 작업, 에이전트, 시각적 추론 | 2.8T MoE 규모, 1M 컨텍스트, 강력한 코딩/에이전트 벤치마크, 오픈 웨이트 로드맵 | 출시 주간 용량 압박, 사고 이력에 대한 민감성, 경로에 따라 비전 지원이 달라질 수 있음 | 플래그십 코딩·장문 컨텍스트 모델로 테스트 |
| GPT-5.6 Sol | 고난도 추론, 코딩, 연구, 광범위한 프로덕션 과업 | 전반적 벤치마크 강세, 성숙한 툴링 | 많은 경로에서 더 높은 가격 | 비교 및 에스컬레이션 모델로 활용 |
| Claude Fable 5 | 글쓰기, 코딩, 에이전트 워크플로, 인간 선호 기반 과업 | 강력한 UX와 광범위한 프런티어 성능 | 일부 과업에서 더 높은 비용 및 정책 기반 폴백 가능성 | 사용자 대면 에이전트·작문 중심 앱에 비교 적용 |
| Claude Opus 4.8 | 심층 추론 및 신뢰할 수 있는 전문가형 작업 | 안정적인 하이엔드 어시스턴트 동작 | 최신 플래그십 대비 다소 이전 세대 | 폴백 또는 벤치마크 기준선으로 유지 |
| GLM-5.2 | 비용 민감형 오픈 모델 평가 | 경쟁력 있는 오픈 모델 대안 | K3 대비 여러 비교에서 열세 | 비용/성능 라우팅 테스트에 포함 |
Kimi K3 접근 방법: 단계별 가이드
- 웹/앱: kimi.com을 방문하거나 Kimi 앱(iOS/Android)을 다운로드하세요. K3(K3 Max 또는 Swarm Max)를 선택.
- Kimi Code: 개발자용 터미널/IDE 중심. 코딩 에이전트에 적합.
- API 액세스:
- Base URL: https://api.moonshot.ai/v1
- Model: kimi-k3
- API 키: platform.moonshot.ai/console에서 발급.
- OpenAI 호환 SDK 예시(Python):
Python
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.moonshot.ai/v1")
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Your prompt"}]
)
도구 호출, JSON 모드, 컨텍스트 캐싱 지원. 요금: 입력 $3, 출력 $15/백만 토큰(캐시 $0.30).
- 집계기: CometAPI(cometapi.com)를 사용해 하나의 키로 Kimi K3 + 500+ 모델에 통합 액세스. 더 낮은 비용(20–40% 절감), 손쉬운 전환. 프로덕션에 적합 – 드롭인 OpenAI 호환, 낮은 지연.
- 셀프 호스팅: 7월 27일 Hugging Face에 웨이트 공개 이후. 막대한 하드웨어 요구 예상(슈퍼노드, 64개+ 가속기 권장). vLLM 같은 커뮤니티 툴 지원 예정.
CometAPI 권장 사항: 다중 키/빌링을 피하려면 CometAPI로 Kimi K3를 통합하세요. Claude/GPT와 함께 A/B 테스트하고, 비용을 최적화하며, 안정적으로 스케일하세요. 대시보드는 모델 전반 사용량을 추적해 K3 실험 모니터링에 이상적입니다. cometapi.com에서 무료 크레딧으로 가입하고 통합 액세스를 시작하세요.
최종 평가
Kimi K3는 2026년 가장 중요한 모델 출시 중 하나입니다. 거대한 규모, 진지한 오픈 웨이트 전략, 1M 토큰 컨텍스트, 네이티브 시각 이해, 그리고 현재 코딩/에이전트 AI 시스템 상단에 위치하는 벤치마크 결과를 결합했습니다. GPT, Claude, Gemini, DeepSeek, Qwen 등 다른 모델의 필요성을 없애지는 않지만, 가장 어려운 장문 컨텍스트 워크플로에 대해 개발자에게 신뢰할 수 있는 새로운 선택지를 제공합니다.
오늘 바로 kimi.com 또는 CometAPI를 통해 손쉽게 통합해 보세요. 코딩과 비전 강점을 실험해 보시길 – 결과가 말해줍니다.
