Moonshot AI가 2026년 7월 말 2.8조 매개변수의 Kimi K3 가중치를 공개했습니다. 역대 최대 오픈 웨이트 모델이며 로컬에서 실행할 수 있는 사람은 거의 없습니다. 이 가이드는 K3의 정체, 실제로 사용할 수 있는 세 가지 방법, 이를 바탕으로 앱을 가장 빠르게 출시하는 방법을 소개합니다.
현실적으로 불가능합니다. Kimi K3는 2.8조 매개변수 모델입니다. 강력한 MXFP4 양자화를 적용해도 가중치 크기가 수백 GB로 소비자용 GPU나 Mac의 처리 범위를 훨씬 넘어섭니다. 직접 실행하려면 여러 GPU로 구성된 서버 클러스터가 필요합니다. 대부분은 첫날부터 K3를 제공한 Together AI 또는 Modal 같은 호스팅 추론 업체나 Moonshot 자체 API를 이용하는 것이 현실적입니다.
Moonshot의 오픈 라이선스에 따라 가중치를 무료로 다운로드할 수 있지만 무료로 실행할 수 있다는 뜻은 아닙니다. 추론에는 실제 비용이 듭니다. 호스팅 제공업체에 토큰 단위로 지불하거나 하드웨어 비용을 내야 합니다. 오픈 웨이트는 제어권, 자체 호스팅 권리, 단일 공급업체에서 벗어날 자유를 제공할 뿐 비용을 없애 주지는 않습니다.
K3는 일반 벤치마크에서 경쟁력이 있으며 핵심 장점은 최첨단 호스팅 모델보다 능력이 크게 앞선다는 것이 아니라 개방성입니다. 코드 생성과 여러 단계로 앱을 만드는 작업에서는 7월 24, 2026년 출시된 Claude Opus 5 같은 최첨단 호스팅 모델이 여전히 앞섭니다. 목표가 모델 연구가 아니라 작동하는 앱이라면 도구 뒤에 있는 모델보다 도구의 제작 과정이 중요합니다.
AI 호출에는 K3 호스팅 추론 엔드포인트 (Together AI, Modal, Moonshot API)를 사용하고 AI 앱 빌더로 제품을 만드세요. We.Inc에서 쉬운 말로 앱을 설명하면 K3 엔드포인트가 API 호출로 연결된 편집 가능한 React 앱을 실시간으로 만들고 자체 도메인에 게시할 수 있습니다. we.inc에서 무료로 시작할 수 있습니다.
Moonshot AI는 2026년 7월 마지막 주에 Kimi K3 가중치를 공개했습니다. 매개변수 2.8조 개로 지금까지 출시된 오픈 웨이트 모델 중 가장 큽니다. Together AI와 Modal이 첫날부터 호스팅을 제공했고 Forbes는 최첨단 AI가 오픈 웨이트로 수렴한다는 가장 분명한 신호라고 평가했으며 "Kimi K3 로컬 실행" 검색이 즉시 급증했습니다.
출시 관련 보도에서 거의 아무도 분명히 말하지 않는 불편한 사실이 있습니다. 이 모델을 자신의 컴퓨터에서 실행할 수는 없습니다.
짧은 요약: Kimi K3 가중치는 무료로 다운로드할 수 있지만 매개변수가 2.8T에 달해 양자화를 강하게 적용한 체크포인트도 수백 GB이며 여러 GPU를 갖춘 서버 클러스터가 필요합니다. 현실적인 방법은 세 가지입니다. (1) Together AI, Modal, Moonshot API를 통한 호스팅 추론, (2) 증류된 소형 버전이 나올 때까지 기다리기, (3) 모델을 직접 사용하지 않고 엔드포인트를 기반으로 제품만 출시하기. 실제 목표가 "이번 주말 AI로 뭔가 만들기"라면 3번이 솔직한 답이며 We.Inc에서 무료로 시작할 수 있습니다.
중요한 사실은 세 가지입니다.
1. 역대 최대 규모의 오픈 모델입니다. 매개변수 2.8조 개의 K3는 사람들이 실제로 실행해 본 대부분의 오픈 모델 (Llama 계열 70B 모델, Mistral 변형 모델)보다 대략 10배 큽니다. DeepSeek의 대표 모델이나 Kimi K2 같은 이전의 "초대형" 오픈 모델도 자체 호스팅으로 감당하기 어려운 수준이었습니다. K3는 더 이상 그런 척할 수 없게 합니다.
2. 오픈 트레이닝이 아니라 오픈 웨이트입니다. 체크포인트와 허가를 구하지 않고 자체 호스팅, 미세 조정, 배포할 권리를 받습니다. 학습 데이터나 저렴한 실행 방법은 제공되지 않습니다. 이번 출시의 핵심은 이 차이에 있습니다.
3. 출시 첫날부터 호스팅할 수 있었던 점이 실제 출시의 핵심이었습니다. Together AI와 Modal이 첫날부터 K3를 제공했다는 사실은 Moonshot이 사람들이 다른 업체의 클러스터를 통해 사용하기를 기대한다는 뜻입니다. HuggingFace 커뮤니티 글에서 MXFP4 양자화에 집중하는 것도 압축 버전조차 데이터센터에서 다룰 규모이기 때문입니다.
2.8T 매개변수 모델을 전체 정밀도로 실행하려면 가중치만 테라바이트 단위로 필요합니다. MXFP4 같은 4비트 형식으로 양자화해도 KV 캐시와 활성화 메모리 이전에 이미 수백 GB 규모입니다. 비교해 보면 다음과 같습니다.
따라서 "PC에서 Kimi K3 실행"을 약속하는 튜토리얼이 API 래퍼를 설명하는 게 아니라면 틀렸습니다. 모델이 오픈이라고 해서 크기가 작아지는 것은 아닙니다.
K3를 냉소적으로 평가하려는 것이 아닙니다. 이 규모의 오픈 웨이트는 구체적인 이유 세 가지로 중요합니다.
K3를 구경하는 데 그치지 않고 사용하려면 다음과 같은 구성이 필요합니다.
3단계의 어려움을 We.Inc가 해결합니다. 막연한 설명이 아니라 실제 작업 흐름은 다음과 같습니다.
마지막 항목이 솔직한 대칭입니다. 폐쇄형 플랫폼을 믿지 못해 K3에 관심을 가진다면 제작 도구에도 같은 기준을 적용하세요. We.Inc는 생성된 코드를 제공합니다. 대부분의 AI 빌더는 그렇지 않습니다.
"kimi k3 vs claude"를 검색하는 사람이 많으므로 한 가지를 분명히 하겠습니다. 두 모델은 역할이 다릅니다. K3는 앱에서 호출할 수 있는 모델입니다. 7월 24, 2026년 출시된 Claude Opus 5는 현재 순수 코딩에 더 강한 모델이며 AI 빌더 내부의 생성 기능을 지원하는 모델 유형입니다. Claude 기반 빌더로 K3를 호출하는 앱을 만드는 것은 모순이 아닙니다. 현재는 소프트웨어 작성에 가장 좋은 모델을, 앱 내부 실행에는 충분히 좋은 저가 오픈 모델을 쓰는 것이 일반적인 구조입니다.
새 모델이 화제가 되는 기간은 짧습니다. 그 기간에 만든 앱은 오래 남습니다. We.Inc에서 무료로 시작하고 카드 없이 앱을 한 문장으로 설명해 오늘 도메인에 공개하세요. 먼저 요금제를 비교하고 싶다면 가격을 확인하세요. 더 넓은 노코드 제작 과정을 알고 싶다면 코드 없이 웹 앱 만들기 가이드를 읽어 보세요.
무료로 시작하기 · 신용카드 필요 없음