오픈소스 프로젝트 Swiftlet은 강력한 양자화로 MacBook의 RAM 4.3GB에서 Qwen3-80B를, iPhone에서 Qwen3-35B를 실행합니다. 개발자에게 어떤 의미인지, 품질과 절충점, 로컬 LLM 엔드포인트를 제품에 연결하는 방법을 소개합니다.
Swiftlet은 극단적인 양자화 기술로 Apple 기기에서 대형 언어 모델을 실행하는 오픈소스 프로젝트(github.com/leonickson1/Swiftlet)입니다. Mac에서 RAM 4.3GB로 Qwen3-80B를, iPhone에서 Qwen3-35B를 실행할 수 있습니다. Swift로 작성됐으며 Apple Metal GPU 프레임워크에 최적화돼 있습니다.
Swiftlet은 강력한 양자화(아마도 2비트 미만)를 적용해 모델 가중치를 원래 크기보다 크게 압축합니다. 정밀도가 높은 FP16의 80B 매개변수 모델은 약 160GB 메모리가 필요합니다. 4비트 양자화에서는 약 40GB가 필요합니다. Swiftlet이 구현한 4.3GB 수준은 매개변수당 평균 약 0.4비트의 극단적인 양자화입니다. 그룹 양자화와 중요도 기반 비트 배분 같은 기술로 핵심 가중치의 품질을 보존합니다.
작업에 따라 다릅니다. 극단적 양자화는 모델의 일반 지식과 지시 수행 능력을 잘 보존하지만 정밀한 수학 추론, 복잡한 다단계 논리, 긴 구조화 출력이 필요한 작업에서는 성능이 낮아집니다. 대화형 인터페이스, 콘텐츠 생성, 분류에는 놀라울 정도로 쓸 만합니다. 코드 생성이나 복잡한 추론에는 양자화를 덜 한 작은 모델(예: 4비트 Qwen3-35B)이 더 나을 수 있습니다. 출시 전에 벤치마크하세요.
네. Swiftlet은 로컬 HTTP 엔드포인트(보통 localhost:8080)를 제공해 프롬프트를 받고 완성 결과를 반환합니다. 모든 웹 앱에서 해당 엔드포인트를 호출할 수 있습니다. We.Inc에서 쉬운 말로 앱을 설명하면 작동하는 React 앱을 바로 만들 수 있습니다. 로컬 Swiftlet 엔드포인트에 fetch 호출을 추가하면 몇 분 안에 제품이 작동합니다. 생성된 코드는 GitHub로 내보낼 수 있으므로 어떤 플랫폼에도 종속되지 않습니다.
Swiftlet은 8월 3, 2026년 Hacker News 첫 화면에 점수 260점과 댓글 116개를 기록했습니다. 제안은 이렇습니다. 최첨단급 대형 언어 모델인 매개변수 800억 개 Qwen3-80B를 MacBook의 RAM 4.3GB에서 실행합니다. 350억 모델은 iPhone에서 작동합니다.
요약: Swiftlet(github.com/leonickson1/Swiftlet)은 극단적 양자화로 보통 메모리 160GB가 필요한 모델을 일반 사용자용 Apple 기기에서 실행합니다. 품질은 실제로 저하되지만 예상보다 제한적입니다. API 비용 없이 로컬 LLM으로 구동하는 제품을 만들고 싶다면 쉽게 시작할 수 있는 방법입니다. We.Inc 앱을 로컬 엔드포인트에 연결해 게시하면 사용자는 모델이 노트북에서 실행되는지 알 필요가 없습니다.
핵심 기술은 마법이 아닙니다. 대부분의 도구보다 양자화를 더 강하게 적용합니다.
계산: FP16(추론의 표준 정밀도) Qwen3-80B는 대략 메모리 160GB가 필요합니다. 일반적으로 쓰이는 4비트 양자화(GGUF Q4_K_M)에서는 약 40GB가 필요합니다. Swiftlet은 그룹 양자화와 중요도 가중 비트 배분을 사용해 평균 매개변수당 약 0.4비트까지 줄입니다. 어텐션 헤드, 첫 레이어와 마지막 레이어 등 가장 중요한 가중치에는 비트를 더 주고 피드포워드 레이어 대부분에는 더 적게 배정합니다.
대상 하드웨어: Apple Silicon. Swiftlet은 Swift로 작성됐으며 GPU 가속에 Metal을 사용합니다. 통합 메모리를 사용하는 M1/M2/M3/M4 Mac이 가장 적합합니다. GPU와 CPU가 동일한 RAM 풀을 공유해 NVIDIA 기반 로컬 추론의 병목인 메모리 복사 작업을 피합니다.
제공 기능: 프롬프트를 받아 완성 결과를 반환하는 로컬 HTTP 서버(보통 localhost:8080)입니다. M3 MacBook Pro에서 80B 모델 토큰 생성 속도는 초당 8~12토큰으로 보고됐습니다. 대화형 앱에는 쓸 수 있지만 즉시 응답하는 속도는 아닙니다.
극단적인 양자화에는 대가가 있습니다. Hacker News 토론과 초기 테스트를 기준으로 잘 유지되는 작업과 저하되는 작업은 다음과 같습니다.
잘 유지되는 작업:
눈에 띄게 저하되는 작업:
실용적인 결론: 제품이 대화형 도구, 요약 도구, 콘텐츠 도구라면 극단적으로 양자화한 80B는 놀라울 정도로 쓸 만합니다. 코드 생성이나 수학이 핵심이면 더 높은 양자화를 적용한 35B를 시험하세요. 큰 모델에 비트를 적게 쓰는 것보다 작은 모델에 비트를 더 쓰는 편이 나은 경우가 많습니다.
제작 단계는 간단합니다. 클라우드 API 키나 결제 계정이 필요하지 않습니다.
1단계: Swiftlet 설치 및 실행. 저장소를 복제하고 양자화된 Qwen3-80B 가중치 파일(4.3GB)을 내려받아 서버를 실행합니다. RAM이 8GB 이상인 Mac에서는 약 30초 안에 시작됩니다.
2단계: 엔드포인트 확인. curl 또는 HTTP 클라이언트로 localhost:8080에 테스트 프롬프트를 보냅니다. 몇 초 뒤 완성 결과를 받아야 합니다.
3단계: 앱 제작. 대부분의 시간이 이 단계에 들어갑니다. 사용자 입력을 로컬 엔드포인트에 보내고 응답을 표시하는 프런트엔드가 필요합니다. We.Inc에 "문단을 받아 세 가지 버전으로 다시 쓰는 글쓰기 도우미" 같은 앱 설명을 입력하면 실시간 미리보기와 작동하는 React 앱을 만듭니다. 그런 다음 API 호출이 Swiftlet 엔드포인트를 가리키도록 수정하세요.
4단계: 게시 또는 내보내기. We.Inc에서 사용자 지정 도메인으로 바로 게시할 수 있습니다(앱이 실행 시 로컬 엔드포인트를 호출). 또는 코드를 GitHub로 내보내 직접 배포하세요. 독점 종속성 없는 표준 React, Vite, TypeScript 코드입니다.
결과는 지속적인 API 비용 없이 로컬 80B 모델로 구동되는 실제 운영 수준의 웹 앱입니다.
로컬 추론이 유리한 경우:
클라우드가 유리한 경우:
현실적인 중간 방법은 개발과 데모에 Swiftlet을 쓰고 실제 운영 규모에서는 클라우드 엔드포인트(OpenRouter, Together AI, Qwen API)로 바꾸는 것입니다. 어느 쪽이든 앱 코드는 같고 엔드포인트 URL만 바꾸면 됩니다.
노트북에서 80B 모델을 실행하는 것은 데이터센터와 품질이 같아서가 아니라 API 키 장벽을 완전히 없앤다는 점에서 중요한 성과입니다. MacBook을 가진 사람은 누구나 이제 최첨단급 모델을 로컬에서 실행하고 그 위에 제품을 만들 수 있습니다.
AI 기반 도구를 개발하던 사람에게 비용 계산이 달라집니다. 프로토타입 단계의 제품은 API 청구서가 실제 마찰 요소였습니다. Swiftlet은 개발과 테스트 중 이 비용을 없앱니다. 모델은 내 기기에서 실행되고 쿼리당 비용이 없으며 대화형 사용에 충분히 빠릅니다.
프런트엔드와 호스팅을 맡는 We.Inc 같은 빌더와 결합하면 "AI 도구 아이디어가 있다"에서 "사용자 지정 도메인에 공개했다"까지 Swiftlet 설치, 앱 설명 입력, localhost 연결, 게시로 이어집니다. 아이디어를 제품으로 만드는 단계가 의미 있게 줄어듭니다.
We.Inc로 무료 제작 시작 후 로컬 Swiftlet 엔드포인트에 연결하세요. 언제든 코드를 GitHub로 내보낼 수 있습니다.
무료로 시작하기 · 신용카드 필요 없음