Swiftlet, Mac에서 RAM 4.3GB로 80B LLM 실행: 앱 제작 방법

오픈소스 프로젝트 Swiftlet은 강력한 양자화로 MacBook의 RAM 4.3GB에서 Qwen3-80B를, iPhone에서 Qwen3-35B를 실행합니다. 개발자에게 어떤 의미인지, 품질과 절충점, 로컬 LLM 엔드포인트를 제품에 연결하는 방법을 소개합니다.

자주 묻는 질문

Swiftlet은 무엇인가요?

Swiftlet은 극단적인 양자화 기술로 Apple 기기에서 대형 언어 모델을 실행하는 오픈소스 프로젝트(github.com/leonickson1/Swiftlet)입니다. Mac에서 RAM 4.3GB로 Qwen3-80B를, iPhone에서 Qwen3-35B를 실행할 수 있습니다. Swift로 작성됐으며 Apple Metal GPU 프레임워크에 최적화돼 있습니다.

Swiftlet은 80B 모델을 어떻게 RAM 4.3GB에 넣나요?

Swiftlet은 강력한 양자화(아마도 2비트 미만)를 적용해 모델 가중치를 원래 크기보다 크게 압축합니다. 정밀도가 높은 FP16의 80B 매개변수 모델은 약 160GB 메모리가 필요합니다. 4비트 양자화에서는 약 40GB가 필요합니다. Swiftlet이 구현한 4.3GB 수준은 매개변수당 평균 약 0.4비트의 극단적인 양자화입니다. 그룹 양자화와 중요도 기반 비트 배분 같은 기술로 핵심 가중치의 품질을 보존합니다.

품질이 실제 운영에 충분한가요?

작업에 따라 다릅니다. 극단적 양자화는 모델의 일반 지식과 지시 수행 능력을 잘 보존하지만 정밀한 수학 추론, 복잡한 다단계 논리, 긴 구조화 출력이 필요한 작업에서는 성능이 낮아집니다. 대화형 인터페이스, 콘텐츠 생성, 분류에는 놀라울 정도로 쓸 만합니다. 코드 생성이나 복잡한 추론에는 양자화를 덜 한 작은 모델(예: 4비트 Qwen3-35B)이 더 나을 수 있습니다. 출시 전에 벤치마크하세요.

Swiftlet으로 실행하는 로컬 LLM을 사용하는 앱을 만들 수 있나요?

네. Swiftlet은 로컬 HTTP 엔드포인트(보통 localhost:8080)를 제공해 프롬프트를 받고 완성 결과를 반환합니다. 모든 웹 앱에서 해당 엔드포인트를 호출할 수 있습니다. We.Inc에서 쉬운 말로 앱을 설명하면 작동하는 React 앱을 바로 만들 수 있습니다. 로컬 Swiftlet 엔드포인트에 fetch 호출을 추가하면 몇 분 안에 제품이 작동합니다. 생성된 코드는 GitHub로 내보낼 수 있으므로 어떤 플랫폼에도 종속되지 않습니다.

Swiftlet은 8월 3, 2026년 Hacker News 첫 화면에 점수 260점과 댓글 116개를 기록했습니다. 제안은 이렇습니다. 최첨단급 대형 언어 모델인 매개변수 800억 개 Qwen3-80B를 MacBook의 RAM 4.3GB에서 실행합니다. 350억 모델은 iPhone에서 작동합니다.

요약: Swiftlet(github.com/leonickson1/Swiftlet)은 극단적 양자화로 보통 메모리 160GB가 필요한 모델을 일반 사용자용 Apple 기기에서 실행합니다. 품질은 실제로 저하되지만 예상보다 제한적입니다. API 비용 없이 로컬 LLM으로 구동하는 제품을 만들고 싶다면 쉽게 시작할 수 있는 방법입니다. We.Inc 앱을 로컬 엔드포인트에 연결해 게시하면 사용자는 모델이 노트북에서 실행되는지 알 필요가 없습니다.

Swiftlet의 실제 작동 방식

핵심 기술은 마법이 아닙니다. 대부분의 도구보다 양자화를 더 강하게 적용합니다.

계산: FP16(추론의 표준 정밀도) Qwen3-80B는 대략 메모리 160GB가 필요합니다. 일반적으로 쓰이는 4비트 양자화(GGUF Q4_K_M)에서는 약 40GB가 필요합니다. Swiftlet은 그룹 양자화와 중요도 가중 비트 배분을 사용해 평균 매개변수당 약 0.4비트까지 줄입니다. 어텐션 헤드, 첫 레이어와 마지막 레이어 등 가장 중요한 가중치에는 비트를 더 주고 피드포워드 레이어 대부분에는 더 적게 배정합니다.

대상 하드웨어: Apple Silicon. Swiftlet은 Swift로 작성됐으며 GPU 가속에 Metal을 사용합니다. 통합 메모리를 사용하는 M1/M2/M3/M4 Mac이 가장 적합합니다. GPU와 CPU가 동일한 RAM 풀을 공유해 NVIDIA 기반 로컬 추론의 병목인 메모리 복사 작업을 피합니다.

제공 기능: 프롬프트를 받아 완성 결과를 반환하는 로컬 HTTP 서버(보통 localhost:8080)입니다. M3 MacBook Pro에서 80B 모델 토큰 생성 속도는 초당 8~12토큰으로 보고됐습니다. 대화형 앱에는 쓸 수 있지만 즉시 응답하는 속도는 아닙니다.

품질 절충점

극단적인 양자화에는 대가가 있습니다. Hacker News 토론과 초기 테스트를 기준으로 잘 유지되는 작업과 저하되는 작업은 다음과 같습니다.

잘 유지되는 작업:

눈에 띄게 저하되는 작업:

실용적인 결론: 제품이 대화형 도구, 요약 도구, 콘텐츠 도구라면 극단적으로 양자화한 80B는 놀라울 정도로 쓸 만합니다. 코드 생성이나 수학이 핵심이면 더 높은 양자화를 적용한 35B를 시험하세요. 큰 모델에 비트를 적게 쓰는 것보다 작은 모델에 비트를 더 쓰는 편이 나은 경우가 많습니다.

로컬 Swiftlet 엔드포인트를 앱에 연결

제작 단계는 간단합니다. 클라우드 API 키나 결제 계정이 필요하지 않습니다.

1단계: Swiftlet 설치 및 실행. 저장소를 복제하고 양자화된 Qwen3-80B 가중치 파일(4.3GB)을 내려받아 서버를 실행합니다. RAM이 8GB 이상인 Mac에서는 약 30초 안에 시작됩니다.

2단계: 엔드포인트 확인. curl 또는 HTTP 클라이언트로 localhost:8080에 테스트 프롬프트를 보냅니다. 몇 초 뒤 완성 결과를 받아야 합니다.

3단계: 앱 제작. 대부분의 시간이 이 단계에 들어갑니다. 사용자 입력을 로컬 엔드포인트에 보내고 응답을 표시하는 프런트엔드가 필요합니다. We.Inc에 "문단을 받아 세 가지 버전으로 다시 쓰는 글쓰기 도우미" 같은 앱 설명을 입력하면 실시간 미리보기와 작동하는 React 앱을 만듭니다. 그런 다음 API 호출이 Swiftlet 엔드포인트를 가리키도록 수정하세요.

4단계: 게시 또는 내보내기. We.Inc에서 사용자 지정 도메인으로 바로 게시할 수 있습니다(앱이 실행 시 로컬 엔드포인트를 호출). 또는 코드를 GitHub로 내보내 직접 배포하세요. 독점 종속성 없는 표준 React, Vite, TypeScript 코드입니다.

결과는 지속적인 API 비용 없이 로컬 80B 모델로 구동되는 실제 운영 수준의 웹 앱입니다.

로컬 추론이 적합한 경우와 그렇지 않은 경우

로컬 추론이 유리한 경우:

클라우드가 유리한 경우:

현실적인 중간 방법은 개발과 데모에 Swiftlet을 쓰고 실제 운영 규모에서는 클라우드 엔드포인트(OpenRouter, Together AI, Qwen API)로 바꾸는 것입니다. 어느 쪽이든 앱 코드는 같고 엔드포인트 URL만 바꾸면 됩니다.

이 기술이 시장에 의미하는 것

노트북에서 80B 모델을 실행하는 것은 데이터센터와 품질이 같아서가 아니라 API 키 장벽을 완전히 없앤다는 점에서 중요한 성과입니다. MacBook을 가진 사람은 누구나 이제 최첨단급 모델을 로컬에서 실행하고 그 위에 제품을 만들 수 있습니다.

AI 기반 도구를 개발하던 사람에게 비용 계산이 달라집니다. 프로토타입 단계의 제품은 API 청구서가 실제 마찰 요소였습니다. Swiftlet은 개발과 테스트 중 이 비용을 없앱니다. 모델은 내 기기에서 실행되고 쿼리당 비용이 없으며 대화형 사용에 충분히 빠릅니다.

프런트엔드와 호스팅을 맡는 We.Inc 같은 빌더와 결합하면 "AI 도구 아이디어가 있다"에서 "사용자 지정 도메인에 공개했다"까지 Swiftlet 설치, 앱 설명 입력, localhost 연결, 게시로 이어집니다. 아이디어를 제품으로 만드는 단계가 의미 있게 줄어듭니다.

We.Inc로 무료 제작 시작 후 로컬 Swiftlet 엔드포인트에 연결하세요. 언제든 코드를 GitHub로 내보낼 수 있습니다.

무료로 시작하기 · 신용카드 필요 없음

Product

Who It's For

Features

Resources

Company

View Sitemap