Swiftlet Mac पर 4.3 GB RAM में 80B LLM चलाता है। इस पर कैसे बनाएं, यहां जानें।

Swiftlet नाम का एक नया ओपन-सोर्स प्रोजेक्ट, आक्रामक क्वांटाइज़ेशन से MacBook पर 4.3 GB RAM में Qwen3-80B और iPhone पर Qwen3-35B चलाता है। यह गाइड कवर करती है कि इसका डेवलपर्स के लिए असल में क्या मतलब है, क्वालिटी ट्रेड-ऑफ कहां हैं, और आज ही एक असली प्रोडक्ट में लोकल LLM एंडपॉइंट कैसे जोड़ें।

अक्सर पूछे जाने वाले सवाल

Swiftlet क्या है?

Swiftlet एक ओपन-सोर्स प्रोजेक्ट है (github.com/leonickson1/Swiftlet) जो एक्सट्रीम क्वांटाइज़ेशन तकनीकों का इस्तेमाल करके Apple हार्डवेयर पर बड़े लैंग्वेज मॉडल चलाता है। यह Mac पर 4.3 GB RAM में Qwen3-80B और iPhone पर Qwen3-35B चला सकता है। यह Swift में लिखा गया है और Apple के Metal GPU फ्रेमवर्क के लिए ऑप्टिमाइज़ किया गया है।

Swiftlet 80B मॉडल को 4.3 GB RAM में कैसे फिट करता है?

Swiftlet मॉडल वेट को उनके मूल साइज़ से कहीं नीचे कंप्रेस करने के लिए आक्रामक क्वांटाइज़ेशन इस्तेमाल करता है, शायद सब-2-बिट। पूरी प्रिसिज़न (FP16) पर एक 80B पैरामीटर मॉडल को लगभग 160 GB मेमोरी चाहिए। 4-बिट क्वांटाइज़ेशन पर इसे लगभग 40 GB चाहिए। जिस 4.3 GB लेवल पर Swiftlet पहुंचता है, वह एक्सट्रीम क्वांटाइज़ेशन है, औसतन लगभग 0.4 बिट प्रति पैरामीटर, जो सबसे महत्वपूर्ण वेट पर क्वालिटी बनाए रखने के लिए ग्रुप्ड क्वांटाइज़ेशन और इंपोर्टेंस-वेटेड बिट एलोकेशन जैसी तकनीकें इस्तेमाल करता है।

क्या क्वालिटी प्रोडक्शन इस्तेमाल के लिए काफी अच्छी है?

यह टास्क पर निर्भर करता है। एक्सट्रीम क्वांटाइज़ेशन मॉडल के सामान्य ज्ञान और निर्देश-पालन क्षमता को अच्छी तरह बनाए रखता है, लेकिन सटीक न्यूमेरिकल रीज़निंग, जटिल मल्टी-स्टेप लॉजिक, या लंबे स्ट्रक्चर्ड आउटपुट वाले टास्क पर परफॉर्मेंस घटाता है। बातचीत वाले इंटरफेस, कंटेंट जनरेशन और क्लासिफिकेशन के लिए, क्वालिटी हैरानी भरे रूप से इस्तेमाल करने लायक है। कोड जनरेशन या जटिल रीज़निंग के लिए, एक कम-क्वांटाइज़्ड छोटा मॉडल (जैसे 4-बिट पर Qwen3-35B) बेहतर नतीजे दे सकता है। शिप करने से पहले बेंचमार्क करें।

क्या मैं ऐसा ऐप बना सकता हूं जो Swiftlet के ज़रिए चलने वाले एक लोकल LLM का इस्तेमाल करे?

हां। Swiftlet एक लोकल HTTP एंडपॉइंट (आमतौर पर localhost:8080 पर) एक्सपोज़ करता है जो प्रॉम्प्ट स्वीकार करता है और कम्प्लीशन लौटाता है। कोई भी वेब ऐप उस एंडपॉइंट को कॉल कर सकता है। We.Inc के साथ, आप सरल भाषा में अपने ऐप का वर्णन कर सकते हैं, तुरंत एक काम करने वाला React ऐप पा सकते हैं, लोकल Swiftlet एंडपॉइंट में एक fetch कॉल जोड़ सकते हैं, और मिनटों में एक काम करने वाला प्रोडक्ट पा सकते हैं। जनरेट किया गया कोड आपका है, इसे GitHub पर एक्सपोर्ट करें, इसलिए आप किसी भी प्लेटफॉर्म में लॉक-इन नहीं हैं।

अगस्त 3, 2026 को Swiftlet, 260 पॉइंट और 116 कमेंट के साथ Hacker News के फ्रंट पेज पर पहुंच गया। पिच: 80 अरब पैरामीटर वाले एक फ्रंटियर-क्लास बड़े लैंग्वेज मॉडल, Qwen3-80B को, MacBook पर 4.3 GB RAM में चलाना। एक 35B मॉडल iPhone पर चलता है।

संक्षेप में: Swiftlet (github.com/leonickson1/Swiftlet) उन मॉडल को उपभोक्ता Apple हार्डवेयर में फिट करने के लिए एक्सट्रीम क्वांटाइज़ेशन इस्तेमाल करता है जिन्हें आमतौर पर 160 GB मेमोरी चाहिए होती है। क्वालिटी ट्रेड-ऑफ असली है लेकिन आपकी उम्मीद से कम है। अगर आप ज़ीरो API लागत के साथ एक लोकल LLM से चलने वाला प्रोडक्ट बनाना चाहते हैं, तो शुरू करने का यह सबसे आसान तरीका है। एक We.Inc ऐप को लोकल एंडपॉइंट से जोड़ें, इसे पब्लिश करें, और आपके यूज़र्स को कभी पता नहीं चलेगा कि मॉडल आपके लैपटॉप पर चल रहा है।

Swiftlet असल में क्या करता है

मुख्य तरकीब कोई जादू नहीं है। यह क्वांटाइज़ेशन है जिसे ज़्यादातर टूल से आगे ले जाया गया है।

गणित: FP16 पर (इनफरेंस के लिए स्टैंडर्ड प्रिसिज़न) Qwen3-80B को लगभग 160 GB मेमोरी चाहिए। आमतौर पर इस्तेमाल होने वाले 4-बिट क्वांटाइज़ेशन (GGUF Q4_K_M) पर, इसे लगभग 40 GB चाहिए। Swiftlet इंपोर्टेंस-वेटेड बिट एलोकेशन के साथ ग्रुप्ड क्वांटाइज़ेशन इस्तेमाल करते हुए औसतन लगभग 0.4 बिट प्रति पैरामीटर तक पहुंचता है। सबसे महत्वपूर्ण वेट (अटेंशन हेड, पहली और आखिरी लेयर) को ज़्यादा बिट मिलते हैं; ज़्यादातर फीड-फॉरवर्ड लेयर को कम।

हार्डवेयर टारगेट: Apple Silicon। Swiftlet Swift में लिखा गया है और GPU एक्सेलरेशन के लिए Metal इस्तेमाल करता है। यूनिफाइड मेमोरी वाले M1/M2/M3/M4 Mac सबसे सही हैं क्योंकि GPU और CPU एक ही RAM पूल शेयर करते हैं, जो उस मेमोरी-कॉपी बॉटलनेक से बचाता है जो NVIDIA-आधारित लोकल इनफरेंस को सीमित करता है।

आपको क्या मिलता है: एक लोकल HTTP सर्वर (आमतौर पर localhost:8080) जो प्रॉम्प्ट स्वीकार करता है और कम्प्लीशन लौटाता है। M3 MacBook Pro पर टोकन जनरेशन स्पीड 80B मॉडल के लिए 8-12 टोकन प्रति सेकंड बताई गई है, जो इंटरैक्टिव एप्लिकेशन के लिए इस्तेमाल करने लायक है लेकिन तुरंत नहीं।

क्वालिटी ट्रेड-ऑफ कहां आता है

एक्सट्रीम क्वांटाइज़ेशन मुफ्त नहीं है। HN चर्चा और शुरुआती टेस्टिंग के आधार पर, यहां बताया गया है कि यह कहां टिकता है और कहां नहीं:

अच्छी तरह टिकता है:

साफ तौर पर घटता है:

व्यावहारिक निष्कर्ष: अगर आपका प्रोडक्ट एक chatbot है, एक समराइज़र है, या एक कंटेंट टूल है, तो एक्सट्रीम क्वांटाइज़ेशन पर 80B हैरानी भरे रूप से सक्षम है। अगर आपका प्रोडक्ट कोड जनरेट करता है या गणित करता है, तो इसके बजाय ऊंचे क्वांटाइज़ेशन पर 35B टेस्ट करें। एक छोटे मॉडल पर प्रति पैरामीटर ज़्यादा बिट अक्सर एक बड़े पर कम बिट से बेहतर होते हैं।

एक लोकल Swiftlet एंडपॉइंट को एक ऐप में कैसे जोड़ें

बिल्ड का रास्ता सीधा है। आपको क्लाउड API की या बिलिंग अकाउंट की ज़रूरत नहीं है।

कदम 1: Swiftlet इंस्टॉल और शुरू करें। रेपो क्लोन करें, क्वांटाइज़्ड Qwen3-80B वेट (4.3 GB फाइल) डाउनलोड करें, और सर्वर चलाएं। 8 GB या उससे ज़्यादा RAM वाले Mac पर, यह लगभग 30 सेकंड में शुरू हो जाता है।

कदम 2: पुष्टि करें कि एंडपॉइंट काम करता है। curl या किसी भी HTTP क्लाइंट से localhost:8080 पर एक टेस्ट प्रॉम्प्ट भेजें। आपको कुछ सेकंड में एक कम्प्लीशन वापस मिलनी चाहिए।

कदम 3: ऐप लेयर बनाएं। यहीं आप अपना ज़्यादातर समय बिताएंगे। आपको एक फ्रंटएंड चाहिए जो यूज़र इनपुट को लोकल एंडपॉइंट पर भेजे और जवाब दिखाए। We.Inc के साथ, आप जो ऐप चाहते हैं उसका वर्णन करें ("एक राइटिंग असिस्टेंट जो एक पैराग्राफ लेता है और तीन फिर से लिखे वर्ज़न लौटाता है") और AI एक लाइव प्रीव्यू वाला काम करने वाला React ऐप बनाता है। फिर अपने Swiftlet एंडपॉइंट की ओर इशारा करने के लिए API कॉल एडिट करें।

कदम 4: पब्लिश या एक्सपोर्ट करें। आप सीधे We.Inc से एक कस्टम डोमेन पर पब्लिश कर सकते हैं (ऐप रनटाइम पर आपके लोकल एंडपॉइंट को कॉल करता है), या कोड को GitHub पर एक्सपोर्ट करके इसे खुद डिप्लॉय कर सकते हैं। कोड बिना किसी प्रोप्राइटरी डिपेंडेंसी के स्टैंडर्ड React, Vite, और TypeScript है।

नतीजा: एक लोकल 80B मॉडल से चलने वाला प्रोडक्शन-क्वालिटी वेब ऐप, बिना किसी चालू API लागत के।

लोकल इनफरेंस कब मायने रखता है (और कब नहीं)

लोकल तब जीतता है जब:

क्लाउड तब जीतता है जब:

ईमानदार बीच का रास्ता: डेवलपमेंट और डेमो के लिए Swiftlet इस्तेमाल करें, फिर प्रोडक्शन स्केल के लिए एक क्लाउड एंडपॉइंट (OpenRouter, Together AI, Qwen API) पर स्विच करें। ऐप कोड दोनों तरह से एक जैसा है; आप बस एंडपॉइंट URL बदलते हैं।

इसका इस कैटेगरी के लिए क्या मतलब है

एक लैपटॉप पर 80B मॉडल चलाना एक मील का पत्थर है, इसलिए नहीं कि क्वालिटी डेटासेंटर से मेल खाती है, बल्कि इसलिए कि यह API-की की बाधा को पूरी तरह हटा देता है। MacBook वाला कोई भी व्यक्ति अब एक फ्रंटियर-क्लास मॉडल लोकल चला सकता है और उस पर बना सकता है।

जो डेवलपर AI-पावर्ड टूल बनाते रहे हैं, उनके लिए लागत का समीकरण बदल जाता है। प्रोटोटाइप-स्टेज प्रोडक्ट के लिए API बिल एक असली रुकावट रहे हैं। Swiftlet डेवलपमेंट और टेस्टिंग के दौरान उस रुकावट को खत्म कर देता है। मॉडल आपकी मशीन पर चलता है, इसकी प्रति क्वेरी कोई लागत नहीं है, और इनफरेंस इंटरैक्टिव इस्तेमाल के लिए काफी तेज़ है।

We.Inc जैसे बिल्डर के साथ जो फ्रंटएंड और होस्टिंग संभालता है, "मेरे पास एक AI टूल का आइडिया है" से "यह एक कस्टम डोमेन पर लाइव है" तक का रास्ता अब है: Swiftlet इंस्टॉल करें, ऐप का वर्णन करें, इसे localhost पर इंगित करें, पब्लिश करें। आइडिया और प्रोडक्ट के बीच कदमों की संख्या में यह एक सार्थक कमी है।

मुफ्त में We.Inc के साथ बनाना शुरू करें और इसे अपने लोकल Swiftlet एंडपॉइंट से जोड़ें। जब चाहें कोड को GitHub पर एक्सपोर्ट करें।

फ़्री में शुरू करें · क्रेडिट कार्ड की ज़रूरत नहीं

Product

Who It's For

Features

Resources

Company

View Sitemap