Swiftlet adlı yeni bir açık kaynak proje, aşırı niceleme kullanarak Qwen3-80B'yi bir MacBook'ta 4,3 GB RAM ile, Qwen3-35B'yi bir iPhone'da çalıştırıyor. Bu rehber bunun geliştiriciler için gerçekte ne anlama geldiğini, kalite ödünleşimlerinin nerede olduğunu ve yerel bir LLM uç noktasını bugün gerçek bir ürüne nasıl bağlayacağınızı kapsar.
Swiftlet, büyük dil modellerini aşırı niceleme teknikleriyle Apple donanımında çalıştıran açık kaynak bir projedir (github.com/leonickson1/Swiftlet). Qwen3-80B'yi bir Mac'te 4,3 GB RAM ile ve Qwen3-35B'yi bir iPhone'da çalıştırabilir. Swift ile yazılmıştır ve Apple'ın Metal GPU çerçevesi için optimize edilmiştir.
Swiftlet, model ağırlıklarını özgün boyutlarının çok altına sıkıştırmak için muhtemelen 2 bitin altında agresif niceleme kullanır. Tam hassasiyette (FP16) 80B parametreli bir model kabaca 160 GB bellek gerektirir. 4 bit nicelemede yaklaşık 40 GB gerekir. Swiftlet'in ulaştığı 4,3 GB düzeyinde niceleme aşırıdır; ortalama parametre başına yaklaşık 0,4 bit; en kritik ağırlıklarda kaliteyi korumak için gruplanmış niceleme ve önem ağırlıklı bit tahsisi gibi teknikler kullanır.
Göreve bağlıdır. Aşırı niceleme modelin genel bilgisini ve talimat izleme yeteneğini iyi korur, ama kesin sayısal akıl yürütme, karmaşık çok adımlı mantık veya uzun yapılandırılmış çıktılar gerektiren görevlerde performansı düşürür. Konuşma arayüzleri, içerik üretimi ve sınıflandırma için kalite şaşırtıcı derecede kullanılabilirdir. Kod üretimi veya karmaşık akıl yürütme için daha az nicelenmiş daha küçük bir model (4 bitte Qwen3-35B gibi) daha iyi sonuç verebilir. Yayınlamadan önce kıyaslayın.
Evet. Swiftlet, istemleri kabul eden ve tamamlamalar döndüren yerel bir HTTP uç noktası sunar (tipik olarak localhost:8080). Herhangi bir web uygulaması bu uç noktayı çağırabilir. We.Inc ile uygulamanızı sade bir dille anlatabilir, hemen çalışan bir React uygulaması alabilir, yerel Swiftlet uç noktasına bir fetch çağrısı ekleyebilir ve dakikalar içinde işleyen bir ürüne sahip olabilirsiniz. Üretilen kod GitHub'a aktarmanız için sizindir; bu yüzden hiçbir platforma kilitlenmezsiniz.
Swiftlet, Ağustos 3, 2026'da 260 puan ve 116 yorumla Hacker News ön sayfasına çıktı. Vaat: 80 milyar parametreli, sınır düzeyinde bir büyük dil modeli olan Qwen3-80B'yi bir MacBook'ta 4,3 GB RAM ile çalıştırmak. 35B bir model bir iPhone'da çalışıyor.
Özet: Swiftlet (github.com/leonickson1/Swiftlet), normalde 160 GB bellek gerektiren modelleri tüketici Apple donanımına sığdırmak için aşırı niceleme kullanır. Kalite ödünleşimi gerçek ama beklediğinizden daha dar. Sıfır API maliyetiyle yerel bir LLM'in güçlendirdiği bir ürün kurmak istiyorsanız, başlamanın en erişilebilir yolu budur. Bir We.Inc uygulamasını yerel uç noktaya bağlayın, yayınlayın; kullanıcılarınız modelin dizüstü bilgisayarınızda çalıştığını asla bilmez.
Temel numara sihir değil. Çoğu aracın gittiğinden daha ileri götürülmüş niceleme.
Matematik: FP16'da (çıkarım için standart hassasiyet) Qwen3-80B kabaca 160 GB bellek gerektirir. Yaygın kullanılan 4 bitlik nicelemede (GGUF Q4_K_M) yaklaşık 40 GB gerekir. Swiftlet, önem ağırlıklı bit tahsisiyle gruplanmış niceleme kullanarak parametre başına ortalama kabaca 0,4 bite iter. En kritik ağırlıklar (dikkat başlıkları, ilk ve son katmanlar) daha fazla bit alır; ileri beslemeli katmanların büyük kısmı daha azını alır.
Donanım hedefi: Apple Silicon. Swiftlet Swift ile yazılmıştır ve GPU hızlandırması için Metal kullanır. Birleşik belleğe sahip M1/M2/M3/M4 Mac'ler tatlı noktadır, çünkü GPU ve CPU aynı RAM havuzunu paylaşır; bu, NVIDIA tabanlı yerel çıkarımı sınırlayan bellek kopyalama darboğazını önler.
Ne elde edersiniz: istemleri kabul eden ve tamamlamalar döndüren yerel bir HTTP sunucusu (tipik olarak localhost:8080). Bir M3 MacBook Pro'da 80B model için jeton üretim hızı saniyede 8-12 jeton olarak bildiriliyor; bu etkileşimli uygulamalar için kullanılabilir ama anlık değil.
Aşırı niceleme bedava değil. HN tartışmasına ve erken testlere dayanarak, nerede dayandığı ve nerede dayanmadığı:
İyi dayanır:
Gözle görülür biçimde bozulur:
Pratik çıkarım: ürününüz bir AI asistanı, bir özetleyici veya bir içerik aracıysa, aşırı nicelemeli 80B şaşırtıcı derecede yetkindir. Ürününüz kod üretiyor veya matematik yapıyorsa, bunun yerine daha yüksek nicelemeli 35B'yi test edin. Daha küçük bir modelde parametre başına daha fazla bit, çoğu zaman daha büyük bir modelde daha az biti yener.
Yapım yolu basit. Bir bulut API anahtarına veya faturalama hesabına ihtiyacınız yok.
1. Adım: Swiftlet'i kurun ve başlatın. Depoyu klonlayın, nicelenmiş Qwen3-80B ağırlıklarını (4,3 GB'lık dosya) indirin ve sunucuyu çalıştırın. 8 GB veya daha fazla RAM'li bir Mac'te yaklaşık 30 saniyede başlar.
2. Adım: Uç noktanın çalıştığını doğrulayın. curl veya herhangi bir HTTP istemcisiyle localhost:8080'e bir test istemi gönderin. Birkaç saniye içinde bir tamamlama almalısınız.
3. Adım: Uygulama katmanını kurun. Zamanınızın çoğunu harcayacağınız yer burası. Kullanıcı girdisini yerel uç noktaya gönderen ve yanıtı gösteren bir ön yüze ihtiyacınız var. We.Inc ile istediğiniz uygulamayı ("bir paragraf alıp üç yeniden yazılmış sürüm döndüren bir yazma asistanı") anlatın ve AI canlı önizlemeli çalışan bir React uygulaması kurar. Ardından API çağrısını Swiftlet uç noktanıza işaret edecek şekilde düzenleyin.
4. Adım: Yayınlayın veya dışa aktarın. We.Inc'ten doğrudan özel bir alan adına yayınlayabilir (uygulama çalışma zamanında yerel uç noktanızı çağırır) ya da kodu GitHub'a aktarıp kendiniz dağıtabilirsiniz. Kod, tescilli bağımlılığı olmayan standart React, Vite ve TypeScript'tir.
Sonuç: yerel bir 80B model tarafından güçlendirilen, sıfır süregelen API maliyetli üretim kalitesinde bir web uygulaması.
Yerel kazanır:
Bulut kazanır:
Dürüst orta yol: geliştirme ve demolar için Swiftlet'i kullanın, ardından üretim ölçeği için bir bulut uç noktasına (OpenRouter, Together AI, Qwen API) geçin. Uygulama kodu her iki durumda da aynıdır; yalnızca uç nokta URL'sini değiştirirsiniz.
Bir dizüstü bilgisayarda 80B model çalıştırmak bir dönüm noktasıdır; kalitenin bir veri merkeziyle eşleşmesi nedeniyle değil, API anahtarı engelini tamamen kaldırması nedeniyle. MacBook'u olan herkes artık sınır düzeyinde bir modeli yerel çalıştırıp üzerine kurabilir.
AI destekli araçlar geliştiren geliştiriciler için maliyet denklemi değişir. Prototip aşamasındaki ürünler için API faturaları gerçek bir sürtünme noktasıydı. Swiftlet bu sürtünmeyi geliştirme ve test sırasında ortadan kaldırır. Model makinenizde çalışır, sorgu başına hiçbir şeye mal olmaz ve çıkarım etkileşimli kullanım için yeterince hızlıdır.
Ön yüzü ve barındırmayı halleden We.Inc gibi bir oluşturucuyla birleştiğinde, "bir AI aracı fikrim var"dan "özel bir alan adında canlı"ya giden yol artık şu: Swiftlet'i kurun, uygulamayı anlatın, localhost'a yönlendirin, yayınlayın. Bu, fikir ile ürün arasındaki adım sayısında anlamlı bir azalmadır.
We.Inc ile ücretsiz kurmaya başlayın ve yerel Swiftlet uç noktanıza bağlayın. Kodu istediğiniz zaman GitHub'a aktarın.
Ücretsiz başlayın · Kredi kartı gerekmez