Swiftlet Menjalankan LLM 80B dalam 4,3 GB RAM di Mac. Begini Cara Membangun di Atasnya.

Proyek open-source baru bernama Swiftlet menggunakan kuantisasi agresif untuk menjalankan Qwen3-80B dalam 4,3 GB RAM di MacBook, dan Qwen3-35B di iPhone. Panduan ini membahas apa artinya itu sebenarnya bagi developer, di mana trade-off kualitasnya, dan cara menghubungkan endpoint LLM lokal ke produk nyata hari ini.

Pertanyaan yang sering diajukan

Apa itu Swiftlet?

Swiftlet adalah proyek open-source (github.com/leonickson1/Swiftlet) yang menjalankan large language model di hardware Apple menggunakan teknik kuantisasi ekstrem. Ini bisa menjalankan Qwen3-80B dalam 4,3 GB RAM di Mac dan Qwen3-35B di iPhone. Ditulis dalam Swift dan dioptimalkan untuk framework GPU Metal Apple.

Bagaimana Swiftlet memuat model 80B ke dalam 4,3 GB RAM?

Swiftlet menggunakan kuantisasi agresif, kemungkinan sub-2-bit, untuk mengompres bobot model jauh di bawah ukuran aslinya. Model 80B parameter pada presisi penuh (FP16) membutuhkan sekitar 160 GB memori. Pada kuantisasi 4-bit butuh sekitar 40 GB. Pada tingkat 4,3 GB yang dicapai Swiftlet, kuantisasinya ekstrem, sekitar 0,4 bit per parameter rata-rata, yang menggunakan teknik seperti kuantisasi berkelompok dan alokasi bit berbobot kepentingan untuk menjaga kualitas pada bobot paling kritis.

Apakah kualitasnya cukup baik untuk penggunaan produksi?

Tergantung tugasnya. Kuantisasi ekstrem menjaga pengetahuan umum model dan kemampuan mengikuti instruksi dengan baik, tapi menurunkan performa pada tugas yang membutuhkan penalaran numerik presisi, logika multi-langkah kompleks, atau output terstruktur panjang. Untuk antarmuka percakapan, pembuatan konten, dan klasifikasi, kualitasnya mengejutkan bisa dipakai. Untuk pembuatan kode atau penalaran kompleks, model lebih kecil dengan kuantisasi lebih ringan (seperti Qwen3-35B pada 4-bit) mungkin menghasilkan hasil lebih baik. Benchmark sebelum merilis.

Bisakah saya membangun app yang menggunakan LLM lokal yang berjalan lewat Swiftlet?

Ya. Swiftlet mengekspos endpoint HTTP lokal (biasanya di localhost:8080) yang menerima prompt dan mengembalikan completion. App web mana pun bisa memanggil endpoint itu. Dengan We.Inc, Anda bisa mendeskripsikan app Anda dalam bahasa sederhana, mendapat app React yang berfungsi segera, menambahkan panggilan fetch ke endpoint Swiftlet lokal, dan punya produk yang berfungsi dalam hitungan menit. Kode yang dihasilkan milik Anda untuk diekspor ke GitHub, jadi Anda tidak terkunci ke platform mana pun.

Swiftlet mencapai halaman depan Hacker News pada Agustus 3, 2026 dengan 260 poin dan 116 komentar. Pitch-nya: jalankan Qwen3-80B, large language model kelas frontier dengan 80 miliar parameter, dalam 4,3 GB RAM di MacBook. Model 35B berjalan di iPhone.

TL;DR: Swiftlet (github.com/leonickson1/Swiftlet) menggunakan kuantisasi ekstrem untuk memuat model yang normalnya butuh 160 GB memori ke dalam hardware Apple konsumen. Trade-off kualitasnya nyata tapi lebih sempit dari yang Anda kira. Jika Anda ingin membangun produk yang ditenagai LLM lokal dengan biaya API nol, ini cara paling mudah diakses untuk memulai. Hubungkan app We.Inc ke endpoint lokal, terbitkan, dan pengguna Anda tidak pernah tahu model berjalan di laptop Anda.

Apa yang Sebenarnya Dilakukan Swiftlet

Triknya inti bukan sihir. Ini kuantisasi yang didorong lebih jauh dari sebagian besar alat.

Matematikanya: Qwen3-80B pada FP16 (presisi standar untuk inferensi) butuh sekitar 160 GB memori. Pada kuantisasi 4-bit yang umum dipakai (GGUF Q4_K_M), butuh sekitar 40 GB. Swiftlet mendorong ke sekitar 0,4 bit per parameter rata-rata, menggunakan kuantisasi berkelompok dengan alokasi bit berbobot kepentingan. Bobot paling kritis (attention head, layer pertama dan terakhir) dapat lebih banyak bit; sebagian besar layer feed-forward dapat lebih sedikit bit.

Target hardware-nya: Apple Silicon. Swiftlet ditulis dalam Swift dan menggunakan Metal untuk akselerasi GPU. Mac M1/M2/M3/M4 dengan memori terpadu adalah titik manisnya karena GPU dan CPU berbagi pool RAM yang sama, yang menghindari bottleneck salin-memori yang membatasi inferensi lokal berbasis NVIDIA.

Yang Anda dapat: server HTTP lokal (biasanya localhost:8080) yang menerima prompt dan mengembalikan completion. Kecepatan generasi token pada MacBook Pro M3 dilaporkan 8-12 token per detik untuk model 80B, yang bisa dipakai untuk aplikasi interaktif tapi tidak instan.

Di Mana Trade-off Kualitas Berada

Kuantisasi ekstrem tidak gratis. Berikut di mana ia bertahan dan di mana tidak, berdasarkan diskusi HN dan pengujian awal:

Bertahan dengan baik:

Menurun jelas:

Kesimpulan praktisnya: jika produk Anda adalah chatbot, peringkas, atau alat konten, 80B pada kuantisasi ekstrem mengejutkan mampu. Jika produk Anda menghasilkan kode atau melakukan matematika, uji 35B pada kuantisasi lebih tinggi sebagai gantinya. Lebih banyak bit per parameter pada model lebih kecil sering mengalahkan lebih sedikit bit pada model lebih besar.

Cara Menghubungkan Endpoint Swiftlet Lokal ke App

Jalur pembangunannya lugas. Anda tidak butuh kunci API cloud atau akun billing.

Langkah 1: Instal dan mulai Swiftlet. Clone repo-nya, unduh bobot Qwen3-80B terkuantisasi (file 4,3 GB), dan jalankan server-nya. Di Mac dengan 8 GB RAM atau lebih, ini mulai dalam sekitar 30 detik.

Langkah 2: Konfirmasi endpoint-nya berfungsi. Kirim prompt uji ke localhost:8080 dengan curl atau klien HTTP mana pun. Anda seharusnya mendapat completion kembali dalam beberapa detik.

Langkah 3: Bangun lapisan app. Di sinilah Anda menghabiskan sebagian besar waktu. Anda butuh frontend yang mengirim input pengguna ke endpoint lokal dan menampilkan responsnya. Dengan We.Inc, deskripsikan app yang Anda inginkan ("asisten penulisan yang mengambil paragraf dan mengembalikan tiga versi tulis ulang") dan AI membangun app React yang berfungsi dengan pratinjau live. Lalu edit panggilan API untuk menunjuk ke endpoint Swiftlet Anda.

Langkah 4: Terbitkan atau ekspor. Anda bisa menerbitkan langsung dari We.Inc ke domain kustom (app-nya memanggil endpoint lokal Anda saat runtime), atau ekspor kodenya ke GitHub dan deploy sendiri. Kodenya React, Vite, dan TypeScript standar tanpa dependensi proprietary.

Hasilnya: app web berkualitas produksi yang ditenagai model 80B lokal, dengan biaya API berkelanjutan nol.

Kapan Inferensi Lokal Masuk Akal (dan Kapan Tidak)

Lokal menang saat:

Cloud menang saat:

Titik tengah yang jujur: gunakan Swiftlet untuk pengembangan dan demo, lalu beralih ke endpoint cloud (OpenRouter, Together AI, API Qwen) untuk skala produksi. Kode app-nya sama saja; Anda hanya mengubah URL endpoint.

Apa Artinya Ini untuk Kategori Ini

Menjalankan model 80B di laptop adalah milestone, bukan karena kualitasnya menyamai datacenter, tapi karena ini menghapus penghalang kunci API sepenuhnya. Siapa pun dengan MacBook sekarang bisa menjalankan model kelas frontier secara lokal dan membangun di atasnya.

Untuk developer yang telah membangun alat bertenaga AI, persamaan biayanya berubah. Tagihan API untuk produk tahap prototipe telah menjadi titik gesekan nyata. Swiftlet menghilangkan gesekan itu selama pengembangan dan pengujian. Modelnya berjalan di mesin Anda, biayanya nol per query, dan inferensinya cukup cepat untuk penggunaan interaktif.

Digabung dengan builder seperti We.Inc yang menangani frontend dan hosting, jalur dari "saya punya ide untuk alat AI" ke "ini live di domain kustom" sekarang: instal Swiftlet, deskripsikan app-nya, arahkan ke localhost, terbitkan. Itu pengurangan bermakna dalam jumlah langkah antara ide dan produk.

Mulai membangun dengan We.Inc gratis dan hubungkan ke endpoint Swiftlet lokal Anda. Ekspor kodenya ke GitHub kapan pun Anda mau.

Mulai gratis · Tanpa kartu kredit

Product

Who It's For

Features

Resources

Company

View Sitemap