โปรเจกต์โอเพนซอร์ส Swiftlet ใช้การบีบอัดโมเดลขั้นสูงเพื่อรัน Qwen3-80B ด้วย RAM 4.3 GB บน MacBook และ Qwen3-35B บน iPhone คู่มือนี้อธิบายความหมายต่อการพัฒนาแอป คุณภาพที่แลกมา และวิธีเชื่อม LLM ในเครื่องเข้ากับผลิตภัณฑ์จริง
Swiftlet เป็นโปรเจกต์โอเพนซอร์ส (github.com/leonickson1/Swiftlet) สำหรับรันโมเดลภาษาขนาดใหญ่บนฮาร์ดแวร์ Apple ด้วยเทคนิคบีบอัดโมเดลขั้นสูง รัน Qwen3-80B ด้วย RAM 4.3 GB บน Mac และ Qwen3-35B บน iPhone เขียนด้วย Swift และปรับให้ใช้ Metal ซึ่งเป็นเฟรมเวิร์ก GPU ของ Apple
Swiftlet ใช้ quantization อย่างเข้มข้น ซึ่งน่าจะต่ำกว่า 2 บิต เพื่อบีบอัดน้ำหนักโมเดล โมเดล 80B แบบ FP16 ต้องใช้หน่วยความจำราว 160 GB ส่วนแบบ 4 บิตใช้ประมาณ 40 GB การลดเหลือ 4.3 GB เป็น quantization ระดับสุดขั้ว เฉลี่ยราว 0.4 บิตต่อพารามิเตอร์ โดยแบ่งกลุ่มและจัดสรรจำนวนบิตตามความสำคัญ เพื่อรักษาน้ำหนักที่สำคัญที่สุด
ขึ้นอยู่กับงาน Quantization ขั้นสุดขั้วยังรักษาความรู้ทั่วไปและการทำตามคำสั่งได้ดี แต่ลดคุณภาพกับการคำนวณแม่นยำ ตรรกะหลายขั้น หรือผลลัพธ์แบบมีโครงสร้างยาว งานแชต สร้างเนื้อหา และจัดหมวดหมู่ยังใช้ได้ดี ส่วนการสร้างโค้ดหรือให้เหตุผลซับซ้อน Qwen3-35B แบบ 4 บิตอาจดีกว่า ควรวัดผลก่อนเปิดใช้
ได้ Swiftlet เปิด HTTP endpoint ในเครื่อง (โดยทั่วไป localhost:8080) รับ prompt และส่งผลลัพธ์กลับ เว็บแอปเรียก endpoint ได้ ด้วย We.Inc คุณอธิบายแอปเป็นภาษาธรรมดาแล้วได้แอป React ที่ทำงานได้ เพิ่ม fetch call ไปยัง endpoint ของ Swiftlet ก็สร้างต้นแบบได้ในไม่กี่นาที โค้ดเป็นของคุณและส่งออกไป GitHub ได้
Swiftlet ขึ้นหน้าแรกของ Hacker News เมื่อวันที่ สิงหาคม 3, 2026 ด้วยคะแนน 260 และ 116 ความคิดเห็น ข้อเสนอคือรัน Qwen3-80B ซึ่งเป็นโมเดลภาษาขนาดใหญ่ระดับแนวหน้าที่มีพารามิเตอร์ 80 พันล้านตัว โดยใช้ RAM 4.3 GB บน MacBook ส่วนโมเดล 35B รันบน iPhone ได้
สรุปสั้น ๆ: Swiftlet (github.com/leonickson1/Swiftlet) ใช้ quantization ขั้นสุดขั้วเพื่อให้โมเดลที่ปกติต้องใช้หน่วยความจำ 160 GB ทำงานบนอุปกรณ์ Apple ทั่วไปได้ มีข้อแลกเปลี่ยนด้านคุณภาพจริง แต่แคบกว่าที่คิด หากอยากสร้างผลิตภัณฑ์ที่ใช้ LLM ในเครื่องโดยไม่มีค่า API นี่เป็นวิธีเริ่มที่เข้าถึงง่าย เชื่อมแอป We.Inc เข้ากับ endpoint ในเครื่อง เผยแพร่ แล้วผู้ใช้ก็ไม่จำเป็นต้องรู้ว่าโมเดลกำลังทำงานบนแล็ปท็อปของคุณ
เคล็ดลับไม่ใช่เวทมนตร์ แต่คือการทำ quantization ไกลกว่าเครื่องมือส่วนใหญ่
ตัวเลข: Qwen3-80B แบบ FP16 (ความละเอียดมาตรฐานสำหรับ inference) ต้องใช้หน่วยความจำราว 160 GB การ quantization 4 บิตที่ใช้ทั่วไป (GGUF Q4_K_M) ต้องใช้ราว 40 GB ส่วน Swiftlet ลดเหลือเฉลี่ยประมาณ 0.4 บิตต่อพารามิเตอร์ ด้วยการ quantization แบบแบ่งกลุ่มและจัดสรรบิตตามความสำคัญ น้ำหนักที่สำคัญ เช่น attention heads และเลเยอร์แรกกับสุดท้าย ได้บิตมากกว่า ส่วนเลเยอร์ feed-forward ส่วนใหญ่ได้บิตน้อยกว่า
ฮาร์ดแวร์เป้าหมาย: Apple Silicon Swiftlet เขียนด้วย Swift และใช้ Metal เร่ง GPU Mac M1/M2/M3/M4 ที่ใช้หน่วยความจำแบบรวมเหมาะที่สุด เพราะ GPU และ CPU ใช้ RAM ชุดเดียวกัน ลดคอขวดจากการคัดลอกข้อมูลที่จำกัดการรันโมเดลบนฮาร์ดแวร์ NVIDIA
สิ่งที่ได้: เซิร์ฟเวอร์ HTTP ในเครื่อง (ปกติ localhost:8080) รับ prompt และส่งผลลัพธ์กลับ มีรายงานว่าบน MacBook Pro M3 สร้าง token ได้ 8 ถึง 12 token ต่อวินาทีสำหรับโมเดล 80B ซึ่งพอใช้กับแอปโต้ตอบได้แต่ไม่ทันที
Quantization ขั้นสุดขั้วมีต้นทุน จากการสนทนาบน HN และการทดสอบระยะแรก:
ยังทำได้ดี:
คุณภาพลดลงชัดเจน:
หากผลิตภัณฑ์เป็นแชตบอต เครื่องมือสรุป หรือสร้างเนื้อหา โมเดล 80B แบบ quantization ขั้นสุดขั้วยังทำได้ดีอย่างน่าประหลาดใจ แต่ถ้าสร้างโค้ดหรือคำนวณ ให้ทดสอบโมเดล 35B ที่ quantization สูงกว่า หลายครั้งบิตต่อพารามิเตอร์ที่มากกว่าในโมเดลเล็กให้ผลดีกว่าบิตน้อยในโมเดลใหญ่
เส้นทางสร้างตรงไปตรงมา ไม่ต้องใช้ cloud API key หรือบัญชีเรียกเก็บเงิน
ขั้นที่ 1: ติดตั้งและเปิด Swiftlet โคลน repository ดาวน์โหลดน้ำหนัก Qwen3-80B แบบ quantized (ไฟล์ 4.3 GB) แล้วเปิดเซิร์ฟเวอร์ บน Mac ที่มี RAM 8 GB ขึ้นไป ใช้เวลาประมาณ 30 วินาทีจึงเริ่มทำงาน
ขั้นที่ 2: ตรวจ endpoint ส่ง prompt ทดสอบไปที่ localhost:8080 ด้วย curl หรือ HTTP client ใดก็ได้ ควรได้รับผลลัพธ์ในไม่กี่วินาที
ขั้นที่ 3: สร้างส่วนแอป สร้าง frontend ที่ส่งข้อมูลผู้ใช้ไปยัง endpoint ในเครื่องและแสดงคำตอบ ด้วย We.Inc อธิบายแอป เช่น “ผู้ช่วยเขียนที่รับหนึ่งย่อหน้าแล้วส่งข้อความเขียนใหม่สามแบบ” AI จะสร้างแอป React พร้อมตัวอย่างสด จากนั้นแก้ API call ให้ชี้ไปยัง Swiftlet endpoint
ขั้นที่ 4: เผยแพร่หรือส่งออก เผยแพร่จาก We.Inc ไปยังโดเมนของคุณได้โดยตรง (แอปเรียก endpoint ในเครื่องของคุณขณะทำงาน) หรือส่งโค้ดออกไป GitHub แล้ว deploy เอง โค้ดเป็น React, Vite และ TypeScript มาตรฐาน ไม่มี dependency เฉพาะแพลตฟอร์ม
ผลที่ได้คือเว็บแอปพร้อมใช้งานที่ขับเคลื่อนด้วยโมเดล 80B ในเครื่อง โดยไม่มีค่า API ต่อเนื่อง
การรันในเครื่องเหมาะเมื่อ:
Cloud เหมาะเมื่อ:
แนวทางกลางคือใช้ Swiftlet ระหว่างพัฒนาและทำเดโม แล้วเปลี่ยนไปใช้ cloud endpoint (OpenRouter, Together AI หรือ Qwen API) เมื่อพร้อมขยายการใช้งาน โค้ดแอปเหมือนเดิม เปลี่ยนแค่ URL endpoint
การรันโมเดล 80B บนแล็ปท็อปเป็นหมุดหมาย ไม่ใช่เพราะคุณภาพเทียบเท่าศูนย์ข้อมูล แต่เพราะตัดอุปสรรคเรื่อง API key ใครมี MacBook ก็รันโมเดลระดับแนวหน้าในเครื่องและสร้างแอปต่อได้
สำหรับนักพัฒนาเครื่องมือ AI สมการค่าใช้จ่ายเปลี่ยนไป ค่า API ระหว่างทำต้นแบบเป็นแรงเสียดทานจริง Swiftlet ตัดปัญหานี้ระหว่างพัฒนาและทดสอบ โมเดลทำงานบนเครื่อง ไม่เสียค่าใช้จ่ายต่อคำถาม และเร็วพอสำหรับการโต้ตอบ
เมื่อใช้ร่วมกับเครื่องมือสร้างอย่าง We.Inc ที่ดูแล frontend และโฮสต์ เส้นทางจาก “มีไอเดียเครื่องมือ AI” ไปสู่ “เปิดใช้บนโดเมนของตัวเอง” คือ ติดตั้ง Swiftlet อธิบายแอป ชี้ไป localhost แล้วเผยแพร่ ช่วยลดขั้นตอนจากไอเดียสู่ผลิตภัณฑ์
เริ่มสร้างด้วย We.Inc ฟรี แล้วเชื่อมกับ Swiftlet endpoint ในเครื่อง ส่งออกโค้ดไป GitHub ได้ทุกเมื่อ
เริ่มต้นฟรี · ไม่ต้องใช้บัตรเครดิต