Dự án mã nguồn mở Swiftlet dùng lượng tử hóa mạnh để chạy Qwen3-80B trong 4.3 GB RAM trên MacBook và Qwen3-35B trên iPhone. Hướng dẫn giải thích điều đó có ý nghĩa gì với nhà phát triển, đánh đổi chất lượng và cách kết nối LLM cục bộ với sản phẩm thực tế ngay hôm nay.
Swiftlet là dự án mã nguồn mở (github.com/leonickson1/Swiftlet) chạy mô hình ngôn ngữ lớn trên phần cứng Apple bằng kỹ thuật lượng tử hóa cực mạnh. Dự án chạy được Qwen3-80B trong 4.3 GB RAM trên Mac và Qwen3-35B trên iPhone. Phần mềm được viết bằng Swift và tối ưu cho khung GPU Metal của Apple.
Swiftlet dùng lượng tử hóa mạnh, có thể dưới 2-bit, để nén trọng số mô hình nhỏ hơn nhiều so với kích thước ban đầu. Mô hình 80B tham số ở độ chính xác đầy đủ (FP16) cần khoảng 160 GB bộ nhớ. Với lượng tử hóa 4-bit, cần khoảng 40 GB. Để đạt mức 4.3 GB, Swiftlet lượng tử hóa cực mạnh, trung bình khoảng 0.4 bit mỗi tham số, bằng các kỹ thuật như lượng tử hóa theo nhóm và phân bổ bit theo mức độ quan trọng nhằm giữ chất lượng ở những trọng số thiết yếu nhất.
Tùy nhiệm vụ. Lượng tử hóa cực mạnh giữ khá tốt kiến thức tổng quát và khả năng làm theo chỉ dẫn của mô hình, nhưng giảm hiệu suất ở nhiệm vụ cần suy luận số chính xác, logic phức tạp nhiều bước hoặc đầu ra có cấu trúc dài. Với giao diện hội thoại, tạo nội dung và phân loại, chất lượng dùng được một cách đáng ngạc nhiên. Với tạo mã hoặc suy luận phức tạp, mô hình nhỏ hơn nhưng ít lượng tử hóa hơn (như Qwen3-35B ở 4-bit) có thể cho kết quả tốt hơn. Hãy đánh giá trước khi phát hành.
Có. Swiftlet mở một điểm cuối HTTP cục bộ (thường tại localhost:8080) nhận lời nhắc và trả về phần tiếp nối văn bản. Ứng dụng web nào cũng có thể gọi điểm cuối này. Với We.Inc, bạn mô tả ứng dụng bằng ngôn ngữ thông thường, nhận ngay ứng dụng React hoạt động được, thêm lời gọi fetch đến điểm cuối Swiftlet cục bộ và có sản phẩm hoạt động trong vài phút. Mã được tạo là của bạn để xuất sang GitHub, nên bạn không bị khóa vào nền tảng nào.
Swiftlet xuất hiện trên trang đầu Hacker News ngày ngày 3, 2026 với 260 điểm và 116 bình luận. Nội dung giới thiệu: chạy Qwen3-80B, mô hình ngôn ngữ lớn hàng đầu có 80 tỷ tham số, chỉ trong 4.3 GB RAM trên MacBook. Mô hình 35B chạy trên iPhone.
Tóm tắt: Swiftlet (github.com/leonickson1/Swiftlet) dùng lượng tử hóa cực mạnh để chạy trên phần cứng Apple phổ thông các mô hình vốn cần 160 GB bộ nhớ. Đánh đổi chất lượng là có thật nhưng hẹp hơn dự đoán. Nếu muốn xây sản phẩm chạy bằng LLM cục bộ mà không tốn phí API, đây là cách dễ tiếp cận nhất để bắt đầu. Kết nối ứng dụng We.Inc với điểm cuối cục bộ, xuất bản và người dùng sẽ không biết mô hình đang chạy trên máy tính xách tay của bạn.
Thủ thuật cốt lõi không phải phép màu. Đó là lượng tử hóa được đẩy xa hơn hầu hết công cụ khác.
Phép tính: Qwen3-80B ở FP16 (độ chính xác tiêu chuẩn cho suy luận) cần khoảng 160 GB bộ nhớ. Ở mức lượng tử hóa 4-bit thường dùng (GGUF Q4_K_M), cần khoảng 40 GB. Swiftlet giảm xuống trung bình khoảng 0.4 bit mỗi tham số bằng lượng tử hóa theo nhóm và phân bổ bit dựa trên tầm quan trọng. Trọng số quan trọng nhất (đầu attention, lớp đầu và lớp cuối) nhận nhiều bit hơn; phần lớn lớp truyền thẳng nhận ít bit hơn.
Phần cứng mục tiêu: Apple Silicon. Swiftlet viết bằng Swift và dùng Metal để tăng tốc GPU. Mac M1/M2/M3/M4 có bộ nhớ hợp nhất là lựa chọn phù hợp nhất vì GPU và CPU dùng chung một vùng RAM, tránh nút thắt sao chép bộ nhớ giới hạn suy luận cục bộ trên máy dùng NVIDIA.
Kết quả: máy chủ HTTP cục bộ (thường ở localhost:8080) nhận lời nhắc và trả về phần tiếp nối văn bản. Tốc độ tạo token trên MacBook Pro M3 được báo cáo ở mức 8-12 token mỗi giây với mô hình 80B; đủ dùng cho ứng dụng tương tác nhưng không tức thời.
Lượng tử hóa cực mạnh không miễn phí. Dựa trên thảo luận ở HN và thử nghiệm ban đầu, đây là những việc hoạt động tốt và chưa tốt:
Hoạt động tốt:
Giảm chất lượng thấy rõ:
Bài học thực tế: nếu sản phẩm là chatbot, công cụ tóm tắt hoặc tạo nội dung, mô hình 80B ở mức lượng tử hóa cực mạnh có năng lực đáng ngạc nhiên. Nếu sản phẩm tạo mã hoặc làm toán, hãy thử mô hình 35B ở mức lượng tử hóa cao hơn. Nhiều bit hơn cho mỗi tham số trong mô hình nhỏ thường hiệu quả hơn ít bit trong mô hình lớn.
Quy trình xây dựng khá đơn giản. Bạn không cần khóa API đám mây hoặc tài khoản thanh toán.
Bước 1: Cài đặt và chạy Swiftlet. Sao chép kho mã nguồn, tải trọng số Qwen3-80B đã lượng tử hóa (tệp 4.3 GB) rồi khởi chạy máy chủ. Trên Mac có ít nhất 8 GB RAM, máy chủ khởi động trong khoảng 30 giây.
Bước 2: Xác nhận điểm cuối hoạt động. Gửi lời nhắc thử đến localhost:8080 bằng curl hoặc bất kỳ máy khách HTTP nào. Bạn sẽ nhận phần tiếp nối trong vài giây.
Bước 3: Xây lớp ứng dụng. Phần này chiếm phần lớn thời gian. Bạn cần giao diện gửi nội dung người dùng đến điểm cuối cục bộ và hiển thị câu trả lời. Với We.Inc, hãy mô tả ứng dụng muốn tạo ("trợ lý viết nhận một đoạn văn rồi trả về ba phiên bản viết lại") để AI xây ứng dụng React hoạt động kèm bản xem trước trực tiếp. Sau đó chỉnh lời gọi API để trỏ đến điểm cuối Swiftlet.
Bước 4: Xuất bản hoặc xuất mã. Bạn có thể xuất bản trực tiếp từ We.Inc lên tên miền riêng (ứng dụng gọi điểm cuối cục bộ khi chạy) hoặc xuất mã sang GitHub rồi tự triển khai. Mã là React, Vite và TypeScript tiêu chuẩn, không có phụ thuộc độc quyền.
Kết quả: ứng dụng web chất lượng sản xuất chạy bằng mô hình 80B cục bộ mà không tốn phí API định kỳ.
Cục bộ phù hợp khi:
Đám mây phù hợp khi:
Lựa chọn trung dung trung thực: dùng Swiftlet để phát triển và trình diễn, sau đó chuyển sang điểm cuối đám mây (OpenRouter, Together AI, Qwen API) khi triển khai ở quy mô sản xuất. Mã ứng dụng không đổi; chỉ cần thay URL điểm cuối.
Chạy mô hình 80B trên máy tính xách tay là một cột mốc, không phải vì chất lượng ngang trung tâm dữ liệu, mà vì nó loại bỏ hoàn toàn rào cản khóa API. Bất kỳ ai có MacBook giờ đều có thể chạy cục bộ mô hình hàng đầu và xây dựng dựa trên nó.
Với nhà phát triển công cụ dùng AI, phép tính chi phí đã thay đổi. Hóa đơn API cho sản phẩm giai đoạn mẫu thử là trở ngại thật. Swiftlet xóa bỏ trở ngại đó trong lúc phát triển và thử nghiệm. Mô hình chạy trên máy bạn, mỗi truy vấn không tốn phí và suy luận đủ nhanh cho sử dụng tương tác.
Kết hợp với trình tạo như We.Inc xử lý giao diện và lưu trữ, lộ trình từ "tôi có ý tưởng cho một công cụ AI" đến "công cụ đã hoạt động trên tên miền riêng" giờ là: cài Swiftlet, mô tả ứng dụng, trỏ đến localhost rồi xuất bản. Số bước từ ý tưởng đến sản phẩm đã giảm đáng kể.
Bắt đầu xây miễn phí với We.Inc rồi kết nối ứng dụng với điểm cuối Swiftlet cục bộ. Xuất mã sang GitHub bất cứ khi nào bạn muốn.
Bắt đầu miễn phí · Không cần thẻ tín dụng