开源项目 Swiftlet 使用激进量化,让 Qwen3-80B 在 MacBook 上以 4.3 GB 内存运行,并让 Qwen3-35B 在 iPhone 上运行。本指南介绍这对开发者的实际意义、质量取舍,以及如何将本地模型端点接入真实产品。
Swiftlet 是一个开源项目(github.com/leonickson1/Swiftlet),通过极端量化技术在 Apple 硬件上运行大型语言模型。它可在 Mac 上用 4.3 GB 内存运行 Qwen3-80B,也可在 iPhone 上运行 Qwen3-35B。项目使用 Swift 编写,并针对 Apple 的 Metal GPU 框架优化。
Swiftlet 使用激进量化(可能低于 2 位)将模型权重压缩到远小于原始尺寸。完整精度 FP16 的 80B 参数模型大约需要 160 GB 内存;使用 4 位量化时约需 40 GB。Swiftlet 达到 4.3 GB,意味着平均每个参数约 0.4 位,采用分组量化和按重要性分配位数等技术,尽量保留关键权重的质量。
取决于任务。极端量化能较好保留模型的一般知识和遵循指令的能力,但会降低精确数学推理、复杂多步骤逻辑和长结构化输出的表现。对对话界面、内容生成和分类而言,质量出人意料地可用。代码生成或复杂推理时,量化程度较低的小模型(例如 4 位量化的 Qwen3-35B)可能效果更好。发布前应进行基准测试。
可以。Swiftlet 会开放本地 HTTP 端点(通常为 localhost:8080),接受提示并返回生成结果。任何 Web 应用都能调用该端点。使用 We.Inc 时,你可以用通俗英语描述应用,立即获得可运行的 React 应用,再添加 fetch 调用至本地 Swiftlet 端点,几分钟内即可运行。生成的代码归你所有,可导出到 GitHub,不会被任何平台锁定。
2026 年 8 月 3 日(原文日期数字:3, 2026),Swiftlet 登上 Hacker News 首页,获得 260 分和 116 条评论。项目宣传重点是:在 MacBook 上用 4.3 GB 内存运行具有前沿能力、包含 80 billion 参数的 Qwen3-80B 大型语言模型;35B 模型则可在 iPhone 上运行。
重点摘要:Swiftlet(github.com/leonickson1/Swiftlet)采用极端量化,让通常需要 160 GB 内存的模型在消费级 Apple 硬件上运行。质量取舍确实存在,但影响范围比预想的窄。若要开发无需 API 费用的本地模型产品,这是最容易入门的方式之一。将 We.Inc 应用连接到本地端点并发布后,用户不会知道模型运行在你的笔记本电脑上。
核心技巧并非魔法,而是把量化推得比多数工具更远。
计算原理:标准推理精度 FP16 下,Qwen3-80B 约需 160 GB 内存;常见的 4 位量化(GGUF Q4_K_M)约需 40 GB。Swiftlet 将平均值推至每个参数约 0.4 位,采用分组量化和按重要性分配位数。关键权重(注意力头、第一层和最后一层)分配较多位数,大部分前馈层分配较少位数。
硬件目标:Apple Silicon。Swiftlet 使用 Swift 编写,并用 Metal 加速 GPU。拥有统一内存的 M1/M2/M3/M4 Mac 是理想设备,因为 GPU 和 CPU 共用同一内存池,避免了限制 NVIDIA 本地推理的内存复制瓶颈。
实际输出:本地 HTTP 服务(通常为 localhost:8080),接收提示并返回生成内容。据报告,80B 模型在 M3 MacBook Pro 上的生成速度为每秒 8–12 个 token,可用于交互式应用,但不是即时响应。
极端量化有代价。根据 Hacker News 讨论和早期测试,以下场景表现较好或较差。
表现良好:
明显下降:
实际而言,如果产品是对话助手、摘要器或内容工具,极端量化的 80B 能力出人意料地好;如果产品要生成代码或处理数学,应测试更高量化位数的 35B。较小模型的每参数位数更多时,表现往往胜过较大模型的低位数版本。
开发流程直接,无需云 API 密钥或付款账户。
第 1 步:安装并启动 Swiftlet。克隆代码库,下载量化后的 Qwen3-80B 权重(4.3 GB 文件),然后启动服务。内存至少为 8 GB 的 Mac 大约 30 秒即可启动。
第 2 步:确认端点可用。用 curl 或任意 HTTP 客户端向 localhost:8080 发送测试提示,几秒内应能收到生成结果。
第 3 步:搭建应用界面。大部分时间会花在这一步。你需要前端将用户输入发送至本地端点并显示回应。使用 We.Inc,描述所需应用(例如“写作助手,输入一段文字后返回 3 个改写版本”),AI 就会生成可运行的 React 应用和实时预览。随后修改 API 调用,让它指向 Swiftlet 端点。
第 4 步:发布或导出。可直接从 We.Inc 发布到自定义域名(应用运行时会调用你的本地端点),也可将代码导出到 GitHub 并自行部署。代码使用标准 React、Vite 和 TypeScript,不依赖专有组件。
最终得到一个由本地 80B 模型驱动的生产级 Web 应用,而且没有持续 API 费用。
适合本地运行的情形:
适合云端的情形:
现实的折中方案是:开发和演示时使用 Swiftlet,正式扩大规模时切换云端端点(OpenRouter、Together AI 或 Qwen API)。应用代码无需变化,只需更改端点 URL。
在笔记本电脑上运行 80B 模型是一个里程碑,重点不是质量已达到数据中心水平,而是完全移除了 API 密钥门槛。任何拥有 MacBook 的人现在都能本地运行前沿级模型并在其上开发产品。
对一直在开发 AI 工具的人来说,成本结构有所变化。原型阶段的 API 账单一直是实际阻力。Swiftlet 消除了开发和测试期间的这项摩擦:模型在自己的机器上运行,每次查询无需付费,速度足够支持交互。
若搭配 We.Inc 等处理前端和托管的建站工具,从“我有一个 AI 工具点子”到“它已发布到自定义域名”,流程变为:安装 Swiftlet、描述应用、指向 localhost、发布。这实质减少了从创意到产品的步骤。
免费开始使用 We.Inc 搭建,并连接本地 Swiftlet 端点。你可随时将代码导出到 GitHub。
免费开始 · 无需信用卡