Swiftlet запускає 80B LLM у 4,3 ГБ пам’яті Mac. Як створювати на її основі

Новий відкритий проєкт Swiftlet завдяки агресивному квантуванню запускає Qwen3-80B у 4,3 ГБ оперативної пам’яті MacBook, а Qwen3-35B — на iPhone. У посібнику розглянуто значення цього для розробників, компроміси якості та під’єднання локальної LLM до реального продукту вже сьогодні.

Поширені запитання

Що таке Swiftlet?

Swiftlet — відкритий проєкт (github.com/leonickson1/Swiftlet), який запускає великі мовні моделі на пристроях Apple за допомогою екстремальних методів квантування. Він запускає Qwen3-80B у 4,3 ГБ пам’яті Mac і Qwen3-35B на iPhone. Проєкт написано мовою Swift і оптимізовано для графічного фреймворку Apple Metal.

Як Swiftlet вміщує модель 80B у 4,3 ГБ оперативної пам’яті?

Swiftlet використовує агресивне квантування, імовірно нижче 2 бітів, щоб стиснути ваги моделі значно нижче початкового розміру. Моделі з 80 млрд параметрів у повній точності FP16 потрібно близько 160 ГБ пам’яті, а за 4-бітового квантування — приблизно 40 ГБ. У Swiftlet рівень 4,3 ГБ означає екстремальне квантування — у середньому близько 0,4 біта на параметр — із груповим квантуванням і розподілом бітів за важливістю, щоб краще зберегти критичні ваги.

Чи достатня якість для виробничого використання?

Це залежить від завдання. Екстремальне квантування добре зберігає загальні знання моделі та виконання інструкцій, але погіршує результати для точних числових обчислень, складної багатокрокової логіки й довгих структурованих відповідей. Для діалогів, створення контенту й класифікації якість напрочуд придатна. Для генерування коду або складних міркувань менша модель Qwen3-35B із 4-бітовим квантуванням може бути кращою. Перевірте її на тестах перед випуском.

Чи можна створити застосунок на локальній LLM, запущеній через Swiftlet?

Так. Swiftlet відкриває локальну HTTP-точку (зазвичай localhost:8080), яка приймає запити й повертає відповіді. Будь-який вебзастосунок може звернутися до неї. У We.Inc можна описати застосунок простою мовою й одразу отримати робочий React-застосунок, додати fetch-запит до локальної точки Swiftlet і за кілька хвилин отримати робочий продукт. Згенерований код належить вам і його можна експортувати до GitHub.

3 серпня 2026 (3, 2026) року Swiftlet вийшов на головну сторінку Hacker News і зібрав 260 балів та 116 коментарів. Обіцянка проєкту: запускати Qwen3-80B — передову велику мовну модель із 80 мільярдами параметрів — у 4,3 ГБ оперативної пам’яті MacBook. Модель 35B запускається на iPhone.

Коротко: Swiftlet (github.com/leonickson1/Swiftlet) використовує екстремальне квантування, щоб запускати моделі, яким зазвичай потрібно 160 ГБ пам’яті, на пристроях Apple для звичайних користувачів. Компроміс у якості реальний, але вужчий, ніж можна очікувати. Якщо хочете створити продукт на локальній LLM без витрат на API, це один із найдоступніших способів почати. Під’єднайте застосунок We.Inc до локальної точки, опублікуйте його — і користувачі не знатимуть, що модель працює на вашому ноутбуці.

Що насправді робить Swiftlet

Основний прийом — не магія, а квантування, доведене далі, ніж у більшості інструментів.

Математика: для Qwen3-80B у FP16 (стандартна точність інференсу) потрібно приблизно 160 ГБ пам’яті. За поширеного 4-бітового квантування GGUF Q4_K_M потрібно близько 40 ГБ. Swiftlet знижує показник у середньому приблизно до 0,4 біта на параметр за допомогою групового квантування й розподілу бітів із урахуванням важливості. Найважливіші ваги (голови уваги, перші й останні шари) отримують більше бітів, а більшість шарів прямого поширення — менше.

Цільове обладнання: Apple Silicon. Swiftlet написано мовою Swift і використовує Metal для прискорення на графічному процесорі. Найкраще підходять комп’ютери Mac M1/M2/M3/M4 з об’єднаною пам’яттю: графічний і центральний процесори спільно використовують RAM, що усуває вузьке місце з копіюванням пам’яті, яке обмежує локальний інференс на системах NVIDIA.

Що ви отримуєте: локальний HTTP-сервер (зазвичай localhost:8080), який приймає запити й повертає відповіді. За повідомленнями, на MacBook Pro M3 модель 80B генерує 8–12 токенів за секунду. Цього досить для інтерактивних застосунків, але відповідь не миттєва.

Як впливає компроміс у якості

Екстремальне квантування має свою ціну. За обговоренням на Hacker News і ранніми тестами, ось де воно працює добре, а де — гірше:

Добре справляється з:

Помітно гірше справляється з:

Практичний висновок: для розмовного помічника, підсумовувача чи інструмента для контенту модель 80B з екстремальним квантуванням напрочуд дієздатна. Якщо продукт генерує код або виконує математичні обчислення, протестуйте 35B із вищим рівнем квантування. Більша кількість бітів на параметр меншої моделі часто дає кращий результат, ніж менша кількість бітів у більшої.

Як під’єднати локальну точку Swiftlet до застосунку

Запуск простий. Хмарний API-ключ і платіжний акаунт не потрібні.

Крок 1. Встановіть і запустіть Swiftlet. Клонуйте репозиторій, завантажте квантизовані ваги Qwen3-80B (файл на 4,3 ГБ) і запустіть сервер. На Mac із RAM від 8 ГБ запуск триває приблизно 30 секунд.

Крок 2. Перевірте роботу точки. Надішліть тестовий запит на localhost:8080 за допомогою curl чи будь-якого HTTP-клієнта. За кілька секунд має надійти відповідь.

Крок 3. Створіть рівень застосунку. Тут ви витратите найбільше часу. Потрібен інтерфейс, який надсилає введений користувачем текст локальній точці й показує відповідь. У We.Inc опишіть застосунок (наприклад, «помічник для письма, який отримує абзац і повертає три перефразовані версії»), і ШІ створить робочий React-застосунок із попереднім переглядом. Потім змініть API-запит, щоб він звертався до точки Swiftlet.

Крок 4. Опублікуйте або експортуйте. Можна опублікувати застосунок безпосередньо з We.Inc на власному домені (під час роботи застосунок звертатиметься до локальної точки) або експортувати код до GitHub і розгорнути самостійно. Це звичайний код React, Vite і TypeScript без пропрієтарних залежностей.

У результаті ви отримаєте вебзастосунок виробничої якості на локальній моделі 80B без постійних витрат на API.

Коли доречний локальний інференс, а коли — ні

Локальний інференс варто обрати, якщо:

Хмару варто обрати, якщо:

Зважений підхід: використовуйте Swiftlet для розробки й демонстрацій, а для виробничого масштабу перейдіть на хмарну точку (OpenRouter, Together AI, Qwen API). Код застосунку однаковий — зміниться лише URL точки.

Що це означає для галузі

Запуск 80B-моделі на ноутбуці — важлива віха не тому, що якість дорівнює дата-центру, а тому, що зникає потреба в API-ключі. Тепер кожен власник MacBook може запускати локально передову модель і створювати на її основі продукти.

Для розробників інструментів на основі ШІ змінюється економіка. Витрати на API під час створення прототипів справді заважали. Swiftlet прибирає цю перешкоду під час розробки й тестування. Модель працює на вашому пристрої, запити нічого не коштують, а інференс достатньо швидкий для інтерактивної роботи.

У поєднанні з конструктором на кшталт We.Inc, який бере на себе інтерфейс і хостинг, шлях від «маю ідею ШІ-інструмента» до «він доступний на власному домені» тепер такий: встановити Swiftlet, описати застосунок, вказати localhost і опублікувати. Це помітно скорочує шлях від ідеї до продукту.

Почніть безплатно створювати з We.Inc і під’єднайте застосунок до локальної точки Swiftlet. За бажанням експортуйте код до GitHub.

Почати безкоштовно · Банківська картка не потрібна

Product

Who It's For

Features

Resources

Company

View Sitemap