Swiftlet запускает LLM 80B в 4.3 ГБ ОЗУ на Mac. Как создавать приложения на её основе

Новый проект с открытым кодом Swiftlet использует агрессивное квантование, чтобы запускать Qwen3-80B в 4.3 ГБ ОЗУ на MacBook, а Qwen3-35B — на iPhone. В руководстве объясняется, что это даёт разработчикам, каковы компромиссы по качеству и как уже сегодня подключить локальную LLM к настоящему продукту.

Частые вопросы

Что такое Swiftlet?

Swiftlet — проект с открытым исходным кодом (github.com/leonickson1/Swiftlet), который запускает большие языковые модели на устройствах Apple с помощью экстремального квантования. Он запускает Qwen3-80B в 4.3 ГБ ОЗУ на Mac и Qwen3-35B на iPhone. Проект написан на Swift и оптимизирован для графического фреймворка Apple Metal.

Как Swiftlet помещает модель 80B в 4.3 ГБ ОЗУ?

Swiftlet использует агрессивное квантование, вероятно ниже 2 бит, чтобы сжать веса модели намного сильнее исходного размера. Для модели с 80 млрд параметров при полной точности FP16 нужно примерно 160 ГБ памяти. При 4-битном квантовании потребуется около 40 ГБ. В Swiftlet модель запускается в 4.3 ГБ благодаря экстремальному квантованию — в среднем около 0.4 бита на параметр. Для сохранения качества на самых важных весах применяются, например, групповое квантование и распределение битов с учётом значимости.

Достаточно ли качества для производственного использования?

Зависит от задачи. Экстремальное квантование хорошо сохраняет общие знания модели и способность следовать инструкциям, но снижает точность в задачах с точными вычислениями, сложной многоэтапной логикой или длинными структурированными ответами. Для диалоговых интерфейсов, создания контента и классификации качество неожиданно приемлемое. Для генерации кода или сложных рассуждений менее квантованная модель меньшего размера (например, Qwen3-35B с квантованием 4 бита) может дать лучший результат. Перед запуском проверьте её на своих задачах.

Можно ли создать приложение с локальной LLM, запущенной через Swiftlet?

Да. Swiftlet предоставляет локальную HTTP-точку (обычно localhost:8080), которая принимает запросы и возвращает ответы. К ней может обращаться любое веб-приложение. В We.Inc можно описать приложение простым языком, сразу получить рабочее приложение React, добавить запрос fetch к локальной точке Swiftlet и за несколько минут получить готовый продукт. Сгенерированный код можно экспортировать в GitHub, поэтому привязки к платформе нет.

3 августа 2026 года (в числовом формате источника — 3, 2026) Swiftlet попал на главную Hacker News: 260 баллов и 116 комментариев. Заявление проекта: запускать Qwen3-80B — передовую большую языковую модель с 80 млрд параметров — в 4.3 ГБ ОЗУ на MacBook. Модель 35B запускается на iPhone.

Кратко: Swiftlet (github.com/leonickson1/Swiftlet) использует экстремальное квантование и запускает модели, которым обычно требуется 160 ГБ памяти, на обычных устройствах Apple. Компромисс по качеству реален, но уже не так велик, как можно ожидать. Если вы хотите создать продукт на локальной LLM без расходов на API, это один из самых доступных способов начать. Подключите приложение We.Inc к локальной точке, опубликуйте его, и пользователи даже не узнают, что модель работает на вашем ноутбуке.

Что именно делает Swiftlet

Основной приём — не магия, а квантование, доведённое дальше, чем в большинстве инструментов.

Расчёты: Qwen3-80B при FP16 (стандартной точности для инференса) требуется примерно 160 ГБ памяти. При распространённом 4-битном квантовании (GGUF Q4_K_M) — около 40 ГБ. Swiftlet снижает показатель примерно до 0.4 бита на параметр в среднем, используя групповое квантование и распределение битов с учётом важности. Самые важные веса (головы внимания, первые и последние слои) получают больше битов, а большая часть полносвязных слоёв — меньше.

Целевое оборудование: Apple Silicon. Swiftlet написан на Swift и использует Metal для ускорения на GPU. Лучше всего подходят Mac с M1/M2/M3/M4 и объединённой памятью: графический и центральный процессоры используют один пул ОЗУ, поэтому нет узкого места из-за копирования памяти, ограничивающего локальный инференс на системах NVIDIA.

Результат: локальный HTTP-сервер (обычно localhost:8080), который принимает запросы и возвращает ответы. По опубликованным данным, на MacBook Pro с M3 скорость генерации составляет 8–12 токенов в секунду для модели 80B. Этого достаточно для интерактивных приложений, хотя ответ появляется не мгновенно.

На чём сказывается компромисс качества

Экстремальное квантование не бесплатно. Ниже — что работает хорошо и что ухудшается согласно обсуждению на Hacker News и первым тестам.

Хорошо справляется с:

Заметно хуже справляется с:

Практический вывод: если ваш продукт — диалоговый помощник, суммаризатор или инструмент для контента, модель 80B с экстремальным квантованием удивительно хорошо подходит. Если продукт генерирует код или решает математические задачи, попробуйте 35B с более высоким уровнем квантования. У меньшей модели с большим числом бит на параметр результат часто лучше, чем у большей модели с меньшим числом бит.

Как подключить локальную точку Swiftlet к приложению

Схема проста. Ключ API для облака и платёжный аккаунт не нужны.

Шаг 1. Установите и запустите Swiftlet. Склонируйте репозиторий, скачайте квантованные веса Qwen3-80B (файл размером 4.3 ГБ) и запустите сервер. На Mac с ОЗУ не менее 8 ГБ запуск занимает около 30 секунд.

Шаг 2. Проверьте точку подключения. Отправьте тестовый запрос на localhost:8080 с помощью curl или любого HTTP-клиента. Через несколько секунд должен прийти ответ.

Шаг 3. Создайте приложение. На это уйдёт больше всего времени. Нужен интерфейс, который передаёт введённый пользователем текст локальной модели и показывает ответ. В We.Inc опишите приложение (например: «помощник для письма, который принимает абзац и возвращает три переписанных варианта»), и ИИ создаст работающее приложение React с предпросмотром. Затем настройте вызов API так, чтобы он обращался к Swiftlet.

Шаг 4. Опубликуйте приложение или экспортируйте его. Можно опубликовать его прямо из We.Inc на собственном домене (во время работы приложение обращается к локальной точке) или экспортировать код в GitHub и самостоятельно развернуть его. Это обычный React, Vite и TypeScript без проприетарных зависимостей.

В результате получится готовое веб-приложение на локальной модели 80B без постоянных расходов на API.

Когда имеет смысл локальный инференс, а когда нет

Локальная модель подходит, когда:

Облачная модель подходит, когда:

Разумный компромисс: использовать Swiftlet для разработки и демонстраций, а затем перейти на облачную точку (OpenRouter, Together AI, Qwen API) для производственного масштаба. Код приложения останется тем же — изменится только URL точки подключения.

Что это значит для отрасли

Запуск модели 80B на ноутбуке — важная веха не потому, что её качество равно качеству модели в дата-центре, а потому что для работы больше не нужен ключ API. Теперь любой владелец MacBook может локально запустить передовую модель и создать на её основе продукт.

Для разработчиков ИИ-инструментов меняется экономика. Счета за API мешали созданию прототипов продуктов. Во время разработки и тестирования Swiftlet устраняет это препятствие: модель работает на вашем компьютере, каждый запрос бесплатен, а скорость инференса подходит для интерактивной работы.

В сочетании с конструктором вроде We.Inc, который берёт на себя интерфейс и хостинг, путь от идеи ИИ-инструмента до запуска на собственном домене теперь такой: установить Swiftlet, описать приложение, подключить localhost и опубликовать. Это заметно сокращает путь от замысла до продукта.

Начните создавать приложение в We.Inc бесплатно и подключите его к локальной точке Swiftlet. Когда захотите, экспортируйте код в GitHub.

Начать бесплатно · Банковская карта не нужна

Product

Who It's For

Features

Resources

Company

View Sitemap