Swiftlet uruchamia LLM 80B w 4.3 GB RAM na Macu. Jak na nim budować

Nowy projekt open source Swiftlet dzięki agresywnej kwantyzacji uruchamia Qwen3-80B w 4.3 GB RAM na MacBooku, a Qwen3-35B na iPhonie. Co to znaczy dla programistów, gdzie leżą kompromisy jakości i jak podłączyć lokalny LLM do produktu.

Najczęściej zadawane pytania

Czym jest Swiftlet?

Swiftlet to projekt open source (github.com/leonickson1/Swiftlet), który uruchamia duże modele językowe na sprzęcie Apple, stosując ekstremalne techniki kwantyzacji. Potrafi uruchomić Qwen3-80B w 4.3 GB RAM na Macu i Qwen3-35B na iPhonie. Jest napisany w Swift i zoptymalizowany pod framework GPU Apple Metal.

Jak Swiftlet mieści model 80B w 4.3 GB RAM?

Swiftlet stosuje agresywną kwantyzację, prawdopodobnie poniżej 2 bitów, aby skompresować wagi modelu znacznie poniżej ich pierwotnego rozmiaru. Model o 80B parametrów w pełnej precyzji (FP16) wymaga około 160 GB pamięci. Przy kwantyzacji 4-bitowej potrzebuje około 40 GB. Na poziomie 4.3 GB, który osiąga Swiftlet, kwantyzacja jest ekstremalna, około 0.4 bita na parametr średnio, i wykorzystuje techniki takie jak kwantyzacja grupowa i alokacja bitów ważona istotnością, aby zachować jakość na najważniejszych wagach.

Czy jakość wystarcza do zastosowań produkcyjnych?

To zależy od zadania. Ekstremalna kwantyzacja dobrze zachowuje ogólną wiedzę modelu i umiejętność wykonywania instrukcji, ale pogarsza wyniki w zadaniach wymagających precyzyjnego rozumowania liczbowego, złożonej logiki wieloetapowej lub długich ustrukturyzowanych wyników. W interfejsach konwersacyjnych, generowaniu treści i klasyfikacji jakość jest zaskakująco użyteczna. W generowaniu kodu lub złożonym rozumowaniu lepsze wyniki może dać mniej skwantyzowany mniejszy model (jak Qwen3-35B w 4 bitach). Przetestuj przed wdrożeniem.

Czy mogę zbudować aplikację używającą lokalnego LLM uruchomionego przez Swiftlet?

Tak. Swiftlet udostępnia lokalny punkt końcowy HTTP (zwykle na localhost:8080), który przyjmuje prompty i zwraca odpowiedzi. Każda aplikacja webowa może go wywołać. W We.Inc możesz opisać aplikację zwykłym językiem, od razu dostać działającą aplikację React, dodać wywołanie fetch do lokalnego punktu końcowego Swiftlet i mieć działający produkt w kilka minut. Wygenerowany kod możesz wyeksportować do GitHuba, więc nie jesteś uzależniony od żadnej platformy.

Swiftlet trafił na pierwszą stronę Hacker News sierpnia 3, 2026, z 260 punktami i 116 komentarzami. Obietnica: uruchomić Qwen3-80B, duży model językowy klasy frontier z 80 miliardami parametrów, w 4.3 GB RAM na MacBooku. Model 35B działa na iPhonie.

W skrócie: Swiftlet (github.com/leonickson1/Swiftlet) używa ekstremalnej kwantyzacji, aby zmieścić modele, które normalnie potrzebują 160 GB pamięci, w konsumenckim sprzęcie Apple. Kompromis jakościowy jest realny, ale węższy, niż byś się spodziewał. Jeśli chcesz zbudować produkt oparty na lokalnym LLM bez kosztów API, to najbardziej dostępny sposób na start. Podłącz aplikację We.Inc do lokalnego punktu końcowego, opublikuj ją, a Twoi użytkownicy nigdy nie dowiedzą się, że model działa na Twoim laptopie.

Co właściwie robi Swiftlet

Główna sztuczka to nie magia. To kwantyzacja posunięta dalej, niż idzie większość narzędzi.

Matematyka: Qwen3-80B w FP16 (standardowa precyzja inferencji) potrzebuje około 160 GB pamięci. Przy powszechnie używanej kwantyzacji 4-bitowej (GGUF Q4_K_M) potrzebuje około 40 GB. Swiftlet dochodzi do około 0.4 bita na parametr średnio, używając kwantyzacji grupowej z alokacją bitów ważoną istotnością. Najważniejsze wagi (głowice uwagi, pierwsza i ostatnia warstwa) dostają więcej bitów; większość warstw feed-forward mniej.

Docelowy sprzęt: Apple Silicon. Swiftlet jest napisany w Swift i używa Metal do akceleracji GPU. Maki M1/M2/M3/M4 z pamięcią zunifikowaną są idealne, bo GPU i CPU dzielą tę samą pulę RAM, co omija wąskie gardło kopiowania pamięci ograniczające lokalną inferencję opartą na NVIDIA.

Co dostajesz: lokalny serwer HTTP (zwykle localhost:8080), który przyjmuje prompty i zwraca odpowiedzi. Szybkość generowania tokenów na MacBooku Pro z M3 jest raportowana na 8-12 tokenów na sekundę dla modelu 80B, co wystarcza dla aplikacji interaktywnych, ale nie jest natychmiastowe.

Gdzie ląduje kompromis jakościowy

Ekstremalna kwantyzacja nie jest darmowa. Oto, gdzie się sprawdza, a gdzie nie, na podstawie dyskusji na HN i wczesnych testów:

Trzyma się dobrze:

Zauważalnie się pogarsza:

Praktyczny wniosek: jeśli Twój produkt to asystent czatowy, narzędzie do streszczeń lub do treści, 80B w ekstremalnej kwantyzacji jest zaskakująco zdolny. Jeśli Twój produkt generuje kod lub liczy, przetestuj zamiast tego 35B przy wyższej kwantyzacji. Więcej bitów na parametr w mniejszym modelu często bije mniej bitów w większym.

Jak podłączyć lokalny punkt końcowy Swiftlet do aplikacji

Ścieżka budowy jest prosta. Nie potrzebujesz klucza API w chmurze ani konta rozliczeniowego.

Krok 1: Zainstaluj i uruchom Swiftlet. Sklonuj repozytorium, pobierz skwantyzowane wagi Qwen3-80B (plik 4.3 GB) i uruchom serwer. Na Macu z 8 GB RAM lub więcej startuje w około 30 sekund.

Krok 2: Potwierdź, że punkt końcowy działa. Wyślij testowy prompt na localhost:8080 przez curl lub dowolnego klienta HTTP. Powinieneś dostać odpowiedź w kilka sekund.

Krok 3: Zbuduj warstwę aplikacji. Tu spędzasz większość czasu. Potrzebujesz frontendu, który wysyła dane użytkownika do lokalnego punktu końcowego i wyświetla odpowiedź. W We.Inc opisz aplikację, którą chcesz („asystent pisania, który bierze akapit i zwraca trzy przepisane wersje”), a AI zbuduje działającą aplikację React z podglądem na żywo. Potem zmień wywołanie API, aby wskazywało na Twój punkt końcowy Swiftlet.

Krok 4: Opublikuj lub wyeksportuj. Możesz opublikować bezpośrednio z We.Inc na własnej domenie (aplikacja wywołuje Twój lokalny punkt końcowy w czasie działania) lub wyeksportować kod do GitHuba i wdrożyć samodzielnie. Kod to standardowy React, Vite i TypeScript bez zastrzeżonych zależności.

Rezultat: produkcyjnej jakości aplikacja webowa napędzana lokalnym modelem 80B, bez bieżących kosztów API.

Kiedy lokalna inferencja ma sens (a kiedy nie)

Lokalna wygrywa, gdy:

Chmura wygrywa, gdy:

Uczciwy środek: używaj Swiftlet do rozwoju i dem, a potem przełącz się na punkt końcowy w chmurze (OpenRouter, Together AI, API Qwen) dla skali produkcyjnej. Kod aplikacji jest ten sam; zmieniasz tylko adres punktu końcowego.

Co to oznacza dla kategorii

Uruchomienie modelu 80B na laptopie to kamień milowy, nie dlatego, że jakość dorównuje centrum danych, ale dlatego, że całkowicie usuwa barierę klucza API. Każdy z MacBookiem może teraz uruchomić lokalnie model klasy frontier i budować na nim.

Dla programistów budujących narzędzia oparte na AI równanie kosztów się zmienia. Rachunki za API dla produktów na etapie prototypu były realnym tarciem. Swiftlet eliminuje to tarcie podczas rozwoju i testów. Model działa na Twojej maszynie, nic nie kosztuje za zapytanie, a inferencja jest wystarczająco szybka do użycia interaktywnego.

W połączeniu z kreatorem takim jak We.Inc, który zajmuje się frontendem i hostingiem, droga od „mam pomysł na narzędzie AI” do „działa na własnej domenie” to teraz: zainstaluj Swiftlet, opisz aplikację, wskaż localhost, opublikuj. To znaczące zmniejszenie liczby kroków między pomysłem a produktem.

Zacznij budować z We.Inc za darmo i podłącz go do swojego lokalnego punktu końcowego Swiftlet. Wyeksportuj kod do GitHuba, kiedy zechcesz.

Zacznij za darmo · Bez karty kredytowej

Product

Who It's For

Features

Resources

Company

View Sitemap