Swiftlet führt ein 80B-LLM in 4,3 GB RAM auf einem Mac aus. So bauen Sie darauf auf.

Ein neues Open-Source-Projekt namens Swiftlet nutzt aggressive Quantisierung, um Qwen3-80B in 4,3 GB RAM auf einem MacBook auszuführen, und Qwen3-35B auf einem iPhone. Dieser Leitfaden behandelt, was das für Entwickler tatsächlich bedeutet, wo die Qualitätskompromisse liegen, und wie man einen lokalen LLM-Endpunkt noch heute in ein echtes Produkt einbaut.

Häufige Fragen

Was ist Swiftlet?

Swiftlet ist ein Open-Source-Projekt (github.com/leonickson1/Swiftlet), das große Sprachmodelle mit extremen Quantisierungstechniken auf Apple-Hardware ausführt. Es kann Qwen3-80B in 4,3 GB RAM auf einem Mac ausführen und Qwen3-35B auf einem iPhone. Es ist in Swift geschrieben und für Apples Metal-GPU-Framework optimiert.

Wie passt Swiftlet ein 80B-Modell in 4,3 GB RAM?

Swiftlet nutzt aggressive Quantisierung, wahrscheinlich unter 2 Bit, um die Modellgewichte weit unter ihre ursprüngliche Größe zu komprimieren. Ein Modell mit 80B Parametern bei voller Präzision (FP16) braucht etwa 160 GB Speicher. Bei 4-Bit-Quantisierung braucht es etwa 40 GB. Auf dem 4,3-GB-Niveau, das Swiftlet erreicht, ist die Quantisierung extrem, im Schnitt etwa 0,4 Bit pro Parameter, was Techniken wie gruppierte Quantisierung und gewichtungsbasierte Bitzuteilung nach Wichtigkeit nutzt, um Qualität bei den kritischsten Gewichten zu erhalten.

Ist die Qualität gut genug für den Produktionseinsatz?

Das hängt von der Aufgabe ab. Extreme Quantisierung erhält das allgemeine Wissen und die Fähigkeit des Modells, Anweisungen zu befolgen, gut, verschlechtert aber die Leistung bei Aufgaben, die präzises numerisches Denken, komplexe mehrstufige Logik oder lange strukturierte Ausgaben erfordern. Für Konversationsschnittstellen, Content-Erzeugung und Klassifizierung ist die Qualität überraschend brauchbar. Für Code-Erzeugung oder komplexes Denken liefert ein weniger stark quantisiertes kleineres Modell (wie Qwen3-35B bei 4 Bit) möglicherweise bessere Ergebnisse. Benchmarken Sie vor dem Ausliefern.

Kann ich eine App bauen, die ein lokales LLM über Swiftlet nutzt?

Ja. Swiftlet stellt einen lokalen HTTP-Endpunkt bereit (typischerweise auf localhost:8080), der Prompts entgegennimmt und Vervollständigungen zurückgibt. Jede Web-App kann diesen Endpunkt aufrufen. Mit We.Inc können Sie Ihre App in einfachem Deutsch beschreiben, sofort eine funktionierende React-App erhalten, einen Fetch-Aufruf zum lokalen Swiftlet-Endpunkt hinzufügen, und in Minuten ein funktionierendes Produkt haben. Der erzeugte Code gehört Ihnen und kann nach GitHub exportiert werden, Sie sind also an keine Plattform gebunden.

Swiftlet erreichte am 3., 2026 die Startseite von Hacker News mit 260 Punkten und 116 Kommentaren, im August. Das Versprechen: Qwen3-80B, ein Sprachmodell der Spitzenklasse mit 80 Milliarden Parametern, in 4,3 GB RAM auf einem MacBook ausführen. Ein 35B-Modell läuft auf einem iPhone.

Kurzfassung: Swiftlet (github.com/leonickson1/Swiftlet) nutzt extreme Quantisierung, um Modelle, die normalerweise 160 GB Speicher brauchen, auf Apple-Consumer-Hardware zu bringen. Der Qualitätskompromiss ist real, aber geringer als erwartet. Wollen Sie ein Produkt bauen, das von einem lokalen LLM ohne API-Kosten angetrieben wird, ist das der zugänglichste Weg zum Start. Verbinden Sie eine We.Inc-App mit dem lokalen Endpunkt, veröffentlichen Sie sie, und Ihre Nutzer merken nie, dass das Modell auf Ihrem Laptop läuft.

Was Swiftlet tatsächlich tut

Der Kerntrick ist keine Magie. Es ist Quantisierung, weiter getrieben, als die meisten Tools gehen.

Die Mathematik: Qwen3-80B bei FP16 (der Standardpräzision für Inferenz) braucht etwa 160 GB Speicher. Bei der üblichen 4-Bit-Quantisierung (GGUF Q4_K_M) braucht es etwa 40 GB. Swiftlet drückt im Schnitt auf etwa 0,4 Bit pro Parameter, mit gruppierter Quantisierung und gewichtungsbasierter Bitzuteilung nach Wichtigkeit. Die kritischsten Gewichte (Attention-Heads, erste und letzte Schichten) bekommen mehr Bits; der Großteil der Feed-Forward-Schichten bekommt weniger.

Das Hardware-Ziel: Apple Silicon. Swiftlet ist in Swift geschrieben und nutzt Metal für GPU-Beschleunigung. M1/M2/M3/M4-Macs mit Unified Memory sind der Sweet Spot, weil GPU und CPU sich denselben RAM-Pool teilen, was den Speicherkopier-Engpass vermeidet, der NVIDIA-basierte lokale Inferenz begrenzt.

Was Sie bekommen: ein lokaler HTTP-Server (typischerweise localhost:8080), der Prompts entgegennimmt und Vervollständigungen zurückgibt. Die Token-Erzeugungsgeschwindigkeit auf einem M3 MacBook Pro wird mit 8-12 Token pro Sekunde für das 80B-Modell angegeben, was für interaktive Anwendungen brauchbar ist, aber nicht sofort.

Wo der Qualitätskompromiss ansetzt

Extreme Quantisierung ist nicht kostenlos. Hier ist, wo es sich hält und wo nicht, basierend auf der HN-Diskussion und frühen Tests:

Hält sich gut:

Verschlechtert sich merklich:

Die praktische Erkenntnis: Ist Ihr Produkt ein Chatbot, ein Zusammenfasser oder ein Content-Tool, ist das 80B-Modell bei extremer Quantisierung überraschend fähig. Erzeugt Ihr Produkt Code oder rechnet, testen Sie stattdessen das 35B-Modell bei höherer Quantisierung. Mehr Bits pro Parameter bei einem kleineren Modell schlägt oft weniger Bits bei einem größeren.

Wie man einen lokalen Swiftlet-Endpunkt in eine App einbaut

Der Bauweg ist unkompliziert. Sie brauchen keinen Cloud-API-Schlüssel oder ein Abrechnungskonto.

Schritt 1: Swiftlet installieren und starten. Klonen Sie das Repo, laden Sie die quantisierten Qwen3-80B-Gewichte herunter (die 4,3-GB-Datei), und starten Sie den Server. Auf einem Mac mit 8 GB RAM oder mehr startet er in etwa 30 Sekunden.

Schritt 2: Bestätigen Sie, dass der Endpunkt funktioniert. Senden Sie einen Test-Prompt an localhost:8080 mit curl oder einem beliebigen HTTP-Client. Sie sollten in wenigen Sekunden eine Vervollständigung zurückbekommen.

Schritt 3: Bauen Sie die App-Ebene. Hier verbringen Sie die meiste Zeit. Sie brauchen ein Frontend, das Nutzereingaben an den lokalen Endpunkt sendet und die Antwort anzeigt. Beschreiben Sie mit We.Inc die gewünschte App („ein Schreibassistent, der einen Absatz nimmt und drei umgeschriebene Versionen zurückgibt"), und die KI baut eine funktionierende React-App mit Live-Vorschau. Bearbeiten Sie dann den API-Aufruf, sodass er auf Ihren Swiftlet-Endpunkt zeigt.

Schritt 4: Veröffentlichen oder exportieren. Sie können direkt aus We.Inc auf einer eigenen Domain veröffentlichen (die App ruft zur Laufzeit Ihren lokalen Endpunkt auf), oder den Code nach GitHub exportieren und selbst deployen. Der Code ist Standard-React, Vite und TypeScript ohne proprietäre Abhängigkeiten.

Das Ergebnis: eine Web-App in Produktionsqualität, angetrieben von einem lokalen 80B-Modell, mit null laufenden API-Kosten.

Wann lokale Inferenz Sinn ergibt (und wann nicht)

Lokal gewinnt, wenn:

Cloud gewinnt, wenn:

Der ehrliche Mittelweg: Nutzen Sie Swiftlet für Entwicklung und Demos, wechseln Sie dann für den Produktionsmaßstab zu einem Cloud-Endpunkt (OpenRouter, Together AI, die Qwen-API). Der App-Code bleibt in beiden Fällen gleich; Sie ändern nur die Endpunkt-URL.

Was das für die Kategorie bedeutet

Ein 80B-Modell auf einem Laptop auszuführen ist ein Meilenstein, nicht weil die Qualität an ein Rechenzentrum heranreicht, sondern weil es die API-Schlüssel-Hürde vollständig beseitigt. Jeder mit einem MacBook kann jetzt ein Modell der Spitzenklasse lokal ausführen und darauf aufbauen.

Für Entwickler, die KI-gestützte Tools bauen, ändert sich die Kostengleichung. API-Rechnungen für Produkte im Prototypenstadium waren ein echter Reibungspunkt. Swiftlet beseitigt diese Reibung während Entwicklung und Tests. Das Modell läuft auf Ihrem Rechner, kostet nichts pro Anfrage, und die Inferenz ist schnell genug für interaktive Nutzung.

Kombiniert mit einem Baukasten wie We.Inc, der Frontend und Hosting übernimmt, ist der Weg von „ich habe eine Idee für ein KI-Tool" zu „es ist live auf einer eigenen Domain" jetzt: Swiftlet installieren, die App beschreiben, auf localhost zeigen, veröffentlichen. Das ist eine bedeutende Verringerung der Schritte zwischen Idee und Produkt.

Starten Sie kostenlos mit We.Inc und verbinden Sie es mit Ihrem lokalen Swiftlet-Endpunkt. Exportieren Sie den Code jederzeit nach GitHub.

Kostenlos starten · Keine Kreditkarte nötig

Product

Who It's For

Features

Resources

Company

View Sitemap