Un nuovo progetto open-source chiamato Swiftlet usa una quantizzazione aggressiva per eseguire Qwen3-80B in 4.3 GB di RAM su un MacBook, e Qwen3-35B su un iPhone. Questa guida copre cosa significa davvero per gli sviluppatori, dove stanno i compromessi di qualità, e come collegare un endpoint LLM locale a un prodotto reale oggi.
Swiftlet è un progetto open-source (github.com/leonickson1/Swiftlet) che esegue modelli linguistici di grandi dimensioni su hardware Apple usando tecniche di quantizzazione estrema. Può eseguire Qwen3-80B in 4.3 GB di RAM su un Mac e Qwen3-35B su un iPhone. È scritto in Swift e ottimizzato per il framework GPU Metal di Apple.
Swiftlet usa una quantizzazione aggressiva, probabilmente sotto i 2 bit, per comprimere i pesi del modello ben oltre le dimensioni originali. Un modello da 80B parametri a piena precisione (FP16) richiede circa 160 GB di memoria. A quantizzazione a 4 bit ne servono circa 40 GB. Al livello di 4.3 GB raggiunto da Swiftlet, la quantizzazione è estrema, circa 0.4 bit per parametro in media, usando tecniche come la quantizzazione raggruppata e l'allocazione di bit pesata per importanza per preservare la qualità sui pesi più critici.
Dipende dal compito. La quantizzazione estrema preserva bene la conoscenza generale del modello e la capacità di seguire istruzioni, ma degrada le prestazioni su compiti che richiedono ragionamento numerico preciso, logica complessa a più passaggi, o output strutturati lunghi. Per interfacce conversazionali, generazione di contenuti e classificazione, la qualità è sorprendentemente utilizzabile. Per generazione di codice o ragionamento complesso, un modello più piccolo e meno quantizzato (come Qwen3-35B a 4 bit) potrebbe dare risultati migliori. Fai un benchmark prima di rilasciare.
Sì. Swiftlet espone un endpoint HTTP locale (tipicamente su localhost:8080) che accetta prompt e restituisce completamenti. Qualsiasi app web può chiamare quell'endpoint. Con We.Inc, puoi descrivere la tua app in parole semplici, ottenere subito un'app React funzionante, aggiungere una chiamata fetch all'endpoint Swiftlet locale, e avere un prodotto funzionante in minuti. Il codice generato è tuo, esportabile su GitHub, quindi non sei vincolato a nessuna piattaforma.
Swiftlet è arrivato in prima pagina su Hacker News ad 3 agosto 2026 (3, 2026), con 260 punti e 116 commenti. La proposta: eseguire Qwen3-80B, un modello linguistico di grandi dimensioni di livello frontier con 80 miliardi di parametri, in 4.3 GB di RAM su un MacBook. Un modello da 35B gira su un iPhone.
In breve: Swiftlet (github.com/leonickson1/Swiftlet) usa una quantizzazione estrema per far stare modelli che normalmente richiedono 160 GB di memoria in hardware Apple consumer. Il compromesso di qualità è reale ma più contenuto di quanto ci si aspetterebbe. Se vuoi costruire un prodotto alimentato da un LLM locale con zero costi API, questo è il modo più accessibile per iniziare. Collega un'app We.Inc all'endpoint locale, pubblicala, e i tuoi utenti non sapranno mai che il modello gira sul tuo laptop.
Il trucco principale non è magia. È una quantizzazione spinta oltre il punto a cui arriva la maggior parte degli strumenti.
La matematica: Qwen3-80B a FP16 (la precisione standard per l'inferenza) richiede circa 160 GB di memoria. Alla quantizzazione a 4 bit comunemente usata (GGUF Q4_K_M), ne servono circa 40 GB. Swiftlet spinge fino a circa 0.4 bit per parametro in media, usando quantizzazione raggruppata con allocazione di bit pesata per importanza. I pesi più critici (teste di attenzione, primo e ultimo layer) ottengono più bit; la maggior parte dei layer feed-forward ne ottiene meno.
L'hardware target: Apple Silicon. Swiftlet è scritto in Swift e usa Metal per l'accelerazione GPU. I Mac M1/M2/M3/M4 con memoria unificata sono il punto ottimale perché GPU e CPU condividono lo stesso pool di RAM, il che evita il collo di bottiglia da copia di memoria che limita l'inferenza locale basata su NVIDIA.
Cosa ottieni: un server HTTP locale (tipicamente localhost:8080) che accetta prompt e restituisce completamenti. La velocità di generazione dei token su un M3 MacBook Pro è riportata a 8-12 token al secondo per il modello 80B, il che è utilizzabile per applicazioni interattive ma non istantaneo.
La quantizzazione estrema non è gratuita. Ecco dove regge e dove no, in base alla discussione su HN e ai test iniziali:
Regge bene:
Degrada notevolmente:
La conclusione pratica: se il tuo prodotto è un chatbot, un riassuntore, o uno strumento di contenuti, l'80B a quantizzazione estrema è sorprendentemente capace. Se il tuo prodotto genera codice o fa matematica, testa invece il 35B a quantizzazione più alta. Più bit per parametro su un modello più piccolo spesso batte meno bit su uno più grande.
Il percorso di costruzione è semplice. Non ti serve una chiave API cloud o un account di fatturazione.
Passo 1: installa e avvia Swiftlet. Clona il repo, scarica i pesi quantizzati di Qwen3-80B (il file da 4.3 GB), ed esegui il server. Su un Mac con 8 GB di RAM o più, parte in circa 30 secondi.
Passo 2: conferma che l'endpoint funzioni. Manda un prompt di prova a localhost:8080 con curl o qualsiasi client HTTP. Dovresti ricevere un completamento in pochi secondi.
Passo 3: costruisci il livello app. È qui che passi la maggior parte del tuo tempo. Ti serve un frontend che mandi l'input dell'utente all'endpoint locale e mostri la risposta. Con We.Inc, descrivi l'app che vuoi ("un assistente di scrittura che prende un paragrafo e restituisce tre versioni riscritte") e l'IA costruisce un'app React funzionante con anteprima live. Poi modifica la chiamata API perché punti al tuo endpoint Swiftlet.
Passo 4: pubblica o esporta. Puoi pubblicare direttamente da We.Inc su un dominio personalizzato (l'app chiama il tuo endpoint locale a runtime), oppure esportare il codice su GitHub e distribuirlo tu stesso. Il codice è React, Vite e TypeScript standard senza dipendenze proprietarie.
Il risultato: un'app web di qualità produzione alimentata da un modello locale da 80B, con zero costi API continuativi.
Il locale vince quando:
Il cloud vince quando:
La via di mezzo onesta: usa Swiftlet per sviluppo e demo, poi passa a un endpoint cloud (OpenRouter, Together AI, l'API Qwen) per la scala di produzione. Il codice dell'app è lo stesso in entrambi i casi; cambi solo l'URL dell'endpoint.
Eseguire un modello da 80B su un laptop è una pietra miliare, non perché la qualità eguagli un data center, ma perché rimuove del tutto la barriera della chiave API. Chiunque abbia un MacBook può ora eseguire un modello di livello frontier localmente e costruirci sopra.
Per gli sviluppatori che hanno costruito strumenti alimentati da IA, l'equazione dei costi cambia. Le bollette API per prodotti in fase di prototipo sono state un vero punto di attrito. Swiftlet elimina quell'attrito durante sviluppo e test. Il modello gira sulla tua macchina, non costa nulla per query, e l'inferenza è abbastanza veloce per l'uso interattivo.
Combinato con un builder come We.Inc che gestisce frontend e hosting, il percorso da "ho un'idea per uno strumento IA" a "è live su un dominio personalizzato" ora è: installa Swiftlet, descrivi l'app, puntala a localhost, pubblica. È una riduzione significativa del numero di passaggi tra idea e prodotto.
Inizia a costruire con We.Inc gratis e collegala al tuo endpoint Swiftlet locale. Esporta il codice su GitHub quando vuoi.
Inizia gratis · Nessuna carta di credito richiesta