Swiftlet ejecuta un LLM 80B con 4.3 GB de RAM en Mac: cómo crear con él

Swiftlet es un nuevo proyecto de código abierto que usa cuantización agresiva para ejecutar Qwen3-80B con 4.3 GB de RAM en un MacBook y Qwen3-35B en un iPhone. Esta guía explica qué significa para los desarrolladores, las concesiones de calidad y cómo conectar hoy un LLM local a un producto real.

Preguntas frecuentes

¿Qué es Swiftlet?

Swiftlet es un proyecto de código abierto (github.com/leonickson1/Swiftlet) que ejecuta modelos de lenguaje grandes en hardware Apple mediante técnicas de cuantización extrema. Puede ejecutar Qwen3-80B con 4.3 GB de RAM en un Mac y Qwen3-35B en un iPhone. Está escrito en Swift y optimizado para el marco gráfico Metal de Apple.

¿Cómo cabe un modelo 80B de Swiftlet en 4.3 GB de RAM?

Swiftlet usa cuantización agresiva, probablemente por debajo de 2 bits, para comprimir los pesos del modelo mucho más allá de su tamaño original. Un modelo de 80B parámetros a precisión completa (FP16) requiere aproximadamente 160 GB de memoria. Con cuantización de 4 bits necesita unos 40 GB. El nivel de 4.3 GB que logra Swiftlet implica una cuantización extrema, de alrededor de 0.4 bits por parámetro en promedio, con técnicas como cuantización agrupada y asignación de bits ponderada por importancia para conservar la calidad de los pesos más críticos.

¿La calidad alcanza para producción?

Depende de la tarea. La cuantización extrema conserva bien el conocimiento general y la capacidad de seguir instrucciones, pero reduce el rendimiento en tareas que requieren razonamiento numérico preciso, lógica compleja de varios pasos o resultados estructurados extensos. Para interfaces conversacionales, generación de contenido y clasificación, la calidad es sorprendentemente utilizable. Para generar código o razonar de forma compleja, un modelo más pequeño y menos cuantizado (como Qwen3-35B a 4 bits) podría dar mejores resultados. Haz pruebas comparativas antes de publicarlo.

¿Puedo crear una aplicación que use un LLM local con Swiftlet?

Sí. Swiftlet expone un punto de conexión HTTP local (normalmente en localhost:8080) que recibe instrucciones y devuelve respuestas generadas. Cualquier aplicación web puede llamar a ese punto. Con We.Inc, describes tu aplicación en inglés corriente, obtienes una aplicación React funcional de inmediato, añades una llamada fetch al endpoint local de Swiftlet y tienes un producto operativo en minutos. El código generado es tuyo y puedes exportarlo a GitHub, así que no quedas atado a ninguna plataforma.

Swiftlet llegó a la portada de Hacker News el agosto 3, 2026, con 260 puntos y 116 comentarios. La propuesta: ejecutar Qwen3-80B, un modelo de lenguaje grande de primera línea con 80 mil millones de parámetros, con 4.3 GB de RAM en un MacBook. Un modelo 35B funciona en un iPhone.

En resumen: Swiftlet (github.com/leonickson1/Swiftlet) usa cuantización extrema para ejecutar en hardware Apple de consumo modelos que normalmente requieren 160 GB de memoria. La concesión de calidad es real, pero menor de lo que cabría esperar. Si quieres crear un producto con un LLM local sin costes de API, es una de las formas más accesibles de empezar. Conecta una aplicación de We.Inc al endpoint local, publícala y tus usuarios ni siquiera sabrán que el modelo se ejecuta en tu portátil.

Qué hace Swiftlet en realidad

El truco central no es magia: lleva la cuantización más lejos que la mayoría de las herramientas.

Las cifras: Qwen3-80B en FP16 (la precisión estándar para inferencia) requiere aproximadamente 160 GB de memoria. Con la cuantización habitual de 4 bits (GGUF Q4_K_M), necesita unos 40 GB. Swiftlet reduce el promedio a unos 0.4 bits por parámetro mediante cuantización agrupada y asignación de bits ponderada por importancia. Los pesos más críticos (cabezas de atención y primeras y últimas capas) reciben más bits; la mayoría de las capas de avance reciben menos.

Hardware objetivo: Apple Silicon. Swiftlet está escrito en Swift y usa Metal para acelerar la GPU. Los Mac M1/M2/M3/M4 con memoria unificada son ideales porque GPU y CPU comparten la misma RAM, lo que evita el cuello de botella de copiar datos que limita la inferencia local con GPU NVIDIA.

Qué obtienes: un servidor HTTP local (normalmente localhost:8080) que recibe instrucciones y devuelve respuestas. Se informa que la generación de tokens en un MacBook Pro M3 alcanza entre 8 y 12 tokens por segundo con el modelo 80B: suficiente para aplicaciones interactivas, aunque no instantánea.

En qué tareas se nota la concesión de calidad

La cuantización extrema tiene un coste. Según el debate de HN y las primeras pruebas, funciona bien en estos casos y menos bien en otros:

Se mantiene bien:

Pierde calidad de forma evidente:

Conclusión práctica: si tu producto es un chatbot, un resumidor o una herramienta de contenido, el modelo 80B con cuantización extrema es sorprendentemente capaz. Si genera código o resuelve matemáticas, prueba en su lugar el 35B con una cuantización mayor. Más bits por parámetro en un modelo pequeño suelen superar menos bits en uno grande.

Cómo conectar un endpoint local de Swiftlet a una aplicación

El proceso es directo. No necesitas una clave de API en la nube ni una cuenta de facturación.

Paso 1: Instala e inicia Swiftlet. Clona el repositorio, descarga los pesos cuantizados de Qwen3-80B (el archivo de 4.3 GB) e inicia el servidor. En un Mac con 8 GB de RAM o más, se inicia en unos 30 segundos.

Paso 2: Confirma que el endpoint funcione. Envía una instrucción de prueba a localhost:8080 con curl o cualquier cliente HTTP. Deberías recibir una respuesta en unos segundos.

Paso 3: Crea la capa de la aplicación. Aquí pasarás la mayor parte del tiempo. Necesitas una interfaz que envíe la entrada del usuario al endpoint local y muestre la respuesta. Con We.Inc, describe la aplicación que quieres («un asistente de escritura que reciba un párrafo y devuelva tres versiones reescritas») y la IA crea una aplicación React funcional con vista previa en directo. Luego cambia la llamada a la API para que apunte al endpoint de Swiftlet.

Paso 4: Publica o exporta. Puedes publicar directamente desde We.Inc en un dominio personalizado (la aplicación consulta el endpoint local cuando se ejecuta) o exportar el código a GitHub y desplegarlo por tu cuenta. El código usa React, Vite y TypeScript estándar, sin dependencias propietarias.

El resultado: una aplicación web de calidad de producción impulsada por un modelo local 80B, sin costes de API recurrentes.

Cuándo conviene la inferencia local (y cuándo no)

La ejecución local conviene cuando:

La nube conviene cuando:

Una solución intermedia razonable: usa Swiftlet para desarrollar y hacer demostraciones, y luego cambia a un endpoint en la nube (OpenRouter, Together AI o la API de Qwen) para escalar en producción. El código de la aplicación es el mismo; solo cambia la URL del endpoint.

Qué significa para esta categoría

Ejecutar un modelo 80B en un portátil es un hito, no porque iguale la calidad de un centro de datos, sino porque elimina por completo la barrera de la clave de API. Ahora cualquiera con un MacBook puede ejecutar localmente un modelo de primera línea y crear algo con él.

Para quienes crean herramientas con IA, cambia la ecuación de costes. Las facturas de API han supuesto una fricción real para los productos en fase de prototipo. Swiftlet elimina ese obstáculo durante el desarrollo y las pruebas. El modelo funciona en tu equipo, cada consulta cuesta cero y la inferencia es lo bastante rápida para interactuar.

Combinado con un creador como We.Inc, que gestiona la interfaz y el alojamiento, el recorrido de «tengo una idea para una herramienta de IA» a «ya está activa en un dominio personalizado» queda así: instala Swiftlet, describe la aplicación, conéctala a localhost y publícala. Reduce de forma significativa los pasos entre una idea y un producto.

Empieza a crear gratis con We.Inc y conéctala a tu endpoint local de Swiftlet. Exporta el código a GitHub cuando quieras.

Empieza gratis · Sin tarjeta de crédito

Product

Who It's For

Features

Resources

Company

View Sitemap