Moonshot AI bracht eind juli 2026 de gewichten van Kimi K3 uit: 2,8 biljoen parameters, het grootste open-weights-model ooit gepubliceerd. Bijna niemand kan het lokaal draaien. Deze gids behandelt wat K3 echt is, je drie realistische opties om het te gebruiken en de snelste manier om er een app bovenop op te leveren.
Realistisch gezien niet. Kimi K3 is een model met 2,8 biljoen parameters. Zelfs met agressieve MXFP4-kwantisatie zijn de gewichten honderden gigabytes, ver voorbij elke consumenten-GPU of Mac. Zelf draaien betekent een servercluster met meerdere GPU's. Voor bijna iedereen zijn de praktische opties gehoste inferentieaanbieders zoals Together AI of Modal, die K3 vanaf dag één aanboden, of de eigen API van Moonshot.
De gewichten zijn gratis te downloaden onder de open licentie van Moonshot, wat iets anders is dan gratis draaien. Inferentie kost hoe dan ook echt geld: je betaalt een hostingaanbieder per token of je betaalt voor de hardware. Open gewichten geven je controle, zelfhostingrechten en vrijheid van één enkele leverancier, geen nulkosten.
K3 is concurrerend op algemene benchmarks en de openheid is de kop, niet een capaciteitssprong ten opzichte van gehoste frontier-modellen. Voor codegeneratie en het bouwen van apps in meerdere stappen lopen gehoste frontier-modellen zoals Claude Opus 5 (uitgebracht op juli 24, 2026) nog voorop. Als je doel een werkende app is en geen modelonderzoek, telt het model achter de tool minder dan de bouwlus van de tool.
Gebruik een gehost inferentie-endpoint voor K3 (Together AI, Modal of de API van Moonshot) voor de AI-aanroepen en bouw het product eromheen met een AI-appbuilder. In We.Inc beschrijf je de app in gewone taal, krijg je een live bewerkbare React-app met je K3-endpoint als API-aanroep erin gekoppeld en publiceer je die op je eigen domein. Je kunt gratis beginnen op we.inc.
Moonshot AI publiceerde in de laatste week van juli 2026 de gewichten van Kimi K3: 2,8 biljoen parameters, het grootste open-weights-model dat ooit is uitgebracht. Together AI en Modal hadden het op dag één gehost, Forbes noemde het het duidelijkste signaal tot nu toe dat frontier-AI convergeert naar open gewichten en zoekopdrachten naar "Kimi K3 lokaal draaien" schoten meteen omhoog.
Hier is het ongemakkelijke deel dat bijna geen enkele lanceringsberichtgeving duidelijk zegt: je gaat dit ding niet op je eigen machine draaien.
TL;DR: De gewichten van Kimi K3 zijn gratis te downloaden, maar bij 2,8T parameters lopen zelfs sterk gekwantiseerde checkpoints op tot honderden gigabytes en is er een servercluster met meerdere GPU's nodig. Je drie realistische opties zijn (1) gehoste inferentie via Together AI, Modal of de API van Moonshot, (2) wachten op gedistilleerde kleinere varianten, of (3) het model helemaal niet rechtstreeks aanraken en gewoon een product op een endpoint opleveren. Als je eigenlijke doel is "dit weekend iets bouwen met AI", is optie 3 het eerlijke antwoord en dat kun je gratis doen met We.Inc.
Drie feiten tellen:
1. Het is de grootste open release in de geschiedenis. Met 2,8 biljoen parameters is K3 ruwweg een orde van grootte groter dan de open modellen die de meeste mensen daadwerkelijk hebben gedraaid (modellen van 70B in de klasse van Llama, varianten van Mistral). Eerdere "enorme" open releases zoals de vlaggenschepen van DeepSeek en Kimi K2 gingen al over wat zelfhosters aankonden. K3 maakt definitief een einde aan de schijn.
2. Open gewichten, geen open training. Je krijgt het checkpoint en het recht om zelf te hosten, te finetunen en te deployen zonder toestemming te vragen. Je krijgt niet de trainingsdata of een goedkope manier om het te draaien. Dat onderscheid is het hele verhaal van deze release.
3. Hosting vanaf dag nul was de echte lancering. Dat Together AI en Modal K3 vanaf de eerste dag serveerden, vertelt hoe Moonshot verwacht dat mensen het gebruiken: via het cluster van iemand anders. De uitleg van de HuggingFace-community richt zich op MXFP4-kwantisatie juist omdat zelfs de gecomprimeerde versie een datacenter-artefact is.
Een model met 2,8T parameters op volledige precisie is meerdere terabytes aan gewichten. Gekwantiseerd naar 4-bits formaten zoals MXFP4 zit je nog steeds in het bereik van honderden gigabytes, vóór KV-cache en activatiegeheugen. Ter vergelijking:
Dus als een tutorial belooft "draai Kimi K3 op je pc", beschrijft die ofwel een API-wrapper ofwel klopt het niet. Dat het model open is, maakt het niet klein.
Dit is geen cynische kijk op K3. Open gewichten op deze schaal zijn om drie concrete redenen belangrijk:
Als je K3 wilt gebruiken in plaats van bewonderen, ziet de stack er zo uit:
Stap 3 is de kloof die We.Inc dicht. Hier is de concrete werkwijze, geen handwuiven:
Dat laatste punt is de eerlijke symmetrie: als je om K3 geeft omdat je gesloten platforms wantrouwt, leg dan dezelfde maatstaf aan je bouwtool. We.Inc geeft je de gegenereerde code; de meeste AI-builders niet.
Een verduidelijking die de moeite waard is, omdat "kimi k3 vs claude" is waarop mensen zoeken: deze spelen verschillende rollen. K3 is een model dat je vanuit je app zou kunnen aanroepen. Claude Opus 5, uitgebracht op juli 24, 2026, is momenteel het sterkere pure codeermodel en de klasse model die de generatie in AI-builders aandrijft. Een builder met zo'n model gebruiken om een app te maken die K3 aanroept, is geen tegenstrijdigheid. Het is nu de normale architectuur: het beste model voor het schrijven van de software, het goedkoopste voldoende goede open model om erin te draaien.
Het venster waarin een nieuwe modelrelease interessant is, is kort. De apps die in dat venster worden gebouwd, blijven. Beschrijf de jouwe in één zin op We.Inc, gratis om te starten, geen kaart nodig, en laat hem vandaag nog live gaan op een domein. Als je eerst abonnementen wilt vergelijken, staan de prijzen hier, en als je het bredere no-code-pad wilt, begin dan met onze gids over een webapp bouwen zonder code.
Gratis beginnen · Geen creditcard nodig