A Moonshot AI lançou os pesos do Kimi K3 no final de julho de 2026: 2,8 trilhões de parâmetros, o maior modelo de pesos abertos já publicado. Quase ninguém consegue rodá-lo localmente. Este guia cobre o que o K3 realmente é, suas três opções realistas para usá-lo, e a forma mais rápida de lançar um app em cima dele.
Realisticamente, não. O Kimi K3 é um modelo de 2,8 trilhões de parâmetros. Mesmo com quantização MXFP4 agressiva os pesos são centenas de gigabytes, muito além de qualquer GPU de consumidor ou Mac. Rodá-lo você mesmo significa um cluster de servidor com várias GPUs. Para quase todo mundo, as opções práticas são provedores de inferência hospedada como Together AI ou Modal, que ofereceram o K3 desde o primeiro dia, ou a própria API da Moonshot.
Os pesos são grátis para baixar sob a licença aberta da Moonshot, que é diferente de grátis para rodar. A inferência custa dinheiro de verdade de qualquer forma: você paga um provedor de hospedagem por token, ou paga pelo hardware. Pesos abertos compram controle, direitos de auto-hospedagem, e liberdade de um único fornecedor, não custo zero.
O K3 é competitivo em benchmarks gerais, e sua abertura é a manchete, não um salto de capacidade sobre modelos de fronteira hospedados. Para geração de código e construção de apps com vários passos, modelos de fronteira hospedados como o Claude Opus 5 (lançado em julho de 24, 2026) ainda lideram. Se seu objetivo é um app funcionando em vez de pesquisa de modelo, o modelo por trás da ferramenta importa menos que o ciclo de construção da ferramenta.
Use um endpoint de inferência hospedado para o K3 (Together AI, Modal, ou a API da Moonshot) para as chamadas de IA, e construa o produto ao redor dele com um criador de apps com IA. Na We.Inc você descreve o app em português simples, recebe um app React editável e ao vivo com seu endpoint K3 conectado como uma chamada de API, e publica no seu próprio domínio. Você pode começar de graça em we.inc.
A Moonshot AI publicou os pesos do Kimi K3 na última semana de julho de 2026: 2,8 trilhões de parâmetros, o maior modelo de pesos abertos que alguém já lançou. A Together AI e a Modal já tinham ele hospedado no primeiro dia, a Forbes chamou isso do sinal mais claro até agora de que a IA de fronteira está convergindo para pesos abertos, e as buscas por "rodar Kimi K3 localmente" dispararam imediatamente.
Aqui está a parte desconfortável que quase nenhuma cobertura de lançamento diz claramente: você não vai rodar essa coisa na sua máquina.
Resumo: Os pesos do Kimi K3 são grátis para baixar, mas com 2,8T de parâmetros mesmo checkpoints fortemente quantizados chegam a centenas de gigabytes e precisam de um cluster de servidor com várias GPUs. Suas três opções realistas são (1) inferência hospedada via Together AI, Modal, ou a API da Moonshot, (2) esperar por variantes menores destiladas, ou (3) não tocar no modelo diretamente e só lançar um produto em cima de um endpoint. Se seu objetivo real é "construir algo com IA neste fim de semana", a opção 3 é a resposta honesta, e você pode fazer isso de graça com a We.Inc.
Três fatos importam:
1. É o maior lançamento aberto da história. Com 2,8 trilhões de parâmetros, o K3 é aproximadamente uma ordem de magnitude maior que os modelos abertos que a maioria das pessoas realmente rodou (modelos classe Llama-70B, variantes do Mistral). Lançamentos abertos anteriores "enormes" como os carros-chefe do DeepSeek e o Kimi K2 já estavam forçando o que auto-hospedadores conseguiam lidar. O K3 acaba com a fingimento por completo.
2. Pesos abertos, não treinamento aberto. Você recebe o checkpoint e o direito de auto-hospedar, ajustar, e implantar sem pedir permissão. Você não recebe os dados de treinamento ou uma forma barata de rodá-lo. Essa distinção é toda a história desse lançamento.
3. A hospedagem no dia zero foi o lançamento real. A Together AI e a Modal servindo o K3 desde o primeiro dia diz como a Moonshot espera que as pessoas o usem: através do cluster de outra pessoa. Os resumos da comunidade da HuggingFace focam na quantização MXFP4 precisamente porque mesmo a versão comprimida é um artefato de datacenter.
Um modelo de 2,8T de parâmetros em precisão total são vários terabytes de pesos. Quantizado para formatos de 4 bits como o MXFP4 você ainda está na faixa de centenas de gigabytes, antes do cache KV e memória de ativação. Para comparação:
Então quando um tutorial promete "rode o Kimi K3 no seu PC", ou está descrevendo um wrapper de API ou está errado. O modelo ser aberto não o torna pequeno.
Essa não é uma visão cínica sobre o K3. Pesos abertos nessa escala importam por três razões concretas:
Se você quer usar o K3 em vez de admirá-lo, a pilha se parece com isso:
O passo 3 é a lacuna que a We.Inc fecha. Aqui está o fluxo concreto, não um gesto vago:
Esse último ponto é a simetria honesta: se você se importa com o K3 porque desconfia de plataformas fechadas, aplique o mesmo padrão à sua ferramenta de construção. A We.Inc te dá o código gerado; a maioria dos criadores de IA não.
Um esclarecimento que vale a pena fazer, porque "kimi k3 vs claude" é o que as pessoas estão buscando: eles têm papéis diferentes. O K3 é um modelo que você pode chamar do seu app. O Claude Opus 5, lançado em julho de 24, 2026, é atualmente o modelo de codificação pura mais forte e a classe de modelo que potencializa a geração dentro de criadores de IA. Usar um criador potencializado por Claude para criar um app que chama o K3 não é uma contradição. É a arquitetura normal agora: o melhor modelo para escrever o software, o modelo aberto adequado mais barato para rodar dentro dele.
A janela onde o lançamento de um novo modelo é interessante é curta. Os apps construídos durante essa janela duram. Descreva o seu em uma frase na We.Inc, grátis para começar, sem cartão exigido, e tenha-o ao vivo em um domínio hoje. Se você está avaliando planos primeiro, os preços estão aqui, e se você quer o caminho mais amplo sem código, comece com nosso guia de construir um web app sem código.
Comece grátis · Sem cartão de crédito