No dia 16 de julho a Moonshot AI anunciou o Kimi K3 como o maior modelo open source já lançado: 2,8 trilhões de parâmetros, arquitetura MoE com apenas 16 de 896 experts ativados por request, contexto de 1M de tokens e benchmarks de coding que encostam no topo do ranking. A manchete da VentureBeat chamou de "modelo que rivaliza com os sistemas top dos EUA". O que a manchete não conta: você não pode baixar esse modelo hoje. Os pesos completos só saem no dia 27 de julho, onze dias depois do anúncio. Até lá, a Artificial Analysis classifica o Kimi K3 como proprietário, não aberto.
Quanto custa rodar o Kimi K3 antes dos pesos saírem?
Enquanto os pesos não chegam, a única forma de usar o Kimi K3 é via API hospedada, e o preço não é sutil: US$ 3 por milhão de tokens de entrada e US$ 15 por milhão de saída, segundo o OpenRouter. Compare com a geração anterior, o Kimi K2, que cobrava US$ 0,60 a US$ 0,95 de entrada e US$ 3 a US$ 4 de saída. É um aumento de 3x a 5x, dependendo da ponta da faixa que você usa como referência.
O modelo já está disponível no OpenRouter, mas com uma ressalva direta da própria página: "capacidade upstream está atualmente limitada, este modelo pode retornar erros 429 com frequência". Ou seja: modelo caro, fechado e sujeito a fila.
Kimi K2 cobrava US$ 0,60-0,95 de entrada. O Kimi K3 cobra US$ 3. Isso é o preço de "esperar os pesos abrirem".
Os benchmarks realmente impressionam?
Em parte, sim. O Kimi K3 fica entre os 3 melhores em seis benchmarks de coding, e lidera dois deles isoladamente:
| Benchmark | Kimi K3 | Comparação |
|---|---|---|
| SWE Marathon | 42,0 | Líder. GPT-5.5 e GLM-5.2 "colapsam pra baixa dezena", segundo a Artificial Analysis |
| Program Bench | 77,8 | Líder isolado |
| Terminal-Bench 2.1 | 88,3 | Quase empate com o líder (88,8, provavelmente GPT-5.6 Sol) |
| FrontierSWE | 81,2 | Segundo lugar, atrás do Fable 5 (86,6) |
O destaque real é o SWE Marathon, que mede sessões longas de codificação sustentada. Faz sentido: contexto de 1M de tokens ajuda em repositórios grandes, e é justamente aí que a maioria dos modelos perde consistência com o tempo.
"Open source" virou rótulo de marketing?
Esse não é o primeiro anúncio do mês que promete generosidade e entrega letra miúda. Já a Cursor dobrou o uso incluído de Grok 4.5 sem dizer qual era o número base, e a Meta lançou o Muse Spark 1.1 com preço 75% menor, mas restrito aos EUA. O padrão se repete: o anúncio vende amplitude, a letra miúda entrega controle de acesso.
Com o Kimi K3, o problema é de rótulo. "Open-weight" hoje significa "vamos abrir os pesos depois", não "os pesos estão abertos". Enquanto isso não acontece, o modelo é uma API paga como qualquer outra, só que mais cara que a geração anterior da própria Moonshot. Chamar isso de "open source" antes do dia 27 é aspiracional, não descritivo.
Como testar modelo aberto de verdade, sem esperar até dia 27
A família Kimi já está disponível agora no Verboo Code: o kimi-k2.7 roda como um dos 7 modelos ativos na plataforma, sem fila, sem 429, sem esperar data de liberação de peso. Pra trocar de modelo dentro de uma sessão:
/model
Escolhe o modelo na lista e continua a sessão sem interromper o contexto. A diferença de custo é o ponto central: numa sessão de refatoração longa, com contexto de repositório grande e várias iterações de debug, é fácil passar de 10-15M de tokens processados. A US$ 3/US$ 15 por milhão, isso vira uma conta de dezenas de dólares numa tarde. No Verboo Code, tokens ilimitados significa que essa conta não existe.
O que fica dessa história
O Kimi K3 é um modelo tecnicamente competente, com benchmarks reais e uma arquitetura MoE eficiente para o tamanho. Mas "maior open source da história" é uma alegação que só vira fato em 27 de julho, e até lá quem quiser usar paga o preço de um modelo fechado. Prova social atualizada do Verboo Code: MRR de R$ 32.614,90 (+52% mês a mês), 174 assinantes ativos (+37%), rodando 7 modelos open source em GPU dedicada, incluindo o próprio Kimi K2.7, hoje. Sem data de liberação, porque já está liberado.
Quer comparar isso na prática com o que a tabela de tokens ilimitados vs pagar por token já mostrou pros outros coding agents? Verboo Code roda os principais modelos open source com tokens ilimitados, sem fila e sem esperar pesos abrirem.
Fontes: VentureBeat, FelloAI, OpenRouter.



