Peso aberto contra peso fechado costuma virar uma disputa de orgulho. Os números não deixam muito espaço para isso aqui. O Kimi K3 faz 60,4% no SWE-bench Verified, contra 95% do Claude Fable 5. A distância é real, grande, e a razão de preço também é: o Fable 5 custa 3,3 vezes mais por token, tanto na entrada quanto na saída.
Isso não fecha a pergunta. Abre a certa: em qual fatia do seu trabalho os 34,6 pontos de diferença realmente aparecem, e em qual fatia você está pagando 3,3x por uma folga que nunca usa.
Como Kimi K3 e Claude Fable 5 se comparam nos benchmarks?
Três medidas independentes, três fontes diferentes, mesma direção: o Fable 5 está na frente em todas. A pergunta que importa é o tamanho do gap em cada uma.
| Benchmark | Kimi K3 | Claude Fable 5 | Fonte |
|---|---|---|---|
| SWE-bench Verified | 60,4% | 95,0% | Moonshot AI / Anthropic |
| Artificial Analysis Intelligence Index | 44 | 53 (5.1) | artificialanalysis.ai |
| WebDev Arena Elo (frontend) | 1691 (5º lugar) | 1788 (2º lugar) | arena.ai |
Consultado em 22/09/2026. O SWE-bench Verified é onde a distância mais dói: quase 35 pontos percentuais é a diferença entre um modelo que resolve a maioria das issues de um repositório real e um que resolve a esmagadora maioria delas. No WebDev Arena, votação cega de humanos comparando apps web gerados, a distância encolhe para 97 pontos de Elo, o que é perceptível mas não esmagador.
Quanto custa cada um na API oficial?
| Modelo | Entrada (por milhão de tokens) | Saída (por milhão de tokens) |
|---|---|---|
| Claude Fable 5 | US$ 10,00 | US$ 50,00 |
| Kimi K3 | US$ 3,00 | US$ 15,00 |
Fonte: preço oficial de lançamento, Anthropic (anthropic.com) e Moonshot AI, consultados em 22/09/2026. A razão é exatamente 3,3 vezes nos dois lados, entrada e saída, o que é incomum: normalmente a saída pesa mais na conta final porque é onde o raciocínio gasta token. Aqui a proporção fica igual, então o multiplicador de custo não muda dependendo do quanto o modelo "pensa" antes de responder.
O que tem dentro de cada modelo?
| Arquitetura | Kimi K3: MoE, 2,8T parâmetros totais, 104B ativos por token |
| Pesos | Kimi K3: abertos. Claude Fable 5: fechados, arquitetura não divulgada |
| Janela de contexto | Kimi K3: 1M tokens. Claude Fable 5: 1M entrada / 128K saída |
| Lançamento | Kimi K3: 16 de julho de 2026 |
O MoE do K3 ativa 104B dos 2,8T parâmetros por token, uma proporção de cerca de 27 para 1. Isso é o que permite servir um modelo desse tamanho a um preço que ainda compete com modelo fechado, mesmo sendo quase quatro vezes maior em parâmetros totais que o GLM-5.2, outro peso aberto da mesma safra.
Onde o Kimi K3 ainda perde, e por quanto
Na tarefa difícil, perde feio. Os quase 35 pontos de SWE-bench Verified não se distribuem igualmente entre issue simples e issue complexa. Concentram-se no topo da curva: refactor que atravessa muitos arquivos, bug cuja causa raiz não é óbvia, contexto de negócio que o modelo precisa inferir em vez de ler. É ali que pagar 3,3x mais pelo Fable 5 se paga sozinho.
Um modelo aberto perdendo de um modelo fechado por 35 pontos num benchmark difícil não é uma notícia ruim para peso aberto. É a distância que existia há dois anos entre qualquer modelo e o estado da arte. A pergunta que decide não é "qual é melhor", é "quanto da sua fila de tickets vive nesse topo difícil".
Como decidir de verdade?
- Olhe a distribuição real da sua fila, não o pior ticket do mês. Se a maioria do trabalho é manutenção, feature pequena e bug comum, os 35 pontos de diferença não aparecem na prática.
- Separe frontend de backend algorítmico. No WebDev Arena a distância é de 97 Elo, bem menor proporcionalmente que no SWE-bench Verified. Se o grosso do trabalho é interface, o gap dói menos.
- Pare de tratar como escolha única. Roteamento é a resposta mais comum na prática: Kimi K3 para o volume, Fable 5 reservado para a issue que já falhou duas vezes com o modelo mais barato.
A conta que a tabela de benchmark não mostra
Todo número acima pressupõe que você pode pagar para o modelo terminar a tarefa. Numa sessão agêntica longa, com o contexto de 1M cheio e várias iterações até o teste passar, o custo por token de saída é o que decide se a quinta tentativa acontece ou se alguém corta a sessão antes da hora.
A Verboo Code já roda o Kimi K3 em GPU dedicada, com tokens ilimitados, por um preço de API menor que o oficial da Moonshot: US$ 2,50 de entrada e US$ 9,00 de saída por milhão de tokens, contra US$ 3,00 e US$ 15,00 direto no laboratório. A distância de 35 pontos no benchmark difícil continua existindo. O que deixa de existir é a conta de token decidindo se você chega até o fim da tarefa fácil.



