Kimi K3 faz 60,4 no SWE-bench Verified. O Claude Fable 5 faz 95 e custa 3,3x mais
Voltar para o Blog
Artigocomparativomodelos de IAbenchmarksopen source

Kimi K3 faz 60,4 no SWE-bench Verified. O Claude Fable 5 faz 95 e custa 3,3x mais

Mafra22 de setembro de 20265 min de leitura

Peso aberto contra peso fechado costuma virar uma disputa de orgulho. Os números não deixam muito espaço para isso aqui. O Kimi K3 faz 60,4% no SWE-bench Verified, contra 95% do Claude Fable 5. A distância é real, grande, e a razão de preço também é: o Fable 5 custa 3,3 vezes mais por token, tanto na entrada quanto na saída.

Isso não fecha a pergunta. Abre a certa: em qual fatia do seu trabalho os 34,6 pontos de diferença realmente aparecem, e em qual fatia você está pagando 3,3x por uma folga que nunca usa.

Como Kimi K3 e Claude Fable 5 se comparam nos benchmarks?

Três medidas independentes, três fontes diferentes, mesma direção: o Fable 5 está na frente em todas. A pergunta que importa é o tamanho do gap em cada uma.

BenchmarkKimi K3Claude Fable 5Fonte
SWE-bench Verified60,4%95,0%Moonshot AI / Anthropic
Artificial Analysis Intelligence Index4453 (5.1)artificialanalysis.ai
WebDev Arena Elo (frontend)1691 (5º lugar)1788 (2º lugar)arena.ai

Consultado em 22/09/2026. O SWE-bench Verified é onde a distância mais dói: quase 35 pontos percentuais é a diferença entre um modelo que resolve a maioria das issues de um repositório real e um que resolve a esmagadora maioria delas. No WebDev Arena, votação cega de humanos comparando apps web gerados, a distância encolhe para 97 pontos de Elo, o que é perceptível mas não esmagador.

Quanto custa cada um na API oficial?

ModeloEntrada (por milhão de tokens)Saída (por milhão de tokens)
Claude Fable 5US$ 10,00US$ 50,00
Kimi K3US$ 3,00US$ 15,00

Fonte: preço oficial de lançamento, Anthropic (anthropic.com) e Moonshot AI, consultados em 22/09/2026. A razão é exatamente 3,3 vezes nos dois lados, entrada e saída, o que é incomum: normalmente a saída pesa mais na conta final porque é onde o raciocínio gasta token. Aqui a proporção fica igual, então o multiplicador de custo não muda dependendo do quanto o modelo "pensa" antes de responder.

O que tem dentro de cada modelo?

ArquiteturaKimi K3: MoE, 2,8T parâmetros totais, 104B ativos por token
PesosKimi K3: abertos. Claude Fable 5: fechados, arquitetura não divulgada
Janela de contextoKimi K3: 1M tokens. Claude Fable 5: 1M entrada / 128K saída
LançamentoKimi K3: 16 de julho de 2026

O MoE do K3 ativa 104B dos 2,8T parâmetros por token, uma proporção de cerca de 27 para 1. Isso é o que permite servir um modelo desse tamanho a um preço que ainda compete com modelo fechado, mesmo sendo quase quatro vezes maior em parâmetros totais que o GLM-5.2, outro peso aberto da mesma safra.

Onde o Kimi K3 ainda perde, e por quanto

Na tarefa difícil, perde feio. Os quase 35 pontos de SWE-bench Verified não se distribuem igualmente entre issue simples e issue complexa. Concentram-se no topo da curva: refactor que atravessa muitos arquivos, bug cuja causa raiz não é óbvia, contexto de negócio que o modelo precisa inferir em vez de ler. É ali que pagar 3,3x mais pelo Fable 5 se paga sozinho.

Um modelo aberto perdendo de um modelo fechado por 35 pontos num benchmark difícil não é uma notícia ruim para peso aberto. É a distância que existia há dois anos entre qualquer modelo e o estado da arte. A pergunta que decide não é "qual é melhor", é "quanto da sua fila de tickets vive nesse topo difícil".

Como decidir de verdade?

  1. Olhe a distribuição real da sua fila, não o pior ticket do mês. Se a maioria do trabalho é manutenção, feature pequena e bug comum, os 35 pontos de diferença não aparecem na prática.
  2. Separe frontend de backend algorítmico. No WebDev Arena a distância é de 97 Elo, bem menor proporcionalmente que no SWE-bench Verified. Se o grosso do trabalho é interface, o gap dói menos.
  3. Pare de tratar como escolha única. Roteamento é a resposta mais comum na prática: Kimi K3 para o volume, Fable 5 reservado para a issue que já falhou duas vezes com o modelo mais barato.

A conta que a tabela de benchmark não mostra

Todo número acima pressupõe que você pode pagar para o modelo terminar a tarefa. Numa sessão agêntica longa, com o contexto de 1M cheio e várias iterações até o teste passar, o custo por token de saída é o que decide se a quinta tentativa acontece ou se alguém corta a sessão antes da hora.

A Verboo Code já roda o Kimi K3 em GPU dedicada, com tokens ilimitados, por um preço de API menor que o oficial da Moonshot: US$ 2,50 de entrada e US$ 9,00 de saída por milhão de tokens, contra US$ 3,00 e US$ 15,00 direto no laboratório. A distância de 35 pontos no benchmark difícil continua existindo. O que deixa de existir é a conta de token decidindo se você chega até o fim da tarefa fácil.

Gostou deste artigo?
Compartilhe conhecimento com sua rede.
// Leia também

Artigos relacionados