kimi-k2.7-code: 60% SWE-bench sem benchmark externo ainda
Voltar para o Blog
Artigo

kimi-k2.7-code: 60% SWE-bench sem benchmark externo ainda

Mafra
26/07/2026
6 min de leitura

O kimi-k2.7-code apareceu no Verboo Code sem cerimônia. Um dia não estava na lista de modelos. No outro, estava. E os números que o Moonshot publicou no lançamento são convidativos: 60,4% no SWE-bench Verified, 1 trilhão de parâmetros totais, 32 bilhões ativos por token, janela de contexto de 1 milhão de tokens, 30% menos tokens de raciocínio que o antecessor K2.6.

Antes de você mudar seu workflow, tem um detalhe que o comunicado de lançamento não coloca no título.

O que é o Kimi K2.7 Code?

O Kimi K2.7 Code é um modelo Mixture-of-Experts (MoE) do Moonshot AI, lançado em 12 de junho de 2026. A arquitetura MoE significa que, apesar dos 1 trilhão de parâmetros totais, apenas 32 bilhões são ativados por inferência. Na prática: velocidade próxima de um modelo de 32B, com a capacidade de padrões aprendidos de um modelo muito maior.

Ficha técnica completa:

  • Janela de contexto: 1 milhão de tokens
  • Licença: Modified MIT (comercialmente viável)
  • Especialização: coding, com foco declarado em eficiência de raciocínio
  • Melhoria sobre o K2.6: 30% menos tokens de raciocínio, 21,8% melhor no Kimi Code Bench v2
  • Parâmetros ativos: 32B por inferência (de 1T total)

Está disponível no Verboo Code ao lado de mimo-v2.5-pro, deepseek-v4-flash, glm-5.2, qwen3.6-27b e outros modelos open source rodando em GPU dedicada no Brasil, sem cap de tokens.

60,4% no SWE-bench: quem mediu?

Esse é o número que vai aparecer em todo artigo sobre o K2.7 Code. 60,4% no SWE-bench Verified. 90,1% no τ²-Bench. 89,6% no GPQA Diamond.

O detalhe: como de 5 de julho de 2026, todos esses números são do próprio Moonshot.

O modelo foi lançado em 12 de junho. São 23 dias. Tempo suficiente para o hype circular, mas não suficiente para que labs independentes rodem o SWE-bench Verified completo, submetam resultados e eles apareçam nos leaderboards públicos. O Aider Polyglot não tem entrada para o K2.7 Code ainda. O Arena WebDev também não.

Todos os benchmarks publicados para o Kimi K2.7 Code até hoje são vendor-reported ou foram medidos internamente antes do lançamento. Nenhum resultado externo independente confirmado como de 05/07/2026. Fonte: Requesty.ai — Kimi K2.7 Code specs.

Isso não é acusação de desonestidade. É o ritmo normal do mercado de modelos de linguagem.

Vendor-reported é a norma, não a exceção

Claude Opus 4.8 publicou 88,6% no SWE-bench no comunicado de lançamento. GPT-5.5 publicou 88,7%. Ambos foram confirmados por labs externos nas semanas seguintes, com variação de 2-4 pontos percentuais. O padrão se repete a cada novo modelo frontier.

O risco real do vendor-reported não é fraude. É otimização de pipeline. Nenhum modelo vai publicar benchmark com o pipeline que atrapalha os resultados. Os números de lançamento mostram o modelo em condições ideais para aquele benchmark específico, com o scaffolding de agente que o time de pesquisa ajustou internamente.

O que muda quando um lab externo roda o mesmo benchmark:

  • Pipeline de inferência diferente (temperatura, sampling, retry logic)
  • Versão exata do dataset e controle de contaminação de treino
  • Overhead de scaffolding do agente varia entre avaliadores
  • Número de tentativas permitidas por issue

Historicamente, a variação entre vendor-reported e externo fica entre 3-8 pontos percentuais para cima ou para baixo. O Moonshot publicou 58,6% no SWE-bench Pro e 60,4% no SWE-bench Verified. Se o padrão se mantiver, espere resultados externos entre 52-66% quando aparecerem. Trate 60,4% como piso razoável, não como garantia.

Como testar o kimi-k2.7-code no Verboo Code agora

Se você quiser formar sua própria opinião antes do mercado decidir, o modelo está disponível. Para acessar o agente de programação do Verboo Code:

verboo

Com o agente rodando, use o comando de troca de modelo:

/model

Selecione kimi-k2.7-code na lista. O agente continua a sessão com o novo modelo sem reiniciar o contexto, o que é útil para testar o mesmo problema em modelos diferentes dentro da mesma conversa.

Para comparação estruturada entre modelos:

  1. Escolha um issue real do seu projeto, de preferência com refatoração ou debugging multilíngue.
  2. Abra uma sessão com kimi-k2.7-code e resolva o issue.
  3. Abra outra sessão com deepseek-v4-flash ou mimo-v2.5-pro para o mesmo issue.
  4. Compare qualidade da solução, número de tentativas e tamanho do contexto consumido.

Com tokens ilimitados, o custo de comparação é zero. Você gasta tempo, não dinheiro.

kimi-k2.7-code vs os outros modelos do Verboo Code

Modelo Contexto Benchmark externo verificado Melhor para
kimi-k2.7-code 1M tokens Pendente (60,4% vendor-reported) Coding especializado, raciocínio eficiente
mimo-v2.5-pro 1M tokens Verificado externamente Refactor de monolito, contexto longo
glm-5.2 1M tokens 77,8% SWE-bench (externo) Coding geral com suporte a PT
deepseek-v4-flash 1M tokens 74,2% Aider Polyglot (externo) Iterações rápidas, debugging
qwen3.6-27b 262k tokens 80,4% SWE-bench (externo) Multilíngue (Go, Rust, Java, Python)

A diferença que importa: kimi-k2.7-code é o único dos cinco cujos benchmarks principais ainda não foram verificados externamente. Para todos os outros, existe pelo menos um resultado de lab independente confirmando os números. Isso não é argumento para não usar. É argumento para calibrar as expectativas corretamente antes de adotar o modelo como padrão do seu stack.

O que esperar nas próximas semanas

Os benchmarks externos chegam. O Aider Polyglot é o mais rápido porque a metodologia é pública e qualquer lab pode rodar independentemente. Em 4-6 semanas a partir do lançamento, o K2.7 Code vai aparecer em pelo menos dois leaderboards públicos com resultados de terceiros.

O comparativo entre vendor-reported e externo vai dizer mais sobre o modelo do que qualquer comunicado de lançamento. Se a diferença ficar dentro de 5 pontos percentuais, o Moonshot acertou a mão. Se cair mais que isso, o pipeline de benchmark deles estava otimizado demais para o próprio benchmark.

Por enquanto, o modelo está disponível, você tem 1M de contexto sem cap, e o benchmark mais honesto que existe é o do seu próprio codebase. Veja como os modelos open source do Verboo Code se saem em benchmarks reais contra Cursor e Claude Code e como 128 devs usam tokens ilimitados no dia a dia.

Quer testar esses modelos sem pagar por token? Verboo Code roda os principais open source com tokens ilimitados.

Gostou deste artigo?
Compartilhe conhecimento com sua rede.
Leia também

Artigos relacionados