O kimi-k2.7-code apareceu no Verboo Code sem cerimônia. Um dia não estava na lista de modelos. No outro, estava. E os números que o Moonshot publicou no lançamento são convidativos: 60,4% no SWE-bench Verified, 1 trilhão de parâmetros totais, 32 bilhões ativos por token, janela de contexto de 1 milhão de tokens, 30% menos tokens de raciocínio que o antecessor K2.6.
Antes de você mudar seu workflow, tem um detalhe que o comunicado de lançamento não coloca no título.
O que é o Kimi K2.7 Code?
O Kimi K2.7 Code é um modelo Mixture-of-Experts (MoE) do Moonshot AI, lançado em 12 de junho de 2026. A arquitetura MoE significa que, apesar dos 1 trilhão de parâmetros totais, apenas 32 bilhões são ativados por inferência. Na prática: velocidade próxima de um modelo de 32B, com a capacidade de padrões aprendidos de um modelo muito maior.
Ficha técnica completa:
- Janela de contexto: 1 milhão de tokens
- Licença: Modified MIT (comercialmente viável)
- Especialização: coding, com foco declarado em eficiência de raciocínio
- Melhoria sobre o K2.6: 30% menos tokens de raciocínio, 21,8% melhor no Kimi Code Bench v2
- Parâmetros ativos: 32B por inferência (de 1T total)
Está disponível no Verboo Code ao lado de mimo-v2.5-pro, deepseek-v4-flash, glm-5.2, qwen3.6-27b e outros modelos open source rodando em GPU dedicada no Brasil, sem cap de tokens.
60,4% no SWE-bench: quem mediu?
Esse é o número que vai aparecer em todo artigo sobre o K2.7 Code. 60,4% no SWE-bench Verified. 90,1% no τ²-Bench. 89,6% no GPQA Diamond.
O detalhe: como de 5 de julho de 2026, todos esses números são do próprio Moonshot.
O modelo foi lançado em 12 de junho. São 23 dias. Tempo suficiente para o hype circular, mas não suficiente para que labs independentes rodem o SWE-bench Verified completo, submetam resultados e eles apareçam nos leaderboards públicos. O Aider Polyglot não tem entrada para o K2.7 Code ainda. O Arena WebDev também não.
Todos os benchmarks publicados para o Kimi K2.7 Code até hoje são vendor-reported ou foram medidos internamente antes do lançamento. Nenhum resultado externo independente confirmado como de 05/07/2026. Fonte: Requesty.ai — Kimi K2.7 Code specs.
Isso não é acusação de desonestidade. É o ritmo normal do mercado de modelos de linguagem.
Vendor-reported é a norma, não a exceção
Claude Opus 4.8 publicou 88,6% no SWE-bench no comunicado de lançamento. GPT-5.5 publicou 88,7%. Ambos foram confirmados por labs externos nas semanas seguintes, com variação de 2-4 pontos percentuais. O padrão se repete a cada novo modelo frontier.
O risco real do vendor-reported não é fraude. É otimização de pipeline. Nenhum modelo vai publicar benchmark com o pipeline que atrapalha os resultados. Os números de lançamento mostram o modelo em condições ideais para aquele benchmark específico, com o scaffolding de agente que o time de pesquisa ajustou internamente.
O que muda quando um lab externo roda o mesmo benchmark:
- Pipeline de inferência diferente (temperatura, sampling, retry logic)
- Versão exata do dataset e controle de contaminação de treino
- Overhead de scaffolding do agente varia entre avaliadores
- Número de tentativas permitidas por issue
Historicamente, a variação entre vendor-reported e externo fica entre 3-8 pontos percentuais para cima ou para baixo. O Moonshot publicou 58,6% no SWE-bench Pro e 60,4% no SWE-bench Verified. Se o padrão se mantiver, espere resultados externos entre 52-66% quando aparecerem. Trate 60,4% como piso razoável, não como garantia.
Como testar o kimi-k2.7-code no Verboo Code agora
Se você quiser formar sua própria opinião antes do mercado decidir, o modelo está disponível. Para acessar o agente de programação do Verboo Code:
verboo
Com o agente rodando, use o comando de troca de modelo:
/model
Selecione kimi-k2.7-code na lista. O agente continua a sessão com o novo modelo sem reiniciar o contexto, o que é útil para testar o mesmo problema em modelos diferentes dentro da mesma conversa.
Para comparação estruturada entre modelos:
- Escolha um issue real do seu projeto, de preferência com refatoração ou debugging multilíngue.
- Abra uma sessão com
kimi-k2.7-codee resolva o issue. - Abra outra sessão com
deepseek-v4-flashoumimo-v2.5-propara o mesmo issue. - Compare qualidade da solução, número de tentativas e tamanho do contexto consumido.
Com tokens ilimitados, o custo de comparação é zero. Você gasta tempo, não dinheiro.
kimi-k2.7-code vs os outros modelos do Verboo Code
| Modelo | Contexto | Benchmark externo verificado | Melhor para |
|---|---|---|---|
| kimi-k2.7-code | 1M tokens | Pendente (60,4% vendor-reported) | Coding especializado, raciocínio eficiente |
| mimo-v2.5-pro | 1M tokens | Verificado externamente | Refactor de monolito, contexto longo |
| glm-5.2 | 1M tokens | 77,8% SWE-bench (externo) | Coding geral com suporte a PT |
| deepseek-v4-flash | 1M tokens | 74,2% Aider Polyglot (externo) | Iterações rápidas, debugging |
| qwen3.6-27b | 262k tokens | 80,4% SWE-bench (externo) | Multilíngue (Go, Rust, Java, Python) |
A diferença que importa: kimi-k2.7-code é o único dos cinco cujos benchmarks principais ainda não foram verificados externamente. Para todos os outros, existe pelo menos um resultado de lab independente confirmando os números. Isso não é argumento para não usar. É argumento para calibrar as expectativas corretamente antes de adotar o modelo como padrão do seu stack.
O que esperar nas próximas semanas
Os benchmarks externos chegam. O Aider Polyglot é o mais rápido porque a metodologia é pública e qualquer lab pode rodar independentemente. Em 4-6 semanas a partir do lançamento, o K2.7 Code vai aparecer em pelo menos dois leaderboards públicos com resultados de terceiros.
O comparativo entre vendor-reported e externo vai dizer mais sobre o modelo do que qualquer comunicado de lançamento. Se a diferença ficar dentro de 5 pontos percentuais, o Moonshot acertou a mão. Se cair mais que isso, o pipeline de benchmark deles estava otimizado demais para o próprio benchmark.
Por enquanto, o modelo está disponível, você tem 1M de contexto sem cap, e o benchmark mais honesto que existe é o do seu próprio codebase. Veja como os modelos open source do Verboo Code se saem em benchmarks reais contra Cursor e Claude Code e como 128 devs usam tokens ilimitados no dia a dia.
Quer testar esses modelos sem pagar por token? Verboo Code roda os principais open source com tokens ilimitados.



