Qwen3.7-Max bate GPT-5.5 no SWE-bench, mas cobra por token
Voltar para o Blog
Artigo

Qwen3.7-Max bate GPT-5.5 no SWE-bench, mas cobra por token

Mafra
02/08/2026
5 min de leitura

Em maio, a Alibaba anunciou o Qwen3.7-Max como "Agent Frontier" e cravou 60,6% no SWE-bench Pro, a maior nota entre modelos proprietários, batendo os 58,6% do GPT-5.5. Ninguém no Twitter dev brasileiro comentou o detalhe que importa de verdade: o modelo é fechado, custa US$ 2,50 por 1M de tokens de entrada e US$ 7,50 por 1M de saída, e é notoriamente verboso. Traduzindo, o campeão do benchmark também é o que mais gasta pra responder a mesma pergunta.

Qwen3.7-Max é mesmo o melhor modelo pra coding?

Em benchmarks isolados, sim. A Qwen team apresentou o Qwen3.7-Max como "Agent Frontier", com contexto de 1M de tokens e Intelligence Index de 56,6 na Artificial Analysis, superando o Claude Opus 4.6 Max em SWE-bench Pro, Terminal-Bench 2.0 e MCP-Atlas. O problema não é a nota, é o que vem depois dela: acesso via Alibaba Cloud Model Studio, sem peso aberto, sem opção de rodar em GPU própria, e cobrança por token desde o primeiro caractere.

A tabela que ninguém publicou

ModeloSWE-bench ProSWE-VerifiedTerminal-Bench 2.0
Qwen3.7-Max60,6%80,4%69,7%
Kimi K2.6 Thinking59,5%N/DN/D
DeepSeek V4 Pro Max59,0%80,6%67,9%
GPT-5.558,6%N/DN/D
Opus 4.6 MaxN/D80,8%65,4%

Fonte: Amit Ray, benchmark comparativo com dados da Artificial Analysis. Repare que a diferença entre o topo e a base da tabela é de 2 pontos percentuais, dentro da margem de erro de boa parte das suítes de avaliação.

Quanto custa rodar o campeão na prática?

Essa é a conta que a Alibaba não coloca no anúncio. Segundo a Artificial Analysis, um modelo que "gera 97 milhões de tokens numa suíte de avaliação padrão vai custar significativamente mais na prática" do que o preço de tabela sugere, justamente porque o Qwen3.7-Max tende a ser mais verboso que os concorrentes na mesma tarefa. Isso significa que os US$ 7,50 por 1M de tokens de saída viram um número abstrato: o gasto real depende de quantos tokens o modelo decide gerar pra chegar na resposta, e isso você só descobre depois de fechar o mês.

US$ 2,50 de entrada, US$ 7,50 de saída, modelo fechado, sem peso aberto, e histórico de gerar mais tokens que a média pra resolver a mesma tarefa. O preço por token raramente é o preço final.

O benchmark não conta a história toda

Aqui vai o ângulo contrário: pra quem programa 6, 8 horas por dia, uma diferença de 2 pontos percentuais em SWE-bench Pro não muda o dia a dia. O que muda o dia a dia é abrir a fatura no fim do mês e não saber se vai vir R$ 400 ou R$ 4.000, porque o modelo que você escolheu por causa de um benchmark de maio decidiu ser verboso numa sessão de refactor grande. A corrida por quem lidera o ranking essa semana é ótima pra manchete, péssima pra orçamento de squad.

O irmão open source do Qwen3.7-Max, o qwen3.6-27b, roda hoje no Verboo Code sem cobrar por token. Não é o mesmo modelo, é uma versão bem menor (27B contra um flagship que a Alibaba não divulga o tamanho), mas resolve a mesma dor de fundo: você não fica refém de quanto o modelo decide "pensar" antes de responder.

Como comparar o custo real antes de trocar de modelo

Antes de migrar pra qualquer modelo novo só porque ele lidera um benchmark, rode essa conta:

  1. Pegue o volume médio de tokens que seu time consome por dia (normalmente já está no dashboard do provedor atual).
  2. Multiplique pelo preço por token do modelo novo, entrada e saída separados.
  3. Adicione uma margem de 30% a 50% pra verbosidade, porque nenhum provedor garante que o modelo novo vai ser tão econômico em tokens quanto o antigo.
  4. Compare com o custo fixo de uma alternativa sem cap, como o Verboo Code.

No CLI, testar um modelo diferente é rápido:

verboo
/model qwen3.6-27b

Sem trocar de plano, sem abrir chamado, sem esperar aprovação de billing. Se quiser comparar lado a lado com outro modelo já coberto aqui no blog, dá pra alternar direto pelo mesmo comando, incluindo o deepseek-v4-flash, que já bateu de frente com o GPT-5 em SWE-bench e também está disponível na plataforma.

O que isso muda pra quem já paga por token hoje

O Verboo Code fechou a última atualização com R$ 31.488,90 de MRR (+47% no mês) e 164 assinantes ativos (+29%), rodando 6 modelos open source em GPU dedicada com plano fixo a partir de R$ 75/mês, tokens ilimitados de verdade. Isso não é um argumento contra o Qwen3.7-Max: ele é fechado, tem 1M de contexto e resolve bem tarefas de agente autônomo de ponta a ponta. É um argumento contra decidir modelo só olhando pro topo do ranking sem rodar a conta de custo real primeiro.

Quem já cobriu esse ângulo antes por aqui foi o post sobre o qwen3.6-27b superando modelo 15x maior em coding, mostrando que tamanho e benchmark de topo não são a mesma coisa que custo previsível.

Fechamento

Qwen3.7-Max lidera o SWE-bench Pro essa semana. Na semana que vem pode ser outro. O que não muda é a pergunta que você deveria fazer antes de trocar de modelo: quanto isso vai custar quando o time inteiro estiver rodando refactor grande ao mesmo tempo? Quer testar modelos open source sem fazer essa conta toda vez? O Verboo Code roda os principais modelos com tokens ilimitados e plano fixo, sem surpresa na fatura.

Gostou deste artigo?
Compartilhe conhecimento com sua rede.
Leia também

Artigos relacionados