Em maio, a Alibaba anunciou o Qwen3.7-Max como "Agent Frontier" e cravou 60,6% no SWE-bench Pro, a maior nota entre modelos proprietários, batendo os 58,6% do GPT-5.5. Ninguém no Twitter dev brasileiro comentou o detalhe que importa de verdade: o modelo é fechado, custa US$ 2,50 por 1M de tokens de entrada e US$ 7,50 por 1M de saída, e é notoriamente verboso. Traduzindo, o campeão do benchmark também é o que mais gasta pra responder a mesma pergunta.
Qwen3.7-Max é mesmo o melhor modelo pra coding?
Em benchmarks isolados, sim. A Qwen team apresentou o Qwen3.7-Max como "Agent Frontier", com contexto de 1M de tokens e Intelligence Index de 56,6 na Artificial Analysis, superando o Claude Opus 4.6 Max em SWE-bench Pro, Terminal-Bench 2.0 e MCP-Atlas. O problema não é a nota, é o que vem depois dela: acesso via Alibaba Cloud Model Studio, sem peso aberto, sem opção de rodar em GPU própria, e cobrança por token desde o primeiro caractere.
A tabela que ninguém publicou
| Modelo | SWE-bench Pro | SWE-Verified | Terminal-Bench 2.0 |
|---|---|---|---|
| Qwen3.7-Max | 60,6% | 80,4% | 69,7% |
| Kimi K2.6 Thinking | 59,5% | N/D | N/D |
| DeepSeek V4 Pro Max | 59,0% | 80,6% | 67,9% |
| GPT-5.5 | 58,6% | N/D | N/D |
| Opus 4.6 Max | N/D | 80,8% | 65,4% |
Fonte: Amit Ray, benchmark comparativo com dados da Artificial Analysis. Repare que a diferença entre o topo e a base da tabela é de 2 pontos percentuais, dentro da margem de erro de boa parte das suítes de avaliação.
Quanto custa rodar o campeão na prática?
Essa é a conta que a Alibaba não coloca no anúncio. Segundo a Artificial Analysis, um modelo que "gera 97 milhões de tokens numa suíte de avaliação padrão vai custar significativamente mais na prática" do que o preço de tabela sugere, justamente porque o Qwen3.7-Max tende a ser mais verboso que os concorrentes na mesma tarefa. Isso significa que os US$ 7,50 por 1M de tokens de saída viram um número abstrato: o gasto real depende de quantos tokens o modelo decide gerar pra chegar na resposta, e isso você só descobre depois de fechar o mês.
US$ 2,50 de entrada, US$ 7,50 de saída, modelo fechado, sem peso aberto, e histórico de gerar mais tokens que a média pra resolver a mesma tarefa. O preço por token raramente é o preço final.
O benchmark não conta a história toda
Aqui vai o ângulo contrário: pra quem programa 6, 8 horas por dia, uma diferença de 2 pontos percentuais em SWE-bench Pro não muda o dia a dia. O que muda o dia a dia é abrir a fatura no fim do mês e não saber se vai vir R$ 400 ou R$ 4.000, porque o modelo que você escolheu por causa de um benchmark de maio decidiu ser verboso numa sessão de refactor grande. A corrida por quem lidera o ranking essa semana é ótima pra manchete, péssima pra orçamento de squad.
O irmão open source do Qwen3.7-Max, o qwen3.6-27b, roda hoje no Verboo Code sem cobrar por token. Não é o mesmo modelo, é uma versão bem menor (27B contra um flagship que a Alibaba não divulga o tamanho), mas resolve a mesma dor de fundo: você não fica refém de quanto o modelo decide "pensar" antes de responder.
Como comparar o custo real antes de trocar de modelo
Antes de migrar pra qualquer modelo novo só porque ele lidera um benchmark, rode essa conta:
- Pegue o volume médio de tokens que seu time consome por dia (normalmente já está no dashboard do provedor atual).
- Multiplique pelo preço por token do modelo novo, entrada e saída separados.
- Adicione uma margem de 30% a 50% pra verbosidade, porque nenhum provedor garante que o modelo novo vai ser tão econômico em tokens quanto o antigo.
- Compare com o custo fixo de uma alternativa sem cap, como o Verboo Code.
No CLI, testar um modelo diferente é rápido:
verboo
/model qwen3.6-27b
Sem trocar de plano, sem abrir chamado, sem esperar aprovação de billing. Se quiser comparar lado a lado com outro modelo já coberto aqui no blog, dá pra alternar direto pelo mesmo comando, incluindo o deepseek-v4-flash, que já bateu de frente com o GPT-5 em SWE-bench e também está disponível na plataforma.
O que isso muda pra quem já paga por token hoje
O Verboo Code fechou a última atualização com R$ 31.488,90 de MRR (+47% no mês) e 164 assinantes ativos (+29%), rodando 6 modelos open source em GPU dedicada com plano fixo a partir de R$ 75/mês, tokens ilimitados de verdade. Isso não é um argumento contra o Qwen3.7-Max: ele é fechado, tem 1M de contexto e resolve bem tarefas de agente autônomo de ponta a ponta. É um argumento contra decidir modelo só olhando pro topo do ranking sem rodar a conta de custo real primeiro.
Quem já cobriu esse ângulo antes por aqui foi o post sobre o qwen3.6-27b superando modelo 15x maior em coding, mostrando que tamanho e benchmark de topo não são a mesma coisa que custo previsível.
Fechamento
Qwen3.7-Max lidera o SWE-bench Pro essa semana. Na semana que vem pode ser outro. O que não muda é a pergunta que você deveria fazer antes de trocar de modelo: quanto isso vai custar quando o time inteiro estiver rodando refactor grande ao mesmo tempo? Quer testar modelos open source sem fazer essa conta toda vez? O Verboo Code roda os principais modelos com tokens ilimitados e plano fixo, sem surpresa na fatura.



