deepseek-v4-flash bate Claude Opus 4.8 no ranking de agosto
Voltar para o Blog
Artigo

deepseek-v4-flash bate Claude Opus 4.8 no ranking de agosto

Mafra
24/08/2026
10 min de leitura

No WebDev Arena de agosto de 2026, o oitavo lugar do ranking mundial não é um modelo de assinatura de US$ 20 por mês. É o deepseek-v4-flash, o mesmo modelo que roda de graça a partir do plano de R$ 75 do Verboo Code. Ele fica à frente de Claude Opus 4.8-thinking (9º lugar) e Claude Opus 4.7 (10º), dois modelos que, poucos meses atrás, disputavam a liderança do mercado.

Não é ruído estatístico. É o retrato de um movimento que já dura alguns meses: o topo da tabela de modelos de IA para código está cada vez mais caro para subir, e cada vez mais barato para acompanhar. Este é o comparativo mensal do Verboo Code, cruzando dois rankings independentes pra mostrar exatamente onde esse gap está e onde ele já fechou.

O que o ranking de agosto realmente mostra?

Cruzando o Intelligence Index da Artificial Analysis com o WebDev Arena, dois rankings independentes que avaliam capacidade de código de formas diferentes, dá pra ver o mesmo padrão nos dois: o grupo de elite ficou mais apertado, e o preço pra entrar nele não acompanha a mesma curva.

No Intelligence Index, a distância entre o 1º e o 3º colocado é de dois pontos, mas o preço entre eles varia quase 3x:

ModeloIntelligence IndexCusto por tarefaVelocidade (tokens/s)
Claude Opus 5 (max)61US$ 2,3456
Claude Opus 5 (xhigh)60US$ 1,8057
Claude Fable 560US$ 3,1575
GPT-5.6 Sol (max)59US$ 1,2369
Kimi K3 (max)57US$ 0,8636
GPT-5.6 Terra (max)55US$ 0,51146

Repara na última linha: o GPT-5.6 Terra perde só 6 pontos de inteligência pro líder, mas custa quase 5x menos por tarefa e roda quase 3x mais rápido. Isso não é uma exceção pontual, é a curva inteira do mercado hoje: pagar pelo topo custa exponencialmente mais caro pra ganhar uma fração de inteligência a mais. E o Intelligence Index nem é o ranking que mais expõe isso. O WebDev Arena expõe mais.

WebDev Arena: por que um modelo grátis aparece entre os líderes de código?

O WebDev Arena mede outra coisa: capacidade real de gerar e iterar aplicações web completas, com avaliação humana pareada, ou seja, pessoas de verdade comparando duas saídas de código lado a lado e votando em qual funciona melhor. É um ranking mais bruto e mais próximo do uso real do que benchmark sintético. E é aqui que o deepseek-v4-flash aparece:

PosiçãoModeloScore
Claude Opus 5 (max)1705
Kimi K3 (max)1676
Claude Opus 5 (high)1669
Qwen3.8-max1668
Claude Fable 51630
GPT-5.6 Sol (xhigh)1620
GLM-5.2 (max)1586
deepseek-v4-flash (high)1577
Claude Opus 4.8-thinking1566
10ºClaude Opus 4.71561
O deepseek-v4-flash, no ajuste de raciocínio "high", entra no top 10 do WebDev Arena à frente de duas versões do Claude Opus que já foram topo de mercado. Fonte: WebDev Arena, agosto/2026.

Importante ser honesto aqui: o deepseek-v4-flash não é o modelo mais inteligente do mercado, e não vai ganhar de um Claude Opus 5 rodando no modo max em toda tarefa complexa de arquitetura. Mas pra gerar e iterar interface, resolver bug e escrever teste, que é a maior parte do trabalho do dia a dia de quem programa, a diferença que sobra não justifica pagar por token pra chegar lá.

O que esses dois rankings medem, e onde eles discordam?

Vale desconfiar de qualquer ranking único, inclusive dos que a Verboo Code está citando aqui. O Intelligence Index é uma média ponderada de benchmarks técnicos (raciocínio, matemática, código, agentes), então favorece modelos consistentes em várias frentes. O WebDev Arena é voto humano pareado, então favorece o que "parece" melhor num teste cego, o que nem sempre é o código mais limpo ou mais sustentável a longo prazo.

É por isso que o Gemini 3.1 Pro liderava o WebDev Arena em julho e não aparece mais no top 10 de agosto, enquanto o Claude Opus 5 domina os dois rankings ao mesmo tempo. Rankings de benchmark oscilam, e um modelo isolado subir ou cair duas posições em um mês não é sinal de nada sozinho. O sinal está no padrão: a distância entre o topo pago e o meio da tabela open source está encolhendo há meses, não só neste mês.

Esse ranking vale só pra código de frontend?

Vale destacar o que o WebDev Arena não mede. O nome já entrega: é um benchmark de geração e iteração de aplicações web, então favorece modelos fortes em interface, componente e fluxo visual. Ele não testa diretamente tarefa de backend puro, script de infraestrutura ou debugging de sistema distribuído, que são boa parte do trabalho de quem programa fora do contexto de produto web. Pra esse tipo de tarefa, o Intelligence Index, que agrega raciocínio, matemática e uso de ferramenta e não só web, conta mais.

Isso não invalida o dado do deepseek-v4-flash. Só contextualiza onde ele vale mais: gerar e corrigir código de produto, que é onde a maioria dos times gasta a maior parte do tempo de qualquer forma.

Um mês faz diferença: o que mudou desde julho

O último comparativo do Verboo Code, feito em julho, mostrava um cenário mais distante. Na época, o Claude Opus 4.8 liderava o SWE-bench Verified com 88,6 pontos, o GPT-5.5 empatava tecnicamente com 88,7, e o melhor modelo open source no mesmo benchmark (Qwen 3.7 Max) ficava a 8 pontos de distância, em 80,4. O líder do WebDev Arena era o Gemini 3.1 Pro, e nenhum modelo com licença aberta aparecia no top 10.

Um mês depois, o cenário mudou em duas frentes ao mesmo tempo. Do lado dos modelos, o deepseek-v4-flash entrou no top 10 do WebDev Arena, superando duas versões do Claude Opus. Do lado do Verboo Code, o catálogo saltou de 3 modelos disponíveis (mimo-v2.5, deepseek-v4-flash e qwen3.6-27b) para 9, e a base de assinantes cresceu de 102 para 165 devs pagantes, com o MRR saindo de R$ 14.575,90 para R$ 30.858,10.

Nem tudo é curva ascendente reta: nos últimos 30 dias corridos, o MRR desacelerou, ficando praticamente estável em vez de repetir o salto de julho. É esperado numa base que mais que dobrou de tamanho em quatro semanas, mas vale registrar sem maquiagem: crescimento explosivo não se sustenta todo mês, e não precisa se sustentar pra a tese continuar de pé.

O mercado de ferramentas de código ainda não escolheu um vencedor

Enquanto os modelos brigam por dois ou três pontos de índice, a camada de ferramenta em cima deles continua fragmentada. Uma pesquisa da Pragmatic Engineer com 906 desenvolvedores, feita no início do ano, apontava o Claude Code como a ferramenta mais bem avaliada por quem usa, com 46% de aprovação. Isso não se traduz em domínio de uso: levantamentos da SemiAnalysis, do mesmo período, estimavam a participação do Claude Code em torno de 4% dos commits gerados por IA em repositórios monitorados. O resto do mercado se divide entre Cursor, que lançou sua versão v3 Glass em abril, GitHub Copilot e uma pilha crescente de plugins que conectam um editor a múltiplos provedores de modelo ao mesmo tempo.

O resultado prático pra quem programa é uma pilha composta: um editor de um lado, um plugin de roteamento de modelo do outro, uma assinatura de modelo em outro canto, cada peça cobrando separado. Nenhuma ferramenta sozinha consolidou preferência de uso e catálogo de modelo ao mesmo tempo. É o espaço que o Verboo Code ocupa: um agente de terminal só, com 9 modelos por trás, sem precisar somar assinatura de editor, assinatura de modelo e plugin de roteamento em três faturas diferentes.

Vale a pena pagar por token pra subir esses 2 ou 3 pontos?

Aqui está o ângulo que os dois rankings não respondem sozinhos: o custo real de quem programa em loop. Um agente de programação não roda uma tarefa por dia, ele roda dezenas: escreve, testa, corrige, testa de novo. Cada volta desse loop é uma chamada nova ao modelo, e cada chamada tem um preço na tabela de custo por tarefa.

Faça a conta com o modelo mais caro da lista, o Claude Fable 5, a US$ 3,15 por tarefa. Um dia de trabalho pesado, com 20 iterações de correção e teste, já custa mais de US$ 60 só naquele dia. Num mês de 20 dias úteis, isso passa de US$ 1.200, ainda que ninguém rode nesse ritmo todo santo dia. Mesmo num cenário mais moderado, de 5 a 10 iterações diárias, o custo mensal por token facilmente ultrapassa os R$ 75 fixos do plano de entrada do Verboo Code, que dá acesso a modelo sem contador de token nenhum.

A conta não é "qual modelo é mais esperto", é "quantas vezes eu preciso rodar de novo até funcionar, e quem paga por isso". Foi exatamente esse cálculo que levou o mercado a discutir cortes de custo por token em outras ferramentas nos últimos meses. O problema nunca foi a inteligência do modelo. Foi o medidor.

Como trocar de modelo no Verboo Code pra testar isso?

O Verboo Code já roda 9 modelos em GPU dedicada, incluindo o deepseek-v4-flash que aparece no ranking acima. Instalar e trocar de modelo direto no terminal:

npm install -g @verboo/code@latest
verboo
/model deepseek-v4-flash

Dentro do terminal, digitar /model sozinho mostra os modelos disponíveis no seu plano. Sem cartão pra testar, sem limite de token pra decidir quando parar de iterar.

Contexto também pesa na escolha entre os 9 modelos: deepseek-v4-flash, deepseek-v4-pro, mimo-v2.5 e mimo-v2.5-pro rodam com até 1 milhão de tokens de janela, enquanto qwen3.6-27b e kimi-k2.7 ficam na faixa de 262 mil. Pra repositório grande ou sessão longa de debugging, isso importa mais do que meio ponto de índice de inteligência. O histórico de atualizações do deepseek-v4-flash mostra que os ganhos de cada re-treino chegam pra quem já assina, sem decisão de compra nova.

Prova, não promessa

Hoje o Verboo Code tem 165 assinantes ativos e R$ 30.858,10 de MRR, rodando 9 modelos (deepseek-v4-flash, deepseek-v4-pro, mimo-v2.5, mimo-v2.5-pro, qwen3.6-27b, kimi-k2.7, glm-5.2, glm-4.7-flash e minimax-m3) em infraestrutura própria, com licenças abertas na maior parte do catálogo. Nem todo mês é recorde: este mês o crescimento de MRR desacelerou frente a julho, mas a base de assinantes segurou e o catálogo de modelos cresceu de 3 pra 9 desde o último comparativo.

Quanto custa cada plano do Verboo Code?

PlanoPreço/mêsModelos incluídosTrial
JuniorR$ 752-
ProR$ 11941 dia grátis, sem cartão
MaxR$ 3197-
UltraR$ 8999-

Todos os planos rodam com tokens ilimitados dentro do limite de requisições por minuto, sem cobrar chamada extra ao modelo, seja no Junior de R$ 75 ou no Ultra com o catálogo inteiro liberado.

É a mesma lógica que aparece nos dois rankings deste comparativo: crescer no topo é caro e lento, seja pra um laboratório de IA subindo dois pontos de índice, seja pra qualquer empresa tentando repetir um salto de MRR de 200% todo mês. Crescer na base, com mais opção de modelo e sem medidor de token, é onde o mercado de fato está se movendo, e é onde o Verboo Code está apostando as fichas.

O que muda pra quem programa todo dia

Modelo mais esperto continua valendo a pena pra decisão de arquitetura, revisão crítica, qualquer coisa que exija raciocínio de verdade e onde um erro custa caro. Mas pro loop repetitivo que consome a maior parte do dia de trabalho (escrever, testar, corrigir, testar de novo), a distância entre pagar US$ 2 ou 3 por tarefa e não pagar nada por tarefa importa mais do que 2 ou 3 pontos de índice de inteligência.

Quer testar esses modelos sem pagar por token? O Verboo Code roda os principais modelos open source com tokens ilimitados, incluindo o deepseek-v4-flash que aparece no top 10 do WebDev Arena.

Gostou deste artigo?
Compartilhe conhecimento com sua rede.
Leia também

Artigos relacionados