Qwen3.8-Max tem 2,4 tri parâmetros - e quase ninguém roda
Voltar para o Blog
Artigo

Qwen3.8-Max tem 2,4 tri parâmetros - e quase ninguém roda

Mafra
25/08/2026
5 min de leitura

A Alibaba lançou o Qwen3.8-Max na segunda-feira (03/08) chamando de o modelo mais capaz da família Qwen até hoje. 2,4 trilhões de parâmetros, 95 bilhões ativos por inferência, contexto de quase 1 milhão de tokens. Os pesos abertos chegam semana que vem. O detalhe que a manchete não conta: praticamente nenhum dev vai conseguir baixar e rodar esse modelo sozinho.

O que a Alibaba realmente anunciou

Qwen3.8-Max é uma arquitetura MoE (mixture of experts) com 2,4 trilhões de parâmetros totais, dos quais 95 bilhões são ativados por token processado, segundo o detalhamento técnico da MarkTechPost. Isso mantém a inferência viável em produção, mas não muda o fato de que armazenar o modelo completo em memória, mesmo quantizado, exige um cluster de GPUs que a maioria das empresas de software não possui.

Os números de contexto são reais: até 991 mil tokens de entrada (983 mil com modo thinking ativado) e até 131 mil tokens de saída. Em coding, o modelo aparece competitivo em alguns benchmarks e atrás em outros:

BenchmarkQwen3.8-MaxClaude Opus 4.8Claude Fable 5GPT-5.6 Sol
Terminal-Bench 2.186,684,684,688,8
SWE-bench Pro67,7-80,0-
FrontierSWE73,5-88,8-

Preço via API: US$ 2 por milhão de tokens de entrada, US$ 6 por milhão de saída, com cache implícito a US$ 0,25. Nada absurdo perto do que o Qwen3.7-Max já cobrava por token um mês atrás, mas ainda é cobrança por token, o modelo de negócio que todo esse mercado insiste em manter mesmo quando o marketing fala em "abertura".

O lançamento também tem leitura competitiva: a Alibaba mira diretamente OpenAI e Anthropic, oferecendo um modelo de classe topo com peso aberto, algo que nenhuma das duas faz hoje. É um movimento de posicionamento tanto quanto técnico.

Peso aberto significa acessível?

Aqui está o ângulo que a cobertura de lançamento deixou passar. A Alibaba lançou dois modelos junto: o Qwen3.8-Max de 2,4 trilhões de parâmetros e o Qwen3.8-27B, um irmão bem menor. Analistas ouvidos pela reportagem da InfoWorld notaram que o modelo de 27B foi "quase inteiramente ignorado" pela imprensa, mesmo sendo o único dos dois que uma organização comum consegue efetivamente rodar em infraestrutura própria.

O flagship de 2,4 trilhões é o que vira manchete. Mas peso aberto, nesse caso, é uma abertura teórica: os arquivos ficam disponíveis pra download, só que rodar um MoE desse tamanho localmente, mesmo quantizado, exige um investimento em GPU que está fora do orçamento de quase todo time de produto. Empresas fora da China, segundo a mesma reportagem, ainda enfrentam custo extra pra rodar via hyperscaler ou infraestrutura própria, o que empurra o dev de volta pra uma API paga de qualquer forma.

Como avaliar se um "open weight" é realmente utilizável

  • Parâmetros ativos vs totais: um MoE de 2,4 tri com 95B ativos ainda precisa carregar os 2,4 tri em memória, mesmo processando só uma fração por token.
  • Quantização real: pesos em FP16 exigem o dobro de VRAM de uma versão em 8 bits. Pergunte qual quantização o benchmark divulgado usou.
  • Quem paga a GPU: "peso aberto" não é "hospedagem grátis". Alguém paga o cluster, seja você ou um provedor.
  • Data real de disponibilidade: "semana que vem" em anúncio de modelo é uma promessa, não um changelog.
  • Modelo certo pro tamanho certo: se o "irmão pequeno" (27B, nesse caso) cobre sua tarefa, ele costuma valer mais que o flagship que você não consegue hospedar.

O que fica pra quem não tem cluster

É exatamente esse o problema que o Verboo Code resolve há meses: rodar modelos open source num agente de programação sem o dev precisar comprar, configurar ou manter GPU. Hoje são 9 modelos disponíveis em GPU dedicada, incluindo o qwen3.6-27b da mesma família que a Alibaba acabou de atualizar, com contexto de até 1 milhão de tokens e tokens ilimitados no plano contratado.

O qwen3.6-27b já roda no Verboo Code desde antes desse anúncio, sem fila de espera por peso aberto e sem exigir que você monte um cluster em casa. Isso é a diferença entre "o código está disponível" e "eu consigo usar isso hoje, no meu projeto, sem trocar de hardware".

Um modelo de 2,4 trilhões de parâmetros com peso aberto ainda é, pra praticamente todo dev, um modelo fechado. A diferença é só quem hospeda.

Fechamento

O Qwen3.8-Max é um lançamento técnico relevante e a Alibaba merece crédito por abrir peso de um modelo dessa classe, algo que Anthropic e OpenAI não fazem. Mas "aberto" e "utilizável por você amanhã de manhã" são coisas diferentes, e é esse segundo problema que decide se um modelo entra na sua stack ou fica só na manchete da semana.

Enquanto o mercado discute quem abre peso e quem não abre, a Verboo Code já entrega modelos open source rodando num agente de programação com tokens ilimitados, sem você precisar resolver o problema de infraestrutura sozinho. Conheça o Verboo Code.

Gostou deste artigo?
Compartilhe conhecimento com sua rede.
Leia também

Artigos relacionados