gpt-oss-120b: MoE da OpenAI rodando no Verboo Code por R$ 0
Back to the blog
Artigo

gpt-oss-120b: MoE da OpenAI rodando no Verboo Code por R$ 0

Mafra
20/07/2026
4 min read

Em agosto de 2025, a OpenAI fez algo que não fazia desde 2019: lançou um modelo com pesos abertos. O gpt-oss-120b chegou ao Hugging Face com licença Apache 2.0. Você pode baixar, modificar, afinar e distribuir comercialmente sem pagar nada à OpenAI. Seis anos de modelo fechado. De repente, dois de uma vez: o gpt-oss-120b e o gpt-oss-20b. Agora o modelo está disponível no Verboo Code com tokens ilimitados.

A pressão competitiva explica o movimento. DeepSeek, Qwen e Gemma 4 estão provando que modelos open source competem com frontier. A OpenAI precisava marcar presença no jogo antes de ficar irrelevante no segmento open weight.

O que é o gpt-oss-120b tecnicamente?

Mixture of Experts (MoE): 120 bilhões de parâmetros no total, mas apenas 5,1 bilhões ativos por inferência. Com MoE, você ativa só a fração especializada no problema atual. Resultado: cabe em uma GPU H100 de 80GB.

  • Parâmetros totais: 120B
  • Parâmetros ativos por token: 5,1B
  • Contexto: 128K tokens
  • Licença: Apache 2.0 (uso comercial livre, sem restrições)
  • Hardware mínimo: 1x H100 80GB (ou MacBook M-series com quantização)
  • Alinhamento base: sem RLHF pesado, chain-of-thought direto na saída

Para comparação: DeepSeek R1 também usa MoE, mas requer 8 GPUs para rodar em capacidade total. O gpt-oss-120b entrega performance comparável em hardware de uma fração do custo de infra.

O gpt-oss-120b passa nos benchmarks de coding?

Para quem usa agente de programação, os números que importam são SWE-bench Verified e HumanEval. Os resultados publicados no model card:

Benchmark gpt-oss-120b Observação
SWE-bench Verified ~62% Competitivo com frontier de 2024
HumanEval 85% Paridade com GPT-5.4-mini
AIME 2024 82% Supera GPT-5.4-mini em raciocínio matemático
GPQA Diamond 78% Forte em raciocínio científico
MATH 91% Abaixo do DeepSeek R1 (96%), mas numa GPU só

Fontes: TokenMix Analysis (jul/2026) e model card oficial no Hugging Face.

Mas não é o modelo mais forte. Vale a pena?

A análise honesta: em coding puro, o gpt-oss-120b não ganha de tudo. O DeepSeek R1 vence em raciocínio profundo (96% vs 91% no MATH). O mimo-v2.5-pro tem resultados melhores no SWE-bench Pro dentro do Verboo Code. O qwen3.6-27b performa melhor em multilingual.

O que o gpt-oss-120b tem que os outros não têm:

  • É da OpenAI. Histórico de alinhamento, documentação e ecossistema de fine-tuning maduro.
  • Apache 2.0. Você pode auditar o comportamento, algo que modelo fechado nunca vai permitir.
  • Uma GPU. Cabe em infra real sem custo de cluster.
  • Raciocínio matemático forte. 82% no AIME é sério para tasks de algoritmos e otimização.

Por que usar no Verboo Code em vez de pagar por token na API?

Via API externa, o gpt-oss-120b custa aproximadamente US$ 0,09/MTok de entrada e US$ 0,40/MTok de saída. Uma sessão de refactor pesado com 500K tokens sai em torno de US$ 45. Em uso diário intenso, isso chega facilmente em US$ 200 a 300 por mês.

No Verboo Code, o gpt-oss-120b faz parte do pool de 11 modelos disponíveis na plataforma. Tokens ilimitados, GPU dedicada, sem billing por inferência. Você troca de modelo conforme o task pede, sem calcular custo por sessão.

O Verboo Code tem 128 assinantes ativos com MRR de R$ 18.824,90, crescendo porque o modelo faz sentido: preço fixo em BRL para usar os melhores modelos open source sem cap.

Quando escolher o gpt-oss-120b no lugar dos outros modelos?

Framework prático de uso:

  • Raciocínio matemático: algoritmos de otimização, complexidade computacional, problemas combinatórios.
  • Contexto longo real: análise de repositórios grandes sem truncar histórico (128K tokens).
  • Auditoria de comportamento: pesos abertos permitem inspecionar o modelo, impossível em modelo fechado.
  • Compliance rigoroso: no Verboo Code, nenhum dado sai para servidores da OpenAI.

Para coding puro e SWE-bench tasks diretos, o deepseek-v4-pro e o mimo-v2.5-pro tendem a performar melhor. Use o gpt-oss-120b quando o task tem componente de raciocínio formal ou contexto longo acima de 80K tokens.

Veja como os modelos se comparam em runs reais: 3 modelos, 50 runs: a matemática do custo zero em coding.

Quer testar esses modelos sem pagar por token? Verboo Code roda os principais open source com tokens ilimitados.

Enjoyed this article?
Share knowledge with your network.
Read also

Related articles