Em agosto de 2025, a OpenAI fez algo que não fazia desde 2019: lançou um modelo com pesos abertos. O gpt-oss-120b chegou ao Hugging Face com licença Apache 2.0. Você pode baixar, modificar, afinar e distribuir comercialmente sem pagar nada à OpenAI. Seis anos de modelo fechado. De repente, dois de uma vez: o gpt-oss-120b e o gpt-oss-20b. Agora o modelo está disponível no Verboo Code com tokens ilimitados.
A pressão competitiva explica o movimento. DeepSeek, Qwen e Gemma 4 estão provando que modelos open source competem com frontier. A OpenAI precisava marcar presença no jogo antes de ficar irrelevante no segmento open weight.
O que é o gpt-oss-120b tecnicamente?
Mixture of Experts (MoE): 120 bilhões de parâmetros no total, mas apenas 5,1 bilhões ativos por inferência. Com MoE, você ativa só a fração especializada no problema atual. Resultado: cabe em uma GPU H100 de 80GB.
- Parâmetros totais: 120B
- Parâmetros ativos por token: 5,1B
- Contexto: 128K tokens
- Licença: Apache 2.0 (uso comercial livre, sem restrições)
- Hardware mínimo: 1x H100 80GB (ou MacBook M-series com quantização)
- Alinhamento base: sem RLHF pesado, chain-of-thought direto na saída
Para comparação: DeepSeek R1 também usa MoE, mas requer 8 GPUs para rodar em capacidade total. O gpt-oss-120b entrega performance comparável em hardware de uma fração do custo de infra.
O gpt-oss-120b passa nos benchmarks de coding?
Para quem usa agente de programação, os números que importam são SWE-bench Verified e HumanEval. Os resultados publicados no model card:
| Benchmark | gpt-oss-120b | Observação |
|---|---|---|
| SWE-bench Verified | ~62% | Competitivo com frontier de 2024 |
| HumanEval | 85% | Paridade com GPT-5.4-mini |
| AIME 2024 | 82% | Supera GPT-5.4-mini em raciocínio matemático |
| GPQA Diamond | 78% | Forte em raciocínio científico |
| MATH | 91% | Abaixo do DeepSeek R1 (96%), mas numa GPU só |
Fontes: TokenMix Analysis (jul/2026) e model card oficial no Hugging Face.
Mas não é o modelo mais forte. Vale a pena?
A análise honesta: em coding puro, o gpt-oss-120b não ganha de tudo. O DeepSeek R1 vence em raciocínio profundo (96% vs 91% no MATH). O mimo-v2.5-pro tem resultados melhores no SWE-bench Pro dentro do Verboo Code. O qwen3.6-27b performa melhor em multilingual.
O que o gpt-oss-120b tem que os outros não têm:
- É da OpenAI. Histórico de alinhamento, documentação e ecossistema de fine-tuning maduro.
- Apache 2.0. Você pode auditar o comportamento, algo que modelo fechado nunca vai permitir.
- Uma GPU. Cabe em infra real sem custo de cluster.
- Raciocínio matemático forte. 82% no AIME é sério para tasks de algoritmos e otimização.
Por que usar no Verboo Code em vez de pagar por token na API?
Via API externa, o gpt-oss-120b custa aproximadamente US$ 0,09/MTok de entrada e US$ 0,40/MTok de saída. Uma sessão de refactor pesado com 500K tokens sai em torno de US$ 45. Em uso diário intenso, isso chega facilmente em US$ 200 a 300 por mês.
No Verboo Code, o gpt-oss-120b faz parte do pool de 11 modelos disponíveis na plataforma. Tokens ilimitados, GPU dedicada, sem billing por inferência. Você troca de modelo conforme o task pede, sem calcular custo por sessão.
O Verboo Code tem 128 assinantes ativos com MRR de R$ 18.824,90, crescendo porque o modelo faz sentido: preço fixo em BRL para usar os melhores modelos open source sem cap.
Quando escolher o gpt-oss-120b no lugar dos outros modelos?
Framework prático de uso:
- Raciocínio matemático: algoritmos de otimização, complexidade computacional, problemas combinatórios.
- Contexto longo real: análise de repositórios grandes sem truncar histórico (128K tokens).
- Auditoria de comportamento: pesos abertos permitem inspecionar o modelo, impossível em modelo fechado.
- Compliance rigoroso: no Verboo Code, nenhum dado sai para servidores da OpenAI.
Para coding puro e SWE-bench tasks diretos, o deepseek-v4-pro e o mimo-v2.5-pro tendem a performar melhor. Use o gpt-oss-120b quando o task tem componente de raciocínio formal ou contexto longo acima de 80K tokens.
Veja como os modelos se comparam em runs reais: 3 modelos, 50 runs: a matemática do custo zero em coding.
Quer testar esses modelos sem pagar por token? Verboo Code roda os principais open source com tokens ilimitados.



