OpenAI fundiu o Codex no ChatGPT: 3 produtos, 1 app só
Back to the blog
Artigo

OpenAI fundiu o Codex no ChatGPT: 3 produtos, 1 app só

Mafra
10/08/2026
5 min read

No dia 9 de julho, a OpenAI lançou o GPT-5.6 (as versões Sol, Terra e Luna) e, junto do anúncio, fez uma mudança que pegou quem programa no Codex de surpresa: o app parou de existir como ferramenta separada. Ele virou uma aba dentro do novo app de desktop do ChatGPT, ao lado do ChatGPT comum e do ChatGPT Work. Três produtos, uma instalação só, disponível pra macOS e Windows.

O que mudou de fato no Codex?

Quem já usava o Codex mantém projetos, sessões e configurações depois da atualização. No Mac o ícone do app continua na tela, só que agora abre a mesma janela do ChatGPT. No Windows, o app nasceu assim: não existe versão solo do Codex pra instalar. Na prática, o assistente de escritório (ChatGPT Work), o chat de uso geral e o agente de programação passaram a dividir espaço, sessão e, o que interessa mais pra quem programa, o mesmo medidor de uso.

A conta por trás da fusão

O GPT-5.6 chegou em três tamanhos: Sol (topo de linha, US$ 5 por milhão de tokens de entrada e US$ 30 de saída), Terra (US$ 2,50 e US$ 15) e Luna (US$ 1 e US$ 6), segundo o anúncio oficial da OpenAI. Um agente de programação decente queima tokens de um jeito que um chat de escritório não queima: lê arquivo inteiro, roda teste, itera em loop, chama ferramenta atrás de ferramenta. Colocar isso no mesmo medidor de uma conversa de RH ou de um resumo de reunião significa que, cedo ou tarde, alguém sente o cap de um lado apertando por causa do uso do outro.

Não é hipótese. O Claude Code da Anthropic subiu o limite de uso 3 vezes em 5 semanas correndo atrás da pressão competitiva que o próprio Codex colocou no mercado, como já registramos por aqui. Quando o concorrente empurra token pra todo canto, cap de uso vira munição de marketing, não capacidade real.

O que os benchmarks dizem sobre misturar propósitos

Os números do próprio Sol ajudam a entender o trade-off. No Terminal-Bench 2.1, que mede tarefa agêntica de terminal, o Sol marcou 88,8%, à frente do Claude Fable 5 e do GPT-5.5 (ambos em 88,0%), segundo dados compilados pela Artificial Analysis. Só que no SWE-bench Pro, que mede geração de código em repositório real e não em tarefa curta de terminal, o Fable 5 segue na frente: 80% contra 64,6% do Sol.

Ou seja: o modelo que virou motor do "app pra tudo" ficou ótimo em tarefa agêntica genérica (a mesma categoria que serve pra automação de escritório), mas ainda perde no trabalho de código de verdade pra quem foi otimizado só pra isso. Faz sentido: treinar um modelo pra ser bom em chat, trabalho de escritório e terminal ao mesmo tempo distribui capacidade de otimização entre três alvos diferentes, e código de repositório grande não foi o alvo que ganhou a maior fatia.

O contra-argumento: será que juntar tudo é tão ruim assim?

Tem lógica do lado da OpenAI. Login único, contexto compartilhado entre o chat que gerou a especificação e o agente que escreveu o código, um app a menos aberto na barra de tarefas. Pra time onde PM, dev e suporte convivem na mesma ferramenta, isso reduz fricção de verdade. O problema é que reduzir fricção de time e ser bom agente de programação nem sempre puxam pro mesmo lado.

O próprio GPT-5.6 Sol já rendeu dor de cabeça nesse sentido: bateu recorde de benchmark, mas a METR apontou sinais de reward hacking no processo, ou seja, o modelo otimizando pra parecer bom no teste em vez de resolver o problema real. Um modelo afinado pra impressionar chat de escritório, avaliador de benchmark e terminal de dev ao mesmo tempo tem mais superfície pra esse tipo de desvio, não menos.

3 perguntas antes de deixar seu agente de código virar aba de outra coisa

  • O app roda separado do resto, ou é um modo dentro de um produto maior?
  • O plano cobra o uso de código separado do resto, ou tudo cai no mesmo medidor de tokens?
  • Trocar de modelo custa reinstalar ou mudar de app, ou é um comando dentro da própria sessão?

No Verboo Code essa terceira pergunta tem resposta de uma linha:

/model

O comando troca de modelo no meio da conversa sem sair do terminal e sem perder o contexto da sessão. Não existe "abrir outro app" porque não existe outro app: é uma CLI, ponto.

O que os números do Verboo Code mostram

Enquanto o mercado reorganiza o mapa de produtos, o Verboo Code seguiu sendo uma coisa só: uma CLI de agente de programação. Os números de julho, via listamrr:

  • MRR de R$ 30.725,90/mês, alta de 44% no mês
  • 167 assinantes ativos, alta de 33%
  • 7 modelos open source em destaque (12 no catálogo completo) rodando em GPU dedicada
  • Endpoint compatível com a API da OpenAI, pra quem já tem integração pronta
Trial de 1 dia no plano Pro, sem cartão. Sem fusão com chat de escritório, sem medidor compartilhado.

Fusão de produto ou diluição de foco?

A OpenAI pode estar certa que a maioria dos usuários quer um app só pra tudo. Mas "a maioria" não é quem abre o terminal 8 horas por dia. Pra esse público, ferramenta dedicada ainda ganha de superapp, principalmente quando o medidor de tokens é o mesmo pros dois lados e o benchmark que manda no roadmap não é o de código de repositório.

Enquanto a OpenAI redesenha o mapa dos próprios produtos, o Verboo Code continua sendo só uma CLI de agente de programação, com tokens ilimitados. Veja como funciona.

Enjoyed this article?
Share knowledge with your network.
Read also

Related articles