No dia 20 de setembro de 2026, um post no r/ClaudeAI passou de 400 pontos com um pedido direto: cancele sua assinatura do Claude. A alegação por trás disso vem de uma análise (não confirmada de forma independente) de 65 dias e mais de 43 mil invocações do Claude Code, atribuída ao usuário Lon no X: 39% das chamadas ao modelo Fable 5 não geram nenhum token de raciocínio, e a mediana fica em 123 tokens, um número muito abaixo da faixa de 16 mil a 128 mil usada nos próprios benchmarks do modelo.
Não é a primeira vez que essa desconfiança aparece, e a versão anterior dela já foi parar no repositório oficial do Claude Code, com metodologia, números e uma resposta (ou a falta dela) que vale mais a pena olhar do que a thread de hoje.
O que a comunidade está alegando agora?
Que o Claude está "pensando" muito menos do que o marketing e os benchmarks sugerem, e que isso não é avisado ao usuário. A thread de 20/09 cita queda de 18% a 50% no orçamento de raciocínio em agosto, com pelo menos uma semana em que a mediana bateu literalmente zero.
Os números específicos vêm de uma análise externa, sem publicação de metodologia auditável no próprio post, então tratamos como alegação, não como fato apurado. Mas o padrão de reclamação não é isolado, e é aí que fica interessante.
Essa desconfiança é nova?
Não. Em 23/01/2026, a issue #20350 no repositório oficial anthropics/claude-code tentou provar a mesma coisa com método: um proxy MITM capturando 7.000 requisições em 4 dias, medindo que apenas cerca de 10% do orçamento de pensamento pedido (31.999 tokens, nível ultrathink) era de fato entregue, caindo para 0,3% em pedidos maiores.
Só que a própria ferramenta usada na auditoria tinha um defeito seríssimo: ela estimava tokens de raciocínio contando blocos de streaming e multiplicando por 32 (thinking_tokens = chunk_count * 32), uma relação que outro desenvolvedor apontou como inválida nos comentários. O autor original reconheceu o erro na própria thread. Os números de "10%" e "0,3%" saíram justamente dessa conta falha, então não são confiáveis como estão.
O que sobrou depois da correção não foi uma retratação nem uma resposta técnica da Anthropic. Foi silêncio: nenhum mantenedor respondeu, e a issue foi fechada automaticamente por inatividade em 01/03/2026, cinco semanas depois, com o rótulo not_planned.
O que a Anthropic diz que acontece, oficialmente?
Que o "thinking" do Claude é adaptativo por design, não um bug. A documentação oficial descreve: "Claude's thinking is adaptive: the model evaluates each request and decides for itself whether to think and how much." Isso vale desde a geração 4.6 (fevereiro de 2026), quando o orçamento fixo de tokens de raciocínio foi substituído por essa decisão automática, requisição a requisição.
O controle que existe é o parâmetro effort (low, medium, high, xhigh, max, com high como padrão), mas ele só aparece documentado para quem chama a API diretamente e escreve o próprio código contra ela, não para quem assina o plano de chat ou usa a CLI oficial como está.
Comunidade vs. documentação oficial, lado a lado
| Ponto | O que a comunidade alega | O que está documentado oficialmente |
|---|---|---|
| Quem decide quanto o modelo pensa | O provedor reduz o orçamento sem avisar, de forma inconsistente entre pedidos parecidos | O próprio modelo decide por requisição ("thinking adaptativo", desde a geração 4.6) |
| Controle direto do usuário | Assinante de chat ou CLI não tem parâmetro visível pra isso | Parâmetro effort existe, mas documentado só para chamadas diretas à API |
| Tentativa de auditoria independente | Issue #20350 mediu ~10% do orçamento pedido sendo entregue, via proxy MITM | Metodologia da própria auditoria (chunk × 32 tokens) foi apontada como falha e parcialmente reconhecida pelo autor |
| Resposta ao questionamento técnico | Nenhuma, segundo o histórico público da issue | Fechada automaticamente por inatividade 5 semanas depois, sem posição de mantenedor |
Dá pra saber com certeza quanto o seu Claude "pensou" numa resposta?
Pela documentação pública, não, se você é assinante do plano de chat ou usa a CLI oficial no dia a dia. O parâmetro effort e a contagem de thinking_tokens existem no nível da API, mas não há um comando de assinatura que devolva "o modelo aplicou nível X nesta resposta" pra quem não está integrando via código.
É exatamente a lacuna que fez o autor da issue #20350 construir uma ferramenta própria, mesmo com metodologia falha, em vez de simplesmente perguntar e receber a resposta.
E se eu quiser ver e escolher o nível de raciocínio na hora, sem proxy nem auditoria?
Na Verboo Code, o comando /effort mostra e deixa trocar o nível de raciocínio do modelo ativo direto no terminal, sem precisar interceptar tráfego:
$ verboo
> /effort current
Effort level: auto (currently high)
> /effort max
Set effort level to max: Maximum reasoning for the most complex tasks
/effort current mostra o nível realmente aplicado mesmo quando está em automático, e a troca vale imediatamente pra próxima resposta, sem esperar um novo lançamento de modelo ou torcer para o valor default mudar sozinho.
Se o que te incomoda nessa história toda é não saber o que está rodando por trás da sua pergunta, na Verboo Code o /effort devolve essa resposta na hora, e com tokens ilimitados você pode testar o nível mais alto quantas vezes precisar sem se preocupar com o custo da tentativa extra.



