Claude "pensa" menos do que deveria? O que a comunidade documentou e o que a Anthropic nunca respondeu
Voltar para o Blog
Artigoclaude codeanthropicverboo codemodelos de IA

Claude "pensa" menos do que deveria? O que a comunidade documentou e o que a Anthropic nunca respondeu

Mafra20 de setembro de 20265 min de leitura

No dia 20 de setembro de 2026, um post no r/ClaudeAI passou de 400 pontos com um pedido direto: cancele sua assinatura do Claude. A alegação por trás disso vem de uma análise (não confirmada de forma independente) de 65 dias e mais de 43 mil invocações do Claude Code, atribuída ao usuário Lon no X: 39% das chamadas ao modelo Fable 5 não geram nenhum token de raciocínio, e a mediana fica em 123 tokens, um número muito abaixo da faixa de 16 mil a 128 mil usada nos próprios benchmarks do modelo.

Não é a primeira vez que essa desconfiança aparece, e a versão anterior dela já foi parar no repositório oficial do Claude Code, com metodologia, números e uma resposta (ou a falta dela) que vale mais a pena olhar do que a thread de hoje.

O que a comunidade está alegando agora?

Que o Claude está "pensando" muito menos do que o marketing e os benchmarks sugerem, e que isso não é avisado ao usuário. A thread de 20/09 cita queda de 18% a 50% no orçamento de raciocínio em agosto, com pelo menos uma semana em que a mediana bateu literalmente zero.

Os números específicos vêm de uma análise externa, sem publicação de metodologia auditável no próprio post, então tratamos como alegação, não como fato apurado. Mas o padrão de reclamação não é isolado, e é aí que fica interessante.

Essa desconfiança é nova?

Não. Em 23/01/2026, a issue #20350 no repositório oficial anthropics/claude-code tentou provar a mesma coisa com método: um proxy MITM capturando 7.000 requisições em 4 dias, medindo que apenas cerca de 10% do orçamento de pensamento pedido (31.999 tokens, nível ultrathink) era de fato entregue, caindo para 0,3% em pedidos maiores.

Só que a própria ferramenta usada na auditoria tinha um defeito seríssimo: ela estimava tokens de raciocínio contando blocos de streaming e multiplicando por 32 (thinking_tokens = chunk_count * 32), uma relação que outro desenvolvedor apontou como inválida nos comentários. O autor original reconheceu o erro na própria thread. Os números de "10%" e "0,3%" saíram justamente dessa conta falha, então não são confiáveis como estão.

O que sobrou depois da correção não foi uma retratação nem uma resposta técnica da Anthropic. Foi silêncio: nenhum mantenedor respondeu, e a issue foi fechada automaticamente por inatividade em 01/03/2026, cinco semanas depois, com o rótulo not_planned.

O que a Anthropic diz que acontece, oficialmente?

Que o "thinking" do Claude é adaptativo por design, não um bug. A documentação oficial descreve: "Claude's thinking is adaptive: the model evaluates each request and decides for itself whether to think and how much." Isso vale desde a geração 4.6 (fevereiro de 2026), quando o orçamento fixo de tokens de raciocínio foi substituído por essa decisão automática, requisição a requisição.

O controle que existe é o parâmetro effort (low, medium, high, xhigh, max, com high como padrão), mas ele só aparece documentado para quem chama a API diretamente e escreve o próprio código contra ela, não para quem assina o plano de chat ou usa a CLI oficial como está.

Comunidade vs. documentação oficial, lado a lado

PontoO que a comunidade alegaO que está documentado oficialmente
Quem decide quanto o modelo pensaO provedor reduz o orçamento sem avisar, de forma inconsistente entre pedidos parecidosO próprio modelo decide por requisição ("thinking adaptativo", desde a geração 4.6)
Controle direto do usuárioAssinante de chat ou CLI não tem parâmetro visível pra issoParâmetro effort existe, mas documentado só para chamadas diretas à API
Tentativa de auditoria independenteIssue #20350 mediu ~10% do orçamento pedido sendo entregue, via proxy MITMMetodologia da própria auditoria (chunk × 32 tokens) foi apontada como falha e parcialmente reconhecida pelo autor
Resposta ao questionamento técnicoNenhuma, segundo o histórico público da issueFechada automaticamente por inatividade 5 semanas depois, sem posição de mantenedor

Dá pra saber com certeza quanto o seu Claude "pensou" numa resposta?

Pela documentação pública, não, se você é assinante do plano de chat ou usa a CLI oficial no dia a dia. O parâmetro effort e a contagem de thinking_tokens existem no nível da API, mas não há um comando de assinatura que devolva "o modelo aplicou nível X nesta resposta" pra quem não está integrando via código.

É exatamente a lacuna que fez o autor da issue #20350 construir uma ferramenta própria, mesmo com metodologia falha, em vez de simplesmente perguntar e receber a resposta.

E se eu quiser ver e escolher o nível de raciocínio na hora, sem proxy nem auditoria?

Na Verboo Code, o comando /effort mostra e deixa trocar o nível de raciocínio do modelo ativo direto no terminal, sem precisar interceptar tráfego:

$ verboo
> /effort current
Effort level: auto (currently high)

> /effort max
Set effort level to max: Maximum reasoning for the most complex tasks

/effort current mostra o nível realmente aplicado mesmo quando está em automático, e a troca vale imediatamente pra próxima resposta, sem esperar um novo lançamento de modelo ou torcer para o valor default mudar sozinho.

Se o que te incomoda nessa história toda é não saber o que está rodando por trás da sua pergunta, na Verboo Code o /effort devolve essa resposta na hora, e com tokens ilimitados você pode testar o nível mais alto quantas vezes precisar sem se preocupar com o custo da tentativa extra.

Gostou deste artigo?
Compartilhe conhecimento com sua rede.
// Leia também

Artigos relacionados