Claude的思考真的变少了吗?社区实测的数据,以及Anthropic始终没有回应的问题
返回博客
文章claude codeanthropicverboo codemodelos de IA

Claude的思考真的变少了吗?社区实测的数据,以及Anthropic始终没有回应的问题

Mafra2026年9月20日阅读约 5 分钟

2026年9月20日,r/ClaudeAI上的一条帖子获得了超过400个赞,标题直截了当:取消你的Claude订阅吧。这个说法的依据来自一份(未经独立核实的)分析,涵盖65天、超过43000次Claude Code调用,作者归为X平台用户Lon:调用Fable 5模型时,39%的请求完全没有产生任何thinking token,中位数仅为123个,远低于该模型自己基准测试中使用的1.6万到12.8万区间。

这种质疑并不是第一次出现。更早的一个版本已经出现在Claude Code的官方代码仓库里,带着方法论、具体数字,以及一个(或者说没有)回应,比今天这条热帖更值得细看。

社区现在在质疑什么?

质疑Claude"思考"的程度远低于营销宣传和基准测试所暗示的水平,而且这一点没有被告知用户。9月20日的这条帖子提到,8月的推理预算下降了18%到50%,其中至少有一周的中位数直接归零。

这些具体数字来自一份外部分析,帖子本身并未公开可审计的方法论,所以我们把它当作一种说法,而不是已核实的事实。但这种抱怨模式并非孤例,有意思的地方也在这里。

这种质疑是新出现的吗?

不是。早在2026年1月23日,Claude Code官方代码仓库anthropics/claude-code中的#20350这个issue就试图用一套方法证明同样的事:通过中间人代理(MITM)捕获4天内的7000次请求,测算出用户申请的思考预算(31999个token,ultrathink档位)实际只交付了约10%,在更大的请求中这个比例进一步跌到0.3%。

但这个审计工具本身有一个严重缺陷:它是通过统计流式传输的数据块数量、再乘以32来估算thinking token数量的(thinking_tokens = chunk_count * 32),另一位开发者在评论区指出这个换算关系并不成立。原作者也在同一个讨论串里承认了这个错误。所谓"10%"和"0.3%"这两个数字,正是从这个有缺陷的计算方式得出的,因此不能按原样采信。

纠错之后发生的,既不是撤回声明,也不是Anthropic的技术回应,而是沉默:没有任何维护者出面回复,这个issue在五周后的2026年3月1日因长期无活动被自动关闭,标签是not_planned

Anthropic官方对此的说法是什么?

官方的说法是,Claude的thinking机制本来就是自适应设计,不是故障。官方文档写道:"Claude's thinking is adaptive: the model evaluates each request and decides for itself whether to think and how much."(Claude的思考是自适应的:模型会评估每一次请求,自行决定是否思考以及思考多少。)这一机制从4.6世代(2026年2月)开始生效,固定的推理token预算被这种逐次请求的自动决策取代。

目前存在的控制手段是effort参数(low、medium、high、xhigh、max,默认值为high),但官方文档只面向直接调用API、自己编写代码对接的开发者,并不面向聊天套餐订阅者,也不面向直接使用官方CLI的普通用户。

社区说法与官方文档,并排对比

对比点社区的说法官方文档的说明
谁来决定模型思考多少服务商在不通知用户的情况下削减预算,相似请求之间表现不一致由模型本身逐次请求自行决定("自适应思考",自4.6世代起)
用户的直接控制权聊天套餐或CLI订阅者没有可见的相关参数存在effort参数,但仅面向直接调用API的场景有文档说明
独立审计的尝试#20350这个issue通过MITM代理测算出申请预算的约10%被实际交付该审计工具自身的方法论(数据块数乘以32)被指出存在缺陷,作者本人也部分承认了这一点
对技术质疑的回应根据issue的公开记录,没有任何回应五周后因无活动被自动关闭,没有任何维护者表态

你能确切知道自己这次对话Claude"思考"了多少吗?

根据公开文档,如果你是聊天套餐订阅者,或者日常使用官方CLI,答案是不能。effort参数和thinking_tokens计数都存在于API层面,但并没有一个面向订阅用户的命令,能直接告诉你"这次回复模型应用了X级别",除非你是通过代码自己对接的。

正是这个空白,促使#20350的作者自己动手搭建了一个审计工具,哪怕方法论有缺陷,也不愿只是提问然后等一个答案。

如果我想当场看到并选择推理级别,不用抓包也不用审计呢?

在Verboo Code里,/effort命令可以直接在终端里查看并切换当前模型的推理级别,完全不需要拦截网络流量:

$ verboo
> /effort current
Effort level: auto (currently high)

> /effort max
Set effort level to max: Maximum reasoning for the most complex tasks

/effort current会显示即使在自动模式下实际生效的级别,切换后立即对下一次回复生效,不用等待新模型发布,也不用赌默认值会不会自己变化。

如果这整件事真正让你在意的是不知道自己的问题背后到底在运行什么,在Verboo Code里,/effort可以立刻给出答案,而且token不限量,你可以按需多次测试最高级别,不用担心多试一次的成本。

喜欢这篇文章吗?
把知识分享给你的朋友。
// 继续阅读

相关文章