GLM-5.2 SWE-bench Pro得分62.1:Opus 4.8领先7分,价格却贵6倍
返回博客
文章comparativomodelos de IAbenchmarksopen source

GLM-5.2 SWE-bench Pro得分62.1:Opus 4.8领先7分,价格却贵6倍

Mafra2026年9月15日阅读约 5 分钟

开源权重曾经意味着你要接受能力上的实际下降,以换取摆脱按量计费的API。GLM-5.2让这个取舍不再那么明显。它在SWE-bench Pro上得分62.1,在Terminal-Bench 2.1上得分81.0,前者超过了GPT-5.5,后者比Claude Opus 4.8低4分,而成本却只有前沿模型API的六分之一左右。

它没有拿到第一。但这不是重点。

GLM-5.2在代码基准测试中表现如何?

对于智能体(agentic)工作而言,两个基准测试最重要。SWE-bench Pro衡量模型能否端到端解决真实的代码仓库问题。Terminal-Bench 2.1衡量模型能否在长时间的shell会话中不迷失方向。

模型SWE-bench ProTerminal-Bench 2.1权重
Claude Opus 4.869.285.0闭源
GLM-5.262.181.0开源,MIT
GPT-5.558.6n/a闭源

要看差距,而不是排名。在SWE-bench Pro上,GLM-5.2比Opus 4.8低7.1分,在Terminal-Bench上低4分。而在SWE-bench Pro上,它又比GPT-5.5高3.5分。一个开源权重模型能赢过一个前沿实验室、又以个位数差距输给另一个,这和一年前的局面已经不同了。

官方API上两者各自的价格是多少?

模型输入(每百万token)输出(每百万token)
Claude Opus 4.85美元25美元
GLM-5.21.40美元4.40美元

数据来源:Anthropic(anthropic.com)与Z.ai(z.ai)的官方发布价格,查询于2026年9月15日。在输出端,也就是推理模型在编码任务中花费预算最多的地方,GLM-5.2便宜5.7倍。在输入端,差距缩小到3.6倍。本文开头所说的"约六分之一的成本",正是输出端的近似值,而这一端在长时间的智能体会话中权重最大。

模型内部是什么样的?

总参数量7530亿
每token激活参数约400亿
上下文窗口100万token
最大输出12.8万token
许可证MIT
发布日期2026年6月13日

MoE的比例是值得关注的一点。一个总参数7530亿、每token只激活约400亿的模型,其服务成本大致相当于一个400亿参数的稠密模型,却承载着体量大十九倍的知识。正是这个比例,决定了它每一分基准分数的价格。

100万token的上下文是第二个关键点。在长时间的智能体任务中,上下文能让智能体不必重新读取同样的文件、重新推导同样的结论,也不必为已经做过的工作再跑一遍。

为什么MIT许可证比跑分更重要?

MIT意味着你可以运行、修改、并用于商业用途,不需要向任何人申请许可。没有下个季度就会变化的使用条款,没有按坐席审计,也没有关于竞品的限制条款。

大多数开源权重的发布都带有自定义许可证,外加某些隐藏的例外条款。一个如此接近前沿水平的模型采用真正宽松的许可证,动摇了"开源权重只适合业余项目"这一说法。

跑分告诉你模型今天能做什么。许可证告诉你未来五年能否在它之上构建一门生意。这两个数字里,只有一个是稳定的。

GLM-5.2在哪些方面仍然落后?

老实说,是在难度曲线的顶端。SWE-bench Pro上那7.1分的差距,并不是平均分布在简单和困难任务之间的。这类差距会集中在最难的场景:意图模糊的issue、牵动十几个文件的重构、连复现步骤本身都是一道谜题的bug。

如果这类任务占了你工作的大部分,Opus 4.8仍然是更好的工具,价格也是合理的。但如果你的工作只是任何代码库都会产生的常规工单分布,那你就是在为一个大多数日子都感觉不到的差距多付六倍的钱。

到底该怎么决定?

  1. 看上个月你遇到的最难的一个工单,而不是平均水平。基准测试的差距只会在那里显现。如果前沿模型也救不了那个工单,这个差距就只是理论上的。
  2. 比较每一分的价格,而不是每个token的价格。多花六倍成本换来百分之十一的能力提升,在大批量场景下是笔糟糕的交易,但对一次关键任务来说却是笔好交易。
  3. 不要把它当成单选题。真正的答案通常是路由:大部分工作交给开源模型,少数值得的任务交给前沿模型。

没有一张基准测试表格会告诉你的陷阱

以上所有数字都假设模型能够跑完全程。但在按量计费的情况下,它常常跑不完。100万token的上下文窗口,只有在你负担得起把它填满时才是优势,而长时间的智能体任务恰恰是那种在有人盯着token账单时会被中途叫停的任务。

那7.1分的差距,只会出现在你这个月最难的那个工单上。至于其余的一切,决定因素不是跑分,而是你能负担得起多少次尝试。在Verboo Code上,GLM-5.2运行在专用GPU上,token不设上限,所以第五次尝试和第一次花费相同,100万的上下文窗口也不再只是参数表上的一个数字。

喜欢这篇文章吗?
把知识分享给你的朋友。
// 继续阅读

相关文章