开放模型 vs 闭源模型:每一分基准成绩要花多少钱(GLM-5.3、Kimi K3、Opus 5.5)
返回博客
文章comparativomodelos de IAbenchmarksopen source

开放模型 vs 闭源模型:每一分基准成绩要花多少钱(GLM-5.3、Kimi K3、Opus 5.5)

Mafra2026年9月29日阅读约 6 分钟

在 Artificial Analysis Intelligence Index 上,最好的开放权重模型得 46 分,最好的闭源模型得 58 分。12 分的差距是真实存在的,也能感受到。但决定你日常用哪个模型的,是另一个问题:每一分要花多少钱,以及每多一分要花多少钱。

我们用 Artificial Analysis 在 2026 年 9 月 29 日的公开数据,对六个模型做了计算:三个开放权重模型(MiMo-V2.6-Pro、GLM-5.3 和 Kimi K3),以及 Anthropic 的三个闭源模型(Claude Opus 5.5、Sonnet 5.5 和 Fable 5.1)。结论:开放模型每一分的成本低 2.3 到 51 倍,而闭源模型每多一分的成本,接近开放模型平均每分成本的 7 倍。

开放模型和闭源模型,每一分基准成绩要花多少钱?

GLM-5.3 每分 0.045 美元,Claude Opus 5.5 每分 0.103 美元。最划算的闭源模型,每分成本仍是同代开放模型的 2.3 倍。

算法很简单:该指数每个任务的平均成本除以得分。每个任务的成本已经包含输入、缓存和输出,按实验室官方 API 价格计算,所有模型都在最高推理强度下运行。

模型权重指数得分每个任务成本每分成本跑完指数的输出 token
MiMo-V2.6-Pro(小米)开放,MIT460.13 美元0.003 美元140M
GLM-5.3 max(Z.ai)开放452.01 美元0.045 美元210M
Kimi K3 max(Moonshot)开放442.00 美元0.045 美元160M
Claude Opus 5.5 max闭源585.98 美元0.103 美元260M
Claude Sonnet 5.5 max闭源567.60 美元0.136 美元410M
Claude Fable 5.1 max闭源537.63 美元0.144 美元190M

来源:Artificial Analysis Intelligence Index v4.3.2,artificialanalysis.ai 上各模型页面,2026 年 9 月 29 日查阅。每分成本由我们计算:每个任务成本 ÷ 得分。

为什么 Sonnet 5.5 每个任务比 Opus 5.5 更贵?

因为它消耗的 token 多得多。Sonnet 5.5 的单价是 Opus 5.5 的一半(每百万 token 输入 2 美元、输出 10 美元,Opus 是 4 美元和 20 美元),但跑完指数生成了 4.1 亿个输出 token,而 Opus 只有 2.6 亿。

结果是 Sonnet 每个任务 7.60 美元,Opus 5.98 美元,而且 Opus 得分更高。Fable 5.1 也一样:每个任务更贵,得分比 Opus 5.5 低 5 分。在最高推理强度下,这两个模型都被"支配"了,也就是存在另一个模型既更好又更便宜。

这个结论适用于任何比较:每 token 价格不等于每任务价格。啰嗦的模型会抵消掉标价上的折扣。

闭源模型每多一分要花多少钱?

从 GLM-5.3 升级到 Claude Opus 5.5,多得 13 分,每个任务多花 3.97 美元。每多一分的成本是 0.31 美元,接近 GLM-5.3 平均每分成本的 7 倍。

切换多得分数每个任务多花每多一分的成本
GLM-5.3 → Claude Opus 5.5+133.97 美元0.31 美元
MiMo-V2.6-Pro → Claude Opus 5.5+125.85 美元0.49 美元
Kimi K3 → Claude Fable 5.1+95.63 美元0.63 美元

这是任何前沿的常态:最后几分最贵。这不代表它们不值,而是说只有在这几分真正起作用的任务上才值。

每分成本看不到什么?

速度、任务类型和推理强度。上面的计算是一张快照,不是结论。

盲点为什么重要
速度MiMo-V2.6-Pro 每秒生成 41 个 token,GLM-5.3 是 87 个,Opus 5.5 是 93 个(Artificial Analysis)。便宜但慢,在长时间的智能体会话里会累积成本。
综合指数,不只是代码Intelligence Index 汇总了 10 项评测。一个模型在代码上的表现可能比综合分更好,也可能更差。
最高推理强度所有模型都在最高强度下测量。强度降低时,token 消耗减少,计算结果也会变化。
实验室定价成本使用官方 API 价格。同一个开放模型的其他提供商可能收费不同。

如何用你自己的数字来算?

把数值换成你在实际使用中测到的:对你的工作最重要的基准得分,以及每个任务的真实成本。下面的脚本在 Python 3 下运行,无需任何依赖。

# 每分成本:每一分要多少钱,以及多一分要多少钱
# 数据:Artificial Analysis Intelligence Index,最高推理强度,2026-09-29
models = {
    # 名称:(指数得分,每个任务平均成本,单位美元)
    "MiMo-V2.6-Pro": (46, 0.13),
    "GLM-5.3": (45, 2.01),
    "Kimi K3": (44, 2.00),
    "Claude Opus 5.5": (58, 5.98),
    "Claude Sonnet 5.5": (56, 7.60),
    "Claude Fable 5.1": (53, 7.63),
}

for name, (score, cost) in models.items():
    print(f"{name}: US$ {cost / score:.4f} per point")

# 边际分:升级模型时,每多得一分要付多少钱
base, target = "GLM-5.3", "Claude Opus 5.5"
(sb, cb), (st, ct) = models[base], models[target]
print(f"{base} -> {target}: US$ {(ct - cb) / (st - sb):.2f} per extra point")

要算出你自己使用中每个任务的成本,把一个典型任务的输入和输出加起来:

def cost_per_task(input_tokens, output_tokens, input_price, output_price):
    # 价格单位:美元 / 百万 token
    return (input_tokens * input_price + output_tokens * output_price) / 1_000_000

那么,该选开放模型还是闭源模型?

两个都用,在不同的时刻。开放模型处理大量日常工作,闭源模型留给那几分真正能解决问题的任务。

场景选择原因
常见 bug、小功能、测试、局部重构开放(GLM-5.3、Kimi K3)每分成本低 2.3 倍,得分足够完成任务
大批量、不赶时间最便宜的开放模型(MiMo-V2.6-Pro)每个任务 0.13 美元,慢一点也无妨
已经失败两次的 bug、依赖很多的架构设计闭源(Claude Opus 5.5)这正是 12 到 13 分差距出现的地方,每多一分 0.31 美元物有所值
在最高强度下固定使用 Sonnet 5.5 或 Fable 5.1重新评估在该指数上,Opus 5.5 得分更高,每个任务花费更少

实际操作就是在会话中途切换模型。在 Verboo Code 的终端里:

/model          # 打开你的套餐可用的模型列表
/model <id>     # 直接切换,会话历史保留
/effort max     # 只为难题提高推理强度
/effort auto    # 恢复模型默认设置

计算每分成本这件事之所以存在,是因为每个 token 都要计费,而正是 token 让啰嗦的模型比价目表贵。在 Verboo Code 上,套餐使用无限 token,所以提高推理强度或让模型多思考,改变的是响应速度,而不是你的账单。

延伸阅读

喜欢这篇文章吗?
把知识分享给你的朋友。
// 继续阅读

相关文章