在 Artificial Analysis Intelligence Index 上,最好的开放权重模型得 46 分,最好的闭源模型得 58 分。12 分的差距是真实存在的,也能感受到。但决定你日常用哪个模型的,是另一个问题:每一分要花多少钱,以及每多一分要花多少钱。
我们用 Artificial Analysis 在 2026 年 9 月 29 日的公开数据,对六个模型做了计算:三个开放权重模型(MiMo-V2.6-Pro、GLM-5.3 和 Kimi K3),以及 Anthropic 的三个闭源模型(Claude Opus 5.5、Sonnet 5.5 和 Fable 5.1)。结论:开放模型每一分的成本低 2.3 到 51 倍,而闭源模型每多一分的成本,接近开放模型平均每分成本的 7 倍。
开放模型和闭源模型,每一分基准成绩要花多少钱?
GLM-5.3 每分 0.045 美元,Claude Opus 5.5 每分 0.103 美元。最划算的闭源模型,每分成本仍是同代开放模型的 2.3 倍。
算法很简单:该指数每个任务的平均成本除以得分。每个任务的成本已经包含输入、缓存和输出,按实验室官方 API 价格计算,所有模型都在最高推理强度下运行。
| 模型 | 权重 | 指数得分 | 每个任务成本 | 每分成本 | 跑完指数的输出 token |
|---|---|---|---|---|---|
| MiMo-V2.6-Pro(小米) | 开放,MIT | 46 | 0.13 美元 | 0.003 美元 | 140M |
| GLM-5.3 max(Z.ai) | 开放 | 45 | 2.01 美元 | 0.045 美元 | 210M |
| Kimi K3 max(Moonshot) | 开放 | 44 | 2.00 美元 | 0.045 美元 | 160M |
| Claude Opus 5.5 max | 闭源 | 58 | 5.98 美元 | 0.103 美元 | 260M |
| Claude Sonnet 5.5 max | 闭源 | 56 | 7.60 美元 | 0.136 美元 | 410M |
| Claude Fable 5.1 max | 闭源 | 53 | 7.63 美元 | 0.144 美元 | 190M |
来源:Artificial Analysis Intelligence Index v4.3.2,artificialanalysis.ai 上各模型页面,2026 年 9 月 29 日查阅。每分成本由我们计算:每个任务成本 ÷ 得分。
为什么 Sonnet 5.5 每个任务比 Opus 5.5 更贵?
因为它消耗的 token 多得多。Sonnet 5.5 的单价是 Opus 5.5 的一半(每百万 token 输入 2 美元、输出 10 美元,Opus 是 4 美元和 20 美元),但跑完指数生成了 4.1 亿个输出 token,而 Opus 只有 2.6 亿。
结果是 Sonnet 每个任务 7.60 美元,Opus 5.98 美元,而且 Opus 得分更高。Fable 5.1 也一样:每个任务更贵,得分比 Opus 5.5 低 5 分。在最高推理强度下,这两个模型都被"支配"了,也就是存在另一个模型既更好又更便宜。
这个结论适用于任何比较:每 token 价格不等于每任务价格。啰嗦的模型会抵消掉标价上的折扣。
闭源模型每多一分要花多少钱?
从 GLM-5.3 升级到 Claude Opus 5.5,多得 13 分,每个任务多花 3.97 美元。每多一分的成本是 0.31 美元,接近 GLM-5.3 平均每分成本的 7 倍。
| 切换 | 多得分数 | 每个任务多花 | 每多一分的成本 |
|---|---|---|---|
| GLM-5.3 → Claude Opus 5.5 | +13 | 3.97 美元 | 0.31 美元 |
| MiMo-V2.6-Pro → Claude Opus 5.5 | +12 | 5.85 美元 | 0.49 美元 |
| Kimi K3 → Claude Fable 5.1 | +9 | 5.63 美元 | 0.63 美元 |
这是任何前沿的常态:最后几分最贵。这不代表它们不值,而是说只有在这几分真正起作用的任务上才值。
每分成本看不到什么?
速度、任务类型和推理强度。上面的计算是一张快照,不是结论。
| 盲点 | 为什么重要 |
|---|---|
| 速度 | MiMo-V2.6-Pro 每秒生成 41 个 token,GLM-5.3 是 87 个,Opus 5.5 是 93 个(Artificial Analysis)。便宜但慢,在长时间的智能体会话里会累积成本。 |
| 综合指数,不只是代码 | Intelligence Index 汇总了 10 项评测。一个模型在代码上的表现可能比综合分更好,也可能更差。 |
| 最高推理强度 | 所有模型都在最高强度下测量。强度降低时,token 消耗减少,计算结果也会变化。 |
| 实验室定价 | 成本使用官方 API 价格。同一个开放模型的其他提供商可能收费不同。 |
如何用你自己的数字来算?
把数值换成你在实际使用中测到的:对你的工作最重要的基准得分,以及每个任务的真实成本。下面的脚本在 Python 3 下运行,无需任何依赖。
# 每分成本:每一分要多少钱,以及多一分要多少钱
# 数据:Artificial Analysis Intelligence Index,最高推理强度,2026-09-29
models = {
# 名称:(指数得分,每个任务平均成本,单位美元)
"MiMo-V2.6-Pro": (46, 0.13),
"GLM-5.3": (45, 2.01),
"Kimi K3": (44, 2.00),
"Claude Opus 5.5": (58, 5.98),
"Claude Sonnet 5.5": (56, 7.60),
"Claude Fable 5.1": (53, 7.63),
}
for name, (score, cost) in models.items():
print(f"{name}: US$ {cost / score:.4f} per point")
# 边际分:升级模型时,每多得一分要付多少钱
base, target = "GLM-5.3", "Claude Opus 5.5"
(sb, cb), (st, ct) = models[base], models[target]
print(f"{base} -> {target}: US$ {(ct - cb) / (st - sb):.2f} per extra point")
要算出你自己使用中每个任务的成本,把一个典型任务的输入和输出加起来:
def cost_per_task(input_tokens, output_tokens, input_price, output_price):
# 价格单位:美元 / 百万 token
return (input_tokens * input_price + output_tokens * output_price) / 1_000_000
那么,该选开放模型还是闭源模型?
两个都用,在不同的时刻。开放模型处理大量日常工作,闭源模型留给那几分真正能解决问题的任务。
| 场景 | 选择 | 原因 |
|---|---|---|
| 常见 bug、小功能、测试、局部重构 | 开放(GLM-5.3、Kimi K3) | 每分成本低 2.3 倍,得分足够完成任务 |
| 大批量、不赶时间 | 最便宜的开放模型(MiMo-V2.6-Pro) | 每个任务 0.13 美元,慢一点也无妨 |
| 已经失败两次的 bug、依赖很多的架构设计 | 闭源(Claude Opus 5.5) | 这正是 12 到 13 分差距出现的地方,每多一分 0.31 美元物有所值 |
| 在最高强度下固定使用 Sonnet 5.5 或 Fable 5.1 | 重新评估 | 在该指数上,Opus 5.5 得分更高,每个任务花费更少 |
实际操作就是在会话中途切换模型。在 Verboo Code 的终端里:
/model # 打开你的套餐可用的模型列表
/model <id> # 直接切换,会话历史保留
/effort max # 只为难题提高推理强度
/effort auto # 恢复模型默认设置
计算每分成本这件事之所以存在,是因为每个 token 都要计费,而正是 token 让啰嗦的模型比价目表贵。在 Verboo Code 上,套餐使用无限 token,所以提高推理强度或让模型多思考,改变的是响应速度,而不是你的账单。



