开源权重与闭源权重的比较,常常变成一场面子之争。这次的数据没给这种争论留多少空间。Kimi K3在SWE-bench Verified上得分60.4%,而Claude Fable 5得分95%。差距是真实且巨大的,价格比例也是如此:Fable 5在输入和输出token上的价格都是Kimi K3的3.3倍。
这并没有回答问题,而是提出了正确的问题:这34.6个百分点的差距,究竟出现在你工作的哪一部分?而你又在为从未用到的那部分能力,多付3.3倍的钱?
Kimi K3和Claude Fable 5在基准测试上表现如何?
三项独立测量,三个不同来源,方向一致:Fable 5在所有测试中都领先。真正重要的问题是每项测试中差距的大小。
| 基准测试 | Kimi K3 | Claude Fable 5 | 来源 |
|---|---|---|---|
| SWE-bench Verified | 60.4% | 95.0% | Moonshot AI / Anthropic |
| Artificial Analysis智能指数 | 44 | 53(5.1版) | artificialanalysis.ai |
| WebDev Arena Elo(前端) | 1691分(第5名) | 1788分(第2名) | arena.ai |
数据查证于2026年9月22日。SWE-bench Verified是差距最痛的地方:近35个百分点,是"能解决真实代码仓库中大多数问题"和"能解决绝大多数问题"之间的区别。在WebDev Arena上,由人类对生成的网页应用进行盲选投票,差距缩小到97个Elo分,可以察觉但并不悬殊。
官方API价格各是多少?
| 模型 | 输入(每百万token) | 输出(每百万token) |
|---|---|---|
| Claude Fable 5 | 10.00美元 | 50.00美元 |
| Kimi K3 | 3.00美元 | 15.00美元 |
来源:Anthropic(anthropic.com)和Moonshot AI的官方发布价格,查证于2026年9月22日。输入和输出两端的比例恰好都是3.3倍,这并不常见:通常输出token在最终账单中占比更大,因为推理过程主要消耗输出token。这里两端比例相同,意味着无论模型在回答前"思考"多久,成本倍数都不会变化。
两个模型内部有什么不同?
| 架构 | Kimi K3:MoE架构,总参数2.8万亿,每个token激活1040亿 |
| 权重 | Kimi K3:开源。Claude Fable 5:闭源,架构未公开 |
| 上下文窗口 | Kimi K3:100万token。Claude Fable 5:输入100万/输出12.8万 |
| 发布日期 | Kimi K3:2026年7月16日 |
K3的MoE架构在2.8万亿参数中,每个token只激活1040亿,比例约为27比1。正是这个比例,让这么大规模的模型能以一个仍可与闭源模型竞争的价格提供服务,尽管它的总参数量几乎是同期另一个开源模型GLM-5.2的四倍。
Kimi K3还在哪些方面落后,差距有多大?
在困难任务上,它输得很明显。SWE-bench Verified近35分的差距,并不是平均分布在简单和复杂问题之间的。它集中在难度曲线的顶端:涉及多个文件的重构、根本原因不明显的bug、模型需要推断而非直接读取的业务上下文。正是在这些场景里,多付3.3倍选择Fable 5才值回票价。
一个开源模型在困难基准测试上落后闭源模型35分,对开源权重来说并不是坏消息。这正是两年前任何模型与业界最先进水平之间存在的差距。真正决定选择的问题不是"哪个更好",而是"你的任务队列里,有多少比例落在那个困难的顶端"。
究竟该如何决定?
- 看你任务队列的真实分布,而不是上个月最难的那张工单。如果大部分工作是维护、小功能和常见bug,这35分的差距在实践中根本不会显现。
- 把前端和算法后端分开看。在WebDev Arena上差距是97个Elo分,按比例远小于SWE-bench Verified上的差距。如果大部分工作是界面开发,这个差距的影响就更小。
- 不要把它当成单一选择。在实践中,路由分发是最常见的答案:Kimi K3处理大批量任务,Fable 5则留给那些用更便宜的模型已经失败两次的问题。
基准测试表格没有显示的那笔账
上面所有数字都有一个前提:你付得起让模型完成任务的钱。在一次长时间的智能体会话中,100万token的上下文被填满,需要多次迭代才能让测试通过,这时每个输出token的成本,决定了第五次尝试会不会发生,还是有人会提前中断这次会话。
Verboo Code已经在专用GPU上运行Kimi K3,提供无限token,API价格比Moonshot官方价格更低:每百万token输入2.50美元、输出9.00美元,而不是实验室直接提供的3.00美元和15.00美元。困难基准测试上35分的差距依然存在。不再存在的,是token账单决定你能否完成一个简单任务的问题。



