Reflection Beam 对比 GLM-5.3 与 Kimi K3:5010 亿参数开放模型的基准测试
返回博客
文章inteligência artificialtecnologiainovação

Reflection Beam 对比 GLM-5.3 与 Kimi K3:5010 亿参数开放模型的基准测试

Mafra2026年10月6日阅读约 6 分钟

Reflection AI 于 2026 年 10 月 5 日发布了 Beam:一个开放权重模型,总参数 5010 亿,每个 token 激活 230 亿,采用 Apache 2.0 许可证,面向代码和智能体场景。写代码的人最关心的问题是:它能超过 GLM-5.3 或 Kimi K3 吗?按 Reflection 自己公布的表格,不能。它在 7 项测试中有 3 项胜过 GLM-5.2,而在与 GLM-5.3 都有成绩的 8 项测试中全部落后。

这并不意味着 Beam 不重要。它的卖点不同:Reflection 称,成绩接近 GLM-5.2,生成阶段的计算量却少 3 到 4 倍。本文把已经测出来的数据和仍然只是承诺的部分分开。

Reflection Beam 能超过 GLM-5.3 和 Kimi K3 吗?

不能。在 Reflection 公布的表格中,Beam 在与 GLM-5.3 都有成绩的 8 项测试中全部落后,在 Kimi K3 出现的每一项测试中也都落后。差距从 1.2 分(GPQA Diamond)到 26.4 分(SWE Atlas Codebase QnA)不等。

测试BeamGLM-5.2GLM-5.3Kimi K3
DeepSWE v1.144.444.061.068.0
SWE-Bench Pro v165.562.1未公布未公布
SWE-Bench Pro v2-Hard77.2未公布84.388.2
Terminal Bench v2.180.181.088.288.3
SWE Atlas Codebase QnA34.6未公布61.068.0
MCP Atlas78.777.884.282.3
SciCode49.7未公布59.058.7
HLE(不使用工具)36.240.542.346.9
GPQA Diamond90.591.291.793.5

来源:Reflection AI,"Introducing Beam",reflection.ai/blog/introducing-beam,2026 年 10 月 6 日查阅。所有成绩均由 Reflection 自己报告。"未公布"表示 Reflection 没有给出该数字。

对比 GLM-5.2,Beam 是平手还是落后?

总体接近平手:Beam 赢 3 项,输 4 项。GLM-5.2 是 Reflection 用来衡量效率的参照模型。

测试BeamGLM-5.2胜者
DeepSWE v1.144.444.0Beam (+0.4)
SWE-Bench Pro v165.562.1Beam (+3.4)
MCP Atlas78.777.8Beam (+0.9)
Terminal Bench v2.180.181.0GLM-5.2 (+0.9)
AIME 202697.899.2GLM-5.2 (+1.4)
GPQA Diamond90.591.2GLM-5.2 (+0.7)
HLE(不使用工具)36.240.5GLM-5.2 (+4.3)

Beam 的胜出中,两项不到 1 分,一项为 3.4 分。最大的落后是 HLE,差 4.3 分。在智能体编程上,双方的差距都很小。

Beam 弱在哪里,它的承诺又在哪里?

弱点是理解大型代码库:在 SWE Atlas Codebase QnA 上它只有 34.6 分,而 GLM-5.3 为 61.0,Kimi K3 为 68.0。它的承诺在效率上,Reflection 称生成阶段的计算量比 GLM-5.2 少 3 到 4 倍。

这第二点是厂商自己的说法,至今没有独立测量。做决定所需的数据也还缺失:

决定选择的因素2026 年 10 月 6 日 Beam 的状态
每百万 token 价格发布时未公布
开放权重承诺"本月晚些时候"(2026 年 10 月)发布,目前尚未放出
许可证Apache 2.0(权重发布后生效)
访问方式通过 platform.reflection.ai 排队申请,测试版
上下文据 Reflection,训练时为 100 万 token;测试版 API 的上限更低
输入与输出仅文本,不支持图片、音频和文件
独立评测暂无

没有价格,就无法计算每个基准分数的成本。对于 GLM-5.2,Artificial Analysis 列出的价格是每百万输入 token 1.40 美元、每百万输出 token 4.40 美元(2026 年 10 月 6 日查阅,该页面已将其标为弃用,推荐改用 GLM-5.3)。Beam 的价格要等 Reflection 公布后才能知道。

如何用自己的代码测试 Beam?

在 platform.reflection.ai 申请访问,然后把任何兼容 OpenAI 的客户端指向 Reflection 的 API。根据 Kingy AI 对文档的分析,base URL 是 https://api.reflection.ai/openai/v1,模型标识符是 Beam-501B-A23B。

curl https://api.reflection.ai/openai/v1/chat/completions \
  -H "Authorization: Bearer $REFLECTION_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Beam-501B-A23B",
    "messages": [{"role": "user", "content": "说明这个 diff 改了什么,并列出风险。"}]
  }'

用同一个任务跑两个模型,数一数各自需要几次尝试。基准分数不能代替这一步。下面的脚本用上表的成绩做胜负统计,你也可以换成自己的数据。

# 计分板:模型 A 在多少项测试中超过 B(成绩来自 Reflection 表格,2026/10/05)
beam = {"DeepSWE": 44.4, "SWE Pro v1": 65.5, "Terminal Bench": 80.1,
        "MCP Atlas": 78.7, "HLE": 36.2, "GPQA": 90.5}
glm52 = {"DeepSWE": 44.0, "SWE Pro v1": 62.1, "Terminal Bench": 81.0,
         "MCP Atlas": 77.8, "HLE": 40.5, "GPQA": 91.2}

common = beam.keys() & glm52.keys()
wins = [t for t in sorted(common) if beam[t] > glm52[t]]
print(f"Beam 在 {len(common)} 项中赢 {len(wins)} 项: {wins}")

那么今天写代码该选哪个开放模型?

今天用于生产,选 GLM-5.3 或 Kimi K3,因为它们分数更高,而且已经可用。Beam 可以先观察,等它有了价格、权重和独立评测再说。

场景选择原因
高难度智能体编程、大型代码库Kimi K3 或 GLM-5.3在表中所有代码测试上都领先 Beam,在 Atlas QnA 和 DeepSWE 上优势明显
想用当前可用的最好开放模型GLM-5.3已经可用,并在 8 项可比测试中全部领先 Beam
权重发布后想在自己的 GPU 上运行继续关注 BeamApache 2.0 和 230 亿激活参数很有吸引力,但权重、价格和第三方评测都还缺
只凭基准分数做决定不要它只衡量一个切面。用你自己的任务在两个模型上跑一遍

当两个模型只差几分时,真正起决定作用的是你能承担多少次尝试。在 Verboo Code 上,各个套餐都不限 token,所以用 /model 在多个模型上跑同一个任务做对比,不会增加你的账单。

延伸阅读

喜欢这篇文章吗?
把知识分享给你的朋友。
// 继续阅读

相关文章