Reflection AI 于 2026 年 10 月 5 日发布了 Beam:一个开放权重模型,总参数 5010 亿,每个 token 激活 230 亿,采用 Apache 2.0 许可证,面向代码和智能体场景。写代码的人最关心的问题是:它能超过 GLM-5.3 或 Kimi K3 吗?按 Reflection 自己公布的表格,不能。它在 7 项测试中有 3 项胜过 GLM-5.2,而在与 GLM-5.3 都有成绩的 8 项测试中全部落后。
这并不意味着 Beam 不重要。它的卖点不同:Reflection 称,成绩接近 GLM-5.2,生成阶段的计算量却少 3 到 4 倍。本文把已经测出来的数据和仍然只是承诺的部分分开。
Reflection Beam 能超过 GLM-5.3 和 Kimi K3 吗?
不能。在 Reflection 公布的表格中,Beam 在与 GLM-5.3 都有成绩的 8 项测试中全部落后,在 Kimi K3 出现的每一项测试中也都落后。差距从 1.2 分(GPQA Diamond)到 26.4 分(SWE Atlas Codebase QnA)不等。
| 测试 | Beam | GLM-5.2 | GLM-5.3 | Kimi K3 |
|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | 44.0 | 61.0 | 68.0 |
| SWE-Bench Pro v1 | 65.5 | 62.1 | 未公布 | 未公布 |
| SWE-Bench Pro v2-Hard | 77.2 | 未公布 | 84.3 | 88.2 |
| Terminal Bench v2.1 | 80.1 | 81.0 | 88.2 | 88.3 |
| SWE Atlas Codebase QnA | 34.6 | 未公布 | 61.0 | 68.0 |
| MCP Atlas | 78.7 | 77.8 | 84.2 | 82.3 |
| SciCode | 49.7 | 未公布 | 59.0 | 58.7 |
| HLE(不使用工具) | 36.2 | 40.5 | 42.3 | 46.9 |
| GPQA Diamond | 90.5 | 91.2 | 91.7 | 93.5 |
来源:Reflection AI,"Introducing Beam",reflection.ai/blog/introducing-beam,2026 年 10 月 6 日查阅。所有成绩均由 Reflection 自己报告。"未公布"表示 Reflection 没有给出该数字。
对比 GLM-5.2,Beam 是平手还是落后?
总体接近平手:Beam 赢 3 项,输 4 项。GLM-5.2 是 Reflection 用来衡量效率的参照模型。
| 测试 | Beam | GLM-5.2 | 胜者 |
|---|---|---|---|
| DeepSWE v1.1 | 44.4 | 44.0 | Beam (+0.4) |
| SWE-Bench Pro v1 | 65.5 | 62.1 | Beam (+3.4) |
| MCP Atlas | 78.7 | 77.8 | Beam (+0.9) |
| Terminal Bench v2.1 | 80.1 | 81.0 | GLM-5.2 (+0.9) |
| AIME 2026 | 97.8 | 99.2 | GLM-5.2 (+1.4) |
| GPQA Diamond | 90.5 | 91.2 | GLM-5.2 (+0.7) |
| HLE(不使用工具) | 36.2 | 40.5 | GLM-5.2 (+4.3) |
Beam 的胜出中,两项不到 1 分,一项为 3.4 分。最大的落后是 HLE,差 4.3 分。在智能体编程上,双方的差距都很小。
Beam 弱在哪里,它的承诺又在哪里?
弱点是理解大型代码库:在 SWE Atlas Codebase QnA 上它只有 34.6 分,而 GLM-5.3 为 61.0,Kimi K3 为 68.0。它的承诺在效率上,Reflection 称生成阶段的计算量比 GLM-5.2 少 3 到 4 倍。
这第二点是厂商自己的说法,至今没有独立测量。做决定所需的数据也还缺失:
| 决定选择的因素 | 2026 年 10 月 6 日 Beam 的状态 |
|---|---|
| 每百万 token 价格 | 发布时未公布 |
| 开放权重 | 承诺"本月晚些时候"(2026 年 10 月)发布,目前尚未放出 |
| 许可证 | Apache 2.0(权重发布后生效) |
| 访问方式 | 通过 platform.reflection.ai 排队申请,测试版 |
| 上下文 | 据 Reflection,训练时为 100 万 token;测试版 API 的上限更低 |
| 输入与输出 | 仅文本,不支持图片、音频和文件 |
| 独立评测 | 暂无 |
没有价格,就无法计算每个基准分数的成本。对于 GLM-5.2,Artificial Analysis 列出的价格是每百万输入 token 1.40 美元、每百万输出 token 4.40 美元(2026 年 10 月 6 日查阅,该页面已将其标为弃用,推荐改用 GLM-5.3)。Beam 的价格要等 Reflection 公布后才能知道。
如何用自己的代码测试 Beam?
在 platform.reflection.ai 申请访问,然后把任何兼容 OpenAI 的客户端指向 Reflection 的 API。根据 Kingy AI 对文档的分析,base URL 是 https://api.reflection.ai/openai/v1,模型标识符是 Beam-501B-A23B。
curl https://api.reflection.ai/openai/v1/chat/completions \
-H "Authorization: Bearer $REFLECTION_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "Beam-501B-A23B",
"messages": [{"role": "user", "content": "说明这个 diff 改了什么,并列出风险。"}]
}'
用同一个任务跑两个模型,数一数各自需要几次尝试。基准分数不能代替这一步。下面的脚本用上表的成绩做胜负统计,你也可以换成自己的数据。
# 计分板:模型 A 在多少项测试中超过 B(成绩来自 Reflection 表格,2026/10/05)
beam = {"DeepSWE": 44.4, "SWE Pro v1": 65.5, "Terminal Bench": 80.1,
"MCP Atlas": 78.7, "HLE": 36.2, "GPQA": 90.5}
glm52 = {"DeepSWE": 44.0, "SWE Pro v1": 62.1, "Terminal Bench": 81.0,
"MCP Atlas": 77.8, "HLE": 40.5, "GPQA": 91.2}
common = beam.keys() & glm52.keys()
wins = [t for t in sorted(common) if beam[t] > glm52[t]]
print(f"Beam 在 {len(common)} 项中赢 {len(wins)} 项: {wins}")
那么今天写代码该选哪个开放模型?
今天用于生产,选 GLM-5.3 或 Kimi K3,因为它们分数更高,而且已经可用。Beam 可以先观察,等它有了价格、权重和独立评测再说。
| 场景 | 选择 | 原因 |
|---|---|---|
| 高难度智能体编程、大型代码库 | Kimi K3 或 GLM-5.3 | 在表中所有代码测试上都领先 Beam,在 Atlas QnA 和 DeepSWE 上优势明显 |
| 想用当前可用的最好开放模型 | GLM-5.3 | 已经可用,并在 8 项可比测试中全部领先 Beam |
| 权重发布后想在自己的 GPU 上运行 | 继续关注 Beam | Apache 2.0 和 230 亿激活参数很有吸引力,但权重、价格和第三方评测都还缺 |
| 只凭基准分数做决定 | 不要 | 它只衡量一个切面。用你自己的任务在两个模型上跑一遍 |
当两个模型只差几分时,真正起决定作用的是你能承担多少次尝试。在 Verboo Code 上,各个套餐都不限 token,所以用 /model 在多个模型上跑同一个任务做对比,不会增加你的账单。



