A Reflection AI lançou o Beam em 05/10/2026: um modelo de pesos abertos com 501 bilhões de parâmetros, 23 bilhões ativos por token, licença Apache 2.0 e foco em código e agentes. A pergunta de quem programa é direta: ele ganha do GLM-5.3 ou do Kimi K3? Pela tabela da própria Reflection, não. Ganha do GLM-5.2 em 3 de 7 testes, e perde para o GLM-5.3 em todos os 8 testes em que os dois aparecem.
Isso não torna o Beam irrelevante. A promessa dele é outra: nota perto do GLM-5.2 gastando de 3 a 4 vezes menos computação na geração, segundo a Reflection. Este artigo separa o que está medido do que ainda é promessa.
O Reflection Beam ganha do GLM-5.3 e do Kimi K3?
Não. Na tabela publicada pela Reflection, o Beam fica atrás do GLM-5.3 nos 8 testes em que os dois têm nota, e atrás do Kimi K3 em todos os testes em que o Kimi aparece. A diferença vai de 1,2 ponto (GPQA Diamond) a 26,4 pontos (SWE Atlas Codebase QnA).
| Teste | Beam | GLM-5.2 | GLM-5.3 | Kimi K3 |
|---|---|---|---|---|
| DeepSWE v1.1 | 44,4 | 44,0 | 61,0 | 68,0 |
| SWE-Bench Pro v1 | 65,5 | 62,1 | sem nota | sem nota |
| SWE-Bench Pro v2-Hard | 77,2 | sem nota | 84,3 | 88,2 |
| Terminal Bench v2.1 | 80,1 | 81,0 | 88,2 | 88,3 |
| SWE Atlas Codebase QnA | 34,6 | sem nota | 61,0 | 68,0 |
| MCP Atlas | 78,7 | 77,8 | 84,2 | 82,3 |
| SciCode | 49,7 | sem nota | 59,0 | 58,7 |
| HLE sem ferramentas | 36,2 | 40,5 | 42,3 | 46,9 |
| GPQA Diamond | 90,5 | 91,2 | 91,7 | 93,5 |
Fonte: Reflection AI, "Introducing Beam", reflection.ai/blog/introducing-beam, consultado em 06/10/2026. Todas as notas são reportadas pela própria Reflection. "Sem nota" significa que a Reflection não publicou o número.
Contra o GLM-5.2, o Beam empata ou perde?
Empata no geral: ganha em 3 testes e perde em 4. O GLM-5.2 é o modelo que a Reflection usa como régua de eficiência.
| Teste | Beam | GLM-5.2 | Quem leva |
|---|---|---|---|
| DeepSWE v1.1 | 44,4 | 44,0 | Beam (+0,4) |
| SWE-Bench Pro v1 | 65,5 | 62,1 | Beam (+3,4) |
| MCP Atlas | 78,7 | 77,8 | Beam (+0,9) |
| Terminal Bench v2.1 | 80,1 | 81,0 | GLM-5.2 (+0,9) |
| AIME 2026 | 97,8 | 99,2 | GLM-5.2 (+1,4) |
| GPQA Diamond | 90,5 | 91,2 | GLM-5.2 (+0,7) |
| HLE sem ferramentas | 36,2 | 40,5 | GLM-5.2 (+4,3) |
As vitórias do Beam são de menos de 1 ponto em dois testes e de 3,4 pontos em um. A derrota mais pesada é em HLE, 4,3 pontos. Em código agêntico, o saldo é pequeno para os dois lados.
Onde o Beam é fraco, e onde a promessa dele está?
O ponto fraco é entender repositório grande: no SWE Atlas Codebase QnA ele faz 34,6, contra 61,0 do GLM-5.3 e 68,0 do Kimi K3. A promessa está na eficiência, que a Reflection afirma ser de 3 a 4 vezes menos computação de geração que o GLM-5.2.
Essa segunda parte é uma alegação do fabricante, sem medição independente até hoje. Também faltam dados que você precisa para decidir:
| O que decide a escolha | Situação do Beam em 06/10/2026 |
|---|---|
| Preço por milhão de tokens | Não publicado no lançamento |
| Pesos abertos | Prometidos para "later this month" (outubro de 2026), ainda não liberados |
| Licença | Apache 2.0 (valerá quando os pesos saírem) |
| Acesso | Lista de espera em platform.reflection.ai, em beta |
| Contexto | 1 milhão de tokens no treino, segundo a Reflection; a API beta tem limite menor |
| Entrada e saída | Só texto, sem imagem, áudio nem arquivo |
| Avaliação independente | Nenhuma ainda |
Sem preço, não existe custo por ponto de benchmark. Para o GLM-5.2, o Artificial Analysis lista US$ 1,40 por milhão de tokens de entrada e US$ 4,40 por milhão de saída (consulta de 06/10/2026, página marcada como modelo descontinuado em favor do GLM-5.3). O do Beam fica em aberto até a Reflection publicar.
Como testar o Beam com o seu próprio código?
Peça acesso em platform.reflection.ai e aponte qualquer cliente compatível com OpenAI para a API da Reflection. Segundo a análise da Kingy AI sobre a documentação, a base é https://api.reflection.ai/openai/v1 e o identificador do modelo é Beam-501B-A23B.
curl https://api.reflection.ai/openai/v1/chat/completions \
-H "Authorization: Bearer $REFLECTION_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "Beam-501B-A23B",
"messages": [{"role": "user", "content": "Explique o que este diff muda e liste os riscos."}]
}'
Rode a mesma tarefa em dois modelos e conte quantas tentativas cada um precisou. Nota de benchmark não substitui isso. O script abaixo resume uma comparação de placar com as notas da tabela acima, e aceita as suas.
# Placar: em quantos testes o modelo A supera o B (notas da tabela da Reflection, 05/10/2026)
beam = {"DeepSWE": 44.4, "SWE Pro v1": 65.5, "Terminal Bench": 80.1,
"MCP Atlas": 78.7, "HLE": 36.2, "GPQA": 90.5}
glm52 = {"DeepSWE": 44.0, "SWE Pro v1": 62.1, "Terminal Bench": 81.0,
"MCP Atlas": 77.8, "HLE": 40.5, "GPQA": 91.2}
comuns = beam.keys() & glm52.keys()
vitorias = [t for t in sorted(comuns) if beam[t] > glm52[t]]
print(f"Beam vence em {len(vitorias)} de {len(comuns)}: {vitorias}")
Então, qual modelo aberto escolher para programar hoje?
Para trabalho em produção hoje, o GLM-5.3 ou o Kimi K3, porque têm notas mais altas e já estão disponíveis. O Beam entra como candidato a observar quando tiver preço, pesos e medição independente.
| Situação | Escolha | Por quê |
|---|---|---|
| Código agêntico difícil, repositório grande | Kimi K3 ou GLM-5.3 | Ficam à frente do Beam em todos os testes de código da tabela, com folga em Atlas QnA e DeepSWE |
| Quer o melhor modelo aberto disponível agora | GLM-5.3 | Já está liberado e aparece à frente do Beam nos 8 testes comparáveis |
| Quer rodar na sua própria GPU quando os pesos saírem | Acompanhar o Beam | Apache 2.0 e 23B ativos são atrativos, mas falta peso, preço e medição de terceiros |
| Decidir só pela nota de benchmark | Não decida | Mede um recorte. Rode a sua tarefa nos dois |
Quando a diferença entre dois modelos é de poucos pontos, o que decide é quantas tentativas você pode se dar o direito de fazer. Na Verboo Code os planos rodam com tokens ilimitados, então rodar a mesma tarefa em mais de um modelo com /model para comparar não aumenta a sua fatura.



