Reflection Beam vs GLM-5.3 e Kimi K3: benchmarks do novo modelo aberto de 501B
Voltar para o Blog
Artigointeligência artificialtecnologiainovação

Reflection Beam vs GLM-5.3 e Kimi K3: benchmarks do novo modelo aberto de 501B

Mafra6 de outubro de 20266 min de leitura

A Reflection AI lançou o Beam em 05/10/2026: um modelo de pesos abertos com 501 bilhões de parâmetros, 23 bilhões ativos por token, licença Apache 2.0 e foco em código e agentes. A pergunta de quem programa é direta: ele ganha do GLM-5.3 ou do Kimi K3? Pela tabela da própria Reflection, não. Ganha do GLM-5.2 em 3 de 7 testes, e perde para o GLM-5.3 em todos os 8 testes em que os dois aparecem.

Isso não torna o Beam irrelevante. A promessa dele é outra: nota perto do GLM-5.2 gastando de 3 a 4 vezes menos computação na geração, segundo a Reflection. Este artigo separa o que está medido do que ainda é promessa.

O Reflection Beam ganha do GLM-5.3 e do Kimi K3?

Não. Na tabela publicada pela Reflection, o Beam fica atrás do GLM-5.3 nos 8 testes em que os dois têm nota, e atrás do Kimi K3 em todos os testes em que o Kimi aparece. A diferença vai de 1,2 ponto (GPQA Diamond) a 26,4 pontos (SWE Atlas Codebase QnA).

TesteBeamGLM-5.2GLM-5.3Kimi K3
DeepSWE v1.144,444,061,068,0
SWE-Bench Pro v165,562,1sem notasem nota
SWE-Bench Pro v2-Hard77,2sem nota84,388,2
Terminal Bench v2.180,181,088,288,3
SWE Atlas Codebase QnA34,6sem nota61,068,0
MCP Atlas78,777,884,282,3
SciCode49,7sem nota59,058,7
HLE sem ferramentas36,240,542,346,9
GPQA Diamond90,591,291,793,5

Fonte: Reflection AI, "Introducing Beam", reflection.ai/blog/introducing-beam, consultado em 06/10/2026. Todas as notas são reportadas pela própria Reflection. "Sem nota" significa que a Reflection não publicou o número.

Contra o GLM-5.2, o Beam empata ou perde?

Empata no geral: ganha em 3 testes e perde em 4. O GLM-5.2 é o modelo que a Reflection usa como régua de eficiência.

TesteBeamGLM-5.2Quem leva
DeepSWE v1.144,444,0Beam (+0,4)
SWE-Bench Pro v165,562,1Beam (+3,4)
MCP Atlas78,777,8Beam (+0,9)
Terminal Bench v2.180,181,0GLM-5.2 (+0,9)
AIME 202697,899,2GLM-5.2 (+1,4)
GPQA Diamond90,591,2GLM-5.2 (+0,7)
HLE sem ferramentas36,240,5GLM-5.2 (+4,3)

As vitórias do Beam são de menos de 1 ponto em dois testes e de 3,4 pontos em um. A derrota mais pesada é em HLE, 4,3 pontos. Em código agêntico, o saldo é pequeno para os dois lados.

Onde o Beam é fraco, e onde a promessa dele está?

O ponto fraco é entender repositório grande: no SWE Atlas Codebase QnA ele faz 34,6, contra 61,0 do GLM-5.3 e 68,0 do Kimi K3. A promessa está na eficiência, que a Reflection afirma ser de 3 a 4 vezes menos computação de geração que o GLM-5.2.

Essa segunda parte é uma alegação do fabricante, sem medição independente até hoje. Também faltam dados que você precisa para decidir:

O que decide a escolhaSituação do Beam em 06/10/2026
Preço por milhão de tokensNão publicado no lançamento
Pesos abertosPrometidos para "later this month" (outubro de 2026), ainda não liberados
LicençaApache 2.0 (valerá quando os pesos saírem)
AcessoLista de espera em platform.reflection.ai, em beta
Contexto1 milhão de tokens no treino, segundo a Reflection; a API beta tem limite menor
Entrada e saídaSó texto, sem imagem, áudio nem arquivo
Avaliação independenteNenhuma ainda

Sem preço, não existe custo por ponto de benchmark. Para o GLM-5.2, o Artificial Analysis lista US$ 1,40 por milhão de tokens de entrada e US$ 4,40 por milhão de saída (consulta de 06/10/2026, página marcada como modelo descontinuado em favor do GLM-5.3). O do Beam fica em aberto até a Reflection publicar.

Como testar o Beam com o seu próprio código?

Peça acesso em platform.reflection.ai e aponte qualquer cliente compatível com OpenAI para a API da Reflection. Segundo a análise da Kingy AI sobre a documentação, a base é https://api.reflection.ai/openai/v1 e o identificador do modelo é Beam-501B-A23B.

curl https://api.reflection.ai/openai/v1/chat/completions \
  -H "Authorization: Bearer $REFLECTION_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Beam-501B-A23B",
    "messages": [{"role": "user", "content": "Explique o que este diff muda e liste os riscos."}]
  }'

Rode a mesma tarefa em dois modelos e conte quantas tentativas cada um precisou. Nota de benchmark não substitui isso. O script abaixo resume uma comparação de placar com as notas da tabela acima, e aceita as suas.

# Placar: em quantos testes o modelo A supera o B (notas da tabela da Reflection, 05/10/2026)
beam = {"DeepSWE": 44.4, "SWE Pro v1": 65.5, "Terminal Bench": 80.1,
        "MCP Atlas": 78.7, "HLE": 36.2, "GPQA": 90.5}
glm52 = {"DeepSWE": 44.0, "SWE Pro v1": 62.1, "Terminal Bench": 81.0,
         "MCP Atlas": 77.8, "HLE": 40.5, "GPQA": 91.2}

comuns = beam.keys() & glm52.keys()
vitorias = [t for t in sorted(comuns) if beam[t] > glm52[t]]
print(f"Beam vence em {len(vitorias)} de {len(comuns)}: {vitorias}")

Então, qual modelo aberto escolher para programar hoje?

Para trabalho em produção hoje, o GLM-5.3 ou o Kimi K3, porque têm notas mais altas e já estão disponíveis. O Beam entra como candidato a observar quando tiver preço, pesos e medição independente.

SituaçãoEscolhaPor quê
Código agêntico difícil, repositório grandeKimi K3 ou GLM-5.3Ficam à frente do Beam em todos os testes de código da tabela, com folga em Atlas QnA e DeepSWE
Quer o melhor modelo aberto disponível agoraGLM-5.3Já está liberado e aparece à frente do Beam nos 8 testes comparáveis
Quer rodar na sua própria GPU quando os pesos saíremAcompanhar o BeamApache 2.0 e 23B ativos são atrativos, mas falta peso, preço e medição de terceiros
Decidir só pela nota de benchmarkNão decidaMede um recorte. Rode a sua tarefa nos dois

Quando a diferença entre dois modelos é de poucos pontos, o que decide é quantas tentativas você pode se dar o direito de fazer. Na Verboo Code os planos rodam com tokens ilimitados, então rodar a mesma tarefa em mais de um modelo com /model para comparar não aumenta a sua fatura.

Leia também

Gostou deste artigo?
Compartilhe conhecimento com sua rede.
// Leia também

Artigos relacionados