Modelo aberto vs fechado: quanto custa cada ponto de benchmark (GLM-5.3, Kimi K3, Opus 5.5)
Voltar para o Blog
Artigocomparativomodelos de IAbenchmarksopen source

Modelo aberto vs fechado: quanto custa cada ponto de benchmark (GLM-5.3, Kimi K3, Opus 5.5)

Mafra29 de setembro de 20266 min de leitura

O melhor modelo aberto do Artificial Analysis Intelligence Index faz 46 pontos. O melhor fechado faz 58. A diferença de 12 pontos é real e aparece. A pergunta que decide o que você usa no dia a dia é outra: quanto custa cada ponto, e quanto custa cada ponto a mais.

Fizemos a conta com os dados públicos do Artificial Analysis de 29/09/2026 para seis modelos: três de pesos abertos (MiMo-V2.6-Pro, GLM-5.3 e Kimi K3) e três fechados da Anthropic (Claude Opus 5.5, Sonnet 5.5 e Fable 5.1). O resultado: o ponto de um modelo aberto custa de 2,3 a 51 vezes menos, e cada ponto extra de um fechado custa perto de 7 vezes o ponto médio do aberto.

Quanto custa cada ponto de benchmark em modelo aberto e fechado?

No GLM-5.3, US$ 0,045 por ponto. No Claude Opus 5.5, US$ 0,103. O modelo fechado mais eficiente custa 2,3 vezes mais por ponto que o aberto de mesma safra.

A conta é simples: custo médio por tarefa do índice dividido pela nota. O custo por tarefa já inclui entrada, cache e saída ao preço da API do laboratório, e todos rodaram no esforço máximo.

ModeloPesosNota no índiceCusto por tarefaCusto por pontoTokens de saída no índice
MiMo-V2.6-Pro (Xiaomi)abertos, MIT46US$ 0,13US$ 0,003140M
GLM-5.3 max (Z.ai)abertos45US$ 2,01US$ 0,045210M
Kimi K3 max (Moonshot)abertos44US$ 2,00US$ 0,045160M
Claude Opus 5.5 maxfechados58US$ 5,98US$ 0,103260M
Claude Sonnet 5.5 maxfechados56US$ 7,60US$ 0,136410M
Claude Fable 5.1 maxfechados53US$ 7,63US$ 0,144190M

Fonte: Artificial Analysis Intelligence Index v4.3.2, páginas de cada modelo em artificialanalysis.ai, consultadas em 29/09/2026. Custo por ponto calculado por nós: custo por tarefa ÷ nota.

Por que o Sonnet 5.5 sai mais caro por tarefa que o Opus 5.5?

Porque gasta muito mais token. O Sonnet 5.5 cobra metade do Opus 5.5 por token (US$ 2 e US$ 10 por milhão, contra US$ 4 e US$ 20), mas gerou 410 milhões de tokens de saída para rodar o índice, contra 260 milhões do Opus.

O resultado é que o Sonnet custa US$ 7,60 por tarefa e o Opus US$ 5,98, com nota maior. O mesmo vale para o Fable 5.1: mais caro por tarefa e 5 pontos abaixo do Opus 5.5. No esforço máximo, os dois ficam dominados, ou seja, existe outro modelo que é ao mesmo tempo melhor e mais barato.

A lição serve para qualquer comparação: preço por token não é preço por tarefa. Modelo verboso anula desconto de tabela.

Quanto custa o ponto a mais de um modelo fechado?

Subir do GLM-5.3 para o Claude Opus 5.5 rende 13 pontos e custa US$ 3,97 a mais por tarefa. Cada ponto extra sai por US$ 0,31, perto de 7 vezes o custo médio do ponto do GLM-5.3.

TrocaPontos a maisCusto a mais por tarefaCusto por ponto a mais
GLM-5.3 → Claude Opus 5.5+13US$ 3,97US$ 0,31
MiMo-V2.6-Pro → Claude Opus 5.5+12US$ 5,85US$ 0,49
Kimi K3 → Claude Fable 5.1+9US$ 5,63US$ 0,63

Isso é o comportamento normal de qualquer fronteira: os últimos pontos são os mais caros. Não quer dizer que não valem. Quer dizer que valem só na tarefa em que esses pontos fazem diferença.

O que o custo por ponto não mostra?

Velocidade, tipo de tarefa e esforço. A conta acima é um retrato, não um veredito.

Ponto cegoPor que importa
VelocidadeO MiMo-V2.6-Pro gera 41 tokens por segundo, contra 87 do GLM-5.3 e 93 do Opus 5.5 (Artificial Analysis). Barato e lento pesa numa sessão agêntica longa.
Índice geral, não só códigoO Intelligence Index agrega 10 avaliações. Um modelo pode ir melhor em código do que a nota geral sugere, e vice-versa.
Esforço máximoTodos foram medidos no esforço mais alto. Em esforço menor, o consumo de token cai e a conta muda.
Preço do laboratórioO custo usa o preço da API oficial. Outro provedor do mesmo modelo aberto pode cobrar diferente.

Como fazer a conta com os seus próprios números?

Troque os valores pelo que você mede no seu uso: nota no benchmark que importa para o seu trabalho e custo real por tarefa. O script abaixo roda em Python 3 sem dependência.

# Custo por ponto: quanto custa cada ponto de nota, e quanto custa o ponto a mais
# Dados: Artificial Analysis Intelligence Index, esforço máximo, 29/09/2026
modelos = {
    # nome: (nota no índice, custo médio por tarefa em US$)
    "MiMo-V2.6-Pro": (46, 0.13),
    "GLM-5.3": (45, 2.01),
    "Kimi K3": (44, 2.00),
    "Claude Opus 5.5": (58, 5.98),
    "Claude Sonnet 5.5": (56, 7.60),
    "Claude Fable 5.1": (53, 7.63),
}

for nome, (nota, custo) in modelos.items():
    print(f"{nome}: US$ {custo / nota:.4f} por ponto")

# Ponto marginal: quanto você paga por cada ponto que ganha ao subir de modelo
base, alvo = "GLM-5.3", "Claude Opus 5.5"
(nb, cb), (na, ca) = modelos[base], modelos[alvo]
print(f"{base} -> {alvo}: US$ {(ca - cb) / (na - nb):.2f} por ponto a mais")

Para achar o custo por tarefa do seu próprio uso, some entrada e saída de uma tarefa típica:

def custo_por_tarefa(tokens_entrada, tokens_saida, preco_entrada, preco_saida):
    # preços em US$ por milhão de tokens
    return (tokens_entrada * preco_entrada + tokens_saida * preco_saida) / 1_000_000

Então, qual escolher: modelo aberto ou fechado?

Os dois, em momentos diferentes. O modelo aberto para o volume, o fechado para a tarefa em que os pontos extras resolvem.

SituaçãoEscolhaPor quê
Bug comum, feature pequena, teste, refactor localAberto (GLM-5.3, Kimi K3)Custo por ponto 2,3x menor e nota suficiente para a tarefa
Lote grande sem pressaAberto mais barato (MiMo-V2.6-Pro)Custo por tarefa de US$ 0,13, lentidão não pesa
Bug que já falhou duas vezes, arquitetura com muitas dependênciasFechado (Claude Opus 5.5)É onde os 12 a 13 pontos aparecem, e US$ 0,31 por ponto extra se paga
Escolha fixa de Sonnet 5.5 ou Fable 5.1 no esforço máximoReverNo índice, o Opus 5.5 faz mais pontos por menos dinheiro por tarefa

Na prática, isso é trocar de modelo no meio da sessão. Na Verboo Code, pelo terminal:

/model          # abre a lista de modelos liberados no seu plano
/model <id>     # troca direto, o histórico da sessão continua
/effort max     # sobe o esforço só para a tarefa difícil
/effort auto    # volta ao padrão do modelo

Toda a conta de custo por ponto existe porque cada token é cobrado, e é o token que faz um modelo verboso custar mais que a tabela promete. Na Verboo Code os planos rodam com tokens ilimitados, então subir o esforço ou deixar o modelo pensar mais muda a velocidade da resposta, não a sua fatura.

Leia também

Gostou deste artigo?
Compartilhe conhecimento com sua rede.
// Leia também

Artigos relacionados