O melhor modelo aberto do Artificial Analysis Intelligence Index faz 46 pontos. O melhor fechado faz 58. A diferença de 12 pontos é real e aparece. A pergunta que decide o que você usa no dia a dia é outra: quanto custa cada ponto, e quanto custa cada ponto a mais.
Fizemos a conta com os dados públicos do Artificial Analysis de 29/09/2026 para seis modelos: três de pesos abertos (MiMo-V2.6-Pro, GLM-5.3 e Kimi K3) e três fechados da Anthropic (Claude Opus 5.5, Sonnet 5.5 e Fable 5.1). O resultado: o ponto de um modelo aberto custa de 2,3 a 51 vezes menos, e cada ponto extra de um fechado custa perto de 7 vezes o ponto médio do aberto.
Quanto custa cada ponto de benchmark em modelo aberto e fechado?
No GLM-5.3, US$ 0,045 por ponto. No Claude Opus 5.5, US$ 0,103. O modelo fechado mais eficiente custa 2,3 vezes mais por ponto que o aberto de mesma safra.
A conta é simples: custo médio por tarefa do índice dividido pela nota. O custo por tarefa já inclui entrada, cache e saída ao preço da API do laboratório, e todos rodaram no esforço máximo.
| Modelo | Pesos | Nota no índice | Custo por tarefa | Custo por ponto | Tokens de saída no índice |
|---|---|---|---|---|---|
| MiMo-V2.6-Pro (Xiaomi) | abertos, MIT | 46 | US$ 0,13 | US$ 0,003 | 140M |
| GLM-5.3 max (Z.ai) | abertos | 45 | US$ 2,01 | US$ 0,045 | 210M |
| Kimi K3 max (Moonshot) | abertos | 44 | US$ 2,00 | US$ 0,045 | 160M |
| Claude Opus 5.5 max | fechados | 58 | US$ 5,98 | US$ 0,103 | 260M |
| Claude Sonnet 5.5 max | fechados | 56 | US$ 7,60 | US$ 0,136 | 410M |
| Claude Fable 5.1 max | fechados | 53 | US$ 7,63 | US$ 0,144 | 190M |
Fonte: Artificial Analysis Intelligence Index v4.3.2, páginas de cada modelo em artificialanalysis.ai, consultadas em 29/09/2026. Custo por ponto calculado por nós: custo por tarefa ÷ nota.
Por que o Sonnet 5.5 sai mais caro por tarefa que o Opus 5.5?
Porque gasta muito mais token. O Sonnet 5.5 cobra metade do Opus 5.5 por token (US$ 2 e US$ 10 por milhão, contra US$ 4 e US$ 20), mas gerou 410 milhões de tokens de saída para rodar o índice, contra 260 milhões do Opus.
O resultado é que o Sonnet custa US$ 7,60 por tarefa e o Opus US$ 5,98, com nota maior. O mesmo vale para o Fable 5.1: mais caro por tarefa e 5 pontos abaixo do Opus 5.5. No esforço máximo, os dois ficam dominados, ou seja, existe outro modelo que é ao mesmo tempo melhor e mais barato.
A lição serve para qualquer comparação: preço por token não é preço por tarefa. Modelo verboso anula desconto de tabela.
Quanto custa o ponto a mais de um modelo fechado?
Subir do GLM-5.3 para o Claude Opus 5.5 rende 13 pontos e custa US$ 3,97 a mais por tarefa. Cada ponto extra sai por US$ 0,31, perto de 7 vezes o custo médio do ponto do GLM-5.3.
| Troca | Pontos a mais | Custo a mais por tarefa | Custo por ponto a mais |
|---|---|---|---|
| GLM-5.3 → Claude Opus 5.5 | +13 | US$ 3,97 | US$ 0,31 |
| MiMo-V2.6-Pro → Claude Opus 5.5 | +12 | US$ 5,85 | US$ 0,49 |
| Kimi K3 → Claude Fable 5.1 | +9 | US$ 5,63 | US$ 0,63 |
Isso é o comportamento normal de qualquer fronteira: os últimos pontos são os mais caros. Não quer dizer que não valem. Quer dizer que valem só na tarefa em que esses pontos fazem diferença.
O que o custo por ponto não mostra?
Velocidade, tipo de tarefa e esforço. A conta acima é um retrato, não um veredito.
| Ponto cego | Por que importa |
|---|---|
| Velocidade | O MiMo-V2.6-Pro gera 41 tokens por segundo, contra 87 do GLM-5.3 e 93 do Opus 5.5 (Artificial Analysis). Barato e lento pesa numa sessão agêntica longa. |
| Índice geral, não só código | O Intelligence Index agrega 10 avaliações. Um modelo pode ir melhor em código do que a nota geral sugere, e vice-versa. |
| Esforço máximo | Todos foram medidos no esforço mais alto. Em esforço menor, o consumo de token cai e a conta muda. |
| Preço do laboratório | O custo usa o preço da API oficial. Outro provedor do mesmo modelo aberto pode cobrar diferente. |
Como fazer a conta com os seus próprios números?
Troque os valores pelo que você mede no seu uso: nota no benchmark que importa para o seu trabalho e custo real por tarefa. O script abaixo roda em Python 3 sem dependência.
# Custo por ponto: quanto custa cada ponto de nota, e quanto custa o ponto a mais
# Dados: Artificial Analysis Intelligence Index, esforço máximo, 29/09/2026
modelos = {
# nome: (nota no índice, custo médio por tarefa em US$)
"MiMo-V2.6-Pro": (46, 0.13),
"GLM-5.3": (45, 2.01),
"Kimi K3": (44, 2.00),
"Claude Opus 5.5": (58, 5.98),
"Claude Sonnet 5.5": (56, 7.60),
"Claude Fable 5.1": (53, 7.63),
}
for nome, (nota, custo) in modelos.items():
print(f"{nome}: US$ {custo / nota:.4f} por ponto")
# Ponto marginal: quanto você paga por cada ponto que ganha ao subir de modelo
base, alvo = "GLM-5.3", "Claude Opus 5.5"
(nb, cb), (na, ca) = modelos[base], modelos[alvo]
print(f"{base} -> {alvo}: US$ {(ca - cb) / (na - nb):.2f} por ponto a mais")
Para achar o custo por tarefa do seu próprio uso, some entrada e saída de uma tarefa típica:
def custo_por_tarefa(tokens_entrada, tokens_saida, preco_entrada, preco_saida):
# preços em US$ por milhão de tokens
return (tokens_entrada * preco_entrada + tokens_saida * preco_saida) / 1_000_000
Então, qual escolher: modelo aberto ou fechado?
Os dois, em momentos diferentes. O modelo aberto para o volume, o fechado para a tarefa em que os pontos extras resolvem.
| Situação | Escolha | Por quê |
|---|---|---|
| Bug comum, feature pequena, teste, refactor local | Aberto (GLM-5.3, Kimi K3) | Custo por ponto 2,3x menor e nota suficiente para a tarefa |
| Lote grande sem pressa | Aberto mais barato (MiMo-V2.6-Pro) | Custo por tarefa de US$ 0,13, lentidão não pesa |
| Bug que já falhou duas vezes, arquitetura com muitas dependências | Fechado (Claude Opus 5.5) | É onde os 12 a 13 pontos aparecem, e US$ 0,31 por ponto extra se paga |
| Escolha fixa de Sonnet 5.5 ou Fable 5.1 no esforço máximo | Rever | No índice, o Opus 5.5 faz mais pontos por menos dinheiro por tarefa |
Na prática, isso é trocar de modelo no meio da sessão. Na Verboo Code, pelo terminal:
/model # abre a lista de modelos liberados no seu plano
/model <id> # troca direto, o histórico da sessão continua
/effort max # sobe o esforço só para a tarefa difícil
/effort auto # volta ao padrão do modelo
Toda a conta de custo por ponto existe porque cada token é cobrado, e é o token que faz um modelo verboso custar mais que a tabela promete. Na Verboo Code os planos rodam com tokens ilimitados, então subir o esforço ou deixar o modelo pensar mais muda a velocidade da resposta, não a sua fatura.



