Metodologia

Tudo aqui é reproduzível a partir das mesmas fontes públicas que você mesmo pode conferir. Onde os dados são escassos ou as fontes discordam, esta página diz isso — uma página de confiança que só traz boas notícias é publicidade.

60% do catálogo não tem nota de qualidade independente. 145 de 364 modelos têm nota. O restante é listado, precificado e claramente marcado como sem nota — nunca classificado.
72/145 posições exibidas que são colocações realmente distintas. 94% dos pares adjacentes ficam dentro da margem de erro do benchmark.
67/364 modelos cujo preço de destaque não é o preço inteiro: faixas de contexto, raciocínio cobrado à parte ou tarifas por horário.
7/447 entries with variable prices withheld
4/447 entries with suspect latency withheld; may overlap the price group

1 · O que “melhor” significa

A qualidade manda e o preço desempata. Essa ordem é o produto inteiro: uma lista do mais barato para o mais caro é trivial de publicar e quase inútil, porque o modelo mais barato deste mercado é 12.500× mais barato que o mais caro e em geral não dá conta do trabalho.

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are LMArena Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

Por que não existe uma nota única de qualidade

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are LMArena Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

2 · Colocações em que você pode confiar

A coluna de colocação é uma colocação de significância, não um número de linha. A colocação de um modelo é um a mais que o número de modelos que o superam por mais do que a soma das duas margens de erro. Modelos com a mesma contagem compartilham a mesma colocação. Dois modelos dentro da margem de erro um do outro ainda podem ter colocações diferentes, porque cada um é comparado com a tabela inteira.

SHA-256 da projeção relevante para a colocação (identificadores, notas, preços por carga de trabalho, marca de fronteira): 06cd12db54e2968c3de49b45a3a2a6881f374f6e58a462437784450842efb989. Datas e carimbos de compilação ficam de fora. Uma mudança aqui é uma mudança na classificação, não na aparência.

Correções

A maior parte da ordem de uma classificação é ruído

Duas pontuações da Arena só contam como separadas quando diferem por mais do que a soma das margens de erro de 95% dos dois modelos. Essa soma é, em média, de 10,47 pontos nesta tabela, e o teste é pelo menos tão rigoroso quanto um intervalo de 95% sobre a diferença. 136 de 144 pares adjacentes (94%) ficam dentro da própria soma. Contando a colocação de cada modelo como um a mais que o número de modelos que o superam claramente, as 145 posições exibidas têm 72 colocações distintas, e 4 modelos dividem o primeiro lugar.

“O modelo nº 1” não é, portanto, uma afirmação que estes dados sustentem. Empates são mostrados como empates. A posição 1 é a posição 1 entre os modelos do feed de preços que este site lê: quando a LMArena coloca acima de todos eles um modelo que o feed não traz, o quadro nomeia esse modelo e não o classifica.

Este método não é nosso. O LMArena classifica assim há anos — o Rank (UB) deles dá a cada modelo um a mais que o número de modelos estatisticamente melhores que ele, e eles abriram o código da implementação. O incomum é aplicá-lo a uma comparação de preços, onde o incentivo é publicar uma ordem nítida.

Applied to the general arena board only. Other boards carry their own error, which we do not have, so they are not given a borrowed threshold.

3 · “Melhor e mais barato” precisa significar isso

A dominância de Pareto sobre preço e capacidade é uma projeção bidimensional de uma decisão de compra muito mais ampla, e essa projeção mente mais vezes do que acerta. Um modelo pode pontuar mais alto e custar menos e, ao mesmo tempo, não aceitar imagens, limitar a saída à metade dos tokens ou reter meio milhão de tokens de contexto a menos.

Por isso “ao mesmo tempo melhor e mais barato” fica reservado a uma substituição cujo envelope de capacidades seja um superconjunto do original. De 133 vereditos de dominância, 113 são estritos e 20 (15%) nomeiam, em vez disso, o que você abriria mão. Sem esse filtro, 61% dos vereditos brutos de dois eixos recomendavam um modelo incapaz de fazer o trabalho do atual.

4 · A fronteira, não uma nota de valor

Um modelo está na fronteira de valor quando não existe outro modelo que pontue pelo menos tão alto, custe no máximo o mesmo e vença em um dos dois. 12 dos modelos avaliados, precificados e de entrega padrão se qualificam. Cada um dos outros 92% tem um modelo assim acima de si, embora nem sempre seja uma substituição equivalente: a seção acima conta os casos em que se abre mão de algo.

Por que não classificar por qualidade por dólar?

Porque a razão premia a baixa de preço muito mais fortemente que a qualidade. Aplicada a este catálogo, ela coroa um modelo que marca 37,8 num teto de cerca de 63, e coloca em segundo um que marca 14,2 — modelos que ninguém deveria colocar em produção. Qualquer site que publique uma coluna de “valor” calculada assim está dando conselho ruim. Usamos a fronteira mais um piso de qualidade explícito.

5 · O preço é uma propriedade de um modelo e de uma carga de trabalho

Não existe “o” preço de um modelo. Resumir é intensivo em entrada, gerar código é intensivo em saída, e um laço de agente repete o próprio contexto a cada turno; o mesmo catálogo se ordena de forma diferente em cada caso. Em vez de escolher uma mistura e escondê-la, a proporção entrada:saída e a taxa de acerto de cache são controles que você vê e altera.

Se não houver tarifa publicada para leitura de cache, a estimativa combinada usa a tarifa integral de entrada da faixa selecionada.

Carga de trabalhoParcela de saídaAcertos de cacheFormato
Equilibrado 25% 0%3 tokens de entrada para 1 de saída
Resumir 5% 30%Entrada enorme, saída mínima
Chat 40% 50%Prompt de sistema longo em cache
Geração de código 60% 20%A saída domina
Agêntico 15% 70%Contexto reenviado a cada turno

Três coisas costumam tornar a tarifa anunciada errada, e todas aparecem na linha:

  • Faixas de contexto. 51 modelos mudam de tarifa acima de um limite de comprimento de prompt, alguns mais de uma vez — o Qwen3.7 Flash vai a 3,33× acima de 32K e a 6,67× acima de 256K. Calcule uma carga de contexto longo pelo preço de destaque e você erra por um múltiplo.
  • Tokens de raciocínio cobrados à parte da saída. Quando os tokens de raciocínio são cobrados separadamente, o custo depende do volume faturado e da tarifa aplicável. Inclua essa cobrança na sua estimativa.
  • Preço por horário. Modelos com faixas de preço publicadas: 2. Confira o intervalo, o fuso horário e as tarifas; não presuma um desconto fixo.

6 · Qual preço publicamos

Uma pontuação é medida na implantação do próprio modelo, então o preço ao lado é o preço de referência: a oferta mais barata, na mistura equilibrada, que passa em todos os testes abaixo. As tarifas de entrada, saída e leitura de cache dessa oferta são publicadas juntas, nunca misturadas com as de outra oferta.

  1. Em serviço. Uma oferta que o OpenRouter lista como fora de serviço é excluída. Uma oferta que aparece degradada no momento da leitura conta mesmo assim se esteve em serviço por pelo menos 95% do último dia. Uma oferta que esteve em serviço por menos de 80% do último dia não conta, seja qual for o seu estado agora.
  2. Entrega padrão. Flex, priority, fast e níveis semelhantes são outro produto e são excluídos.
  3. Tarifa padrão. Uma oferta em promoção conta pela tarifa padrão: cada tarifa dividida por um menos o desconto. O preço promocional é informado, nunca ranqueado.
  4. Janela padrão. Um preço que depende do horário conta pela tarifa padrão; as horas com desconto são informadas.
  5. A precisão do fabricante ou melhor. Uma oferta de 4 bits (fp4, nvfp4, mxfp4, int4) só conta quando o próprio fabricante serve em 4 bits ou, quando o fabricante não informa a precisão, seus pesos publicados são de 4 bits. Uma oferta que não informa precisão conta quando é a do próprio fabricante, ou a de um revendedor de um modelo de pesos fechados: ele serve a implantação do fabricante. Com pesos abertos, ou que ninguém registrou, a de um revendedor que não a informa é excluída: nunca é lida como precisão total.

Quando nenhuma oferta passa, o modelo fica com um preço de reserva, rotulado como preço sem oferta equivalente com o motivo, porque um modelo sem preço pareceria ausente: entre as ofertas em serviço com entrega padrão, cada uma pela tarifa padrão, a mais barata de um revendedor que não informa a precisão e, na falta dela, a mais barata de 4 bits. Outro nível de entrega só é usado quando nada mais está em serviço. Um modelo sem oferta da qual tirar um preço fica com o preço do modelo do OpenRouter.

A oferta mais barata que a regra exclui, quando é mais barata, aparece na página do modelo como “Mais barato agora”, com o motivo: uma promoção e sua porcentagem, 4 bits, um nível de entrega ou precisão não informada. Ela nunca define uma posição, a fronteira, um veredito nem um número de destaque. Quando a oferta que define o preço está ela mesma em promoção, é o seu próprio preço promocional que aparece.

Nestes dados, 333 modelos têm preço de referência, 15 um preço sem oferta equivalente e 99 o preço do modelo do OpenRouter, incluindo listagens batch e gratuitas. 86 mostram agora uma oferta mais barata, 11 delas de um revendedor que não informa a precisão.

Antes desta regra, todo preço aqui era o preço do modelo do OpenRouter, que qualquer vendedor pode definir, incluindo promoções e cópias de 4 bits. A mudança está registrada como §96 no registro de correções, com os números de antes e depois.

7 · Classificação condicionada à tarefa

Uma única ordem global é intelectualmente desonesta, porque trabalhos diferentes são vencidos por modelos diferentes. Mantemos Elo por tarefa em 25 categorias — front-end, visualização de dados, desenvolvimento de jogos, SVG, Android, apresentações e mais. Selecionar uma tarefa reordena todo o painel pelo Elo daquela tarefa, e não por um índice geral.

As pontuações por tarefa são o Elo por tarefa do Design Arena, lido do feed de modelos do OpenRouter: designarena.ai.

A cobertura varia por categoria, e um modelo ausente da classificação de uma categoria aparece como não medido naquela tarefa, não como ruim nela.

8 · Quando o mesmo modelo é vendido duas vezes

Alguns modelos não são modelos novos. O próprio vendedor diz isso: 11 entradas deste catálogo são descritas pelo próprio fornecedor como outro modelo do catálogo servido de outra forma — uma via mais rápida, um modo de raciocínio diferente, mais computação por consulta. 10 das 11 não têm entrada em nenhum ranking do LMArena. Dos 11 modelos base delas, 11 têm.

Quando o mesmo modelo é vendido duas vezes
Vendido comoPreço do nívelModelo baseO que o vendedor diz
o1-pro sem entrada$600 ×10o1 1.365,8 mais computação por consulta
o3 Pro sem entrada$80 ×10o3 1.409,9 mais computação por consulta
GPT-6 Astra Pro sem entrada$50 ×1GPT-6 Astra 1.442,3 com esforço máximomesmo modelo, outro modo de serviço
GPT-5.6 Sol Pro sem entrada$20 ×1GPT-5.6 Sol 1.456,3 com esforço muito altomesmo modelo, outro modo de serviço
GPT-5.6 Terra Pro sem entrada$12 ×1GPT-5.6 Terra 1.446,3 com esforço muito altomesmo modelo, outro modo de serviço
GPT-6 Sol Pro sem entrada$10 ×1GPT-6 Sol 1.395,4 com esforço máximomesmo modelo, outro modo de serviço
GPT-6.1 Sol Pro sem entrada$10 ×1GPT-6.1 Sol 1.445,6 com esforço máximomesmo modelo, outro modo de serviço
o3 Mini High 1.336,6 $4,4 ×1o3 Mini 1.319,4 mesmo modelo, outro modo de serviço
o4 Mini High sem entrada$4,4 ×1o4 Mini 1.353,2 mesmo modelo, outro modo de serviço
GPT-5.6 Luna Pro sem entrada$1,2 ×1GPT-5.6 Luna 1.431 com esforço muito altomesmo modelo, outro modo de serviço
GPT-6 Luna Pro sem entrada$0,5 ×1GPT-6 Luna 1.391,5 com esforço máximomesmo modelo, outro modo de serviço

A distinção importa para o que você pode concluir. Onde o vendedor diz capacidades idênticas — 0 das 11 entradas —, a nota do modelo base também é a afirmação do próprio vendedor sobre o nível, e a única coisa que você está comprando é velocidade. Onde o vendedor diz mais computação ou outro modo, nenhuma medição publicada diz o que o gasto extra compra, com a única exceção citada acima.

Esta contagem inclui apenas o que o vendedor declara. Um modelo cujo nome termina em “Pro”, mas que o próprio fornecedor chama de modelo carro-chefe por si só, não entra aqui, porque isso seria afirmação nossa, não deles — o mesmo erro de tratar os próprios níveis de serviço de um fornecedor como vendedores concorrentes, que certa vez transformou uma variação de preço de 2× em 7,2× publicados.

Não ter entrada em um ranking do LMArena não é um veredito. Não é evidência de baixa qualidade, e não significa que ninguém avaliou esses modelos — os fornecedores publicam os próprios resultados. Significa que o eixo pelo qual este site classifica não tem leitura para eles, então não os classificamos.

9 · De onde vêm os dados

Os preços são normalizados a partir de um catálogo legível por máquina que cobre vários provedores e conferidos com as páginas de preços dos fornecedores. Cada página de modelo liga à sua fonte e à data de coleta.

  • Conflitos são registrados, não promediados. Quando duas fontes discordam sobre um preço, essa discordância é o achado. Um modelo listado a US$ 4/US$ 20 pelo fornecedor e vendido a US$ 2/US$ 10 por um agregador tem dois preços verdadeiros, e qual vale depende de onde você compra.
  • Valores implausíveis são postos em quarentena. Um sentinela de origem igual a −1 para “preço definido no momento da requisição” vira −US$ 750.000 por milhão se passar sem tratamento, e vence qualquer ordenação do mais barato. Tudo fora de uma faixa plausível é retido com um motivo anexado.
  • A confiança é por campo. Não um selo por linha. Afirmar que um registro está verificado quando só o preço dele foi conferido é o tipo de exagero que acaba com a confiança na primeira vez que alguém percebe.
  • Sem nota não é zero. 219 modelos não têm nota independente. Eles são listados por preço e excluídos da ordenação por qualidade; nunca são jogados para o fim como se tivessem sido medidos e reprovado.

10 · Licenciamento, e o que ele restringe

Dois dos benchmarks em que este site se apoia têm termos de redistribuição bem diferentes, e isso muda o que pode ser publicado.

  • O LMArena publica sua classificação como um conjunto de dados CC-BY-4.0, o que permite redistribuição com atribuição — e que traz os limites de confiança dos quais as colocações de significância acima dependem. Esse é o canal a usar; raspar o próprio site é proibido pelos termos deles.
  • Artificial Analysis's free tier is "internal use only with attribution"; public redistribution requires a commercial licence, and their site terms separately limit use to personal and non-commercial purposes. So we do not publish their figures at all. Every general capability score on this site is LMArena Elo, used under CC BY 4.0 from the official dataset; the per-task scores are Design Arena’s, below. Artificial Analysis remains an internal cross-check, which is what its free tier permits; it reaches no page, export or API here.
  • Os termos da API do Design Arena liberam o uso dos dados do ranking, inclusive comercial, com uma condição: toda exibição pública cita o Design Arena e tem link para designarena.ai. O Elo por tarefa chega a este site pelo feed de modelos do OpenRouter; a visão por tarefa, as posições por tarefa de cada página de modelo e esta página o citam.
  • O preço em si é um fato que o fornecedor publica, coisa diferente de uma nota de índice compilada. Os preços são conferidos com as páginas dos fornecedores e cada linha liga à sua fonte.

11 · Correções

Preços mudam sem aviso e páginas são reformatadas; parte do que está aqui estará errado em algum momento. Se você encontrar um erro, o caminho mais rápido é dizer qual modelo, qual deveria ser o número e onde ele está publicado — correções com fonte primária são aplicadas diretamente.

Relatar um preço errado

Catálogo coletado pela última vez em 2026-10-06. A lógica de classificação é versionada junto com o site, de modo que uma mudança em como “melhor” é calculado vira um diff visível, e não um reajuste silencioso.

Evidências e perguntas