---
title: "Metodologia — como se decide o “melhor”, e onde os dados são fracos · Undominated.ai"
canonical: https://undominated.ai/pt-br/methodology/
description: "Como este site classifica 364 modelos de IA: a fronteira, o Elo condicionado à tarefa, preços conscientes da carga de trabalho e um relato honesto do que os dados não cobrem."
---

# Metodologia — como se decide o “melhor”, e onde os dados são fracos · Undominated.ai

> Como este site classifica 364 modelos de IA: a fronteira, o Elo condicionado à tarefa, preços conscientes da carga de trabalho e um relato honesto do que os dados não cobrem.

# Metodologia

Tudo aqui é reproduzível a partir das mesmas fontes públicas que você mesmo pode conferir. Onde os dados são escassos ou as fontes discordam, esta página diz isso — uma página de confiança que só traz boas notícias é publicidade.

 On this page [2 · Colocações em que você pode confiar](#methodology-section-1)[8 · Quando o mesmo modelo é vendido duas vezes](#tiers)[9 · De onde vêm os dados](#methodology-section-3)[10 · Licenciamento, e o que ele restringe](#sources) 60% do catálogo **não tem nota de qualidade independente**. 145 de 364 modelos têm nota. O restante é listado, precificado e claramente marcado como sem nota — nunca classificado.
 72/145 posições exibidas que são **colocações realmente distintas**. 94% dos pares adjacentes ficam dentro da margem de erro do benchmark.
 67/364 modelos cujo preço de destaque **não é o preço inteiro**: faixas de contexto, raciocínio cobrado à parte ou tarifas por horário.
 7/447 entries with variable prices withheld
 4/447 entries with suspect latency withheld; may overlap the price group

## 1 · O que “melhor” significa

A qualidade manda e o preço desempata. Essa ordem é o produto inteiro: uma lista do mais barato para o mais caro é trivial de publicar e quase inútil, porque o modelo mais barato deste mercado é 12.500× mais barato que o mais caro e em geral não dá conta do trabalho.

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are **LMArena** Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

### Por que não existe uma nota única de qualidade

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are **LMArena** Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

## 2 · Colocações em que você pode confiar

A coluna de colocação é uma **colocação de significância**, não um número de linha. A colocação de um modelo é um a mais que o número de modelos que o superam por mais do que a soma das duas margens de erro. Modelos com a mesma contagem compartilham a mesma colocação. Dois modelos dentro da margem de erro um do outro ainda podem ter colocações diferentes, porque cada um é comparado com a tabela inteira.

SHA-256 da projeção relevante para a colocação (identificadores, notas, preços por carga de trabalho, marca de fronteira): 06cd12db54e2968c3de49b45a3a2a6881f374f6e58a462437784450842efb989 . Datas e carimbos de compilação ficam de fora. Uma mudança aqui é uma mudança na classificação, não na aparência.

[Correções](/pt-br/corrections/)

### A maior parte da ordem de uma classificação é ruído

Duas pontuações da Arena só contam como separadas quando diferem por mais do que a soma das margens de erro de 95% dos dois modelos. Essa soma é, em média, de 10,47 pontos nesta tabela, e o teste é pelo menos tão rigoroso quanto um intervalo de 95% sobre a diferença. **136 de 144 pares adjacentes (94%)** ficam dentro da própria soma. Contando a colocação de cada modelo como um a mais que o número de modelos que o superam claramente, as 145 posições exibidas têm **72 colocações distintas**, e 4 modelos dividem o primeiro lugar.

“O modelo nº 1” não é, portanto, uma afirmação que estes dados sustentem. Empates são mostrados como empates. A posição 1 é a posição 1 entre os modelos do feed de preços que este site lê: quando a LMArena coloca acima de todos eles um modelo que o feed não traz, o quadro nomeia esse modelo e não o classifica.

Este método não é nosso. O LMArena classifica assim há anos — o [Rank (UB)](https://news.lmarena.ai/ranking-method/) deles dá a cada modelo um a mais que o número de modelos estatisticamente melhores que ele, e eles [abriram o código da implementação](https://github.com/lmarena/arena-rank). O incomum é aplicá-lo a uma comparação de *preços*, onde o incentivo é publicar uma ordem nítida.

Applied to the general arena board only. Other boards carry their own error, which we do not have, so they are not given a borrowed threshold.

## 3 · “Melhor e mais barato” precisa significar isso

A dominância de Pareto sobre preço e capacidade é uma projeção bidimensional de uma decisão de compra muito mais ampla, e essa projeção mente mais vezes do que acerta. Um modelo pode pontuar mais alto e custar menos e, ao mesmo tempo, não aceitar imagens, limitar a saída à metade dos tokens ou reter meio milhão de tokens de contexto a menos.

Por isso **“ao mesmo tempo melhor e mais barato” fica reservado a uma substituição cujo envelope de capacidades seja um superconjunto** do original. De 133 vereditos de dominância, 113 são estritos e **20 (15%)** nomeiam, em vez disso, o que você abriria mão. Sem esse filtro, 61% dos vereditos brutos de dois eixos recomendavam um modelo incapaz de fazer o trabalho do atual.

## 4 · A fronteira, não uma nota de valor

Um modelo está na **fronteira de valor** quando não existe outro modelo que pontue pelo menos tão alto, custe no máximo o mesmo e vença em um dos dois. 12 dos modelos avaliados, precificados e de entrega padrão se qualificam. Cada um dos outros 92% tem um modelo assim acima de si, embora nem sempre seja uma substituição equivalente: a seção acima conta os casos em que se abre mão de algo.

### Por que não classificar por qualidade por dólar?

Porque a razão premia a baixa de preço muito mais fortemente que a qualidade. Aplicada a este catálogo, ela coroa um modelo que marca 37,8 num teto de cerca de 63, e coloca em segundo um que marca 14,2 — modelos que ninguém deveria colocar em produção. Qualquer site que publique uma coluna de “valor” calculada assim está dando conselho ruim. Usamos a fronteira mais um piso de qualidade explícito.

## 5 · O preço é uma propriedade de um modelo e de uma carga de trabalho

Não existe “o” preço de um modelo. Resumir é intensivo em entrada, gerar código é intensivo em saída, e um laço de agente repete o próprio contexto a cada turno; o mesmo catálogo se ordena de forma diferente em cada caso. Em vez de escolher uma mistura e escondê-la, a proporção entrada:saída e a taxa de acerto de cache são controles que você vê e altera.

Se não houver tarifa publicada para leitura de cache, a estimativa combinada usa a tarifa integral de entrada da faixa selecionada.

| Carga de trabalho | Parcela de saída | Acertos de cache | Formato |
| --- | --- | --- | --- |
| Equilibrado | Parcela de saída 25% | Acertos de cache 0% | 3 tokens de entrada para 1 de saída |
| Resumir | Parcela de saída 5% | Acertos de cache 30% | Entrada enorme, saída mínima |
| Chat | Parcela de saída 40% | Acertos de cache 50% | Prompt de sistema longo em cache |
| Geração de código | Parcela de saída 60% | Acertos de cache 20% | A saída domina |
| Agêntico | Parcela de saída 15% | Acertos de cache 70% | Contexto reenviado a cada turno |

Três coisas costumam tornar a tarifa anunciada errada, e todas aparecem na linha:

 - **Faixas de contexto.** 51 modelos mudam de tarifa acima de um limite de comprimento de prompt, alguns mais de uma vez — o Qwen3.7 Flash vai a 3,33× acima de 32K e a 6,67× acima de 256K. Calcule uma carga de contexto longo pelo preço de destaque e você erra por um múltiplo.
 - **Tokens de raciocínio cobrados à parte da saída.** Quando os tokens de raciocínio são cobrados separadamente, o custo depende do volume faturado e da tarifa aplicável. Inclua essa cobrança na sua estimativa.
 - **Preço por horário.** Modelos com faixas de preço publicadas: 2. Confira o intervalo, o fuso horário e as tarifas; não presuma um desconto fixo.

## 6 · Qual preço publicamos

Uma pontuação é medida na implantação do próprio modelo, então o preço ao lado é o **preço de referência**: a oferta mais barata, na mistura equilibrada, que passa em todos os testes abaixo. As tarifas de entrada, saída e leitura de cache dessa oferta são publicadas juntas, nunca misturadas com as de outra oferta.

 - **Em serviço.** Uma oferta que o OpenRouter lista como fora de serviço é excluída. Uma oferta que aparece degradada no momento da leitura conta mesmo assim se esteve em serviço por pelo menos 95% do último dia. Uma oferta que esteve em serviço por menos de 80% do último dia não conta, seja qual for o seu estado agora.
 - **Entrega padrão.** Flex, priority, fast e níveis semelhantes são outro produto e são excluídos.
 - **Tarifa padrão.** Uma oferta em promoção conta pela tarifa padrão: cada tarifa dividida por um menos o desconto. O preço promocional é informado, nunca ranqueado.
 - **Janela padrão.** Um preço que depende do horário conta pela tarifa padrão; as horas com desconto são informadas.
 - **A precisão do fabricante ou melhor.** Uma oferta de 4 bits (fp4, nvfp4, mxfp4, int4) só conta quando o próprio fabricante serve em 4 bits ou, quando o fabricante não informa a precisão, seus pesos publicados são de 4 bits. Uma oferta que não informa precisão conta quando é a do próprio fabricante, ou a de um revendedor de um modelo de pesos fechados: ele serve a implantação do fabricante. Com pesos abertos, ou que ninguém registrou, a de um revendedor que não a informa é excluída: nunca é lida como precisão total.

Quando nenhuma oferta passa, o modelo fica com um preço de reserva, rotulado como **preço sem oferta equivalente** com o motivo, porque um modelo sem preço pareceria ausente: entre as ofertas em serviço com entrega padrão, cada uma pela tarifa padrão, a mais barata de um revendedor que não informa a precisão e, na falta dela, a mais barata de 4 bits. Outro nível de entrega só é usado quando nada mais está em serviço. Um modelo sem oferta da qual tirar um preço fica com o preço do modelo do OpenRouter.

A oferta mais barata que a regra exclui, quando é mais barata, aparece na página do modelo como “Mais barato agora”, com o motivo: uma promoção e sua porcentagem, 4 bits, um nível de entrega ou precisão não informada. Ela nunca define uma posição, a fronteira, um veredito nem um número de destaque. Quando a oferta que define o preço está ela mesma em promoção, é o seu próprio preço promocional que aparece.

Nestes dados, 333 modelos têm preço de referência, 15 um preço sem oferta equivalente e 99 o preço do modelo do OpenRouter, incluindo listagens batch e gratuitas. 86 mostram agora uma oferta mais barata, 11 delas de um revendedor que não informa a precisão.

Antes desta regra, todo preço aqui era o preço do modelo do OpenRouter, que qualquer vendedor pode definir, incluindo promoções e cópias de 4 bits. A mudança está registrada como §96 no registro de correções, com os números de antes e depois.

## 7 · Classificação condicionada à tarefa

Uma única ordem global é intelectualmente desonesta, porque trabalhos diferentes são vencidos por modelos diferentes. Mantemos Elo por tarefa em **25 categorias** — front-end, visualização de dados, desenvolvimento de jogos, SVG, Android, apresentações e mais. Selecionar uma tarefa reordena todo o painel pelo Elo daquela tarefa, e não por um índice geral.

As pontuações por tarefa são o Elo por tarefa do **Design Arena**, lido do feed de modelos do OpenRouter: [designarena.ai](https://designarena.ai).

A cobertura varia por categoria, e um modelo ausente da classificação de uma categoria aparece como não medido naquela tarefa, não como ruim nela.

## 8 · Quando o mesmo modelo é vendido duas vezes

Alguns modelos não são modelos novos. O próprio vendedor diz isso: **11 entradas deste catálogo** são descritas pelo próprio fornecedor como outro modelo do catálogo servido de outra forma — uma via mais rápida, um modo de raciocínio diferente, mais computação por consulta. **10 das 11 não têm entrada em nenhum ranking do LMArena. Dos 11 modelos base delas, 11 têm.**

Quando o mesmo modelo é vendido duas vezes

| Vendido como | Preço do nível | Modelo base | O que o vendedor diz |
| --- | --- | --- | --- |
| [o1-pro](/models/openai__o1-pro/) sem entrada | $600 ×10 | [o1](/models/openai__o1/) 1.365,8 | mais computação por consulta |
| [o3 Pro](/models/openai__o3-pro/) sem entrada | $80 ×10 | [o3](/models/openai__o3/) 1.409,9 | mais computação por consulta |
| [GPT-6 Astra Pro](/models/openai__gpt-6-astra-pro/) sem entrada | $50 ×1 | [GPT-6 Astra](/models/openai__gpt-6-astra/) 1.442,3 com esforço máximo | mesmo modelo, outro modo de serviço |
| [GPT-5.6 Sol Pro](/models/openai__gpt-5.6-sol-pro/) sem entrada | $20 ×1 | [GPT-5.6 Sol](/models/openai__gpt-5.6-sol/) 1.456,3 com esforço muito alto | mesmo modelo, outro modo de serviço |
| [GPT-5.6 Terra Pro](/models/openai__gpt-5.6-terra-pro/) sem entrada | $12 ×1 | [GPT-5.6 Terra](/models/openai__gpt-5.6-terra/) 1.446,3 com esforço muito alto | mesmo modelo, outro modo de serviço |
| [GPT-6 Sol Pro](/models/openai__gpt-6-sol-pro/) sem entrada | $10 ×1 | [GPT-6 Sol](/models/openai__gpt-6-sol/) 1.395,4 com esforço máximo | mesmo modelo, outro modo de serviço |
| [GPT-6.1 Sol Pro](/models/openai__gpt-6.1-sol-pro/) sem entrada | $10 ×1 | [GPT-6.1 Sol](/models/openai__gpt-6.1-sol/) 1.445,6 com esforço máximo | mesmo modelo, outro modo de serviço |
| [o3 Mini High](/models/openai__o3-mini-high/) 1.336,6 | $4,4 ×1 | [o3 Mini](/models/openai__o3-mini/) 1.319,4 | mesmo modelo, outro modo de serviço |
| [o4 Mini High](/models/openai__o4-mini-high/) sem entrada | $4,4 ×1 | [o4 Mini](/models/openai__o4-mini/) 1.353,2 | mesmo modelo, outro modo de serviço |
| [GPT-5.6 Luna Pro](/models/openai__gpt-5.6-luna-pro/) sem entrada | $1,2 ×1 | [GPT-5.6 Luna](/models/openai__gpt-5.6-luna/) 1.431 com esforço muito alto | mesmo modelo, outro modo de serviço |
| [GPT-6 Luna Pro](/models/openai__gpt-6-luna-pro/) sem entrada | $0,5 ×1 | [GPT-6 Luna](/models/openai__gpt-6-luna/) 1.391,5 com esforço máximo | mesmo modelo, outro modo de serviço |

A distinção importa para o que você pode concluir. Onde o vendedor diz *capacidades idênticas* — 0 das 11 entradas —, a nota do modelo base também é a afirmação do próprio vendedor sobre o nível, e a única coisa que você está comprando é velocidade. Onde o vendedor diz mais computação ou outro modo, nenhuma medição publicada diz o que o gasto extra compra, com a única exceção citada acima.

Esta contagem inclui apenas o que o vendedor declara. Um modelo cujo nome termina em “Pro”, mas que o próprio fornecedor chama de modelo carro-chefe por si só, não entra aqui, porque isso seria afirmação nossa, não deles — o mesmo erro de tratar os próprios níveis de serviço de um fornecedor como vendedores concorrentes, que certa vez transformou uma variação de preço de 2× em 7,2× publicados.

Não ter entrada em um ranking do LMArena não é um veredito. Não é evidência de baixa qualidade, e não significa que ninguém avaliou esses modelos — os fornecedores publicam os próprios resultados. Significa que o eixo pelo qual este site classifica não tem leitura para eles, então não os classificamos.

## 9 · De onde vêm os dados

Os preços são normalizados a partir de um catálogo legível por máquina que cobre vários provedores e conferidos com as páginas de preços dos fornecedores. Cada página de modelo liga à sua fonte e à data de coleta.

 - **Conflitos são registrados, não promediados.** Quando duas fontes discordam sobre um preço, essa discordância é o achado. Um modelo listado a US$ 4/US$ 20 pelo fornecedor e vendido a US$ 2/US$ 10 por um agregador tem dois preços verdadeiros, e qual vale depende de onde você compra.
 - **Valores implausíveis são postos em quarentena.** Um sentinela de origem igual a −1 para “preço definido no momento da requisição” vira −US$ 750.000 por milhão se passar sem tratamento, e vence qualquer ordenação do mais barato. Tudo fora de uma faixa plausível é retido com um motivo anexado.
 - **A confiança é por campo.** Não um selo por linha. Afirmar que um registro está verificado quando só o preço dele foi conferido é o tipo de exagero que acaba com a confiança na primeira vez que alguém percebe.
 - **Sem nota não é zero.** 219 modelos não têm nota independente. Eles são listados por preço e excluídos da ordenação por qualidade; nunca são jogados para o fim como se tivessem sido medidos e reprovado.

## 10 · Licenciamento, e o que ele restringe

Dois dos benchmarks em que este site se apoia têm termos de redistribuição bem diferentes, e isso muda o que pode ser publicado.

 - O **LMArena** publica sua classificação como um [conjunto de dados CC-BY-4.0](https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset), o que permite redistribuição com atribuição — e que traz os limites de confiança dos quais as colocações de significância acima dependem. Esse é o canal a usar; raspar o próprio site é proibido pelos termos deles.
 - **Artificial Analysis**'s free tier is *"internal use only with attribution"*; public redistribution requires a commercial licence, and their site terms separately limit use to personal and non-commercial purposes. **So we do not publish their figures at all.** Every general capability score on this site is LMArena Elo, used under CC BY 4.0 from the official dataset; the per-task scores are Design Arena’s, below. Artificial Analysis remains an internal cross-check, which is what its free tier permits; it reaches no page, export or API here.
 - Os termos da API do **Design Arena** liberam o uso dos dados do ranking, inclusive comercial, com uma condição: toda exibição pública cita o Design Arena e tem link para [designarena.ai](https://designarena.ai). O Elo por tarefa chega a este site pelo feed de modelos do OpenRouter; a visão por tarefa, as posições por tarefa de cada página de modelo e esta página o citam.
 - **O preço em si** é um fato que o fornecedor publica, coisa diferente de uma nota de índice compilada. Os preços são conferidos com as páginas dos fornecedores e cada linha liga à sua fonte.

## 11 · Correções

Preços mudam sem aviso e páginas são reformatadas; parte do que está aqui estará errado em algum momento. Se você encontrar um erro, o caminho mais rápido é dizer qual modelo, qual deveria ser o número e onde ele está publicado — correções com fonte primária são aplicadas diretamente.

[Relatar um preço errado](/report/)

Catálogo coletado pela última vez em 2026-10-06. A lógica de classificação é versionada junto com o site, de modo que uma mudança em como “melhor” é calculado vira um diff visível, e não um reajuste silencioso.

## Continue your investigation

 - [Inspect measured uncertainty · English](/significance/)
- [Read source policy](/pt-br/independence/)
- [See recorded corrections](/pt-br/corrections/)
- [Reuse accepted data · English](/api/)
