A fronteira de valor

Cada modelo, plotado pelo que custa em relação a quão bom é. A escada é a fronteira: nada supera esses modelos nos dois eixos ao mesmo tempo. Tudo abaixo e à direita é um negócio estritamente pior — existe algo ao mesmo tempo mais inteligente e mais barato.

Changing the workload below moves the frontier less than you would expect: 91% of frontier models are on it under every workload (only Solar Pro 4 moves). What does change is the price — the same model swings up to across these shapes. So the control is not about which models to consider. It is about what you would actually pay for them.

10 não dominados de 106 96 negócios piores
Carga de trabalho
Medido em
$0.030$0.100$0.300$1.00$3.00$10.00102030405060$ efetivo por milhão de tokens — escala logarítmicacapacidade em Geral
  1. 1 Ling-3.0-flashinclusionAI 37.8 $0.032/M degrau mais barato
  2. 2 Solar Pro 4Upstage 41.6 $0.052/M +3.8 por 1.7× o preço
  3. 3 DeepSeek V4 Flash 0423DeepSeek 42.1 $0.061/M +0.5 por 1.2× o preço
  4. 4 DeepSeek V4 Flash 0731DeepSeek 51.8 $0.105/M +9.7 por 1.7× o preço
  5. 5 GPT-5.6 LunaOpenAI 52.3 $0.450/M +0.5 por 4.3× o preço
  6. 6 Gemini 3.7 FlashGoogle 56.0 $0.750/M +3.7 por 1.7× o preço
  7. 7 Muse Spark 1.2Meta 56.8 $2.00/M +0.8 por 2.7× o preço
  8. 8 GLM 5.3Z.ai 59.5 $2.15/M +2.7 por 1.1× o preço
  9. 9 Grok 4.6xAI 60.9 $3.00/M +1.4 por 1.4× o preço
  10. 10 Claude Opus 5Anthropic 63.1 $10.00/M +2.2 por 3.3× o preço
Markdown for LLMs