La frontera de valor

Todos los modelos, situados según lo que cuestan frente a lo buenos que son. La escalera es la frontera: nada supera a esos modelos en ambos ejes a la vez. Todo lo que queda abajo y a la derecha es una opción estrictamente peor: hay algo a la vez más inteligente y más barato.

Changing the workload below moves the frontier less than you would expect: 91% of frontier models are on it under every workload (only Solar Pro 4 moves). What does change is the price — the same model swings up to across these shapes. So the control is not about which models to consider. It is about what you would actually pay for them.

10 no dominados de 106 96 opciones peores
Carga de trabajo
Medido en
$0.030$0.100$0.300$1.00$3.00$10.00102030405060$ efectivos por millón de tokens — escala logarítmicacapacidad en General
  1. 1 Ling-3.0-flashinclusionAI 37.8 $0.032/M peldaño más barato
  2. 2 Solar Pro 4Upstage 41.6 $0.052/M +3.8 por 1.7× el precio
  3. 3 DeepSeek V4 Flash 0423DeepSeek 42.1 $0.061/M +0.5 por 1.2× el precio
  4. 4 DeepSeek V4 Flash 0731DeepSeek 51.8 $0.105/M +9.7 por 1.7× el precio
  5. 5 GPT-5.6 LunaOpenAI 52.3 $0.450/M +0.5 por 4.3× el precio
  6. 6 Gemini 3.7 FlashGoogle 56.0 $0.750/M +3.7 por 1.7× el precio
  7. 7 Muse Spark 1.2Meta 56.8 $2.00/M +0.8 por 2.7× el precio
  8. 8 GLM 5.3Z.ai 59.5 $2.15/M +2.7 por 1.1× el precio
  9. 9 Grok 4.6xAI 60.9 $3.00/M +1.4 por 1.4× el precio
  10. 10 Claude Opus 5Anthropic 63.1 $10.00/M +2.2 por 3.3× el precio
Markdown for LLMs