Граница эффективности

Каждая модель нанесена по тому, сколько она стоит, против того, насколько она хороша. Лесенка — это граница: ни одна модель не обходит те, что на ней, сразу по обеим осям. Всё, что ниже и правее, — строго худшая сделка: есть что-то одновременно умнее и дешевле.

Changing the workload below moves the frontier less than you would expect: 91% of frontier models are on it under every workload (only Solar Pro 4 moves). What does change is the price — the same model swings up to across these shapes. So the control is not about which models to consider. It is about what you would actually pay for them.

10 не доминируемых из 106 худших сделок: 96
Нагрузка
Измерено на
$0.030$0.100$0.300$1.00$3.00$10.00102030405060эффективные $ за миллион токенов — логарифмическая шкаласпособности (Общие)
  1. 1 Ling-3.0-flashinclusionAI 37.8 $0.032/M самая дешёвая ступень
  2. 2 Solar Pro 4Upstage 41.6 $0.052/M +3.8 за цену ×1.7
  3. 3 DeepSeek V4 Flash 0423DeepSeek 42.1 $0.061/M +0.5 за цену ×1.2
  4. 4 DeepSeek V4 Flash 0731DeepSeek 51.8 $0.105/M +9.7 за цену ×1.7
  5. 5 GPT-5.6 LunaOpenAI 52.3 $0.450/M +0.5 за цену ×4.3
  6. 6 Gemini 3.7 FlashGoogle 56.0 $0.750/M +3.7 за цену ×1.7
  7. 7 Muse Spark 1.2Meta 56.8 $2.00/M +0.8 за цену ×2.7
  8. 8 GLM 5.3Z.ai 59.5 $2.15/M +2.7 за цену ×1.1
  9. 9 Grok 4.6xAI 60.9 $3.00/M +1.4 за цену ×1.4
  10. 10 Claude Opus 5Anthropic 63.1 $10.00/M +2.2 за цену ×3.3
Markdown for LLMs