Методологія
Усе тут відтворюється з тих самих відкритих джерел, які ви можете перевірити самі. Там, де даних мало або джерела розходяться, ця сторінка про це каже — сторінка про довіру, що подає лише добрі новини, є рекламою.
1 · Що означає «найкращий»
Веде якість, ціна розв’язує нічию. Цей порядок і є весь продукт: перелік «спершу найдешевше» публікується тривіально й майже некорисний, бо найдешевша модель на цьому ринку у 12 500× дешевша за найдорожчу і зазвичай не впорається з роботою.
Capability comes from independent evaluators, never from us and never from the vendor. The general scores are LMArena Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.
Чому немає єдиної оцінки якості
Capability comes from independent evaluators, never from us and never from the vendor. The general scores are LMArena Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.
2 · Ранги, на які можна спертися
Стовпець рангу — це ранг значущості, а не номер рядка. Ранг моделі на одиницю більший за кількість моделей, які перевершують її більше ніж на суму обох похибок. Моделі, у яких ця кількість однакова, ділять ранг. Дві моделі в межах похибки одна одної все одно можуть мати різні ранги, бо кожну порівнюють з усією таблицею.
SHA-256 значущої для рангу проєкції (ідентифікатори, оцінки, ціни за навантаженням, ознака межі): 06cd12db54e2968c3de49b45a3a2a6881f374f6e58a462437784450842efb989. Дати та мітки збірки виключено. Зміна тут — це зміна в ранжуванні, а не в оформленні.
Більша частина порядку в рейтингу — це шум
Дві оцінки Arena вважаються розділеними, лише коли вони різняться більше ніж на суму 95-відсоткових похибок обох моделей. Середнє цієї суми по таблиці, у пунктах: 10,47. Такий тест не м’якший за 95-відсотковий інтервал для різниці. Сусідні пари в межах своєї суми: 136 з 144 (94%). Якщо ранг моделі дорівнює одиниці плюс кількість моделей, які явно її перевершують, то кількість різних рангів серед показаних позицій (145): 72. Моделей, що ділять перше місце: 4.
«Модель номер 1» — отже, не те твердження, яке ці дані витримують. Нічиї показані як нічиї. Ранг 1 — це ранг 1 серед моделей зі стрічки цін, яку читає цей сайт: якщо LMArena ставить вище за них усіх модель, якої в цій стрічці немає, таблиця називає цю модель і не надає їй рангу.
Цей метод не наш. LMArena ранжує так уже роки — їхній Rank (UB) присвоює кожній моделі ранг, на одиницю більший за кількість моделей, статистично кращих за неї, і вони відкрили код реалізації. Незвичним є застосувати це до порівняння цін, де стимул саме в тому, щоб опублікувати чіткий порядок.
Applied to the general arena board only. Other boards carry their own error, which we do not have, so they are not given a borrowed threshold.
3 · «Кращий і дешевший» має щось означати
Домінування за Парето за ціною та спроможностями — це двовимірна проєкція значно ширшого рішення про купівлю, і ця проєкція частіше бреше, ніж ні. Модель може набирати більше і коштувати менше, водночас не приймаючи зображень, обрізаючи вивід удвічі за токенами або утримуючи на пів мільйона токенів менше контексту.
Тому «водночас кращий і дешевший» відведено для заміни, чия оболонка можливостей є надмножиною вихідної. Із 133 вердиктів про домінування 113 є строгими, а 20 (15%) натомість називають, чим доведеться поступитися. Без цього фільтра 61% сирих двовісних вердиктів рекомендував модель, нездатну виконувати роботу чинної.
4 · Межа, а не оцінка вартості
Модель перебуває на межі вартості, коли немає іншої моделі, яка має не нижчу оцінку, коштує не більше й перевершує її в одному з двох. Цьому відповідають 12 оцінених моделей із ціною та стандартною доставкою. Кожна з решти 92% має над собою таку модель, хоча не завжди рівноцінну заміну: розділ вище рахує ті, з якими доведеться чимось поступитися.
Чому не ранжувати за якістю на долар?
Бо таке відношення винагороджує дешевизну значно крутіше, ніж якість. Застосоване до цього каталогу, воно вінчає модель з оцінкою 37,8 за стелі близько 63 і ставить на друге місце модель з оцінкою 14,2 — моделі, які нікому не варто запускати в роботу. Будь-який сайт, що публікує так порахований стовпець «вартості», дає погану пораду. Ми натомість використовуємо межу плюс явний поріг якості.
5 · Ціна — це властивість моделі і навантаження
Не існує «тієї самої» ціни моделі. Реферування інтенсивне за входом, генерація коду — за виходом, а агентний цикл заново відтворює свій контекст на кожному кроці; той самий каталог упорядковується по-різному в кожному випадку. Замість обрати одну суміш і сховати її, співвідношення вхід:вихід і частка влучань у кеш є видимими органами керування, які ви можете змінити.
Якщо тариф читання з кешу не опубліковано, змішана оцінка вартості використовує повну ціну вхідних токенів вибраного цінового рівня.
| Навантаження | Частка виводу | Влучання в кеш | Форма |
|---|---|---|---|
| Збалансоване | 25% | 0% | 3 токени на вході на 1 на виході |
| Резюмування | 5% | 30% | Величезний вхід, крихітний вихід |
| Чат | 40% | 50% | Довгий кешований системний промпт |
| Генерація коду | 60% | 20% | Домінує вихід |
| Агентне | 15% | 70% | Контекст повторюється на кожному кроці |
Три речі регулярно роблять заявлену ставку хибною, і всі три показані в рядку:
- Щаблі за контекстом. 51 моделей змінюють ставку після порога довжини запиту, деякі — не раз: Qwen3.7 Flash переходить на 3,33× понад 32K і на 6,67× понад 256K. Порахуєте довгоконтекстне навантаження за заявленою ціною — помилитеся в рази.
- Токени міркування, тарифіковані окремо від виводу. Якщо токени міркування оплачуються окремо, вартість залежить від кількості оплачуваних токенів і застосовного тарифу. Врахуйте цю суму в оцінці витрат.
- Ціни залежно від часу доби. Кількість моделей з опублікованим розкладом тарифів: 2. Перевірте інтервал, часовий пояс і тарифи; не розраховуйте на однакову знижку.
6 · Яку ціну ми публікуємо
Оцінку вимірюють на власному розгортанні моделі, тому ціна поруч із нею — опорна ціна: найдешевша пропозиція за збалансованою сумішшю, яка проходить усі перевірки нижче. Ставки цієї пропозиції за введення, виведення й читання кешу публікуються разом і ніколи не змішуються зі ставками іншої пропозиції.
- Працює. Пропозицію, яку OpenRouter позначає як непрацюючу, виключено. Пропозиція, яка в момент читання позначена як погіршена, усе одно враховується, якщо за останню добу вона працювала щонайменше 95% часу. Пропозиція, яка за останню добу працювала менше ніж 80% часу, не враховується, хоч би яким був її статус зараз.
- Стандартна доставка. Flex, priority, fast і подібні рівні — інший продукт, тому їх виключено.
- Стандартний тариф. Пропозиція з акцією враховується за стандартним тарифом: кожну ставку ділять на одиницю мінус знижка. Акційну ціну розкрито, але вона ніколи не бере участі в рейтингу.
- Стандартне вікно. Ціна, що залежить від часу доби, рахується за стандартною ставкою; години знижки розкрито.
- Точність виробника або вища. 4-бітна пропозиція (fp4, nvfp4, mxfp4, int4) враховується, лише якщо сам виробник обслуговує в 4 бітах або, коли виробник не вказує точність, його опубліковані ваги 4-бітні. Пропозиція без зазначеної точності враховується, якщо це пропозиція самого виробника або перепродавця моделі із закритими вагами: він обслуговує розгортання виробника. Для відкритих ваг або ваг, про які немає запису, пропозицію перепродавця без зазначеної точності виключено: її ніколи не вважають повною точністю.
Якщо жодна пропозиція не проходить, модель зберігає запасну ціну з позначкою ціна без рівноцінної пропозиції та причиною, бо модель без ціни виглядала б відсутньою: серед робочих пропозицій зі стандартною доставкою, кожна за стандартним тарифом, найдешевшу від перепродавця, який не вказує точність, а якщо такої немає, найдешевшу 4-бітну. Інший рівень доставки використовується, лише якщо більше нічого не працює. Модель без пропозиції, з якої можна взяти ціну, зберігає ціну моделі в OpenRouter.
Найдешевша пропозиція, яку виключає правило, якщо вона дешевша, показується на сторінці моделі як «Зараз дешевше» з причиною: акція та її відсоток, 4 біти, рівень доставки або нерозкрита точність. Вона ніколи не визначає місце, межу, вердикт чи головну цифру. Якщо пропозиція, яка задає ціну, сама бере участь в акції, показується її власна акційна ціна.
У цих даних 333 моделей мають опорну ціну, 15 — ціну без рівноцінної пропозиції, а 99 — ціну моделі в OpenRouter, серед них записи batch і безкоштовні. 86 показують зараз дешевшу пропозицію, з них 11 — від перепродавця, який не вказує точність.
До цього правила кожна ціна тут була ціною моделі в OpenRouter, яку може задати будь-який продавець, разом з акціями та 4-бітними копіями. Зміну записано як §96 у журналі виправлень разом із цифрами до та після.
7 · Ранжування з урахуванням задачі
Єдиний глобальний порядок інтелектуально нечесний, бо різні роботи виграють різні моделі. Ми ведемо Ело за задачами у 25 категоріях: фронтенд, візуалізація даних, розробка ігор, SVG, Android, презентації та інші. Вибір задачі переупорядковує всю таблицю за Ело цієї задачі, а не за загальним індексом.
Оцінки за завданнями — це Elo для кожного завдання від Design Arena, узяті зі стрічки моделей OpenRouter: designarena.ai.
Покриття різниться між категоріями, і модель, відсутня в рейтингу категорії, показана як невиміряна в цій задачі, а не як погана в ній.
8 · Коли ту саму модель продають двічі
Деякі моделі — не нові моделі. Про це каже сам продавець: 11 позицій у цьому каталозі їхній власний постачальник описує як іншу модель каталогу, яку обслуговують інакше, — швидша смуга, інший режим міркування, більше обчислень на запит. 10 із цих 11 не мають запису в жодному рейтингу LMArena. Із їхніх 11 базових моделей запис мають 11.
| Продається як | Ціна рівня | Базова модель | Що каже продавець |
|---|---|---|---|
| o1-pro немає запису | $600 ×10 | o1 1 365,8 | більше обчислень на запит |
| o3 Pro немає запису | $80 ×10 | o3 1 409,9 | більше обчислень на запит |
| GPT-6 Astra Pro немає запису | $50 ×1 | GPT-6 Astra 1 442,3 зусилля під час виміру: максимальне | та сама модель, інший режим обслуговування |
| GPT-5.6 Sol Pro немає запису | $20 ×1 | GPT-5.6 Sol 1 456,3 зусилля під час виміру: дуже високе | та сама модель, інший режим обслуговування |
| GPT-5.6 Terra Pro немає запису | $12 ×1 | GPT-5.6 Terra 1 446,3 зусилля під час виміру: дуже високе | та сама модель, інший режим обслуговування |
| GPT-6 Sol Pro немає запису | $10 ×1 | GPT-6 Sol 1 395,4 зусилля під час виміру: максимальне | та сама модель, інший режим обслуговування |
| GPT-6.1 Sol Pro немає запису | $10 ×1 | GPT-6.1 Sol 1 445,6 зусилля під час виміру: максимальне | та сама модель, інший режим обслуговування |
| o3 Mini High 1 336,6 | $4,4 ×1 | o3 Mini 1 319,4 | та сама модель, інший режим обслуговування |
| o4 Mini High немає запису | $4,4 ×1 | o4 Mini 1 353,2 | та сама модель, інший режим обслуговування |
| GPT-5.6 Luna Pro немає запису | $1,2 ×1 | GPT-5.6 Luna 1 431 зусилля під час виміру: дуже високе | та сама модель, інший режим обслуговування |
| GPT-6 Luna Pro немає запису | $0,5 ×1 | GPT-6 Luna 1 391,5 зусилля під час виміру: максимальне | та сама модель, інший режим обслуговування |
Ця відмінність важлива для того, які висновки можна зробити. Там, де продавець каже про ідентичні можливості, — 0 із 11, — оцінка базової моделі є водночас власним твердженням продавця про рівень, і єдине, що ви купуєте, — швидкість. Там, де продавець каже про більше обчислень або інший режим, жодне опубліковане вимірювання не показує, що дають додаткові витрати, за єдиним винятком, згаданим вище.
Тут враховано лише те, що заявляє продавець. Модель, назва якої закінчується на «Pro», але яку її постачальник називає самостійною флагманською моделлю, тут не враховано, бо це було б нашим твердженням, а не їхнім, — та сама помилка, що й вважати власні рівні обслуговування постачальника продавцями-конкурентами, через яку колись розкид цін 2× перетворився на опублікований 7,2×.
Відсутність запису в рейтингу LMArena — не вердикт. Це не доказ низької якості й не означає, що їх ніхто не оцінював, — постачальники публікують власні результати. Це означає, що вісь, за якою ранжує цей сайт, не має для них виміру, тож ми їх не ранжуємо.
9 · Звідки беруться дані
Ціни нормалізуються з машиночитного каталогу за багатьма постачальниками і звіряються зі сторінками цін постачальників. Кожна сторінка моделі посилається на своє джерело та дату отримання.
- Конфлікти фіксуються, а не усереднюються. Коли два джерела розходяться в ціні, це розходження і є результатом. Модель, зазначена постачальником по $4/$20 і продавана через агрегатор по $2/$10, має дві істинні ціни, і яка з них чинна — залежить від того, де ви купуєте.
- Неправдоподібні значення потрапляють у карантин. Вхідне сторожове значення −1 для «ціна визначається в момент запиту» при бездумній передачі перетворюється на −$750 000 за мільйон і виграє будь-яке сортування «спершу дешеві». Усе, що виходить за правдоподібний діапазон, притримується з доданою причиною.
- Впевненість — за кожним полем. Не один значок на рядок. Стверджувати, що запис перевірено, коли перевірено лише його ціну, — це те перебільшення, що вбиває довіру за першого ж виявлення.
- Без оцінки — не нуль. У 219 моделей немає незалежної оцінки. Вони перелічені за ціною та виключені з упорядкування за якістю; їх ніколи не відправляють униз так, ніби їх виміряли і вони провалилися.
10 · Ліцензії та те, що вони обмежують
У двох бенчмарків, на які спирається цей сайт, дуже різні умови поширення, і це змінює те, що можна публікувати.
- LMArena публікує свій рейтинг як набір даних під CC-BY-4.0, що дозволяє поширення із зазначенням авторства — і який містить довірчі межі, на яких тримаються наведені вище ранги значущості. Це і є потрібний канал; збирання даних із самого сайту заборонено їхніми умовами.
- Artificial Analysis's free tier is "internal use only with attribution"; public redistribution requires a commercial licence, and their site terms separately limit use to personal and non-commercial purposes. So we do not publish their figures at all. Every general capability score on this site is LMArena Elo, used under CC BY 4.0 from the official dataset; the per-task scores are Design Arena’s, below. Artificial Analysis remains an internal cross-check, which is what its free tier permits; it reaches no page, export or API here.
- Умови API Design Arena дозволяють безкоштовно використовувати дані рейтингу, зокрема комерційно, за однієї умови: публічний показ зазначає Design Arena як джерело й посилається на designarena.ai. Elo за завданнями потрапляє на цей сайт через стрічку моделей OpenRouter; режим завдань, місця за завданнями на кожній сторінці моделі та ця сторінка зазначають джерело.
- Сама ціна — це факт, який публікує постачальник, і це не те саме, що зведена оцінка індексу. Ціни звіряються зі сторінками постачальників, і кожен рядок посилається на своє джерело.
11 · Виправлення
Ціни змінюються без попередження, а сторінки перебудовуються; частина того, що тут є, у будь-який момент виявиться хибною. Якщо ви знайшли помилку, найшвидше — вказати, яка модель, якою має бути величина і де вона опублікована: виправлення з первинним джерелом застосовуються напряму.
Каталог отримано востаннє 2026-10-06. Логіка ранжування версіонується разом із сайтом, тож зміна в тому, як обчислюється «найкращий», — це видимий diff, а не тихе переналаштування.