---
title: "Методология — как решается, что «лучше», и где данные слабы · Undominated.ai"
canonical: https://undominated.ai/ru/methodology/
description: "Как этот сайт ранжирует 364 ИИ-моделей: граница, Elo, зависящий от задачи, цены с учётом нагрузки и честный отчёт о том, чего данные не покрывают."
---

# Методология — как решается, что «лучше», и где данные слабы · Undominated.ai

> Как этот сайт ранжирует 364 ИИ-моделей: граница, Elo, зависящий от задачи, цены с учётом нагрузки и честный отчёт о том, чего данные не покрывают.

# Методология

Всё здесь воспроизводимо из тех же открытых источников, которые вы можете проверить сами. Там, где данных мало или источники расходятся, эта страница так и говорит: страница о доверии, сообщающая только хорошие новости, — это реклама.

 On this page [2 · Ранги, на которые можно опереться](#methodology-section-1)[8 · Когда одну и ту же модель продают дважды](#tiers)[9 · Откуда берутся данные](#methodology-section-3)[10 · Лицензии и то, что они ограничивают](#sources) 60% каталога **не имеет независимой оценки качества**. Оценено 145 моделей из 364. Остальные перечислены, с ценой и чёткой пометкой «без оценки», и никогда не ранжируются.
 72/145 показанных позиций, которые являются **действительно различными рангами**. 94% соседних пар попадают в пределы погрешности бенчмарка.
 67/364 моделей, у которых заявленная цена **не является полной ценой**: ступени по контексту, отдельно тарифицируемое рассуждение или ставки в зависимости от времени суток.
 7/447 entries with variable prices withheld
 4/447 entries with suspect latency withheld; may overlap the price group

## 1 · Что значит «лучший»

Ведёт качество, цена разрешает ничью. Этот порядок и есть весь продукт: список «сначала самое дешёвое» публикуется тривиально и почти бесполезен, потому что самая дешёвая модель на этом рынке в 12 500× дешевле самой дорогой и, как правило, не справляется с работой.

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are **LMArena** Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

### Почему нет единой оценки качества

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are **LMArena** Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

## 2 · Ранги, на которые можно опереться

Колонка ранга — это **ранг значимости**, а не номер строки. Ранг модели на единицу больше числа моделей, которые превосходят её больше чем на сумму обеих погрешностей. Модели, у которых это число одинаково, делят ранг. Две модели в пределах погрешности друг друга всё равно могут иметь разные ранги, потому что каждая сравнивается со всей таблицей.

SHA-256 значимой для ранга проекции (идентификаторы, оценки, цены по нагрузке, признак границы): 06cd12db54e2968c3de49b45a3a2a6881f374f6e58a462437784450842efb989 . Даты и метки сборки исключены. Изменение здесь — это изменение в ранжировании, а не в оформлении.

[Исправления](/ru/corrections/)

### Большая часть порядка в рейтинге — это шум

Две оценки Arena считаются разделёнными, только если они различаются больше, чем на сумму 95-процентных погрешностей обеих моделей. Среднее этой суммы по таблице, в пунктах: 10,47. Такой тест не мягче 95-процентного интервала для разности. Соседние пары в пределах своей суммы: **136 из 144 (94%)**. Если ранг модели равен единице плюс число моделей, которые явно её превосходят, то число различных рангов среди показанных позиций (145): **72**. Моделей, делящих первое место: 4.

«Модель номер 1» — следовательно, не то утверждение, которое эти данные выдерживают. Ничьи показаны как ничьи. Ранг 1 — это ранг 1 среди моделей из ленты цен, которую читает этот сайт: если LMArena ставит выше их всех модель, которой в этой ленте нет, таблица называет эту модель и не присваивает ей ранг.

Этот метод не наш. LMArena ранжирует так уже годы: их [Rank (UB)](https://news.lmarena.ai/ranking-method/) присваивает каждой модели ранг на единицу больше числа моделей, статистически лучших, чем она, и они [открыли исходный код реализации](https://github.com/lmarena/arena-rank). Необычно применять это к сравнению *цен*, где стимул как раз в том, чтобы опубликовать чёткий порядок.

Applied to the general arena board only. Other boards carry their own error, which we do not have, so they are not given a borrowed threshold.

## 3 · «Лучше и дешевле» должно что-то значить

Доминирование по Парето по цене и способностям — это двумерная проекция куда более широкого решения о покупке, и эта проекция чаще лжёт, чем нет. Модель может набирать больше и стоить меньше, при этом не принимая изображения, урезая вывод вдвое по токенам или удерживая на полмиллиона токенов меньше контекста.

Поэтому **«одновременно лучше и дешевле» отведено для замены, чья оболочка возможностей является надмножеством** исходной. Из 133 вердиктов о доминировании 113 строгие, а **20 (15%)** вместо этого называют, чем придётся поступиться. Без этого фильтра 61% сырых двухосевых вердиктов рекомендовал модель, не способную выполнять работу действующей.

## 4 · Граница, а не оценка ценности

Модель находится на **границе ценности**, когда нет другой модели, которая набирает не меньше, стоит не больше и выигрывает по одной из двух осей. Этому отвечают 12 оценённых моделей с ценой и стандартной поставкой. У каждой из остальных 92% есть такая модель выше неё, хотя это не всегда эквивалентная замена: в разделе выше подсчитано, в скольких случаях приходится чем-то поступиться.

### Почему не ранжировать по качеству на доллар?

Потому что такое отношение вознаграждает дешевизну гораздо круче, чем качество. Применённое к этому каталогу, оно венчает модель с оценкой 37,8 при потолке около 63 и ставит на второе место модель с оценкой 14,2 — модели, которые никому не следует запускать в работу. Любой сайт, публикующий так рассчитанный столбец «ценности», даёт плохой совет. Мы вместо этого используем границу плюс явный порог качества.

## 5 · Цена — это свойство модели и нагрузки

Не существует «той самой» цены модели. Суммаризация интенсивна по входу, генерация кода — по выходу, а агентный цикл заново проигрывает свой контекст на каждом шаге; один и тот же каталог упорядочивается по-разному в каждом случае. Вместо того чтобы выбрать одну смесь и спрятать её, соотношение вход:выход и доля попаданий в кэш — это видимые органы управления, которые вы можете изменить.

Если тариф чтения из кеша не опубликован, смешанная оценка стоимости использует полную цену входных токенов выбранной ценовой ступени.

| Нагрузка | Доля вывода | Попадания в кэш | Форма |
| --- | --- | --- | --- |
| Сбалансированная | Доля вывода 25% | Попадания в кэш 0% | 3 токена на входе на 1 на выходе |
| Сжатие | Доля вывода 5% | Попадания в кэш 30% | Огромный вход, крошечный выход |
| Чат | Доля вывода 40% | Попадания в кэш 50% | Длинный кэшированный системный промпт |
| Генерация кода | Доля вывода 60% | Попадания в кэш 20% | Преобладает вывод |
| Агентная | Доля вывода 15% | Попадания в кэш 70% | Контекст переотправляется каждый ход |

Три вещи регулярно делают заявленную ставку неверной, и все три показаны в строке:

 - **Ступени по контексту.** 51 моделей меняют ставку после порога длины запроса, некоторые — не один раз: Qwen3.7 Flash переходит на 3,33× свыше 32K и на 6,67× свыше 256K. Посчитаете длинноконтекстную нагрузку по заявленной цене — ошибётесь в разы.
 - **Токены рассуждения, тарифицируемые отдельно от вывода.** При отдельной оплате токенов рассуждения стоимость зависит от количества оплачиваемых токенов и применяемого тарифа. Включите эту сумму в оценку затрат.
 - **Цены в зависимости от времени суток.** Число моделей с опубликованным расписанием цен: 2. Проверьте интервал, часовой пояс и тарифы; не рассчитывайте на единый размер скидки.

## 6 · Какую цену мы публикуем

Оценка измеряется на собственном развёртывании модели, поэтому цена рядом с ней — **опорная цена**: самое дешёвое предложение по сбалансированной смеси, которое проходит все проверки ниже. Ставки этого предложения за ввод, вывод и чтение кэша публикуются вместе и никогда не смешиваются со ставками другого предложения.

 - **Работает.** Предложение, которое OpenRouter отмечает как неработающее, исключается. Предложение, которое в момент чтения отмечено как ухудшенное, всё равно учитывается, если за последние сутки оно работало не менее 95% времени. Предложение, которое за последние сутки работало менее 80% времени, не учитывается, каким бы ни был его статус сейчас.
 - **Стандартная доставка.** Flex, priority, fast и подобные уровни — другой продукт, и они исключаются.
 - **Стандартный тариф.** Предложение с акцией учитывается по стандартному тарифу: каждая ставка делится на единицу минус скидка. Акционная цена раскрывается, но никогда не участвует в рейтинге.
 - **Стандартное окно.** Цена, зависящая от времени суток, считается по стандартной ставке; часы скидки раскрываются.
 - **Точность производителя или выше.** 4-битное предложение (fp4, nvfp4, mxfp4, int4) учитывается, только если сам производитель обслуживает в 4 битах или, когда производитель не указывает точность, его опубликованные веса 4-битные. Предложение без указанной точности учитывается, если это предложение самого производителя или перепродавца модели с закрытыми весами: он обслуживает развёртывание производителя. Для открытых весов или весов, о которых нет записи, предложение перепродавца без указанной точности исключается: оно никогда не считается полной точностью.

Если ни одно предложение не проходит, модель сохраняет запасную цену с меткой **цена без равноценного предложения** и причиной, потому что модель без цены выглядела бы отсутствующей: среди работающих предложений со стандартной доставкой, каждое по стандартному тарифу, самое дешёвое от перепродавца, который не указывает точность, а если такого нет, самое дешёвое 4-битное. Другой уровень доставки используется, только если больше ничего не работает. Модель без предложения, из которого можно взять цену, сохраняет цену модели в OpenRouter.

Самое дешёвое предложение, исключённое правилом, если оно дешевле, показывается на странице модели как «Сейчас дешевле» с причиной: акция и её процент, 4 бита, уровень доставки или нераскрытая точность. Оно никогда не определяет место, границу, вердикт или главную цифру. Если предложение, которое задаёт цену, само участвует в акции, показывается его собственная акционная цена.

В этих данных у 333 моделей опорная цена, у 15 — цена без равноценного предложения, а у 99 — цена модели в OpenRouter, среди них записи batch и бесплатные. 86 показывают сейчас более дешёвое предложение, из них 11 — от перепродавца, который не указывает точность.

До этого правила каждая цена здесь была ценой модели в OpenRouter, которую может задать любой продавец, включая акции и 4-битные копии. Изменение записано как §96 в журнале исправлений вместе с цифрами до и после.

## 7 · Ранжирование с учётом задачи

Единый глобальный порядок интеллектуально нечестен, потому что разные работы выигрывают разные модели. Мы ведём Эло по задачам в **25 категориях**: фронтенд, визуализация данных, разработка игр, SVG, Android, презентации и другие. Выбор задачи переупорядочивает всю таблицу по Эло этой задачи, а не по общему индексу.

Оценки по задачам — это Elo по каждой задаче от **Design Arena**, взятые из ленты моделей OpenRouter: [designarena.ai](https://designarena.ai).

Покрытие различается по категориям, и модель, отсутствующая в рейтинге категории, показана как неизмеренная по этой задаче, а не как плохая в ней.

## 8 · Когда одну и ту же модель продают дважды

Некоторые модели — не новые модели. Так говорит сам продавец: **11 позиций в этом каталоге** их собственный поставщик описывает как другую модель каталога, предоставляемую иначе, — более быстрый канал, другой режим рассуждения, больше вычислений на запрос. **У 10 из 11 нет записи ни в одном рейтинге LMArena. Из их 11 базовых моделей запись есть у 11.**

Когда одну и ту же модель продают дважды

| Продаётся как | Цена уровня | Базовая модель | Что говорит продавец |
| --- | --- | --- | --- |
| [o1-pro](/models/openai__o1-pro/) нет записи | $600 ×10 | [o1](/models/openai__o1/) 1 365,8 | больше вычислений на запрос |
| [o3 Pro](/models/openai__o3-pro/) нет записи | $80 ×10 | [o3](/models/openai__o3/) 1 409,9 | больше вычислений на запрос |
| [GPT-6 Astra Pro](/models/openai__gpt-6-astra-pro/) нет записи | $50 ×1 | [GPT-6 Astra](/models/openai__gpt-6-astra/) 1 442,3 усилие при замере: максимальное | та же модель, другой режим обслуживания |
| [GPT-5.6 Sol Pro](/models/openai__gpt-5.6-sol-pro/) нет записи | $20 ×1 | [GPT-5.6 Sol](/models/openai__gpt-5.6-sol/) 1 456,3 усилие при замере: очень высокое | та же модель, другой режим обслуживания |
| [GPT-5.6 Terra Pro](/models/openai__gpt-5.6-terra-pro/) нет записи | $12 ×1 | [GPT-5.6 Terra](/models/openai__gpt-5.6-terra/) 1 446,3 усилие при замере: очень высокое | та же модель, другой режим обслуживания |
| [GPT-6 Sol Pro](/models/openai__gpt-6-sol-pro/) нет записи | $10 ×1 | [GPT-6 Sol](/models/openai__gpt-6-sol/) 1 395,4 усилие при замере: максимальное | та же модель, другой режим обслуживания |
| [GPT-6.1 Sol Pro](/models/openai__gpt-6.1-sol-pro/) нет записи | $10 ×1 | [GPT-6.1 Sol](/models/openai__gpt-6.1-sol/) 1 445,6 усилие при замере: максимальное | та же модель, другой режим обслуживания |
| [o3 Mini High](/models/openai__o3-mini-high/) 1 336,6 | $4,4 ×1 | [o3 Mini](/models/openai__o3-mini/) 1 319,4 | та же модель, другой режим обслуживания |
| [o4 Mini High](/models/openai__o4-mini-high/) нет записи | $4,4 ×1 | [o4 Mini](/models/openai__o4-mini/) 1 353,2 | та же модель, другой режим обслуживания |
| [GPT-5.6 Luna Pro](/models/openai__gpt-5.6-luna-pro/) нет записи | $1,2 ×1 | [GPT-5.6 Luna](/models/openai__gpt-5.6-luna/) 1 431 усилие при замере: очень высокое | та же модель, другой режим обслуживания |
| [GPT-6 Luna Pro](/models/openai__gpt-6-luna-pro/) нет записи | $0,5 ×1 | [GPT-6 Luna](/models/openai__gpt-6-luna/) 1 391,5 усилие при замере: максимальное | та же модель, другой режим обслуживания |

Это различие важно для того, какие выводы можно сделать. Там, где продавец говорит об *идентичных возможностях* — 0 из 11, — оценка базовой модели является и собственным утверждением продавца об уровне, а покупаете вы только скорость. Там, где продавец говорит о большем объёме вычислений или другом режиме, ни одно опубликованное измерение не говорит, что даёт дополнительная трата, за единственным исключением, указанным выше.

Здесь учитывается только то, что заявляет продавец. Модель, название которой оканчивается на «Pro», но которую её поставщик называет самостоятельной флагманской моделью, здесь не учитывается, потому что это было бы нашим утверждением, а не их, — та же ошибка, что и считать собственные уровни обслуживания поставщика конкурирующими продавцами; однажды она превратила разброс цен 2× в опубликованные 7,2×.

Отсутствие записи в рейтинге LMArena — не вердикт. Это не свидетельство низкого качества и не значит, что их никто не оценивал: поставщики публикуют собственные результаты. Это значит, что у оси, по которой ранжирует этот сайт, нет для них замера, поэтому мы их не ранжируем.

## 9 · Откуда берутся данные

Цены нормализуются из машиночитаемого каталога по многим поставщикам и сверяются со страницами цен поставщиков. Каждая страница модели ссылается на свой источник и дату получения.

 - **Конфликты фиксируются, а не усредняются.** Когда два источника расходятся в цене, это расхождение и есть результат. Модель, указанная поставщиком по $4/$20 и продаваемая через агрегатор по $2/$10, имеет две истинные цены, и какая из них применима — зависит от того, где вы покупаете.
 - **Неправдоподобные значения помещаются в карантин.** Исходное сторожевое значение −1 для «цена определяется в момент запроса» при бездумной передаче превращается в −$750 000 за миллион и выигрывает любую сортировку «сначала дешёвые». Всё, что выходит за правдоподобный диапазон, удерживается с приложенной причиной.
 - **Уверенность — по каждому полю.** Не один значок на строку. Утверждать, что запись проверена, когда проверена только её цена, — это то преувеличение, которое кончает с доверием при первом же обнаружении.
 - **Без оценки — не ноль.** У 219 моделей нет независимой оценки. Они перечислены по цене и исключены из упорядочивания по качеству; их никогда не отправляют вниз так, будто их измерили и они провалились.

## 10 · Лицензии и то, что они ограничивают

У двух бенчмарков, на которые опирается этот сайт, очень разные условия распространения, и это меняет то, что можно публиковать.

 - **LMArena** публикует свой рейтинг как [набор данных под CC-BY-4.0](https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset), что допускает распространение с указанием авторства — и который содержит доверительные границы, на которых держатся приведённые выше ранги значимости. Это и есть нужный канал; сбор данных с самого сайта запрещён их условиями.
 - **Artificial Analysis**'s free tier is *"internal use only with attribution"*; public redistribution requires a commercial licence, and their site terms separately limit use to personal and non-commercial purposes. **So we do not publish their figures at all.** Every general capability score on this site is LMArena Elo, used under CC BY 4.0 from the official dataset; the per-task scores are Design Arena’s, below. Artificial Analysis remains an internal cross-check, which is what its free tier permits; it reaches no page, export or API here.
 - Условия API **Design Arena** разрешают бесплатно использовать данные рейтинга, в том числе в коммерческих целях, при одном условии: публичный показ указывает Design Arena как источник и ссылается на [designarena.ai](https://designarena.ai). Elo по задачам попадает на этот сайт через ленту моделей OpenRouter; режим задач, места по задачам на каждой странице модели и эта страница указывают источник.
 - **Сама цена** — это факт, публикуемый поставщиком, и это не то же самое, что сводная оценка индекса. Цены сверяются со страницами поставщиков, и каждая строка ссылается на свой источник.

## 11 · Исправления

Цены меняются без предупреждения, а страницы переверстываются; часть того, что здесь есть, в любой момент окажется неверной. Если вы нашли ошибку, быстрее всего указать, какая модель, какой должна быть величина и где она опубликована: исправления с первичным источником применяются напрямую.

[Сообщить о неверной цене](/report/)

Каталог получен в последний раз 2026-10-06. Логика ранжирования версионируется вместе с сайтом, так что изменение в том, как вычисляется «лучший», — это видимый diff, а не тихая перенастройка.

## Continue your investigation

 - [Inspect measured uncertainty · English](/significance/)
- [Read source policy](/ru/independence/)
- [See recorded corrections](/ru/corrections/)
- [Reuse accepted data · English](/api/)
