---
title: "方法论 — “最好”如何判定，以及数据薄弱之处 · Undominated.ai"
canonical: https://undominated.ai/zh/methodology/
description: "本站如何为 364 个 AI 模型排名：前沿、按任务条件的 Elo、随负载变化的定价，以及对数据未覆盖之处的如实说明。"
---

# 方法论 — “最好”如何判定，以及数据薄弱之处 · Undominated.ai

> 本站如何为 364 个 AI 模型排名：前沿、按任务条件的 Elo、随负载变化的定价，以及对数据未覆盖之处的如实说明。

# 方法

这里的一切都可以从你自己就能核对的公开来源复现。数据单薄或来源互相矛盾的地方，本页会直说——一个只报好消息的信任页面，是广告。

 On this page [2 · 可以依赖的位次](#methodology-section-1)[8 · 同一个模型被卖两次时](#tiers)[9 · 数据从哪里来](#methodology-section-3)[10 · 许可，以及它带来的限制](#sources) 60% 的目录**没有独立的质量评分**。364 个模型中有 145 个已评分。其余照常列出、标注价格，并明确标记为未评分，绝不参与排名。
 72/145 所显示的名次中属于**真正不同的位次**的部分。相邻配对中有 94% 落在基准的误差范围内。
 67/364 标价**并非全部价格**的模型：上下文阶梯、单独计费的推理，或按时段计价。
 7/447 entries with variable prices withheld
 4/447 entries with suspect latency withheld; may overlap the price group

## 1 · “最好”是什么意思

质量优先，价格用于打破并列。这个顺序就是整个产品：按最便宜排列的清单发布起来毫不费力，也几乎无用，因为这个市场上最便宜的模型比最贵的便宜 12,500×，而且通常干不了这活。

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are **LMArena** Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

### 为什么没有单一的质量分

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are **LMArena** Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

## 2 · 可以依赖的位次

位次列是**显著性位次**，不是行号。一个模型的位次，等于以超过两个误差范围之和的差距优于它的模型数加一。这个数相同的模型共享同一位次。彼此处于误差范围内的两个模型仍可能位次不同，因为每个模型都是与整个榜单比较。

与位次相关投影（标识符、分数、按工作负载的价格、前沿标记）的 SHA-256： 06cd12db54e2968c3de49b45a3a2a6881f374f6e58a462437784450842efb989 。日期与构建戳不计入。这里发生变化，意味着排名变了，而不是外观变了。

[更正](/zh/corrections/)

### 排行榜的顺序大部分是噪声

两个 Arena 分数只有在差距超过两个模型 95% 误差范围之和时，才算彼此分开。这个和在本榜单上平均为 10.47 分，这一检验至少和差值的 95% 区间一样严格。**144 对相邻模型中有 136 对（94%）**落在各自的和之内。若把每个模型的位次算作明显优于它的模型数加一，那么显示出的 145 个位置共有 **72 个不同的位次**，4 个模型并列第一。

所以“第 1 名的模型”并不是这些数据能支撑的说法。并列就按并列显示。 第 1 名是指本站读取的价格源所含模型中的第 1 名：当 LMArena 把一个不在该价格源中的模型排在它们全部之上时，榜单会写出该模型的名称，但不为其排名。

这个方法不是我们发明的。LMArena 多年来就是这样排名的——他们的 [Rank (UB)](https://news.lmarena.ai/ranking-method/) 给每个模型的位次，是统计上优于它的模型数加一。他们也已经[开源了实现](https://github.com/lmarena/arena-rank)。不寻常的是把它用在*价格*比较上，因为在价格比较里，动机恰恰是给出一个干脆的排序。

Applied to the general arena board only. Other boards carry their own error, which we do not have, so they are not given a borrowed threshold.

## 3 · “更好又更便宜”必须名副其实

在价格与能力上的帕累托占优，是一个宽得多的采购决策的二维投影，而这个投影错的时候比对的时候多。一个模型可以分数更高、花费更少，同时却不接受图像、把输出砍到一半的 token，或者少保留五十万 token 的上下文。

因此**“既更好又更便宜”只保留给能力范围是原模型超集的替代品**。在 133 条占优判定中，113 条是严格的，另有 **20 条（15%）**会指明你将放弃什么。若没有这道关卡，原始的二维判定中有 61% 推荐了干不了现有模型这份活的模型。

## 4 · 前沿，而不是价值分

如果没有其他模型同时做到分数不低于它、价格不高于它，并在两者之一上胜过它，这个模型就位于**价值前沿**。在已评分、有价格且为标准交付的模型中，有 12 个符合。其余 92% 的模型，每一个上方都有这样一个模型，但它不一定是同等条件下的替代品：上一节给出了其中需要放弃某些东西的数量。

### 为什么不按每元质量排名？

因为这个比值对便宜的奖励远比对质量陡峭。套用到本目录，它会让一个在约 63 上限中得 37.8 的模型登顶，并把得 14.2 的排到第二——这些模型谁都不该上线。任何按此计算并发布“价值”列的网站，都是在给出坏建议。我们改用前沿加上一条明确的质量下限。

## 5 · 价格是模型 与 工作负载共同的属性

并不存在某个模型“的”价格。摘要偏重输入，代码生成偏重输出，而智能体循环每一轮都会重放自己的上下文；同一份目录在每种情形下的排序都不同。与其挑一种配比再把它藏起来，我们把输入与输出之比、缓存命中率做成你看得见也改得动的控件。

若未公布缓存读取费率，混合成本估算将使用所选价格档位的完整输入费率。

| 工作负载 | 输出占比 | 缓存命中 | 形态 |
| --- | --- | --- | --- |
| 均衡 | 输出占比 25% | 缓存命中 0% | 输入 3 token，输出 1 token |
| 摘要 | 输出占比 5% | 缓存命中 30% | 超长输入，极短输出 |
| 对话 | 输出占比 40% | 缓存命中 50% | 长系统提示词已缓存 |
| 代码生成 | 输出占比 60% | 缓存命中 20% | 输出占主导 |
| 智能体 | 输出占比 15% | 缓存命中 70% | 每轮重放上下文 |

有三件事经常让公布的费率失真，而三者都会显示在该行上：

 - **上下文阶梯。**51 个模型在提示长度越过阈值后改变费率，有些还不止一次——Qwen3.7 Flash 超过 32K 变为 3.33×，超过 256K 变为 6.67×。若按标价估算长上下文负载，你会差出一个倍数。
 - **与输出分开计费的推理 token。**推理 token 单独计费时，费用取决于实际计费数量和适用费率。请将这笔费用纳入估算。
 - **按时段计价。**已公布分时价格的模型数量：2。请核对时段、时区和费率，不要假定存在统一折扣。

## 6 · 我们发布哪个价格

分数是在模型自身的部署上测得的，因此旁边的价格是**参考价格**：按均衡配比计算，通过以下全部测试的最便宜报价。该报价的输入、输出和缓存读取价格一并发布，从不与其他报价混用。

 - **在服务中。**OpenRouter 标为未在服务的报价被排除。读取时显示为降级的报价，如果最近一天有至少 95% 的时间在服务，仍然计入。最近一天在服务时间不足 80% 的报价不计入，无论当前状态如何。
 - **标准交付。**flex、priority、fast 等层级是另一种产品，因此被排除。
 - **标准价。**促销中的报价按其标准价计入：每项价格除以（1 − 折扣）。促销价会被披露，但从不参与排名。
 - **标准时段。**按时段计价的价格以其标准费率计算；折扣时段会被披露。
 - **达到制造商精度或更高。**4 位报价（fp4、nvfp4、mxfp4、int4）只有在制造商自己以 4 位提供服务，或制造商未声明精度而其公开权重为 4 位时才计入。未声明精度的报价，来自制造商自己，或来自权重封闭模型的转售方时计入：转售方提供的是制造商的部署。对于权重开放或无人记录的模型，转售方未声明精度的报价被排除：从不被视为全精度。

当没有报价通过时，模型保留一个后备价格，标注为**无同等条件报价的价格**并注明原因，因为没有价格的模型会被看作不存在：在标准交付且在服务中的报价里，各按其标准价计，取未声明精度的转售方中最便宜的报价，没有时取最便宜的 4 位报价。只有在没有其他报价在服务时才使用其他交付层级。没有任何可取价报价的模型保留 OpenRouter 的模型级价格。

被规则排除的最便宜报价若更便宜，会在模型页面上显示为“当前更便宜”，并注明原因：促销及其百分比、4 位、交付层级，或精度未披露。它从不决定排名、前沿、结论或标题数字。如果决定价格的报价本身正在促销，则显示它自己的促销价。

在这批数据中，333 个模型有参考价格，15 个为无同等条件报价的价格，99 个为 OpenRouter 的模型级价格（其中包括 batch 和免费条目）。86 个模型当前有更便宜的报价，其中 11 个来自未声明精度的转售方。

在这条规则之前，这里的每个价格都是 OpenRouter 的模型级价格，任何卖家都可以设定，包括促销和 4 位版本。这一变更以 §96 记录在更正日志中，附有变更前后的数字。

## 7 · 以任务为条件的排名

单一的全局排序在智识上并不诚实，因为不同的活由不同的模型胜出。我们在 **25 个类别**上维护按任务的 Elo——前端、数据可视化、游戏开发、SVG、Android、幻灯片等等。选定一个任务后，整张榜单会按该任务的 Elo 重排，而不是按通用指数。

任务得分是 **Design Arena** 的分任务 Elo，读取自 OpenRouter 的模型数据：[designarena.ai](https://designarena.ai)。

各类别的覆盖程度不同；某个模型若不在某类别的榜单上，会显示为该任务未测量，而不是在该任务上表现差。

## 8 · 同一个模型被卖两次时

有些模型并不是新模型。卖家自己就是这么说的：**本目录中有 11 个条目**被其自家厂商描述为以不同方式提供的另一个目录内模型——更快的通道、不同的推理模式、每次查询更多算力。**这 11 个中有 10 个在任何 LMArena 榜单上都没有条目。它们的 11 个基础模型中有 11 个有。**

同一个模型被卖两次时

| 售卖名称 | 该档价格 | 基础模型 | 卖家的说法 |
| --- | --- | --- | --- |
| [o1-pro](/models/openai__o1-pro/) 无条目 | $600 ×10 | [o1](/models/openai__o1/) 1,365.8 | 每次查询更多算力 |
| [o3 Pro](/models/openai__o3-pro/) 无条目 | $80 ×10 | [o3](/models/openai__o3/) 1,409.9 | 每次查询更多算力 |
| [GPT-6 Astra Pro](/models/openai__gpt-6-astra-pro/) 无条目 | $50 ×1 | [GPT-6 Astra](/models/openai__gpt-6-astra/) 1,442.3 推理强度：最高 | 同一模型，不同服务模式 |
| [GPT-5.6 Sol Pro](/models/openai__gpt-5.6-sol-pro/) 无条目 | $20 ×1 | [GPT-5.6 Sol](/models/openai__gpt-5.6-sol/) 1,456.3 推理强度：超高 | 同一模型，不同服务模式 |
| [GPT-5.6 Terra Pro](/models/openai__gpt-5.6-terra-pro/) 无条目 | $12 ×1 | [GPT-5.6 Terra](/models/openai__gpt-5.6-terra/) 1,446.3 推理强度：超高 | 同一模型，不同服务模式 |
| [GPT-6 Sol Pro](/models/openai__gpt-6-sol-pro/) 无条目 | $10 ×1 | [GPT-6 Sol](/models/openai__gpt-6-sol/) 1,395.4 推理强度：最高 | 同一模型，不同服务模式 |
| [GPT-6.1 Sol Pro](/models/openai__gpt-6.1-sol-pro/) 无条目 | $10 ×1 | [GPT-6.1 Sol](/models/openai__gpt-6.1-sol/) 1,445.6 推理强度：最高 | 同一模型，不同服务模式 |
| [o3 Mini High](/models/openai__o3-mini-high/) 1,336.6 | $4.4 ×1 | [o3 Mini](/models/openai__o3-mini/) 1,319.4 | 同一模型，不同服务模式 |
| [o4 Mini High](/models/openai__o4-mini-high/) 无条目 | $4.4 ×1 | [o4 Mini](/models/openai__o4-mini/) 1,353.2 | 同一模型，不同服务模式 |
| [GPT-5.6 Luna Pro](/models/openai__gpt-5.6-luna-pro/) 无条目 | $1.2 ×1 | [GPT-5.6 Luna](/models/openai__gpt-5.6-luna/) 1,431 推理强度：超高 | 同一模型，不同服务模式 |
| [GPT-6 Luna Pro](/models/openai__gpt-6-luna-pro/) 无条目 | $0.5 ×1 | [GPT-6 Luna](/models/openai__gpt-6-luna/) 1,391.5 推理强度：最高 | 同一模型，不同服务模式 |

这一区分关系到你能得出什么结论。在卖家称*能力完全相同*的地方——11 个中有 0 个——基础模型的分数同样是卖家自己对该服务档的说法，你买到的唯一东西就是速度。在卖家称更多算力或不同模式的地方，除上文提到的那一个例外，没有任何已发布的测量能告诉你多花的钱换来了什么。

这里只计入卖家自己声明的内容。名称以“Pro”结尾、但其厂商称之为独立旗舰模型的模型，不计入此处，因为那将是我们的说法，而不是他们的——这与把厂商自家的服务档当作相互竞争的卖家是同一种错误，这种错误曾把 2× 的价差变成了公开发布的 7.2×。

在 LMArena 榜单上没有条目，并不是一种判定。它不是质量差的证据，也不意味着没人评估过这些模型——厂商会发布自己的结果。它意味着本站排名所依据的轴对它们没有读数，所以我们不对它们排名。

## 9 · 数据从哪里来

价格从一份可机读、跨多家供应商的目录中归一化而来，并与厂商价格页面互相核对。每个模型页面都链接其来源与获取日期。

 - **冲突会被记录，而不是取平均。**当两个来源在价格上不一致时，这种不一致本身就是发现。一个模型被厂商标为 $4/$20，通过聚合商却以 $2/$10 售出，它有两个真实价格，哪个适用取决于你在哪里购买。
 - **不可信的数值会被隔离。**上游用 −1 作为“请求时定价”的哨兵值，若原样放行就会变成每百万 −$750,000，并且在任何“最便宜优先”的排序中稳居第一。凡超出合理范围的都会被扣留，并附上理由。
 - **可信度按字段标注。**不是每行一个徽章。只核对了价格却声称整条记录已验证，正是那种一旦被人发现就会终结信任的夸大。
 - **未评分不等于零。**219 个模型没有独立评分。它们按价格列出，并排除在质量排序之外；绝不会像被测过又不及格那样被压到最底部。

## 10 · 许可，以及它带来的限制

本站所依赖的两个基准，再分发条款相差很大，这会改变什么可以公开。

 - **LMArena** 以 [CC-BY-4.0 数据集](https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset)的形式发布其排行榜，允许在署名的前提下再分发——其中也带有上文显著性位次所依赖的置信界限。这就是应当使用的渠道；抓取网站本身则被其条款禁止。
 - **Artificial Analysis**'s free tier is *"internal use only with attribution"*; public redistribution requires a commercial licence, and their site terms separately limit use to personal and non-commercial purposes. **So we do not publish their figures at all.** Every general capability score on this site is LMArena Elo, used under CC BY 4.0 from the official dataset; the per-task scores are Design Arena’s, below. Artificial Analysis remains an internal cross-check, which is what its free tier permits; it reaches no page, export or API here.
 - **Design Arena** 的 API 条款允许免费使用其排行榜数据，包括商业用途，条件只有一个：公开展示须注明 Design Arena 并链接到 [designarena.ai](https://designarena.ai)。分任务 Elo 经由 OpenRouter 的模型数据进入本站；任务视图、每个模型页的分任务名次以及本页都注明了来源。
 - **价格本身**是厂商公布的事实，这与一个编纂出来的指数分数并不相同。价格与厂商页面互相核对，且每一行都链接其来源。

## 11 · 更正

价格会毫无预告地变动，页面也会被重排；此处的内容在任一时刻都会有一部分是错的。若你发现错误，最快的途径是说明是哪个模型、数字应当是多少、以及它公布在哪里——附有一手来源的更正会被直接采纳。

[报告价格错误](/report/)

目录最近一次获取于 2026-10-06。排名逻辑与站点一同做版本管理，因此“最好”的计算方式若有变动，会是一处可见的差异，而不是一次悄无声息的重新调校。

## Continue your investigation

 - [Inspect measured uncertainty · English](/significance/)
- [Read source policy](/zh/independence/)
- [See recorded corrections](/zh/corrections/)
- [Reuse accepted data · English](/api/)
