方法
这里的一切都可以从你自己就能核对的公开来源复现。数据单薄或来源互相矛盾的地方,本页会直说——一个只报好消息的信任页面,是广告。
1 · “最好”是什么意思
质量优先,价格用于打破并列。这个顺序就是整个产品:按最便宜排列的清单发布起来毫不费力,也几乎无用,因为这个市场上最便宜的模型比最贵的便宜 12,500×,而且通常干不了这活。
Capability comes from independent evaluators, never from us and never from the vendor. The general scores are LMArena Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.
为什么没有单一的质量分
Capability comes from independent evaluators, never from us and never from the vendor. The general scores are LMArena Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.
2 · 可以依赖的位次
位次列是显著性位次,不是行号。一个模型的位次,等于以超过两个误差范围之和的差距优于它的模型数加一。这个数相同的模型共享同一位次。彼此处于误差范围内的两个模型仍可能位次不同,因为每个模型都是与整个榜单比较。
与位次相关投影(标识符、分数、按工作负载的价格、前沿标记)的 SHA-256:06cd12db54e2968c3de49b45a3a2a6881f374f6e58a462437784450842efb989。日期与构建戳不计入。这里发生变化,意味着排名变了,而不是外观变了。
排行榜的顺序大部分是噪声
两个 Arena 分数只有在差距超过两个模型 95% 误差范围之和时,才算彼此分开。这个和在本榜单上平均为 10.47 分,这一检验至少和差值的 95% 区间一样严格。144 对相邻模型中有 136 对(94%)落在各自的和之内。若把每个模型的位次算作明显优于它的模型数加一,那么显示出的 145 个位置共有 72 个不同的位次,4 个模型并列第一。
所以“第 1 名的模型”并不是这些数据能支撑的说法。并列就按并列显示。 第 1 名是指本站读取的价格源所含模型中的第 1 名:当 LMArena 把一个不在该价格源中的模型排在它们全部之上时,榜单会写出该模型的名称,但不为其排名。
这个方法不是我们发明的。LMArena 多年来就是这样排名的——他们的 Rank (UB) 给每个模型的位次,是统计上优于它的模型数加一。他们也已经开源了实现。不寻常的是把它用在价格比较上,因为在价格比较里,动机恰恰是给出一个干脆的排序。
Applied to the general arena board only. Other boards carry their own error, which we do not have, so they are not given a borrowed threshold.
3 · “更好又更便宜”必须名副其实
在价格与能力上的帕累托占优,是一个宽得多的采购决策的二维投影,而这个投影错的时候比对的时候多。一个模型可以分数更高、花费更少,同时却不接受图像、把输出砍到一半的 token,或者少保留五十万 token 的上下文。
因此“既更好又更便宜”只保留给能力范围是原模型超集的替代品。在 133 条占优判定中,113 条是严格的,另有 20 条(15%)会指明你将放弃什么。若没有这道关卡,原始的二维判定中有 61% 推荐了干不了现有模型这份活的模型。
4 · 前沿,而不是价值分
如果没有其他模型同时做到分数不低于它、价格不高于它,并在两者之一上胜过它,这个模型就位于价值前沿。在已评分、有价格且为标准交付的模型中,有 12 个符合。其余 92% 的模型,每一个上方都有这样一个模型,但它不一定是同等条件下的替代品:上一节给出了其中需要放弃某些东西的数量。
为什么不按每元质量排名?
因为这个比值对便宜的奖励远比对质量陡峭。套用到本目录,它会让一个在约 63 上限中得 37.8 的模型登顶,并把得 14.2 的排到第二——这些模型谁都不该上线。任何按此计算并发布“价值”列的网站,都是在给出坏建议。我们改用前沿加上一条明确的质量下限。
5 · 价格是模型与工作负载共同的属性
并不存在某个模型“的”价格。摘要偏重输入,代码生成偏重输出,而智能体循环每一轮都会重放自己的上下文;同一份目录在每种情形下的排序都不同。与其挑一种配比再把它藏起来,我们把输入与输出之比、缓存命中率做成你看得见也改得动的控件。
若未公布缓存读取费率,混合成本估算将使用所选价格档位的完整输入费率。
| 工作负载 | 输出占比 | 缓存命中 | 形态 |
|---|---|---|---|
| 均衡 | 25% | 0% | 输入 3 token,输出 1 token |
| 摘要 | 5% | 30% | 超长输入,极短输出 |
| 对话 | 40% | 50% | 长系统提示词已缓存 |
| 代码生成 | 60% | 20% | 输出占主导 |
| 智能体 | 15% | 70% | 每轮重放上下文 |
有三件事经常让公布的费率失真,而三者都会显示在该行上:
- 上下文阶梯。51 个模型在提示长度越过阈值后改变费率,有些还不止一次——Qwen3.7 Flash 超过 32K 变为 3.33×,超过 256K 变为 6.67×。若按标价估算长上下文负载,你会差出一个倍数。
- 与输出分开计费的推理 token。推理 token 单独计费时,费用取决于实际计费数量和适用费率。请将这笔费用纳入估算。
- 按时段计价。已公布分时价格的模型数量:2。请核对时段、时区和费率,不要假定存在统一折扣。
6 · 我们发布哪个价格
分数是在模型自身的部署上测得的,因此旁边的价格是参考价格:按均衡配比计算,通过以下全部测试的最便宜报价。该报价的输入、输出和缓存读取价格一并发布,从不与其他报价混用。
- 在服务中。OpenRouter 标为未在服务的报价被排除。读取时显示为降级的报价,如果最近一天有至少 95% 的时间在服务,仍然计入。最近一天在服务时间不足 80% 的报价不计入,无论当前状态如何。
- 标准交付。flex、priority、fast 等层级是另一种产品,因此被排除。
- 标准价。促销中的报价按其标准价计入:每项价格除以(1 − 折扣)。促销价会被披露,但从不参与排名。
- 标准时段。按时段计价的价格以其标准费率计算;折扣时段会被披露。
- 达到制造商精度或更高。4 位报价(fp4、nvfp4、mxfp4、int4)只有在制造商自己以 4 位提供服务,或制造商未声明精度而其公开权重为 4 位时才计入。未声明精度的报价,来自制造商自己,或来自权重封闭模型的转售方时计入:转售方提供的是制造商的部署。对于权重开放或无人记录的模型,转售方未声明精度的报价被排除:从不被视为全精度。
当没有报价通过时,模型保留一个后备价格,标注为无同等条件报价的价格并注明原因,因为没有价格的模型会被看作不存在:在标准交付且在服务中的报价里,各按其标准价计,取未声明精度的转售方中最便宜的报价,没有时取最便宜的 4 位报价。只有在没有其他报价在服务时才使用其他交付层级。没有任何可取价报价的模型保留 OpenRouter 的模型级价格。
被规则排除的最便宜报价若更便宜,会在模型页面上显示为“当前更便宜”,并注明原因:促销及其百分比、4 位、交付层级,或精度未披露。它从不决定排名、前沿、结论或标题数字。如果决定价格的报价本身正在促销,则显示它自己的促销价。
在这批数据中,333 个模型有参考价格,15 个为无同等条件报价的价格,99 个为 OpenRouter 的模型级价格(其中包括 batch 和免费条目)。86 个模型当前有更便宜的报价,其中 11 个来自未声明精度的转售方。
在这条规则之前,这里的每个价格都是 OpenRouter 的模型级价格,任何卖家都可以设定,包括促销和 4 位版本。这一变更以 §96 记录在更正日志中,附有变更前后的数字。
7 · 以任务为条件的排名
单一的全局排序在智识上并不诚实,因为不同的活由不同的模型胜出。我们在 25 个类别上维护按任务的 Elo——前端、数据可视化、游戏开发、SVG、Android、幻灯片等等。选定一个任务后,整张榜单会按该任务的 Elo 重排,而不是按通用指数。
任务得分是 Design Arena 的分任务 Elo,读取自 OpenRouter 的模型数据:designarena.ai。
各类别的覆盖程度不同;某个模型若不在某类别的榜单上,会显示为该任务未测量,而不是在该任务上表现差。
8 · 同一个模型被卖两次时
有些模型并不是新模型。卖家自己就是这么说的:本目录中有 11 个条目被其自家厂商描述为以不同方式提供的另一个目录内模型——更快的通道、不同的推理模式、每次查询更多算力。这 11 个中有 10 个在任何 LMArena 榜单上都没有条目。它们的 11 个基础模型中有 11 个有。
| 售卖名称 | 该档价格 | 基础模型 | 卖家的说法 |
|---|---|---|---|
| o1-pro 无条目 | $600 ×10 | o1 1,365.8 | 每次查询更多算力 |
| o3 Pro 无条目 | $80 ×10 | o3 1,409.9 | 每次查询更多算力 |
| GPT-6 Astra Pro 无条目 | $50 ×1 | GPT-6 Astra 1,442.3 推理强度:最高 | 同一模型,不同服务模式 |
| GPT-5.6 Sol Pro 无条目 | $20 ×1 | GPT-5.6 Sol 1,456.3 推理强度:超高 | 同一模型,不同服务模式 |
| GPT-5.6 Terra Pro 无条目 | $12 ×1 | GPT-5.6 Terra 1,446.3 推理强度:超高 | 同一模型,不同服务模式 |
| GPT-6 Sol Pro 无条目 | $10 ×1 | GPT-6 Sol 1,395.4 推理强度:最高 | 同一模型,不同服务模式 |
| GPT-6.1 Sol Pro 无条目 | $10 ×1 | GPT-6.1 Sol 1,445.6 推理强度:最高 | 同一模型,不同服务模式 |
| o3 Mini High 1,336.6 | $4.4 ×1 | o3 Mini 1,319.4 | 同一模型,不同服务模式 |
| o4 Mini High 无条目 | $4.4 ×1 | o4 Mini 1,353.2 | 同一模型,不同服务模式 |
| GPT-5.6 Luna Pro 无条目 | $1.2 ×1 | GPT-5.6 Luna 1,431 推理强度:超高 | 同一模型,不同服务模式 |
| GPT-6 Luna Pro 无条目 | $0.5 ×1 | GPT-6 Luna 1,391.5 推理强度:最高 | 同一模型,不同服务模式 |
这一区分关系到你能得出什么结论。在卖家称能力完全相同的地方——11 个中有 0 个——基础模型的分数同样是卖家自己对该服务档的说法,你买到的唯一东西就是速度。在卖家称更多算力或不同模式的地方,除上文提到的那一个例外,没有任何已发布的测量能告诉你多花的钱换来了什么。
这里只计入卖家自己声明的内容。名称以“Pro”结尾、但其厂商称之为独立旗舰模型的模型,不计入此处,因为那将是我们的说法,而不是他们的——这与把厂商自家的服务档当作相互竞争的卖家是同一种错误,这种错误曾把 2× 的价差变成了公开发布的 7.2×。
在 LMArena 榜单上没有条目,并不是一种判定。它不是质量差的证据,也不意味着没人评估过这些模型——厂商会发布自己的结果。它意味着本站排名所依据的轴对它们没有读数,所以我们不对它们排名。
9 · 数据从哪里来
价格从一份可机读、跨多家供应商的目录中归一化而来,并与厂商价格页面互相核对。每个模型页面都链接其来源与获取日期。
- 冲突会被记录,而不是取平均。当两个来源在价格上不一致时,这种不一致本身就是发现。一个模型被厂商标为 $4/$20,通过聚合商却以 $2/$10 售出,它有两个真实价格,哪个适用取决于你在哪里购买。
- 不可信的数值会被隔离。上游用 −1 作为“请求时定价”的哨兵值,若原样放行就会变成每百万 −$750,000,并且在任何“最便宜优先”的排序中稳居第一。凡超出合理范围的都会被扣留,并附上理由。
- 可信度按字段标注。不是每行一个徽章。只核对了价格却声称整条记录已验证,正是那种一旦被人发现就会终结信任的夸大。
- 未评分不等于零。219 个模型没有独立评分。它们按价格列出,并排除在质量排序之外;绝不会像被测过又不及格那样被压到最底部。
10 · 许可,以及它带来的限制
本站所依赖的两个基准,再分发条款相差很大,这会改变什么可以公开。
- LMArena 以 CC-BY-4.0 数据集的形式发布其排行榜,允许在署名的前提下再分发——其中也带有上文显著性位次所依赖的置信界限。这就是应当使用的渠道;抓取网站本身则被其条款禁止。
- Artificial Analysis's free tier is "internal use only with attribution"; public redistribution requires a commercial licence, and their site terms separately limit use to personal and non-commercial purposes. So we do not publish their figures at all. Every general capability score on this site is LMArena Elo, used under CC BY 4.0 from the official dataset; the per-task scores are Design Arena’s, below. Artificial Analysis remains an internal cross-check, which is what its free tier permits; it reaches no page, export or API here.
- Design Arena 的 API 条款允许免费使用其排行榜数据,包括商业用途,条件只有一个:公开展示须注明 Design Arena 并链接到 designarena.ai。分任务 Elo 经由 OpenRouter 的模型数据进入本站;任务视图、每个模型页的分任务名次以及本页都注明了来源。
- 价格本身是厂商公布的事实,这与一个编纂出来的指数分数并不相同。价格与厂商页面互相核对,且每一行都链接其来源。
11 · 更正
价格会毫无预告地变动,页面也会被重排;此处的内容在任一时刻都会有一部分是错的。若你发现错误,最快的途径是说明是哪个模型、数字应当是多少、以及它公布在哪里——附有一手来源的更正会被直接采纳。
目录最近一次获取于 2026-10-06。排名逻辑与站点一同做版本管理,因此“最好”的计算方式若有变动,会是一处可见的差异,而不是一次悄无声息的重新调校。