方法論

ここにあるものはすべて、あなた自身が確認できる同じ公開情報から再現できます。データが薄いところ、出典どうしが食い違うところでは、このページはそう書きます。良い知らせしか載せない信頼のページは、広告です。

60% のカタログには独立した品質スコアがありません。364 件中 145 件が評価済みです。残りは掲載し、価格を示し、未評価とはっきり明記します。順位付けは決して行いません。
72/145 表示位置のうち本当に異なる順位であるもの。隣り合う組の 94% はベンチマークの誤差の範囲に収まります。
67/364 表示価格が価格のすべてではないモデル。文脈長による段階、別建てで課金される推論、時間帯別の料金などがあります。
7/447 entries with variable prices withheld
4/447 entries with suspect latency withheld; may overlap the price group

1 · 「最良」の意味

品質が先、価格は同着を分けます。この順序こそが製品のすべてです。安い順に並べた一覧は公開するのが容易で、ほとんど役に立ちません。この市場で最も安いモデルは最も高いものより 12,500× 安く、たいていその仕事をこなせないからです。

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are LMArena Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

単一の品質スコアを置かない理由

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are LMArena Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

2 · 頼れる順位

順位の列は有意差順位であり、行番号ではありません。モデルの順位は、両方の誤差範囲の合計を超える差でそのモデルを上回るモデルの数に 1 を足したものです。この数が同じモデルは同じ順位を共有します。互いの誤差範囲内にある二つのモデルでも、それぞれがボード全体と比較されるため、異なる順位になることがあります。

順位に関わる射影(識別子、スコア、ワークロード別価格、フロンティア判定)の SHA-256:06cd12db54e2968c3de49b45a3a2a6881f374f6e58a462437784450842efb989。日付やビルド情報は含めません。ここが変われば順位付けが変わったということであり、見た目の変更ではありません。

訂正

順位表の並びの大半は雑音です

Arena の二つのスコアが分かれているとみなされるのは、差が両モデルの 95% 誤差範囲の合計を超えるときだけです。この合計はこのボードで平均 10.47 ポイントで、この検定は差に対する 95% 区間と少なくとも同じくらい厳格です。隣り合う 144 組のうち 136 組(94%)は、それぞれの合計の範囲内に入ります。各モデルの順位を、そのモデルを明確に上回るモデルの数に 1 を足したものとして数えると、表示されている 145 個の位置には 72 個の異なる順位があります。1 位を分け合うモデルの数は 4 です。

したがって「第 1 位のモデル」は、このデータが支えられる主張ではありません。同着は同着として示します。 1 位とは、このサイトが読み込む価格フィードにあるモデルの中での 1 位です。フィードにないモデルを LMArena がそのすべてより上位としている場合、ボードはそのモデルの名前を示し、順位は付けません。

この方法は当方の考案ではありません。LMArena は何年も前からこの方式で順位を付けています。Rank (UB) は各モデルに、統計的にそれより優れたモデルの数に 1 を足した順位を与え、実装も公開されています。珍しいのは、これを価格比較に適用することです。価格比較では、はっきりした順位を出す誘因が働くからです。

Applied to the general arena board only. Other boards carry their own error, which we do not have, so they are not given a borrowed threshold.

3 · 「より高性能かつ安価」は言葉どおりでなければならない

価格と能力によるパレート優越は、はるかに広い購買判断を二次元に射影したものであり、その射影はしばしば実態を裏切ります。あるモデルはスコアが高く費用も低い一方で、画像を受け付けない、出力を半分のトークンで打ち切る、文脈を 50 万トークン分少なくしか保持しない、ということがあり得ます。

そこで「より高性能かつ安価」は、能力の範囲が元のモデルの上位集合である置き換えに限って用います。133 件の優越判定のうち 113 件が厳密で、20 件(15%)は代わりに何を手放すことになるかを明示します。この関門がなければ、素の二軸判定の 61% が、現行モデルの仕事をこなせないモデルを勧めていました。

4 · 価値スコアではなく、フロンティア

スコアがそれ以上で、費用がそれ以下で、しかも二つのうち一方で上回る、という別のモデルが存在しないとき、そのモデルは価値フロンティア上にあります。評価済み・価格あり・標準提供のモデルのうち 12 件が該当します。残りの 92% には、いずれもそうしたモデルが上にありますが、常に同条件の置き換えになるとは限りません。何かを手放すことになるものは、上のセクションで数えています。

なぜ「1 ドルあたりの品質」で並べないのか

その比は、品質よりも安さをはるかに急勾配で報いるからです。このカタログに当てはめると、上限およそ 63 のうち 37.8 のモデルが首位となり、14.2 のモデルが 2 位に来ます。どちらも本番に載せるべきではありません。そのように計算した「価値」列を公開しているサイトは、悪い助言をしています。当方は代わりに、フロンティアと明示的な品質下限を用います。

5 · 価格はモデルとワークロードの両方の性質です

モデルに「その」価格というものはありません。要約は入力が重く、コード生成は出力が重く、エージェントのループは毎ターン文脈を再送します。同じカタログでも、それぞれで並びが変わります。ひとつの配合を選んで隠すのではなく、入力と出力の比とキャッシュ命中率を、見えて変えられる操作子として置いています。

キャッシュ読み取り料金が未公表の場合、混合コストの見積もりには選択された価格帯の通常入力料金を使用します。

ワークロード出力の割合キャッシュ命中形
均衡 25% 0%入力3に対し出力1
要約 5% 30%巨大な入力、わずかな出力
チャット 40% 50%長いキャッシュ済みシステムプロンプト
コード生成 60% 20%出力が大半を占める
エージェント 15% 70%ターンごとにコンテキストを再送

表示料金が実態と食い違う原因は主に三つあり、いずれも行の上に示しています。

  • 文脈長による段階。51 件のモデルはプロンプト長のしきい値を超えると料金が変わり、複数回変わるものもあります。Qwen3.7 Flash は 32K 超で 3.33×、256K 超で 6.67× になります。長文脈のワークロードを表示価格で見積もれば、倍率単位で外します。
  • 出力とは別に課金される推論トークン。推論トークンが別途課金される場合、費用は請求対象のトークン数と単価によって決まります。この費用を見積もりに含めてください。
  • 時間帯別の価格。公表された時間帯別料金があるモデル数: 2。対象の時間帯・タイムゾーン・料金を確認し、一律の割引を前提にしないでください。

6 · 公開する価格

スコアはモデル自身のデプロイで測定されるため、その横の価格は基準価格です。バランス配合で、以下のすべてのテストを満たす最も安い提供です。その提供の入力・出力・キャッシュ読み取りの料金はまとめて公開し、別の提供の料金と混ぜることはありません。

  1. 提供中。OpenRouter が提供停止と示す提供は除外します。読み取りの瞬間に劣化と示されていても、直近 1 日の 95% 以上で提供されていた提供は数えます。直近 1 日の提供が 80% 未満の提供は、現在の表示にかかわらず数えません。
  2. 標準配信。flex、priority、fast などのティアは別の商品なので除外します。
  3. 標準料金。プロモーション中の提供は標準料金で数えます。各料金を(1 − 割引率)で割った値です。プロモーション価格は開示しますが、順位には使いません。
  4. 標準時間帯。時間帯で変わる価格は標準料金で数え、割引時間は開示します。
  5. メーカーの精度以上。4 ビットの提供(fp4、nvfp4、mxfp4、int4)は、メーカー自身が 4 ビットで提供している場合、またはメーカーが精度を開示しておらず公開された重みが 4 ビットの場合にのみ数えます。精度を開示しない提供は、メーカー自身のもの、または重みが非公開のモデルの再販業者のものを数えます。再販業者はメーカーのデプロイを提供するからです。重みが公開されている、または記録のないモデルでは、精度を開示しない再販業者の提供は除外します。フル精度とはみなしません。

どの提供もテストを満たさない場合、モデルは代替の価格を持ち、理由とともに同等条件の提供がない価格と表示します。価格のないモデルは存在しないように見えるからです。標準配信で提供中の提供を標準料金で比べ、精度を開示しない再販業者の最も安い提供、それがなければ最も安い 4 ビットの提供を使います。ほかの配信ティアは、ほかに提供中のものがない場合にのみ使います。価格を取れる提供がないモデルは、OpenRouter のモデル単位の価格のままです。

ルールで除外された提供のうち最も安いものが基準価格より安い場合、モデルページに「現在より安い提供」として理由とともに表示します。理由はプロモーションとその割合、4 ビット、配信ティア、または精度非開示です。順位、フロンティア、判定、見出しの数値には使いません。価格を決める提供自体がプロモーション中の場合は、その提供のプロモーション価格を表示します。

このデータでは、333 モデルが基準価格、15 モデルが同等条件の提供がない価格、99 モデルが OpenRouter のモデル単位の価格(batch と無料の掲載を含む)です。86 モデルで現在より安い提供があり、そのうち 11 は精度を開示しない再販業者の提供です。

このルール以前は、ここの価格はすべて OpenRouter のモデル単位の価格で、どの販売者でも設定でき、プロモーションや 4 ビット版も含まれていました。この変更は訂正ログの §96 に、変更前後の数値とともに記録されています。

7 · タスク条件付きの順位付け

単一の全体順序は知的に不誠実です。仕事が違えば勝つモデルも違うからです。当方は 25 カテゴリにわたってタスク別 Elo を保持しています。フロントエンド、データ可視化、ゲーム開発、SVG、Android、スライドなどです。タスクを選ぶと、一般的な指標ではなくそのタスクの Elo で盤面全体が並べ替わります。

タスク別スコアは Design Arena のタスク別 Elo で、OpenRouter のモデルフィードから読み取っています:designarena.ai。

網羅状況はカテゴリごとに異なります。あるカテゴリの順位表に載っていないモデルは、そのタスクが不得手なのではなく、未測定として示します。

8 · 同じモデルが二度売られるとき

新しいモデルではないモデルもあります。販売元自身がそう述べています。このカタログの 11 件の項目は、その提供元自身によって、このカタログにある別のモデルを異なる形で提供したものだと説明されています。より高速なレーン、異なる推論モード、クエリあたりのより多くの計算量といったものです。11 件のうち 10 件は、どの LMArena リーダーボードにも掲載がありません。それらのベースモデル 11 件のうち 11 件には掲載があります。

同じモデルが二度売られるとき
販売名提供枠の価格ベースモデル販売元の説明
o1-pro 掲載なし$600 ×10o1 1,365.8 クエリあたりの計算量が多い
o3 Pro 掲載なし$80 ×10o3 1,409.9 クエリあたりの計算量が多い
GPT-6 Astra Pro 掲載なし$50 ×1GPT-6 Astra 1,442.3 推論の強さ:最大同じモデル、異なる提供モード
GPT-5.6 Sol Pro 掲載なし$20 ×1GPT-5.6 Sol 1,456.3 推論の強さ:超高同じモデル、異なる提供モード
GPT-5.6 Terra Pro 掲載なし$12 ×1GPT-5.6 Terra 1,446.3 推論の強さ:超高同じモデル、異なる提供モード
GPT-6 Sol Pro 掲載なし$10 ×1GPT-6 Sol 1,395.4 推論の強さ:最大同じモデル、異なる提供モード
GPT-6.1 Sol Pro 掲載なし$10 ×1GPT-6.1 Sol 1,445.6 推論の強さ:最大同じモデル、異なる提供モード
o3 Mini High 1,336.6 $4.4 ×1o3 Mini 1,319.4 同じモデル、異なる提供モード
o4 Mini High 掲載なし$4.4 ×1o4 Mini 1,353.2 同じモデル、異なる提供モード
GPT-5.6 Luna Pro 掲載なし$1.2 ×1GPT-5.6 Luna 1,431 推論の強さ:超高同じモデル、異なる提供モード
GPT-6 Luna Pro 掲載なし$0.5 ×1GPT-6 Luna 1,391.5 推論の強さ:最大同じモデル、異なる提供モード

この区別は、何を結論づけられるかを左右します。販売元が同一の能力と述べている場合(11 件中 0 件)、ベースモデルのスコアはその提供枠についての販売元自身の主張でもあり、買っているのは速度だけです。販売元が計算量の増加や異なるモードを挙げている場合、上で触れた一つの例外を除いて、追加の支出で何が得られるかを示す公表済みの測定はありません。

ここで数えるのは、販売元が明言していることだけです。名前が「Pro」で終わっていても、提供元がそれ自体で独立したフラッグシップモデルと呼んでいるモデルは、ここでは数えません。そうすれば、それは販売元ではなく当サイトの主張になってしまうからです。これは、提供元自身の提供枠を競合する販売元として扱うのと同じ誤りであり、その誤りのせいで、かつて 2× の価格差が 7.2× として公開されました。

LMArena のリーダーボードに掲載がないことは、判定ではありません。品質が低いことの証拠ではなく、誰もこれらを評価していないという意味でもありません。提供元は独自の結果を公表しています。意味するのは、このサイトが順位付けに用いる軸にそれらの測定値がない、ということです。だから順位を付けません。

9 · データの出どころ

価格は、機械可読で複数の提供元にまたがるカタログから正規化し、各社の価格ページと突き合わせています。各モデルページには出典と取得日へのリンクがあります。

  • 食い違いは記録するのであって、平均しません。二つの出典が価格で食い違うとき、その食い違い自体が知見です。提供元が $4/$20 と示し、アグリゲーター経由では $2/$10 で売られているモデルには、真の価格が二つあります。どちらが当てはまるかは、どこで買うかによります。
  • ありえない値は隔離します。「リクエスト時に価格決定」を表す上流の番兵値 −1 を素通しすると、100 万あたり −$750,000 になり、安い順の並べ替えで必ず首位に来ます。妥当な範囲を外れる値は、理由を添えて保留します。
  • 確からしさは項目ごとです。1 行に 1 つのバッジではありません。価格しか確認していないのにレコード全体を検証済みと称するのは、誰かが気づいた瞬間に信頼を終わらせる類いの誇張です。
  • 未評価はゼロではありません。219 件のモデルには独立したスコアがありません。これらは価格で掲載し、品質による並べ替えからは除外します。測って落第したかのように最下部へ送ることは決してしません。

10 · ライセンスと、それが縛るもの

このサイトが依拠するベンチマークのうち二つは再配布条件が大きく異なり、それが公開できる内容を左右します。

  • LMArena は順位表を CC-BY-4.0 のデータセットとして公開しています。出典表示を条件に再配布が認められ、上記の有意差順位が依拠する信頼区間も含まれています。使うべきはこの経路です。サイト自体をスクレイピングすることは、同社の規約で禁じられています。
  • Artificial Analysis's free tier is "internal use only with attribution"; public redistribution requires a commercial licence, and their site terms separately limit use to personal and non-commercial purposes. So we do not publish their figures at all. Every general capability score on this site is LMArena Elo, used under CC BY 4.0 from the official dataset; the per-task scores are Design Arena’s, below. Artificial Analysis remains an internal cross-check, which is what its free tier permits; it reaches no page, export or API here.
  • Design Arena の API 条件では、そのリーダーボードデータは商用を含め無料で利用できます。条件は一つ、公開表示では Design Arena を出典として示し、designarena.ai へリンクすることです。タスク別 Elo は OpenRouter のモデルフィード経由で当サイトに届き、タスク別ビュー、各モデルページのタスク別順位、そしてこのページが出典を示しています。
  • 価格そのものは提供元が公開している事実であり、編纂された指標スコアとは別物です。価格は各社のページと突き合わせ、各行が出典へリンクしています。

11 · 訂正

価格は予告なく変わり、ページの体裁も変わります。ここにあるものの一部は、どの時点でも誤っているはずです。誤りを見つけた場合は、どのモデルか、数値はいくつであるべきか、それがどこに公開されているかをお知らせいただくのが最短です。一次情報のある訂正はそのまま反映します。

価格の誤りを報告

カタログの最終取得日は 2026-10-06 です。順位付けのロジックはサイトと同じくバージョン管理しているため、「最良」の算出方法の変更は、静かな再調整ではなく目に見える差分になります。

根拠と質問