数値を理解する

バリューフロンティア

すべてのモデルを、価格と性能の関係でプロットしています。階段状の線がフロンティアです。両方の軸で同時にそれらのモデルを上回るものはありません。その下および右側にあるものは、明確に割の悪い選択肢です。より賢く、しかも安いものが存在します。

検索ではカタカナの「バリュー・フロンティア」と出ます。このページの日本語見出しは「価値のフロンティア」です。同じ考えです。

下のワークロードを変えても、フロンティアは思うほど動きません。フロンティアのモデルの 46% は、どのワークロードでもフロンティア上にあります(7 件が動く)。変わるのは価格のほうで、同じモデルがこれらの形の間で最大 3.6× 振れます。つまりこの操作は、どのモデルを検討するかではなく、それらに実際いくら払うかの問題です。

ワークロード
測定基準

総合 · 均衡

Claude Opus 5.5

Anthropic

フロンティア上
総合 の能力
1511.7
実効 $/M
$8.00/M

Compared with the previous price rung, Gemini 3.8 Flash: +14.7 Elo · +$5.00/M for 均衡. Score differences are not task-success or capability guarantees.

Compare General scores and capabilities
$0.030$0.100$0.300$1.00$3.00$10.00$30.0010801170126013501440100万トークンあたりの実効 $ — 対数スケール総合 の能力
100万トークンあたりの実効 $ — 対数スケール · 総合 の能力

フロンティア上

総合 · 均衡 · 実効 $/M

  1. 1 Llama 3.1 8B Instruct Meta 1186.5 $0.025/M 最安の段
  2. 2 gpt-oss-20b OpenAI 1287.7 $0.036/M +101.2 Elo · +$0.011/M vs previous rung
  3. 3 Gemma 3 4B Google 1290.8 $0.063/M +3.1 Elo · +$0.027/M vs previous rung
  4. 4 gpt-oss-120b OpenAI 1365.4 $0.065/M +74.6 Elo · +$0.0025/M vs previous rung
  5. 5 DeepSeek V4 Flash 0423 DeepSeek 1432.1 $0.113/M +66.7 Elo · +$0.048/M vs previous rung
  6. 6 Gemma 4 26B A4B Google 1433.9 $0.127/M +1.8 Elo · +$0.014/M vs previous rung
  7. 7 MiMo-V2.6-Flash Xiaomi 1456.4 $0.175/M +22.5 Elo · +$0.048/M vs previous rung
  8. 8 DeepSeek V4.1 Flash DeepSeek 1462.5 $0.182/M +6.1 Elo · +$0.0073/M vs previous rung
  9. 9 GLM 5.3 Flash Z.ai 1469.6 $0.238/M +7.1 Elo · +$0.055/M vs previous rung
  10. 10 MiMo-V2.6-Pro Xiaomi 1491.0 $0.540/M +21.4 Elo · +$0.303/M vs previous rung
  11. 11 Gemini 3.8 Flash Google 1497.0 $3.00/M +6.0 Elo · +$2.46/M vs previous rung
  12. 12 Claude Opus 5.5 Anthropic 1511.7 $8.00/M +14.7 Elo · +$5.00/M vs previous rung
根拠と質問