Spannen
Die Rangliste gibt Ihnen eine Position. Der Benchmark veröffentlicht außerdem ein Intervall um sie herum. Auf Rang 40 umfasst dieses Intervall 24 verschiedene Modelle — und sie kosten zwischen $0,077 und $50 pro Million Token.
Ein Board, das für jedes Modell ein Konfidenzintervall veröffentlicht, veröffentlicht zugleich 402 verschiedene ganzzahlige Positionen für 402 Modelle — ohne einen einzigen Gleichstand.
Über das gesamte Board überlappen sich 399 von 401 benachbarten Intervallen. So sieht die veröffentlichte Unsicherheit aus, wenn man sie zeichnet, statt nach ihr zu sortieren.
Stellen Sie sich auf eine Position
Wählen Sie einen Rang. Dies sind die Modelle, deren veröffentlichtes Intervall ihn abdeckt.
24 Modelle sind für Rang 40 nicht ausgeschlossen. Das günstigste berechnet $0,077 pro Million Ausgabe-Token, das teuerste $50 — eine Spanne von 647× auf einer einzigen Position.
| Modell | Nicht ausgeschlossen für | $/Mio. Ausgabe |
|---|---|---|
| Qwen3.6 Max Preview | 23–47 | $6,16 |
| GLM 5 | 23–43 | $1,92 |
| GPT-5.6 Terra | 23–44 | $12 |
| Kimi K2.5 | 26–41 | $2,25 |
| DeepSeek V4 Pro 0423 | 23–48 | $0,845 |
| GPT-6 Astra | 21–53 | $50 |
| Claude Sonnet 5 | 28–48 | $10 |
| Gemma 4 31B | 26–52 | $0,34 |
| Hy3 | 27–52 | $0,33 |
| GLM 4.6 | 29–48 | $1,75 |
| Inkling | 29–51 | $4,05 |
| Qwen3.8 27B | 28–53 | $2,55 |
| Claude Sonnet 4.5 | 32–50 | $15 |
| Qwen3.5 397B A17B | 31–51 | $3,5 |
| Qwen3.6 Plus | 32–53 | $1,95 |
| GLM 5V Turbo | 29–54 | $4 |
| GLM 4.7 | 30–54 | $1,75 |
| Gemini 3.5 Flash Lite | 32–54 | $2,5 |
| Gemma 4 26B A4B | 30–58 | $0,3 |
| MiniMax M3 | 33–54 | $1,2 |
| DeepSeek V4 Flash 0423 | 36–56 | $0,077 |
| GLM 4.5 | 37–61 | $2,2 |
| GPT-5.6 Luna | 39–61 | $1,2 |
| Grok 4.6 | 36–61 | $6 |
Die breiteste Position dieses Boards ist Rang 56: 22 Modelle mit einer Preisspanne von 971×.
Diese Bänder sind absichtlich breiter als die Wahrheit. Sie entstehen allein aus dem jeweils eigenen veröffentlichten Intervall eines Modells und lassen damit außer Acht, dass die Bewertungen gemeinsam aus geteilten Duellen geschätzt werden — eine Kovarianz, die sich aus den veröffentlichten Intervallen nicht zurückgewinnen lässt. Ein Band zeigt also, was nicht ausgeschlossen ist, nie was feststeht, und zwei Modelle auf derselben Position sind deshalb weder gleichauf noch gleichwertig.
Das ist keine Behauptung, die Rangfolge sei falsch. Eine Rangspalte ist die deterministische Darstellung einer Sortierung über Punktschätzungen, und der Benchmark hat nie statistische Trennschärfe behauptet. Er ist zudem das einzige Board in diesem Markt, das überhaupt ein Intervall veröffentlicht — und nur deshalb ist diese Seite möglich.
196 Modelle im Katalog haben auf diesem Board keinen Eintrag. Sie fehlen in der Grafik und werden als fehlend benannt — nie auf Rang null gezeichnet und nie als schlecht bewertet gezählt. Das Fehlen einer Messung ist keine Messung.
Probieren Sie es selbst
Der Blindtest zeigt zwei Modelle mit verdeckten Namen und lässt Sie das höher bewertete wählen — und sagt Ihnen dann, ob die veröffentlichten Intervalle die beiden überhaupt auseinanderhalten können.
Bewertungen und Intervalle sind LMArena-Elo, verwendet unter CC BY 4.0 aus dem offiziellen Datensatz. Preise sind Listen-Ausgabepreise pro Million Token, wie von den Anbietern veröffentlicht.