---
title: "Spannen · Undominated.ai"
canonical: https://undominated.ai/de/ranges/
description: "Die Rangliste gibt Ihnen eine Position. Der Benchmark veröffentlicht außerdem ein Intervall um sie herum. Auf Rang 40 umfasst dieses Intervall 24 verschiedene Modelle — und sie kosten zwischen $0,077 und $50 pro Million Token."
---

# Spannen · Undominated.ai

> Die Rangliste gibt Ihnen eine Position. Der Benchmark veröffentlicht außerdem ein Intervall um sie herum. Auf Rang 40 umfasst dieses Intervall 24 verschiedene Modelle — und sie kosten zwischen $0,077 und $50 pro Million Token.

# Spannen

Die Rangliste gibt Ihnen eine Position. Der Benchmark veröffentlicht außerdem ein Intervall um sie herum. Auf Rang 40 umfasst dieses Intervall **24** verschiedene Modelle — und sie kosten zwischen **$0,077** und **$50** pro Million Token.

Ein Board, das für jedes Modell ein Konfidenzintervall veröffentlicht, veröffentlicht zugleich **402** verschiedene ganzzahlige Positionen für 402 Modelle — **ohne einen einzigen Gleichstand**.

Über das gesamte Board überlappen sich **399** von 401 benachbarten Intervallen. So sieht die veröffentlichte Unsicherheit aus, wenn man sie zeichnet, statt nach ihr zu sortieren.

 Jeder Balken ist ein Modell. Seine Länge ist die Spanne der Ränge, die das veröffentlichte Intervall nicht ausschließt; die blasse Diagonale dahinter ist die eine Position, die das Board anzeigt. Die Farbe steht für den Preis, nicht für die Qualität.

## Stellen Sie sich auf eine Position

Wählen Sie einen Rang. Dies sind die Modelle, deren veröffentlichtes Intervall ihn abdeckt.

 Rang 40

**24** Modelle sind für Rang 40 nicht ausgeschlossen. Das günstigste berechnet **$0,077** pro Million Ausgabe-Token, das teuerste **$50** — eine Spanne von **647×** auf einer einzigen Position.

| Modell | Nicht ausgeschlossen für | $/Mio. Ausgabe |
| --- | --- | --- |
| Qwen3.6 Max Preview | 23–47 | $6,16 |
| GLM 5 | 23–43 | $1,92 |
| GPT-5.6 Terra | 23–44 | $12 |
| Kimi K2.5 | 26–41 | $2,25 |
| DeepSeek V4 Pro 0423 | 23–48 | $0,845 |
| GPT-6 Astra | 21–53 | $50 |
| Claude Sonnet 5 | 28–48 | $10 |
| Gemma 4 31B | 26–52 | $0,34 |
| Hy3 | 27–52 | $0,33 |
| GLM 4.6 | 29–48 | $1,75 |
| Inkling | 29–51 | $4,05 |
| Qwen3.8 27B | 28–53 | $2,55 |
| Claude Sonnet 4.5 | 32–50 | $15 |
| Qwen3.5 397B A17B | 31–51 | $3,5 |
| Qwen3.6 Plus | 32–53 | $1,95 |
| GLM 5V Turbo | 29–54 | $4 |
| GLM 4.7 | 30–54 | $1,75 |
| Gemini 3.5 Flash Lite | 32–54 | $2,5 |
| Gemma 4 26B A4B | 30–58 | $0,3 |
| MiniMax M3 | 33–54 | $1,2 |
| DeepSeek V4 Flash 0423 | 36–56 | $0,077 |
| GLM 4.5 | 37–61 | $2,2 |
| GPT-5.6 Luna | 39–61 | $1,2 |
| Grok 4.6 | 36–61 | $6 |

Die breiteste Position dieses Boards ist Rang 56: 22 Modelle mit einer Preisspanne von 971×.

Diese Bänder sind absichtlich breiter als die Wahrheit. Sie entstehen allein aus dem jeweils eigenen veröffentlichten Intervall eines Modells und lassen damit außer Acht, dass die Bewertungen gemeinsam aus geteilten Duellen geschätzt werden — eine Kovarianz, die sich aus den veröffentlichten Intervallen nicht zurückgewinnen lässt. Ein Band zeigt also, was *nicht ausgeschlossen* ist, nie was feststeht, und zwei Modelle auf derselben Position sind deshalb weder gleichauf noch gleichwertig.

Das ist keine Behauptung, die Rangfolge sei falsch. Eine Rangspalte ist die deterministische Darstellung einer Sortierung über Punktschätzungen, und der Benchmark hat nie statistische Trennschärfe behauptet. Er ist zudem das einzige Board in diesem Markt, das überhaupt ein Intervall veröffentlicht — und nur deshalb ist diese Seite möglich.

196 Modelle im Katalog haben auf diesem Board keinen Eintrag. Sie fehlen in der Grafik und werden als fehlend benannt — nie auf Rang null gezeichnet und nie als schlecht bewertet gezählt. Das Fehlen einer Messung ist keine Messung.

## Probieren Sie es selbst

Der Blindtest zeigt zwei Modelle mit verdeckten Namen und lässt Sie das höher bewertete wählen — und sagt Ihnen dann, ob die veröffentlichten Intervalle die beiden überhaupt auseinanderhalten können.

[Blindtest](/blind-rank/)

Bewertungen und Intervalle sind LMArena-Elo, verwendet unter CC BY 4.0 aus dem offiziellen Datensatz. Preise sind Listen-Ausgabepreise pro Million Token, wie von den Anbietern veröffentlicht.
