Methodik

Alles hier ist aus denselben öffentlichen Quellen nachvollziehbar, die Sie selbst prüfen können. Wo die Daten dünn sind oder die Quellen widersprechen, sagt diese Seite das. Eine Vertrauensseite, die nur Gutes meldet, ist Marketing.

63% des Katalogs haben keine unabhängige Qualitätswertung. 150 von 410 Modellen sind bewertet. Der Rest ist gelistet, bepreist und klar als ohne Wertung markiert, nie eingeordnet.
r = 0.806 Korrelation zwischen unseren zwei unabhängigen Qualitätsquellen, über die 62 Modelle, die beide bewertet haben. Sie stimmen weitgehend überein, aber nicht bei jedem Modell.
52/108 angezeigte Positionen, die wirklich unterschiedliche Ränge sind. 93% der benachbarten Paare liegen innerhalb der Fehlertoleranz des Benchmarks.
79 Modelle, deren Kopfpreis nicht der ganze Preis ist: Kontextstaffeln, getrennt abgerechnetes Reasoning oder tageszeitabhängige Sätze.
9 Werte, die als unplausibel zurückgehalten statt angezeigt werden: 5 zur Laufzeit bepreiste Router-Produkte, 4 unmögliche Latenzzahlen.

1 · Was „beste“ heißt

Qualität führt, Preis trennt Gleichstände. Diese Ordnung ist das ganze Produkt: eine Liste nach Billigstem zuerst ist trivial zu veröffentlichen und nahezu nutzlos, weil das günstigste Modell in diesem Markt 15.000× günstiger ist als das teuerste und die Arbeit in der Regel nicht erledigen kann.

Leistungsfähigkeit kommt von unabhängigen Bewertern, nie von uns und nie vom Anbieter. Zwei Quellen werden geführt: Artificial Analysis-Indizes für allgemeine, Programmier- und Agentenfähigkeit, und LMArena-Elo aus menschlicher Präferenz.

Warum es keine einzige Qualitätszahl gibt

Über die 62 Modelle, die beide Quellen gemessen haben, korrelieren sie mit r = 0.806: enge Übereinstimmung. Das ist nicht das Argument, sie zu mischen. Es ist das Argument, dorthin zu schauen, wo sie sich trennen. 4 Modelle stehen zwischen den beiden sehr unterschiedlich, und eine Verbundzahl würde genau die auslöschen, die ein Käufer am nötigsten markiert braucht. Deshalb stehen beide Achsen nebeneinander und werden nie gemittelt.

Eine frühere Fassung dieser Seite nannte r = 0,409 und behauptete, die Benchmarks widersprächen sich im Großen. Die Zahl stammte von 15 Modellen, die von einer Bestenliste abgeschöpft waren, alle Frontier-Klasse; so eng den Bereich zu beschränken, flacht eine Korrelation. Neu bezogen aus Arenas lizenziertem Datensatz umfasst die Stichprobe 62 Modelle über die volle Spanne, und die Korrelation ist 0.806. Die frühere Behauptung war falsch, und das darauf gebaute Argument auch.

ModellArtificial AnalysisLMArena
Gemini 2.5 Pro18. Perzentil71. Perzentil
GPT-5.6 Luna73. Perzentil35. Perzentil
Solar Pro 453. Perzentil16. Perzentil
Grok 4.694. Perzentil58. Perzentil
GPT-5.4 Nano45. Perzentil11. Perzentil

Beide Perzentile werden über die Modelle berechnet, die beide Quellen bewertet haben. Jedes Modell nur in der eigenen Quellenpopulation zu rangieren würde einen kleinen, durchweg frontier-klassigen Arena-Pool gegen den marktweiten Index-Pool stellen und Uneinigkeiten erzeugen, die es nicht gibt. Das war unsere erste Umsetzung, und sie war falsch.

2 · Ränge, auf die Sie sich verlassen können

Die Rangspalte ist ein Signifikanzrang, keine Zeilennummer. Zwei Modelle, die die Messung nicht trennen kann, teilen sich einen Rang.

Der größte Teil einer Bestenlisten-Ordnung ist Rauschen

Das 95%-Konfidenzintervall auf eine Differenz zwischen zwei Artificial-Analysis-Werten beträgt etwa ±1.41 Indexpunkte. In diesem Katalog fallen 100 von 107 benachbarten Paaren (93%) hinein. Also tragen 108 angezeigte Positionen nur 52 wirklich unterschiedliche Ränge, und 2 Modelle sind gemeinsam Erste.

„Das Modell Nr. 1“ ist deshalb keine Behauptung, die diese Daten tragen. Gleichstände werden als Gleichstände gezeigt.

Dieses Verfahren ist nicht unseres. LMArena rangiert seit Jahren so: ihr Rank (UB) gibt Modellen denselben Rang, die statistisch nicht trennbar sind, und sie haben die Umsetzung offengelegt. Ungewöhnlich ist, es auf einen Preisvergleich anzuwenden, wo der Anreiz eine knackige Ordnung ist.

Angewendet nur auf die Artificial-Analysis-Achsen. Aufgaben-Elo trägt eigenen Fehler, den wir nicht haben, also bekommt es keine geliehene Schwelle.

3 · „Besser und günstiger“ muss das auch heißen

Pareto-Dominanz auf Preis und Leistung ist eine zweidimensionale Projektion einer viel weiteren Kaufentscheidung, und die Projektion lügt öfter als nicht. Ein Modell kann höher werten und weniger kosten und trotzdem keine Bilder annehmen, die Ausgabe auf die Hälfte der Token deckeln oder eine halbe Million Token weniger Kontext halten.

Deshalb ist „zugleich besser und günstiger“ einem Ersatz vorbehalten, dessen Leistungsfähigkeits-Hülle eine Obermenge des Originals ist. Von 133 Dominanzurteilen sind 111 streng und 22 (17%) nennen, was Sie stattdessen aufgeben würden. Ohne dieses Tor empfahlen 61% der rohen Zwei-Achsen-Urteile ein Modell, das die Arbeit des Amtsinhabers nicht tun konnte.

4 · Die Grenze, keine Wertzahl

Ein Modell liegt auf der Effizienzgrenze, wenn nichts anderes zugleich besser und günstiger ist. 11 der bewerteten, bepreisten Modelle mit Standardauslieferung erfüllen das; die anderen 90% sind schlicht schlechtere Angebote.

Warum nicht nach Qualität pro Dollar rangieren?

Weil das Verhältnis Billigkeit viel steiler belohnt als Qualität. Auf diesen Katalog angewandt krönt es ein Modell mit 37,8 von einer Decke um 63 und setzt eines mit 14,2 auf Platz zwei: Modelle, die niemand ausliefern sollte. Jede Seite, die eine so gerechnete „Value“-Spalte veröffentlicht, gibt schlechten Rat. Wir nutzen die Grenze plus eine ausdrückliche Qualitätsuntergrenze.

5 · Preis ist eine Eigenschaft eines Modells und einer Nutzung

Es gibt nicht „den“ Preis eines Modells. Zusammenfassen ist eingabelastig, Codeerzeugung ausgabelastig, und eine Agentenschleife spielt ihren Kontext in jeder Runde neu; derselbe Katalog ordnet sich unter jeder Form anders. Statt eine Mischung zu wählen und zu verstecken, sind das Verhältnis Eingabe zu Ausgabe und die Cache-Trefferquote Steuerungen, die Sie sehen und ändern können.

NutzungAusgabeanteilCache-TrefferForm
Ausgewogen25%0%3 Token rein pro 1 raus
Zusammenfassen5%30%Riesige Eingabe, winzige Ausgabe
Chat40%50%Langer, zwischengespeicherter System-Prompt
Code60%20%Ausgabe überwiegt
Agenten15%70%Kontext wird in jeder Runde neu gesendet

Drei Dinge machen den beworbenen Satz regelmäßig falsch, und alle stehen auf der Zeile:

  • Kontextstaffeln. 55 Modelle ändern den Satz ab einer Prompt-Längen-Schwelle, manche mehrfach. Qwen3.7 Flash geht 3,33× ab 32K und 6,67× ab 256K. Eine lange Nutzung vom Kopfpreis zu rechnen, und Sie liegen um ein Vielfaches daneben.
  • Reasoning-Token, getrennt von der Ausgabe berechnet. Bei den betroffenen Modellen können das 38–42% einer echten Rechnung sein, und sie stehen im beworbenen Preis überhaupt nicht.
  • Tageszeitabhängige Preise. 3 Modelle rabattieren ~50% in veröffentlichten Nebenzeiten.

6 · Aufgabenbedingte Rangfolge

Eine einzige globale Ordnung ist intellektuell unredlich, weil verschiedene Modelle verschiedene Arbeit gewinnen. Wir führen Elo je Aufgabe über 25 Kategorien: Frontend, Datenvisualisierung, Spieleentwicklung, SVG, Android, Folien und mehr. Die Wahl einer Aufgabe ordnet die ganze Tafel nach dem Elo dieser Aufgabe neu, nicht nach einem allgemeinen Index.

Die Abdeckung schwankt je Kategorie, und ein Modell, das auf der Bestenliste einer Kategorie fehlt, wird für diese Aufgabe als ungemessen gezeigt, nicht als schlecht darin.

7 · Woher die Daten kommen

Preise werden aus einem maschinenlesbaren Katalog über Anbieter normalisiert und gegen die Preisseiten der Hersteller gegencheckt. Jede Modellseite verlinkt ihre Quelle und das Abrufdatum.

  • Widersprüche werden festgehalten, nicht gemittelt. Wenn zwei Quellen bei einem Preis widersprechen, ist dieser Widerspruch der Befund. Ein Modell, das sein Hersteller mit 4/20 $ listet und ein Aggregator mit 2/10 $ verkauft, hat zwei wahre Preise, und welcher gilt, hängt davon ab, wo Sie kaufen.
  • Unplausible Werte werden unter Quarantäne gestellt. Ein Upstream-Sentinel von −1 für „Preis bei Anfrage“ wird zu −750.000 $ pro Million, wenn man ihn naiv durchreicht, und gewinnt jede Sortierung nach Billigstem. Alles außerhalb eines plausiblen Bereichs wird mit einem Grund zurückgehalten.
  • Vertrauen gilt je Feld. Nicht ein Abzeichen je Zeile. Einen Datensatz als geprüft auszugeben, wenn nur der Preis geprüft wurde, ist die Art von Überzeichnung, die Vertrauen beim ersten Nachschauen beendet.
  • Ohne Wertung ist nicht null. 260 Modelle haben keine unabhängige Wertung. Sie sind nach Preis gelistet und von der Qualitätsordnung ausgeschlossen, nie nach unten sortiert, als wären sie gemessen worden und durchgefallen.

9 · Lizenzen, und was das einschränkt

Zwei der Benchmarks, auf die sich diese Seite stützt, haben sehr unterschiedliche Weitergabebedingungen, und das ändert, was veröffentlicht werden kann.

  • LMArena veröffentlicht seine Bestenliste als CC-BY-4.0-Datensatz, der Weitergabe mit Namensnennung erlaubt, und trägt die Konfidenzgrenzen, von denen die Signifikanzränge oben abhängen. Das ist der Kanal, den man nutzen soll; das Abschöpfen der Website selbst verbieten ihre Bedingungen.
  • Die kostenlose Stufe von Artificial Analysis ist „nur interne Nutzung mit Namensnennung“; öffentliche Weitergabe braucht eine kommerzielle Lizenz. Ihre Website-Bedingungen beschränken die Nutzung zusätzlich auf persönlich und nicht kommerziell. Das ist ungelöst. Bis dahin behandeln Sie jede Artificial-Analysis-Zahl hier als zur Bewertung gezeigt, nicht als unter einem Weitergaberecht veröffentlicht.
  • Der Preis selbst ist eine Tatsache, die ein Anbieter veröffentlicht, und das ist etwas anderes als ein zusammengesetzter Indexwert. Preise werden gegen Herstellerseiten gegencheckt, und jede Zeile verlinkt ihre Quelle.

10 · Korrekturen

Preise ändern sich ohne Ankündigung, und Seiten werden umformatiert; ein Teil von dem, was hier steht, wird in jedem Moment falsch sein. Wenn Sie einen Fehler finden, ist der schnellste Weg: welches Modell, welche Zahl es sein sollte, und wo sie veröffentlicht ist. Korrekturen mit Primärquelle werden direkt übernommen.

Katalog zuletzt abgerufen 2026-08-24. Die Rangfolgelogik ist mit der Site versioniert, sodass eine Änderung, wie „beste“ gerechnet wird, ein sichtbarer Diff ist, keine stille Nachjustierung.

Markdown für LLMs