Methodik

Alles hier ist aus denselben öffentlichen Quellen nachvollziehbar, die Sie selbst prüfen können. Wo die Daten dünn sind oder die Quellen widersprechen, sagt diese Seite das. Eine Vertrauensseite, die nur Gutes meldet, ist Marketing.

60% des Katalogs haben keine unabhängige Qualitätswertung. 145 von 364 Modellen sind bewertet. Der Rest ist gelistet, bepreist und klar als ohne Wertung markiert, nie eingeordnet.
72/145 angezeigte Positionen, die wirklich unterschiedliche Ränge sind. 94% der benachbarten Paare liegen innerhalb der Fehlertoleranz des Benchmarks.
67/364 Modelle, deren Kopfpreis nicht der ganze Preis ist: Kontextstaffeln, getrennt abgerechnetes Reasoning oder tageszeitabhängige Sätze.
7/447 entries with variable prices withheld
4/447 entries with suspect latency withheld; may overlap the price group

1 · Was „beste“ heißt

Qualität führt, Preis trennt Gleichstände. Diese Ordnung ist das ganze Produkt: eine Liste nach Billigstem zuerst ist trivial zu veröffentlichen und nahezu nutzlos, weil das günstigste Modell in diesem Markt 12.500× günstiger ist als das teuerste und die Arbeit in der Regel nicht erledigen kann.

Leistungsfähigkeit stammt von unabhängigen Prüfern, nie von uns und nie vom Anbieter. Die allgemeinen Werte sind LMArena-Elo-Werte aus menschlichen Präferenzen, vom allgemeinen Board und vom Dokumenten-Board, verwendet unter CC BY 4.0 aus dem offiziellen Datensatz. Die Wertungen je Aufgabe in der Aufgabenansicht stammen von Design Arena, Quellenangabe unten.

Warum es keine einzige Qualitätszahl gibt

Leistungsfähigkeit stammt von unabhängigen Prüfern, nie von uns und nie vom Anbieter. Die allgemeinen Werte sind LMArena-Elo-Werte aus menschlichen Präferenzen, vom allgemeinen Board und vom Dokumenten-Board, verwendet unter CC BY 4.0 aus dem offiziellen Datensatz. Die Wertungen je Aufgabe in der Aufgabenansicht stammen von Design Arena, Quellenangabe unten.

2 · Ränge, auf die Sie sich verlassen können

Die Rangspalte ist ein Signifikanzrang, keine Zeilennummer. Der Rang eines Modells ist um eins höher als die Zahl der Modelle, die es um mehr als beide Fehlermargen zusammen schlagen. Modelle mit derselben Anzahl teilen sich einen Rang. Zwei Modelle, die innerhalb ihrer Fehlermargen beieinanderliegen, können trotzdem verschiedene Ränge haben, weil jedes mit der gesamten Rangliste verglichen wird.

SHA-256 der rangrelevanten Projektion (Slugs, Wertungen, Nutzungspreise, Frontier-Kennzeichen): 06cd12db54e2968c3de49b45a3a2a6881f374f6e58a462437784450842efb989. Daten und Build-Stempel sind ausgeschlossen. Eine Änderung hier ist eine Änderung der Rangfolge, nicht des Chroms.

Korrekturen

Der größte Teil einer Bestenlisten-Ordnung ist Rauschen

Zwei Arena-Werte gelten erst als getrennt, wenn sie sich um mehr als die Summe der 95-%-Fehlermargen beider Modelle unterscheiden. Diese Summe beträgt auf diesem Board im Mittel 10,47 Punkte, und der Test ist mindestens so streng wie ein 95-%-Intervall für die Differenz. 136 von 144 benachbarten Paaren (94%) liegen innerhalb ihrer eigenen Summe. Zählt man den Rang eines Modells als eins mehr als die Zahl der Modelle, die es eindeutig schlagen, tragen die 145 dargestellten Positionen 72 verschiedene Ränge, und 4 Modelle teilen sich den ersten Platz.

„Das Modell Nr. 1“ ist deshalb keine Behauptung, die diese Daten tragen. Gleichstände werden als Gleichstände gezeigt. Rang 1 ist Rang 1 unter den Modellen im Preis-Feed, den diese Website liest: Führt LMArena ein Modell, das der Feed nicht enthält, vor ihnen allen, nennt das Board dieses Modell und stuft es nicht ein.

Dieses Verfahren ist nicht unseres. LMArena vergibt seit Jahren so Ränge: ihr Rank (UB) gibt jedem Modell als Rang eins mehr als die Zahl der Modelle, die statistisch besser sind als es, und sie haben die Umsetzung offengelegt. Ungewöhnlich ist, es auf einen Preisvergleich anzuwenden, wo der Anreiz eine knackige Ordnung ist.

Gilt nur für das allgemeine Arena-Board. Andere Boards haben ihre eigene Fehlerspanne, die uns nicht vorliegt; sie erhalten deshalb keinen geliehenen Schwellenwert.

3 · „Besser und günstiger“ muss das auch heißen

Pareto-Dominanz auf Preis und Leistung ist eine zweidimensionale Projektion einer viel weiteren Kaufentscheidung, und die Projektion lügt öfter als nicht. Ein Modell kann höher werten und weniger kosten und trotzdem keine Bilder annehmen, die Ausgabe auf die Hälfte der Token deckeln oder eine halbe Million Token weniger Kontext halten.

Deshalb ist „zugleich besser und günstiger“ einem Ersatz vorbehalten, dessen Leistungsfähigkeits-Hülle eine Obermenge des Originals ist. Von 133 Dominanzurteilen sind 113 streng und 20 (15%) nennen, was Sie stattdessen aufgeben würden. Ohne dieses Tor empfahlen 61% der rohen Zwei-Achsen-Urteile ein Modell, das die Arbeit des Amtsinhabers nicht tun konnte.

4 · Die Grenze, keine Wertzahl

Ein Modell liegt auf der Effizienzgrenze, wenn kein anderes Modell mindestens so hoch bewertet ist, nicht mehr kostet und bei einem der beiden vorn liegt. 12 der bewerteten, bepreisten Modelle mit Standardauslieferung erfüllen das. Jedes der anderen 92% hat ein solches Modell über sich, allerdings nicht immer einen gleichwertigen Ersatz: Der Abschnitt darüber zählt die Fälle, in denen man dabei etwas aufgibt.

Warum nicht nach Qualität pro Dollar rangieren?

Weil das Verhältnis Billigkeit viel steiler belohnt als Qualität. Auf diesen Katalog angewandt krönt es ein Modell mit 37,8 von einer Decke um 63 und setzt eines mit 14,2 auf Platz zwei: Modelle, die niemand ausliefern sollte. Jede Seite, die eine so gerechnete „Value“-Spalte veröffentlicht, gibt schlechten Rat. Wir nutzen die Grenze plus eine ausdrückliche Qualitätsuntergrenze.

5 · Preis ist eine Eigenschaft eines Modells und einer Nutzung

Es gibt nicht „den“ Preis eines Modells. Zusammenfassen ist eingabelastig, Codeerzeugung ausgabelastig, und eine Agentenschleife spielt ihren Kontext in jeder Runde neu; derselbe Katalog ordnet sich unter jeder Form anders. Statt eine Mischung zu wählen und zu verstecken, sind das Verhältnis Eingabe zu Ausgabe und die Cache-Trefferquote Steuerungen, die Sie sehen und ändern können.

Ist kein Cache-Lesepreis angegeben, verwendet die Mischkalkulation den vollen Eingabepreis der gewählten Preisstufe.

NutzungAusgabeanteilCache-TrefferForm
Ausgewogen 25% 0%3 Token rein pro 1 raus
Zusammenfassen 5% 30%Riesige Eingabe, winzige Ausgabe
Chat 40% 50%Langer, zwischengespeicherter System-Prompt
Code 60% 20%Ausgabe überwiegt
Agenten 15% 70%Kontext wird in jeder Runde neu gesendet

Drei Dinge machen den beworbenen Satz regelmäßig falsch, und alle stehen auf der Zeile:

  • Kontextstaffeln. 51 Modelle ändern den Satz oberhalb einer Prompt-Längen-Schwelle, manche mehrfach. Qwen3.7 Flash geht 3,33× bei mehr als 32K und 6,67× bei mehr als 256K. Eine lange Nutzung vom Kopfpreis zu rechnen, und Sie liegen um ein Vielfaches daneben.
  • Reasoning-Token, getrennt von der Ausgabe berechnet. Werden Reasoning-Token separat berechnet, hängen die Kosten von ihrer abgerechneten Menge und dem geltenden Satz ab. Berücksichtigen Sie diesen Posten in Ihrer Schätzung.
  • Tageszeitabhängige Preise. Modelle mit veröffentlichten Preiszeitfenstern: 2. Prüfen Sie Zeitfenster, Zeitzone und Preise; gehen Sie nicht von einem einheitlichen Rabatt aus.

6 · Welchen Preis wir veröffentlichen

Eine Bewertung wird auf der eigenen Bereitstellung des Modells gemessen, daher ist der Preis daneben der Referenzpreis: das günstigste Angebot in der ausgewogenen Mischung, das jeden der folgenden Tests besteht. Eingabe-, Ausgabe- und Cache-Lese-Rate dieses Angebots werden zusammen veröffentlicht, nie mit denen eines anderen Angebots gemischt.

  1. Verfügbar. Ein Angebot, das OpenRouter als nicht verfügbar führt, wird ausgeschlossen. Ein Angebot, das im Moment des Abrufs als beeinträchtigt gilt, zählt trotzdem, wenn es am letzten Tag mindestens 95 % verfügbar war. Ein Angebot, das am letzten Tag weniger als 80 % verfügbar war, zählt nicht, was immer es im Moment anzeigt.
  2. Standardauslieferung. Flex, Priority, Fast und ähnliche Stufen sind ein anderes Produkt und werden ausgeschlossen.
  3. Standardpreis. Ein Angebot mit Aktion zählt zu seinem Standardpreis: jeder Preis geteilt durch eins minus den Rabatt. Der Aktionspreis wird offengelegt, nie gerankt.
  4. Standardzeitfenster. Ein tageszeitabhängiger Preis zählt mit seiner Standardrate; die Rabattstunden werden offengelegt.
  5. Die Präzision des Herstellers oder besser. Ein 4-Bit-Angebot (fp4, nvfp4, mxfp4, int4) zählt nur, wenn der Hersteller selbst 4-Bit anbietet oder, wo der Hersteller keine Präzision angibt, seine veröffentlichten Gewichte 4-Bit sind. Ein Angebot ohne Präzisionsangabe zählt, wenn es das eigene des Herstellers ist oder das eines Wiederverkäufers für ein Modell mit geschlossenen Gewichten: Dieser bedient die Bereitstellung des Herstellers. Bei offenen oder nicht erfassten Gewichten ist das Angebot eines Wiederverkäufers ohne Präzisionsangabe ausgeschlossen: Es wird nie als volle Präzision gelesen.

Besteht kein Angebot, behält das Modell einen Ersatzpreis, gekennzeichnet als Preis ohne gleichwertiges Angebot mit seinem Grund, weil ein Modell ohne Preis als fehlend gelesen würde: unter den verfügbaren Angeboten mit Standardauslieferung, jedes zu seinem Standardpreis, das günstigste eines Wiederverkäufers ohne Präzisionsangabe, sonst das günstigste 4-Bit-Angebot. Eine andere Auslieferungsstufe wird nur genutzt, wenn sonst nichts verfügbar ist. Ein Modell ohne Angebot, aus dem ein Preis kommen kann, behält den Modellpreis von OpenRouter.

Das günstigste Angebot, das die Regel ausschließt, wird, wenn es günstiger ist, auf der Modellseite als „Gerade günstiger“ gezeigt, mit dem Grund: eine Aktion und ihr Prozentsatz, 4-Bit, eine Auslieferungsstufe oder Präzision nicht angegeben. Es bestimmt nie einen Rang, die Frontier, ein Urteil oder eine Schlagzeilenzahl. Ist das Angebot, das den Preis setzt, selbst in einer Aktion, wird sein eigener Aktionspreis gezeigt.

In diesen Daten tragen 333 Modelle einen Referenzpreis, 15 einen Preis ohne gleichwertiges Angebot und 99 den Modellpreis von OpenRouter, darunter Batch- und Free-Einträge. 86 zeigen gerade ein günstigeres Angebot, 11 davon von einem Wiederverkäufer ohne Präzisionsangabe.

Vor dieser Regel war jeder Preis hier der Modellpreis von OpenRouter, den jeder Anbieter setzen kann, Aktionen und 4-Bit-Kopien eingeschlossen. Die Änderung ist als §96 im Korrekturprotokoll verzeichnet, mit den Zahlen davor und danach.

7 · Aufgabenbedingte Rangfolge

Eine einzige globale Ordnung ist intellektuell unredlich, weil verschiedene Modelle verschiedene Arbeit gewinnen. Wir führen Elo je Aufgabe über 25 Kategorien: Frontend, Datenvisualisierung, Spieleentwicklung, SVG, Android, Folien und mehr. Die Wahl einer Aufgabe ordnet die ganze Tafel nach dem Elo dieser Aufgabe neu, nicht nach einem allgemeinen Index.

Die Aufgabenwertungen sind das aufgabenbezogene Elo von Design Arena, gelesen aus dem Modell-Feed von OpenRouter: designarena.ai.

Die Abdeckung schwankt je Kategorie, und ein Modell, das auf der Bestenliste einer Kategorie fehlt, wird für diese Aufgabe als ungemessen gezeigt, nicht als schlecht darin.

8 · Wenn dasselbe Modell zweimal verkauft wird

Manche Modelle sind keine neuen Modelle. Der Anbieter sagt es selbst: 11 Einträge in diesem Katalog werden von ihrem eigenen Anbieter als ein anderes Katalogmodell beschrieben, das lediglich anders ausgeliefert wird — eine schnellere Spur, ein anderer Reasoning-Modus, mehr Rechenleistung pro Anfrage. 10 der 11 haben keinen Eintrag auf irgendeinem LMArena-Board. 11 ihrer 11 Basismodelle haben einen.

Wenn dasselbe Modell zweimal verkauft wird
Verkauft alsPreis der StufeBasismodellAngabe des Anbieters
o1-pro kein Eintrag$600 ×10o1 1.365,8 mehr Rechenleistung pro Anfrage
o3 Pro kein Eintrag$80 ×10o3 1.409,9 mehr Rechenleistung pro Anfrage
GPT-6 Astra Pro kein Eintrag$50 ×1GPT-6 Astra 1.442,3 bei Denkaufwand maximaldasselbe Modell, anderer Auslieferungsmodus
GPT-5.6 Sol Pro kein Eintrag$20 ×1GPT-5.6 Sol 1.456,3 bei Denkaufwand sehr hochdasselbe Modell, anderer Auslieferungsmodus
GPT-5.6 Terra Pro kein Eintrag$12 ×1GPT-5.6 Terra 1.446,3 bei Denkaufwand sehr hochdasselbe Modell, anderer Auslieferungsmodus
GPT-6 Sol Pro kein Eintrag$10 ×1GPT-6 Sol 1.395,4 bei Denkaufwand maximaldasselbe Modell, anderer Auslieferungsmodus
GPT-6.1 Sol Pro kein Eintrag$10 ×1GPT-6.1 Sol 1.445,6 bei Denkaufwand maximaldasselbe Modell, anderer Auslieferungsmodus
o3 Mini High 1.336,6 $4,4 ×1o3 Mini 1.319,4 dasselbe Modell, anderer Auslieferungsmodus
o4 Mini High kein Eintrag$4,4 ×1o4 Mini 1.353,2 dasselbe Modell, anderer Auslieferungsmodus
GPT-5.6 Luna Pro kein Eintrag$1,2 ×1GPT-5.6 Luna 1.431 bei Denkaufwand sehr hochdasselbe Modell, anderer Auslieferungsmodus
GPT-6 Luna Pro kein Eintrag$0,5 ×1GPT-6 Luna 1.391,5 bei Denkaufwand maximaldasselbe Modell, anderer Auslieferungsmodus

Die Unterscheidung bestimmt, was Sie daraus schließen dürfen. Wo der Anbieter identische Fähigkeiten angibt — 0 von 11 —, ist die Bewertung des Basismodells zugleich die Aussage des Anbieters über die Stufe, und Sie kaufen ausschließlich Geschwindigkeit. Wo der Anbieter mehr Rechenleistung oder einen anderen Modus angibt, sagt keine veröffentlichte Messung, was die Mehrausgabe bringt — mit der einen oben genannten Ausnahme.

Gezählt wird ausschließlich, was der Anbieter selbst angibt. Ein Modell, dessen Name auf „Pro“ endet, das sein Anbieter aber als eigenständiges Spitzenmodell bezeichnet, wird hier nicht gezählt — das wäre unsere Behauptung und nicht seine. Es ist derselbe Fehler wie der, die eigenen Service-Stufen eines Anbieters als konkurrierende Verkäufer zu behandeln, der aus einer Preisspanne von 2× einmal veröffentlichte 7,2× machte.

Kein Eintrag auf einem LMArena-Board ist kein Urteil. Es ist kein Beleg für geringe Qualität, und es bedeutet nicht, dass niemand diese Modelle geprüft hätte — Anbieter veröffentlichen eigene Ergebnisse. Es bedeutet, dass die Achse, nach der diese Seite ordnet, für sie keinen Messwert hat, und deshalb ordnen wir sie nicht ein.

9 · Woher die Daten kommen

Preise werden aus einem maschinenlesbaren Katalog über Anbieter normalisiert und gegen die Preisseiten der Hersteller gegencheckt. Jede Modellseite verlinkt ihre Quelle und das Abrufdatum.

  • Widersprüche werden festgehalten, nicht gemittelt. Wenn zwei Quellen bei einem Preis widersprechen, ist dieser Widerspruch der Befund. Ein Modell, das sein Hersteller mit 4/20 $ listet und ein Aggregator mit 2/10 $ verkauft, hat zwei wahre Preise, und welcher gilt, hängt davon ab, wo Sie kaufen.
  • Unplausible Werte werden unter Quarantäne gestellt. Ein Upstream-Sentinel von −1 für „Preis bei Anfrage“ wird zu −750.000 $ pro Million, wenn man ihn naiv durchreicht, und gewinnt jede Sortierung nach Billigstem. Alles außerhalb eines plausiblen Bereichs wird mit einem Grund zurückgehalten.
  • Vertrauen gilt je Feld. Nicht ein Abzeichen je Zeile. Einen Datensatz als geprüft auszugeben, wenn nur der Preis geprüft wurde, ist die Art von Überzeichnung, die Vertrauen beim ersten Nachschauen beendet.
  • Ohne Wertung ist nicht null. 219 Modelle haben keine unabhängige Wertung. Sie sind nach Preis gelistet und von der Qualitätsordnung ausgeschlossen, nie nach unten sortiert, als wären sie gemessen worden und durchgefallen.

10 · Lizenzen, und was das einschränkt

Zwei der Benchmarks, auf die sich diese Seite stützt, haben sehr unterschiedliche Weitergabebedingungen, und das ändert, was veröffentlicht werden kann.

  • LMArena veröffentlicht seine Bestenliste als CC-BY-4.0-Datensatz, der Weitergabe mit Namensnennung erlaubt, und trägt die Konfidenzgrenzen, von denen die Signifikanzränge oben abhängen. Das ist der Kanal, den man nutzen soll; das Abschöpfen der Website selbst verbieten ihre Bedingungen.
  • Artificial Analysis erlaubt in der kostenlosen Stufe „nur interne Nutzung mit Quellenangabe“; eine öffentliche Weiterverbreitung erfordert eine kommerzielle Lizenz, und die Website-Bedingungen beschränken die Nutzung zusätzlich auf persönliche, nicht kommerzielle Zwecke. Deshalb veröffentlichen wir ihre Werte überhaupt nicht. Jeder allgemeine Leistungswert auf dieser Website ist LMArena-Elo, verwendet unter CC BY 4.0 aus dem offiziellen Datensatz; die Wertungen je Aufgabe stammen von Design Arena, siehe unten. Artificial Analysis bleibt eine interne Gegenprüfung — genau das erlaubt die kostenlose Stufe — und erreicht hier keine Seite, keinen Export und keine API.
  • Die API-Bedingungen von Design Arena geben die Ranglistendaten zur freien Nutzung frei, auch kommerziell, unter einer Bedingung: Eine öffentliche Darstellung nennt Design Arena und verlinkt designarena.ai. Das aufgabenbezogene Elo gelangt über den Modell-Feed von OpenRouter auf diese Website; die Aufgabenansicht, die Rangplätze je Aufgabe auf jeder Modellseite und diese Seite nennen die Quelle.
  • Der Preis selbst ist eine Tatsache, die ein Anbieter veröffentlicht, und das ist etwas anderes als ein zusammengesetzter Indexwert. Preise werden gegen Herstellerseiten gegencheckt, und jede Zeile verlinkt ihre Quelle.

11 · Korrekturen

Preise ändern sich ohne Ankündigung, und Seiten werden umformatiert; ein Teil von dem, was hier steht, wird in jedem Moment falsch sein. Wenn Sie einen Fehler finden, ist der schnellste Weg: welches Modell, welche Zahl es sein sollte, und wo sie veröffentlicht ist. Korrekturen mit Primärquelle werden direkt übernommen.

Falschen Preis melden

Katalog zuletzt abgerufen 2026-10-06. Die Rangfolgelogik ist mit der Site versioniert, sodass eine Änderung, wie „beste“ gerechnet wird, ein sichtbarer Diff ist, keine stille Nachjustierung.

Belege & Fragen