Methodologie
Alles hier is reproduceerbaar uit dezelfde openbare bronnen die je zelf kunt controleren. Waar de gegevens dun zijn of de bronnen elkaar tegenspreken, zegt deze pagina dat — een vertrouwenspagina die alleen goed nieuws brengt is reclame.
1 · Wat ‘beste’ betekent
Kwaliteit gaat voor en prijs beslist bij gelijkspel. Die volgorde ís het product: een lijst op goedkoopste-eerst is triviaal te publiceren en vrijwel nutteloos, want het goedkoopste model in deze markt is 12.500× goedkoper dan het duurste en kan het werk doorgaans niet aan.
Capability comes from independent evaluators, never from us and never from the vendor. The general scores are LMArena Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.
Waarom er geen enkele kwaliteitsscore is
Capability comes from independent evaluators, never from us and never from the vendor. The general scores are LMArena Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.
2 · Rangen waarop je kunt bouwen
De rangkolom is een significantierang, geen regelnummer. De rang van een model is één meer dan het aantal modellen die het met meer dan beide foutmarges samen verslaan. Modellen met hetzelfde aantal delen een rang. Twee modellen die binnen elkaars foutmarge liggen, kunnen toch een verschillende rang hebben, omdat elk met de hele ranglijst wordt vergeleken.
SHA-256 van de voor de rang relevante projectie (identificatoren, scores, prijzen per werklast, frontiervlag): 06cd12db54e2968c3de49b45a3a2a6881f374f6e58a462437784450842efb989. Datums en buildstempels blijven buiten beschouwing. Een verandering hier is een verandering in de rangschikking, niet in de vormgeving.
Het grootste deel van de volgorde van een ranglijst is ruis
Twee Arena-scores gelden pas als gescheiden als ze meer verschillen dan de som van de 95%-foutmarges van beide modellen. Die som is op deze ranglijst gemiddeld 10,47 punten, en de toets is minstens zo streng als een 95%-interval op het verschil. 136 van 144 aangrenzende paren (94%) vallen binnen hun eigen som. Tel je de rang van een model als één meer dan het aantal modellen die het duidelijk verslaan, dan dragen de 145 getoonde posities 72 verschillende rangen, en delen 4 modellen de eerste plaats.
‘Het nummer 1-model’ is dus geen bewering die deze gegevens ondersteunen. Gelijke standen worden als gelijk getoond. Positie 1 is positie 1 onder de modellen in de prijsfeed die deze site leest: plaatst LMArena een model dat niet in die feed staat boven al die modellen, dan noemt het bord dat model en geeft het geen positie.
Deze methode is niet van ons. LMArena rangschikt al jaren zo — hun Rank (UB) geeft elk model als rang één plus het aantal modellen die statistisch beter zijn dan dat model, en ze hebben de implementatie opengesteld. Ongebruikelijk is het toe te passen op een prijsvergelijking, waar de prikkel juist is om een scherpe volgorde te publiceren.
Applied to the general arena board only. Other boards carry their own error, which we do not have, so they are not given a borrowed threshold.
3 · ‘Beter en goedkoper’ moet het ook betekenen
Pareto-dominantie op prijs en capaciteit is een tweedimensionale projectie van een veel bredere aankoopbeslissing, en die projectie liegt vaker wel dan niet. Een model kan hoger scoren en minder kosten en tegelijk geen afbeeldingen accepteren, de uitvoer op de helft van de tokens aftoppen, of een half miljoen tokens minder context vasthouden.
Daarom is ‘zowel beter als goedkoper’ voorbehouden aan een vervanger waarvan het capaciteitsbereik een superset is van het origineel. Van 133 dominantieoordelen zijn er 113 strikt en noemen 20 (15%) juist wat je zou inleveren. Zonder die poort beval 61% van de ruwe tweeassige oordelen een model aan dat het werk van de zittende niet aankon.
4 · De frontier, geen waardescore
Een model staat op de waardefrontier wanneer geen ander model minstens even hoog scoort, hoogstens evenveel kost én op een van de twee wint. 12 van de beoordeelde modellen met prijs en standaardlevering komen in aanmerking. Elk van de overige 92% heeft zo’n model boven zich, al is dat niet altijd een gelijkwaardige vervanger: de sectie hierboven telt de alternatieven die iets inleveren.
Waarom niet rangschikken op kwaliteit per euro?
Omdat de verhouding goedkoopte veel sterker beloont dan kwaliteit. Toegepast op deze catalogus kroont zij een model dat 37,8 scoort op een plafond van ongeveer 63, en zet zij er een dat 14,2 scoort op de tweede plaats — modellen die niemand in productie zou moeten nemen. Elke site die een zo berekende ‘waarde’-kolom publiceert, geeft slecht advies. Wij gebruiken in plaats daarvan de frontier plus een expliciete kwaliteitsdrempel.
5 · Prijs is een eigenschap van een model én van een werklast
Er bestaat niet zoiets als ‘de’ prijs van een model. Samenvatten is invoerintensief, code genereren uitvoerintensief, en een agentische lus speelt zijn context elke beurt opnieuw af; dezelfde catalogus ordent in elk geval anders. In plaats van één mengsel te kiezen en te verbergen, zijn de verhouding invoer:uitvoer en het cachetrefpercentage instellingen die je ziet en kunt wijzigen.
Ontbreekt een tarief voor gecachte invoer? Dan gebruikt de gemengde kostenraming het volledige invoertarief van de gekozen prijsschijf.
| Werklast | Aandeel uitvoer | Cachetreffers | Vorm |
|---|---|---|---|
| Gebalanceerd | 25% | 0% | 3 tokens in per 1 uit |
| Samenvatten | 5% | 30% | Enorme invoer, minieme uitvoer |
| Chat | 40% | 50% | Lange gecachete systeemprompt |
| Codegen | 60% | 20% | Uitvoer overheerst |
| Agentisch | 15% | 70% | Context wordt elke beurt opnieuw afgespeeld |
Drie dingen maken het geadverteerde tarief geregeld onjuist, en alle drie staan op de regel:
- Contextdrempels. 51 modellen wisselen van tarief voorbij een promptlengtedrempel, sommige meer dan eens — Qwen3.7 Flash gaat naar 3,33× voorbij 32K en naar 6,67× voorbij 256K. Reken je een langecontextwerklast op de kopprijs, dan zit je er een factor naast.
- Redeneertokens die los van de uitvoer worden gefactureerd. Als redeneertokens apart worden gefactureerd, hangen de kosten af van het aantal gefactureerde tokens en het bijbehorende tarief. Neem die kosten mee in je schatting.
- Prijzen naar tijdstip. Modellen met gepubliceerde tijdsgebonden tarieven: 2. Controleer het tijdvenster, de tijdzone en de tarieven; ga niet uit van een vaste korting.
6 · Welke prijs we publiceren
Een score wordt gemeten op de eigen inzet van het model, dus de prijs ernaast is de referentieprijs: het goedkoopste aanbod, op de gebalanceerde mix, dat elke toets hieronder doorstaat. De invoer-, uitvoer- en cache-leesprijs van dat aanbod worden samen gepubliceerd, nooit gemengd met die van een ander aanbod.
- Beschikbaar. Een aanbod dat OpenRouter als niet beschikbaar vermeldt, valt af. Een aanbod dat op het moment van uitlezen als verstoord staat, telt toch mee als het de afgelopen dag minstens 95% beschikbaar was. Een aanbod dat de afgelopen dag minder dan 80% beschikbaar was, telt niet mee, wat de status nu ook is.
- Standaardlevering. Flex, priority, fast en vergelijkbare niveaus zijn een ander product en vallen af.
- Standaardtarief. Een aanbod in de actie telt tegen het standaardtarief: elk tarief gedeeld door één min de korting. De actieprijs wordt vermeld, nooit gerangschikt.
- Standaardvenster. Een prijs die afhangt van het tijdstip telt tegen het standaardtarief; de kortingsuren worden vermeld.
- De precisie van de maker of beter. Een 4-bitaanbod (fp4, nvfp4, mxfp4, int4) telt alleen als de maker zelf 4-bit serveert of, waar de maker geen precisie vermeldt, zijn gepubliceerde gewichten 4-bit zijn. Een aanbod zonder vermelde precisie telt mee als het van de maker zelf is, of van een wederverkoper van een model met gesloten gewichten: die levert de uitrol van de maker. Bij open gewichten, of gewichten die niemand heeft vastgelegd, is het aanbod van een wederverkoper zonder vermelde precisie uitgesloten: het wordt nooit gelezen als volledige precisie.
Als geen aanbod de toetsen doorstaat, houdt het model een terugvalprijs, gelabeld als prijs zonder gelijkwaardig aanbod met de reden erbij, omdat een model zonder prijs als afwezig zou lezen: van het beschikbare aanbod met standaardlevering, elk tegen het standaardtarief, het goedkoopste van een wederverkoper die geen precisie vermeldt, en anders het goedkoopste 4-bitaanbod. Een ander leveringsniveau wordt alleen gebruikt als er niets anders beschikbaar is. Een model zonder aanbod om een prijs uit te halen, houdt de modelprijs van OpenRouter.
Het goedkoopste aanbod dat de regel uitsluit, wordt, als het goedkoper is, op de modelpagina getoond als ‘Nu goedkoper’, met de reden: een actie en het percentage, 4-bit, een leveringsniveau of precisie niet vermeld. Het bepaalt nooit een rang, de frontier, een oordeel of een kopcijfer. Is het aanbod dat de prijs bepaalt zelf in de actie, dan wordt de eigen actieprijs getoond.
In deze gegevens hebben 333 modellen een referentieprijs, 15 een prijs zonder gelijkwaardig aanbod en 99 de modelprijs van OpenRouter, waaronder batch- en gratis vermeldingen. 86 tonen nu een goedkoper aanbod, waarvan 11 van een wederverkoper die geen precisie vermeldt.
Vóór deze regel was elke prijs hier de modelprijs van OpenRouter, die elke verkoper kan bepalen, acties en 4-bitkopieën inbegrepen. De wijziging staat als §96 in het correctielogboek, met de cijfers ervoor en erna.
7 · Taakafhankelijke rangschikking
Eén globale volgorde is intellectueel oneerlijk, want verschillend werk wordt door verschillende modellen gewonnen. Wij houden Elo per taak bij over 25 categorieën — front-end, datavisualisatie, gameontwikkeling, SVG, Android, presentaties en meer. Een taak kiezen herrangschikt het hele bord op de Elo van die taak in plaats van op een algemene index.
Taakscores zijn de Elo per taak van Design Arena, gelezen uit de modelfeed van OpenRouter: designarena.ai.
De dekking verschilt per categorie, en een model dat op de ranglijst van een categorie ontbreekt, wordt getoond als niet gemeten voor die taak, niet als slecht daarin.
8 · Als hetzelfde model twee keer wordt verkocht
Sommige modellen zijn geen nieuwe modellen. De verkoper zegt het zelf: 11 vermeldingen in deze catalogus worden door hun eigen leverancier beschreven als een ander model uit de catalogus dat op een andere manier wordt aangeboden — een snellere afhandeling, een andere redeneermodus, meer rekenkracht per query. 10 van de 11 hebben op geen enkele LMArena-ranglijst een notering. Van hun 11 basismodellen hebben er 11 wel een.
| Verkocht als | Prijs van het niveau | Basismodel | Wat de verkoper zegt |
|---|---|---|---|
| o1-pro geen notering | $600 ×10 | o1 1.365,8 | meer rekenkracht per query |
| o3 Pro geen notering | $80 ×10 | o3 1.409,9 | meer rekenkracht per query |
| GPT-6 Astra Pro geen notering | $50 ×1 | GPT-6 Astra 1.442,3 bij inspanning maximaal | zelfde model, andere bedieningsmodus |
| GPT-5.6 Sol Pro geen notering | $20 ×1 | GPT-5.6 Sol 1.456,3 bij inspanning zeer hoog | zelfde model, andere bedieningsmodus |
| GPT-5.6 Terra Pro geen notering | $12 ×1 | GPT-5.6 Terra 1.446,3 bij inspanning zeer hoog | zelfde model, andere bedieningsmodus |
| GPT-6 Sol Pro geen notering | $10 ×1 | GPT-6 Sol 1.395,4 bij inspanning maximaal | zelfde model, andere bedieningsmodus |
| GPT-6.1 Sol Pro geen notering | $10 ×1 | GPT-6.1 Sol 1.445,6 bij inspanning maximaal | zelfde model, andere bedieningsmodus |
| o3 Mini High 1.336,6 | $4,4 ×1 | o3 Mini 1.319,4 | zelfde model, andere bedieningsmodus |
| o4 Mini High geen notering | $4,4 ×1 | o4 Mini 1.353,2 | zelfde model, andere bedieningsmodus |
| GPT-5.6 Luna Pro geen notering | $1,2 ×1 | GPT-5.6 Luna 1.431 bij inspanning zeer hoog | zelfde model, andere bedieningsmodus |
| GPT-6 Luna Pro geen notering | $0,5 ×1 | GPT-6 Luna 1.391,5 bij inspanning maximaal | zelfde model, andere bedieningsmodus |
Het onderscheid doet ertoe voor wat je kunt concluderen. Waar de verkoper identieke capaciteiten zegt — 0 van de 11 — is de score van het basismodel ook de eigen bewering van de verkoper over het niveau, en het enige wat je koopt is snelheid. Waar de verkoper meer rekenkracht of een andere modus noemt, vertelt geen enkele gepubliceerde meting je wat de extra uitgave oplevert, op die ene uitzondering hierboven na.
Dit telt alleen wat de verkoper zelf zegt. Een model waarvan de naam op ‘Pro’ eindigt, maar dat de leverancier een op zichzelf staand vlaggenschipmodel noemt, telt hier niet mee, want dat zou onze bewering zijn in plaats van de hunne — dezelfde fout als de eigen serviceniveaus van een leverancier behandelen als concurrerende verkopers, waardoor een prijsspreiding van 2× ooit als 7,2× werd gepubliceerd.
Geen notering op een LMArena-ranglijst is geen oordeel. Het is geen bewijs van slechte kwaliteit, en het betekent niet dat niemand deze modellen heeft geëvalueerd — leveranciers publiceren hun eigen resultaten. Het betekent dat de as waarop deze site rangschikt voor deze modellen geen meting heeft, dus rangschikken wij ze niet.
9 · Waar de gegevens vandaan komen
Prijzen worden genormaliseerd uit een machineleesbare catalogus over meerdere aanbieders en gekruist met de prijspagina’s van leveranciers. Elke modelpagina linkt naar haar bron en ophaaldatum.
- Conflicten worden vastgelegd, niet gemiddeld. Wanneer twee bronnen het over een prijs oneens zijn, is die onenigheid de bevinding. Een model dat door de leverancier op $4/$20 wordt gezet en via een aggregator voor $2/$10 wordt verkocht, heeft twee ware prijzen, en welke geldt hangt af van waar je koopt.
- Onaannemelijke waarden gaan in quarantaine. Een bovenstroomse sentinel van −1 voor ‘prijs op moment van aanvraag’ wordt −$750.000 per miljoen als je haar klakkeloos doorlaat, en wint elke sortering op goedkoopste-eerst. Alles buiten een aannemelijk bereik wordt achtergehouden met een reden erbij.
- Vertrouwen geldt per veld. Niet één badge per regel. Beweren dat een record geverifieerd is terwijl alleen de prijs is gecontroleerd, is het soort overdrijving dat het vertrouwen beëindigt zodra iemand het merkt.
- Niet beoordeeld is geen nul. 219 modellen hebben geen onafhankelijke score. Ze staan op prijs vermeld en zijn uitgesloten van de kwaliteitsordening; ze worden nooit onderaan gezet alsof ze gemeten waren en gefaald hadden.
10 · Licenties, en wat die beperken
Twee van de benchmarks waarop deze site steunt hebben zeer verschillende herdistributievoorwaarden, en dat verandert wat er gepubliceerd mag worden.
- LMArena publiceert haar ranglijst als een CC-BY-4.0-dataset, die herdistributie met bronvermelding toestaat — en die de betrouwbaarheidsgrenzen bevat waarvan de significantierangen hierboven afhangen. Dat is het kanaal om te gebruiken; de site zelf schrapen is door hun voorwaarden verboden.
- Artificial Analysis's free tier is "internal use only with attribution"; public redistribution requires a commercial licence, and their site terms separately limit use to personal and non-commercial purposes. So we do not publish their figures at all. Every general capability score on this site is LMArena Elo, used under CC BY 4.0 from the official dataset; the per-task scores are Design Arena’s, below. Artificial Analysis remains an internal cross-check, which is what its free tier permits; it reaches no page, export or API here.
- De API-voorwaarden van Design Arena stellen de klassementsgegevens vrij voor gebruik, ook commercieel, op één voorwaarde: een openbare weergave vermeldt Design Arena en linkt naar designarena.ai. De Elo per taak komt via de modelfeed van OpenRouter op deze site; de taakweergave, de rangen per taak op elke modelpagina en deze pagina vermelden de bron.
- De prijs zelf is een feit dat een leverancier publiceert, en dat is iets anders dan een samengestelde indexscore. Prijzen worden gekruist met leverancierspagina’s en elke regel linkt naar haar bron.
11 · Correcties
Prijzen veranderen zonder aankondiging en pagina’s worden opnieuw opgemaakt; een deel van wat hier staat zal op enig moment onjuist zijn. Vind je een fout, dan is de snelste route: zeg welk model, wat het cijfer zou moeten zijn, en waar het gepubliceerd staat — correcties met een primaire bron worden direct doorgevoerd.
Catalogus laatst opgehaald op 2026-10-06. De rangschikkingslogica is mee geversioneerd met de site, zodat een verandering in hoe ‘beste’ wordt berekend een zichtbare diff is en geen stille herafstemming.