Metod

Allt här går att återskapa ur samma offentliga källor som du själv kan kontrollera. Där underlaget är tunt eller källorna säger emot varandra säger den här sidan det — en förtroendesida som bara rapporterar goda nyheter är marknadsföring.

60% av katalogen har ingen oberoende kvalitetspoäng. 145 av 364 modeller är betygsatta. Resten listas, prissätts och märks tydligt som obetygsatta — och rangordnas aldrig.
72/145 visade positioner som är verkligt skilda placeringar. 94 % av intilliggande par ligger inom benchmarkens felmarginal.
67/364 modeller vars rubrikpris inte är hela priset: kontextnivåer, resonemang som faktureras separat, eller taxor efter tid på dygnet.
7/447 entries with variable prices withheld
4/447 entries with suspect latency withheld; may overlap the price group

1 · Vad ”bäst” betyder

Kvalitet går först och pris avgör vid lika. Den ordningen är hela produkten: en lista sorterad billigast först är trivial att publicera och nästan oanvändbar, eftersom den billigaste modellen på den här marknaden är 12 500× billigare än den dyraste och i allmänhet inte klarar jobbet.

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are LMArena Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

Varför det inte finns någon enda kvalitetspoäng

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are LMArena Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

2 · Placeringar du kan lita på

Placeringskolumnen är en signifikansplacering, inte ett radnummer. En modells placering är ett mer än antalet modeller som slår den med mer än båda felmarginalerna tillsammans. Modeller där antalet är detsamma får samma placering. Två modeller inom varandras felmarginal kan ändå få olika placeringar, eftersom var och en jämförs med hela listan.

SHA-256 av den placeringsrelevanta projektionen (identifierare, poäng, priser per arbetsbelastning, frontflagga): 06cd12db54e2968c3de49b45a3a2a6881f374f6e58a462437784450842efb989. Datum och byggstämplar utesluts. En förändring här är en förändring i rangordningen, inte i ytan.

Rättelser

Det mesta av en rankninglistas ordning är brus

Två Arena-poäng räknas som åtskilda först när de skiljer sig med mer än summan av båda modellernas felmarginaler på 95 %. Den summan är i genomsnitt 10,47 poäng på den här listan, och testet är minst lika strängt som ett 95 %-intervall för skillnaden. 136 av 144 intilliggande par (94 %) ligger inom sin egen summa. Räknar man en modells placering som ett mer än antalet modeller som tydligt slår den, har de 145 visade positionerna 72 olika placeringar, och 4 modeller delar förstaplatsen.

”Modellen som är nummer 1” är därför inte ett påstående dessa data bär. Delade placeringar visas som delade. Placering 1 är placering 1 bland modellerna i prisflödet som den här webbplatsen läser: när LMArena placerar en modell som flödet inte innehåller över dem alla, namnger tavlan den modellen och ger den ingen placering.

Metoden är inte vår. LMArena har rankat så i åratal — deras Rank (UB) ger varje modell placeringen ett mer än antalet modeller som är statistiskt bättre än den, och de har släppt implementationen som öppen källkod. Det ovanliga är att tillämpa den på en prisjämförelse, där incitamentet är att publicera en skarp ordning.

Applied to the general arena board only. Other boards carry their own error, which we do not have, so they are not given a borrowed threshold.

3 · ”Bättre och billigare” måste betyda något

Paretodominans på pris och förmåga är en tvådimensionell projektion av ett långt bredare köpbeslut, och projektionen ljuger oftare än inte. En modell kan få högre poäng och kosta mindre samtidigt som den inte tar emot bilder, kapar utdata till hälften så många tokens, eller håller en halv miljon färre tokens kontext.

Därför är ”både bättre och billigare” reserverat för en ersättare vars förmågeomfång är en övermängd av originalets. Av 133 dominansutlåtanden är 113 strikta och 20 (15 %) namnger i stället vad du skulle avstå från. Utan den grinden rekommenderade 61 % av de råa tvåaxliga utlåtandena en modell som inte klarade den sittandes arbete.

4 · Fronten, inte ett värdebetyg

En modell ligger på värdefronten när ingen annan modell får minst lika hög poäng, kostar högst lika mycket och vinner på någon av de två. 12 av de betygsatta, prissatta modellerna med standardleverans kvalificerar sig. Var och en av de övriga 92 % har en sådan modell ovanför sig, men inte alltid en likvärdig ersättare: avsnittet ovan räknar dem där du skulle avstå från något.

Varför inte rangordna efter kvalitet per krona?

Därför att kvoten belönar billighet mycket brantare än kvalitet. Tillämpad på den här katalogen kröner den en modell som når 37,8 av ett tak kring 63, och sätter en som når 14,2 på andra plats — modeller ingen borde sätta i drift. Varje sajt som publicerar en ”värde”-kolumn räknad så ger dåliga råd. Vi använder i stället fronten plus en uttalad kvalitetströskel.

5 · Pris är en egenskap hos en modell och en arbetsbelastning

Det finns inget som heter ”priset” för en modell. Sammanfattning är indatatung, kodgenerering utdatatung, och en agentslinga spelar upp sin kontext varje varv; samma katalog ordnar sig olika i vart och ett av fallen. I stället för att välja en blandning och dölja den är förhållandet in:ut och cacheträffgraden reglage du ser och kan ändra.

Om pris för cacheläsning saknas använder den blandade kostnadsberäkningen fullt indatapris för den valda prisnivån.

ArbetsbelastningAndel utdataCacheträffarForm
Balanserad 25% 0%3 tokens in per 1 ut
Sammanfatta 5% 30%Enorm indata, liten utdata
Chatt 40% 50%Lång cachad systemprompt
Kodgen 60% 20%Utdata dominerar
Agentisk 15% 70%Kontexten spelas upp varje tur

Tre saker gör regelbundet den annonserade taxan felaktig, och alla tre visas på raden:

  • Kontextnivåer. 51 modeller byter taxa bortom en tröskel för promptlängd, vissa mer än en gång — Qwen3.7 Flash går till 3,33× bortom 32K och 6,67× bortom 256K. Prissätt en långkontextbelastning utifrån rubrikpriset och du hamnar fel med en multipel.
  • Resonemangstokens som faktureras skilt från utdata. När resonemangstokens faktureras separat beror kostnaden på den fakturerade mängden och priset per token. Ta med den kostnaden i din uppskattning.
  • Prissättning efter tid på dygnet. Modeller med publicerade prisfönster: 2. Kontrollera tidsfönster, tidszon och priser; räkna inte med en enhetlig rabatt.

6 · Vilket pris vi publicerar

Ett betyg mäts på modellens egen driftsättning, så priset bredvid är referenspriset: det billigaste erbjudandet, på den balanserade mixen, som klarar alla tester nedan. Erbjudandets priser för indata, utdata och cacheläsning publiceras tillsammans, aldrig blandade med ett annat erbjudandes.

  1. I drift. Ett erbjudande som OpenRouter anger som ur drift utesluts. Ett erbjudande som vid avläsningen visas som försämrat räknas ändå om det var i drift minst 95 % av det senaste dygnet. Ett erbjudande som var i drift mindre än 80 % av det senaste dygnet räknas inte, oavsett vad det visar nu.
  2. Standardleverans. Flex, priority, fast och liknande nivåer är en annan produkt och utesluts.
  3. Standardpris. Ett erbjudande med kampanj räknas till sitt standardpris: varje pris delat med ett minus rabatten. Kampanjpriset redovisas, men rangordnas aldrig.
  4. Standardfönster. Ett pris som beror på tid på dygnet räknas till standardpriset; rabattimmarna redovisas.
  5. Tillverkarens precision eller bättre. Ett 4-bitarserbjudande (fp4, nvfp4, mxfp4, int4) räknas bara när tillverkaren själv serverar 4-bit eller, när tillverkaren inte anger någon precision, dess publicerade vikter är 4-bit. Ett erbjudande som inte anger precision räknas när det är tillverkarens eget, eller en återförsäljares av en modell med stängda vikter: den levererar tillverkarens driftsättning. Med öppna vikter, eller vikter som ingen har registrerat, utesluts en återförsäljares erbjudande som inte anger någon: det läses aldrig som full precision.

När inget erbjudande klarar testerna behåller modellen ett reservpris, märkt som pris utan likvärdigt erbjudande med sitt skäl, eftersom en modell utan pris skulle läsas som frånvarande: bland erbjudandena i drift med standardleverans, vart och ett till sitt standardpris, det billigaste från en återförsäljare som inte anger precision, och annars det billigaste 4-bitarserbjudandet. En annan leveransnivå används bara när inget annat är i drift. En modell utan något erbjudande att ta ett pris från behåller OpenRouters modellpris.

Det billigaste erbjudandet som regeln utesluter visas, när det är billigare, på modellsidan som ”Billigare just nu”, med skälet: en kampanj och dess procent, 4-bit, en leveransnivå eller precision ej angiven. Det sätter aldrig en rang, fronten, ett utlåtande eller en rubriksiffra. När erbjudandet som sätter priset självt har en kampanj visas dess eget kampanjpris.

I dessa data har 333 modeller ett referenspris, 15 ett pris utan likvärdigt erbjudande och 99 OpenRouters modellpris, bland dem batch- och gratisposter. 86 visar just nu ett billigare erbjudande, varav 11 från en återförsäljare som inte anger precision.

Före denna regel var varje pris här OpenRouters modellpris, som vilken säljare som helst kan sätta, kampanjer och 4-bitarskopior inräknade. Ändringen är loggad som §96 i rättelseloggen, med siffrorna före och efter.

7 · Uppgiftsberoende rangordning

En enda global ordning är intellektuellt oärlig, eftersom olika modeller vinner olika arbete. Vi bär Elo per uppgift över 25 kategorier — frontend, datavisualisering, spelutveckling, SVG, Android, presentationer med mera. Att välja en uppgift rangordnar hela tabellen efter den uppgiftens Elo i stället för efter ett allmänt index.

Uppgiftspoängen är Design Arenas Elo per uppgift, hämtad ur OpenRouters modellflöde: designarena.ai.

Täckningen varierar mellan kategorier, och en modell som saknas i en kategoris rankning visas som omätt för den uppgiften, inte som dålig på den.

8 · När samma modell säljs två gånger

Vissa modeller är inte nya modeller. Säljaren säger det själv: 11 poster i den här katalogen beskrivs av sin egen leverantör som en annan modell i katalogen som serveras på ett annat sätt — en snabbare fil, ett annat resonemangsläge, mer beräkningskraft per förfrågan. 10 av dessa 11 har ingen notering på någon LMArena-topplista. 11 av deras 11 basmodeller har en.

När samma modell säljs två gånger
Säljs somNivåns prisBasmodellVad säljaren säger
o1-pro ingen notering$600 ×10o1 1 365,8 mer beräkningskraft per förfrågan
o3 Pro ingen notering$80 ×10o3 1 409,9 mer beräkningskraft per förfrågan
GPT-6 Astra Pro ingen notering$50 ×1GPT-6 Astra 1 442,3 vid resonemangsinsats maximalsamma modell, annat serveringsläge
GPT-5.6 Sol Pro ingen notering$20 ×1GPT-5.6 Sol 1 456,3 vid resonemangsinsats mycket högsamma modell, annat serveringsläge
GPT-5.6 Terra Pro ingen notering$12 ×1GPT-5.6 Terra 1 446,3 vid resonemangsinsats mycket högsamma modell, annat serveringsläge
GPT-6 Sol Pro ingen notering$10 ×1GPT-6 Sol 1 395,4 vid resonemangsinsats maximalsamma modell, annat serveringsläge
GPT-6.1 Sol Pro ingen notering$10 ×1GPT-6.1 Sol 1 445,6 vid resonemangsinsats maximalsamma modell, annat serveringsläge
o3 Mini High 1 336,6 $4,4 ×1o3 Mini 1 319,4 samma modell, annat serveringsläge
o4 Mini High ingen notering$4,4 ×1o4 Mini 1 353,2 samma modell, annat serveringsläge
GPT-5.6 Luna Pro ingen notering$1,2 ×1GPT-5.6 Luna 1 431 vid resonemangsinsats mycket högsamma modell, annat serveringsläge
GPT-6 Luna Pro ingen notering$0,5 ×1GPT-6 Luna 1 391,5 vid resonemangsinsats maximalsamma modell, annat serveringsläge

Skillnaden avgör vilka slutsatser du kan dra. Där säljaren säger identiska förmågor — 0 av de 11 — är basmodellens poäng också säljarens eget påstående om nivån, och det enda du köper är hastighet. Där säljaren säger mer beräkningskraft eller ett annat läge finns ingen publicerad mätning som visar vad den extra utgiften ger, med det enda undantaget som nämns ovan.

Här räknas bara det som säljaren själv uppger. En modell vars namn slutar på ”Pro” men som dess leverantör kallar en flaggskeppsmodell i egen rätt räknas inte här, eftersom det vore vårt påstående och inte deras — samma misstag som att behandla en leverantörs egna tjänstenivåer som konkurrerande säljare, vilket en gång gjorde en prisspridning på 2× till publicerade 7,2×.

Att sakna notering på en LMArena-topplista är ingen bedömning. Det är inget belägg för dålig kvalitet, och det betyder inte att ingen har utvärderat dessa — leverantörerna publicerar sina egna resultat. Det betyder att axeln som den här sajten rangordnar efter saknar mätvärde för dem, så vi rangordnar dem inte.

9 · Varifrån data kommer

Priser normaliseras från en maskinläsbar katalog över flera leverantörer och stäms av mot leverantörernas prissidor. Varje modellsida länkar sin källa och hämtningsdatum.

  • Konflikter registreras, de medelvärdesbildas inte. När två källor är oense om ett pris är den oenigheten fyndet. En modell som listas till 4/20 USD av sin leverantör och säljs till 2/10 USD via en aggregator har två sanna priser, och vilket som gäller beror på var du köper.
  • Orimliga värden sätts i karantän. En uppströms sentinel på −1 för ”pris sätts vid förfrågan” blir −750 000 USD per miljon om den släpps igenom rakt av, och vinner varje sortering på billigast först. Allt utanför ett rimligt intervall hålls inne med ett skäl bifogat.
  • Tillförlitlighet gäller per fält. Inte en märkning per rad. Att påstå att en post är verifierad när bara priset kontrollerats är den sorts överdrift som avslutar förtroendet första gången någon märker det.
  • Obetygsatt är inte noll. 219 modeller saknar oberoende poäng. De listas efter pris och utesluts ur kvalitetsordningen; de sorteras aldrig längst ner som om de hade mätts och underkänts.

10 · Licensiering, och vad den begränsar

Två av de benchmarker den här sajten vilar på har mycket olika villkor för vidaredistribution, och det ändrar vad som får publiceras.

  • LMArena publicerar sin rankning som ett CC-BY-4.0-dataset, vilket tillåter vidaredistribution med angivande av källa — och som bär de konfidensgränser signifikansplaceringarna ovan bygger på. Det är kanalen att använda; att skrapa själva webbplatsen är förbjudet enligt deras villkor.
  • Artificial Analysis's free tier is "internal use only with attribution"; public redistribution requires a commercial licence, and their site terms separately limit use to personal and non-commercial purposes. So we do not publish their figures at all. Every general capability score on this site is LMArena Elo, used under CC BY 4.0 from the official dataset; the per-task scores are Design Arena’s, below. Artificial Analysis remains an internal cross-check, which is what its free tier permits; it reaches no page, export or API here.
  • Design Arenas API-villkor gör topplistans data fri att använda, även kommersiellt, på ett villkor: en offentlig visning anger Design Arena som källa och länkar till designarena.ai. Elo per uppgift når den här webbplatsen via OpenRouters modellflöde; uppgiftsvyn, placeringarna per uppgift på varje modellsida och den här sidan anger källan.
  • Priset i sig är ett faktum som en leverantör publicerar, vilket är något annat än ett sammanställt indexvärde. Priser stäms av mot leverantörssidor och varje rad länkar sin källa.

11 · Rättelser

Priser ändras utan förvarning och sidor görs om; något av det som står här kommer att vara fel vid en given tidpunkt. Hittar du ett fel är snabbaste vägen att säga vilken modell, vad siffran borde vara, och var den är publicerad — rättelser med primärkälla tillämpas direkt.

Rapportera ett felaktigt pris

Katalogen hämtades senast 2026-10-06. Rangordningslogiken versionshanteras med sajten, så en förändring i hur ”bäst” beräknas är en synlig diff och ingen tyst omjustering.

Belägg & frågor