Metodyka
Wszystko tutaj da się odtworzyć z tych samych publicznych źródeł, które możesz sprawdzić sam. Tam, gdzie danych jest mało albo źródła się rozchodzą, ta strona to mówi — strona o zaufaniu, która podaje wyłącznie dobre wieści, jest reklamą.
1 · Co znaczy „najlepszy”
Prowadzi jakość, a cena rozstrzyga remisy. Ta kolejność jest całym produktem: lista od najtańszego jest banalnie łatwa do opublikowania i niemal bezużyteczna, bo najtańszy model na tym rynku jest 12 500× tańszy od najdroższego i zwykle nie podoła zadaniu.
Capability comes from independent evaluators, never from us and never from the vendor. The general scores are LMArena Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.
Dlaczego nie ma jednej oceny jakości
Capability comes from independent evaluators, never from us and never from the vendor. The general scores are LMArena Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.
2 · Miejsca, na których można polegać
Kolumna miejsca to miejsce istotności, a nie numer wiersza. Miejsce modelu jest o jeden większe niż liczba modeli, które biją go o więcej niż suma obu marginesów błędu. Modele, dla których ta liczba jest taka sama, dzielą miejsce. Dwa modele mieszczące się nawzajem w swoich marginesach błędu mogą mimo to zajmować różne miejsca, bo każdy jest porównywany z całym rankingiem.
SHA-256 rzutu istotnego dla miejsca (identyfikatory, wyniki, ceny wg obciążenia, znacznik granicy): 06cd12db54e2968c3de49b45a3a2a6881f374f6e58a462437784450842efb989. Daty i znaczniki kompilacji są pominięte. Zmiana tutaj to zmiana w rankingu, a nie w oprawie.
Większość kolejności w rankingu to szum
Dwa wyniki Arena liczą się jako rozdzielone dopiero wtedy, gdy różnią się o więcej niż suma 95-procentowych marginesów błędu obu modeli. Średnia tej sumy na tej liście, w punktach: 10,47. Test jest co najmniej tak surowy jak 95-procentowy przedział dla różnicy. Sąsiednie pary mieszczące się we własnej sumie: 136 z 144 (94%). Gdy miejsce modelu liczy się jako o jeden większe niż liczba modeli, które wyraźnie go biją, liczba odrębnych miejsc wśród pokazanych pozycji (145) wynosi 72. Modele ex aequo na pierwszym miejscu: 4.
„Model numer 1” nie jest więc twierdzeniem, które te dane uniosą. Remisy pokazujemy jako remisy. Miejsce 1 to miejsce 1 wśród modeli ze źródła cen, które czyta ta strona: gdy LMArena stawia ponad nimi wszystkimi model, którego to źródło nie zawiera, tablica wymienia ten model i nie nadaje mu miejsca.
Ta metoda nie jest nasza. LMArena szereguje tak od lat — ich Rank (UB) przypisuje każdemu modelowi miejsce o jeden większe niż liczba modeli statystycznie od niego lepszych, a implementację udostępnili otwarcie. Nietypowe jest zastosowanie tego do porównania cen, gdzie zachęta idzie w stronę publikowania ostrej kolejności.
Applied to the general arena board only. Other boards carry their own error, which we do not have, so they are not given a borrowed threshold.
3 · „Lepszy i tańszy” musi coś znaczyć
Dominacja Pareta po cenie i zdolnościach to dwuwymiarowy rzut o wiele szerszej decyzji zakupowej, a ten rzut częściej kłamie, niż nie. Model może mieć wyższy wynik i kosztować mniej, a jednocześnie nie przyjmować obrazów, ograniczać wyjście do połowy tokenów albo utrzymywać o pół miliona tokenów mniej kontekstu.
Dlatego „zarazem lepszy i tańszy” jest zarezerwowane dla zamiennika, którego zakres możliwości jest nadzbiorem oryginału. Spośród 133 werdyktów dominacji 113 jest ścisłych, a 20 (15%) nazywa zamiast tego, z czego trzeba by zrezygnować. Bez tej bramki 61% surowych werdyktów dwuosiowych polecało model, który nie podołałby pracy dotychczasowego.
4 · Granica, a nie ocena wartości
Model leży na granicy wartości, gdy nie istnieje inny model, który ma co najmniej tak wysoki wynik, kosztuje nie więcej i wygrywa na jednej z tych dwóch osi. Kwalifikuje się 12 ocenionych i wycenionych modeli w dostawie standardowej. Nad każdym z pozostałych 92% znajduje się taki model, choć nie zawsze jest to porównywalny zamiennik: sekcja powyżej liczy przypadki, w których trzeba z czegoś zrezygnować.
Dlaczego nie szeregować według jakości za złotówkę?
Bo taki iloraz nagradza taniość znacznie stromiej niż jakość. Zastosowany do tego katalogu koronuje model z wynikiem 37,8 przy pułapie około 63, a na drugim miejscu stawia model z wynikiem 14,2 — modele, których nikt nie powinien wdrażać. Każdy serwis publikujący tak liczoną kolumnę „wartości” doradza źle. My używamy granicy oraz jawnego progu jakości.
5 · Cena jest własnością modelu oraz obciążenia
Nie istnieje „ta” cena modelu. Streszczanie jest intensywne po stronie wejścia, generowanie kodu po stronie wyjścia, a pętla agentowa odtwarza swój kontekst w każdej turze; ten sam katalog układa się inaczej w każdym z tych przypadków. Zamiast wybrać jedną mieszankę i ją ukryć, stosunek wejścia do wyjścia i trafienia w cache są widocznymi regulatorami, które możesz zmienić.
Jeśli nie podano stawki odczytu z pamięci podręcznej, szacunek mieszany stosuje pełną stawkę wejściową wybranego progu cenowego.
| Obciążenie | Udział wyjścia | Trafienia cache | Kształt |
|---|---|---|---|
| Zrównoważone | 25% | 0% | 3 tokeny wejścia na 1 wyjścia |
| Streszczanie | 5% | 30% | Ogromne wejście, znikome wyjście |
| Czat | 40% | 50% | Długi, cache’owany prompt systemowy |
| Generowanie kodu | 60% | 20% | Dominuje wyjście |
| Agentowe | 15% | 70% | Kontekst odtwarzany w każdej turze |
Trzy rzeczy regularnie unieważniają reklamowaną stawkę i wszystkie trzy widać w wierszu:
- Progi kontekstu. 51 modeli zmienia stawkę po przekroczeniu progu długości promptu, część więcej niż raz — Qwen3.7 Flash przechodzi na 3,33× powyżej 32K i na 6,67× powyżej 256K. Wycenisz obciążenie długokontekstowe po cenie z nagłówka i pomylisz się o wielokrotność.
- Tokeny rozumowania fakturowane osobno od wyjścia. Gdy tokeny rozumowania są rozliczane osobno, koszt zależy od liczby naliczonych tokenów i obowiązującej stawki. Uwzględnij tę opłatę w swoim oszacowaniu.
- Ceny zależne od pory doby. Liczba modeli z opublikowanymi stawkami zależnymi od pory dnia: 2. Sprawdź godziny, strefę czasową i stawki; nie zakładaj jednakowej zniżki.
6 · Jaką cenę publikujemy
Wynik jest mierzony na własnym wdrożeniu modelu, więc cena obok niego to cena referencyjna: najtańsza oferta, w zrównoważonym miksie, która przechodzi każdy z poniższych testów. Stawki za wejście, wyjście i odczyt z cache tej oferty są publikowane razem, nigdy nie mieszane ze stawkami innej oferty.
- Działa. Oferta, którą OpenRouter oznacza jako niedziałającą, jest wykluczona. Oferta, która w chwili odczytu jest oznaczona jako pogorszona, liczy się mimo to, jeśli działała przez co najmniej 95% ostatniej doby. Oferta, która działała przez mniej niż 80% ostatniej doby, nie liczy się, bez względu na jej obecny stan.
- Standardowa dostawa. Flex, priority, fast i podobne poziomy to inny produkt i są wykluczone.
- Stawka standardowa. Oferta w promocji liczy się po stawce standardowej: każda stawka podzielona przez jeden minus rabat. Cena promocyjna jest ujawniana, nigdy nie trafia do rankingu.
- Standardowe okno. Cena zależna od pory dnia liczy się według stawki standardowej; godziny rabatu są ujawniane.
- Precyzja producenta lub lepsza. Oferta 4-bitowa (fp4, nvfp4, mxfp4, int4) liczy się tylko wtedy, gdy producent sam serwuje 4 bity albo, gdy producent nie podaje precyzji, jego opublikowane wagi są 4-bitowe. Oferta bez podanej precyzji liczy się, gdy jest ofertą samego producenta albo odsprzedawcy modelu o zamkniętych wagach: obsługuje on wdrożenie producenta. Przy wagach otwartych albo takich, których nikt nie odnotował, oferta odsprzedawcy bez podanej precyzji jest wykluczona: nigdy nie jest odczytywana jako pełna precyzja.
Gdy żadna oferta nie przechodzi testów, model zachowuje cenę zastępczą, oznaczoną jako cena bez równoważnej oferty wraz z powodem, bo model bez ceny wyglądałby na nieobecny: spośród działających ofert ze standardową dostawą, każda po stawce standardowej, najtańszą od odsprzedawcy, który nie podaje precyzji, a gdy takiej nie ma, najtańszą 4-bitową. Inny poziom dostawy jest używany tylko wtedy, gdy nic innego nie działa. Model bez oferty, z której można wziąć cenę, zachowuje cenę modelu z OpenRouter.
Najtańsza oferta wykluczona przez regułę, gdy jest tańsza, pojawia się na stronie modelu jako „Teraz taniej”, z powodem: promocja i jej procent, 4 bity, poziom dostawy albo precyzja nieujawniona. Nigdy nie ustala pozycji, granicy, werdyktu ani liczby w nagłówku. Gdy oferta ustalająca cenę sama jest w promocji, pokazywana jest jej własna cena promocyjna.
W tych danych 333 modeli ma cenę referencyjną, 15 cenę bez równoważnej oferty, a 99 cenę modelu z OpenRouter, w tym wpisy batch i darmowe. 86 pokazuje teraz tańszą ofertę, w tym 11 od odsprzedawcy, który nie podaje precyzji.
Przed tą regułą każda cena tutaj była ceną modelu z OpenRouter, którą może ustalić każdy sprzedawca, łącznie z promocjami i kopiami 4-bitowymi. Zmiana jest zapisana jako §96 w dzienniku korekt, z liczbami przed i po.
7 · Szeregowanie zależne od zadania
Jedna globalna kolejność jest intelektualnie nieuczciwa, bo różne prace wygrywają różne modele. Prowadzimy Elo zadaniowe w 25 kategoriach — front-end, wizualizacja danych, tworzenie gier, SVG, Android, prezentacje i więcej. Wybór zadania przestawia całą tablicę według Elo tego zadania, a nie według indeksu ogólnego.
Wyniki zadań to Elo dla poszczególnych zadań z Design Arena, odczytane z kanału modeli OpenRouter: designarena.ai.
Pokrycie różni się między kategoriami, a model nieobecny w rankingu danej kategorii jest pokazany jako niezmierzony w tym zadaniu, a nie jako w nim słaby.
8 · Gdy ten sam model jest sprzedawany dwa razy
Niektóre modele nie są nowymi modelami. Mówi to sam sprzedawca: 11 pozycji w tym katalogu ich własny dostawca opisuje jako inny model z katalogu, udostępniany w inny sposób — szybszą ścieżką, w innym trybie rozumowania, z większą mocą obliczeniową na zapytanie. 10 z 11 nie ma wpisu w żadnym rankingu LMArena. Z ich 11 modeli bazowych wpis ma 11.
| Sprzedawany jako | Cena poziomu | Model bazowy | Co mówi sprzedawca |
|---|---|---|---|
| o1-pro brak wpisu | $600 ×10 | o1 1365,8 | więcej mocy obliczeniowej na zapytanie |
| o3 Pro brak wpisu | $80 ×10 | o3 1409,9 | więcej mocy obliczeniowej na zapytanie |
| GPT-6 Astra Pro brak wpisu | $50 ×1 | GPT-6 Astra 1442,3 przy wysiłku maksymalnym | ten sam model, inny tryb obsługi |
| GPT-5.6 Sol Pro brak wpisu | $20 ×1 | GPT-5.6 Sol 1456,3 przy wysiłku bardzo wysokim | ten sam model, inny tryb obsługi |
| GPT-5.6 Terra Pro brak wpisu | $12 ×1 | GPT-5.6 Terra 1446,3 przy wysiłku bardzo wysokim | ten sam model, inny tryb obsługi |
| GPT-6 Sol Pro brak wpisu | $10 ×1 | GPT-6 Sol 1395,4 przy wysiłku maksymalnym | ten sam model, inny tryb obsługi |
| GPT-6.1 Sol Pro brak wpisu | $10 ×1 | GPT-6.1 Sol 1445,6 przy wysiłku maksymalnym | ten sam model, inny tryb obsługi |
| o3 Mini High 1336,6 | $4,4 ×1 | o3 Mini 1319,4 | ten sam model, inny tryb obsługi |
| o4 Mini High brak wpisu | $4,4 ×1 | o4 Mini 1353,2 | ten sam model, inny tryb obsługi |
| GPT-5.6 Luna Pro brak wpisu | $1,2 ×1 | GPT-5.6 Luna 1431 przy wysiłku bardzo wysokim | ten sam model, inny tryb obsługi |
| GPT-6 Luna Pro brak wpisu | $0,5 ×1 | GPT-6 Luna 1391,5 przy wysiłku maksymalnym | ten sam model, inny tryb obsługi |
To rozróżnienie ma znaczenie dla tego, co można wywnioskować. Tam, gdzie sprzedawca mówi o identycznych możliwościach — 0 z 11 — wynik modelu bazowego jest także własnym twierdzeniem sprzedawcy o danym poziomie, a jedyne, co kupujesz, to szybkość. Tam, gdzie sprzedawca mówi o większej mocy obliczeniowej lub innym trybie, żaden opublikowany pomiar nie mówi, co daje dodatkowy wydatek, z jednym wyjątkiem opisanym wyżej.
Liczymy tu wyłącznie to, co stwierdza sprzedawca. Model, którego nazwa kończy się na „Pro”, ale który jego dostawca nazywa samodzielnym modelem flagowym, nie jest tu liczony, bo byłoby to nasze twierdzenie, a nie ich — ten sam błąd, co traktowanie własnych poziomów usług dostawcy jak konkurujących sprzedawców, który kiedyś zamienił rozrzut cen 2× w opublikowane 7,2×.
Brak wpisu w rankingu LMArena nie jest werdyktem. Nie jest dowodem słabej jakości i nie oznacza, że nikt tych modeli nie oceniał — dostawcy publikują własne wyniki. Oznacza, że oś, według której ten serwis szereguje, nie ma dla nich odczytu, więc ich nie szeregujemy.
9 · Skąd pochodzą dane
Ceny są normalizowane z czytelnego maszynowo katalogu obejmującego wielu dostawców i weryfikowane wobec stron cenowych dostawców. Każda strona modelu odsyła do swojego źródła i daty pobrania.
- Konflikty są odnotowywane, a nie uśredniane. Gdy dwa źródła podają różne ceny, ta rozbieżność jest ustaleniem. Model wystawiony przez dostawcę po 4/20 USD i sprzedawany po 2/10 USD przez agregatora ma dwie prawdziwe ceny, a to, która obowiązuje, zależy od miejsca zakupu.
- Wartości nieprawdopodobne trafiają do kwarantanny. Wartość wartownicza −1 z wejścia, oznaczająca „cena ustalana przy żądaniu”, po bezmyślnym przepuszczeniu staje się −750 000 USD za milion i wygrywa każde sortowanie od najtańszego. Wszystko poza wiarygodnym zakresem jest wstrzymywane wraz z uzasadnieniem.
- Pewność jest podawana dla pola. Nie jedna odznaka na wiersz. Twierdzenie, że rekord jest zweryfikowany, gdy sprawdzono tylko jego cenę, to rodzaj przesady, który kończy zaufanie przy pierwszym zauważeniu.
- Brak oceny to nie zero. 219 modeli nie ma niezależnego wyniku. Są wypisane według ceny i wyłączone z porządkowania po jakości; nigdy nie są spychane na koniec, jakby je zmierzono i uznano za słabe.
10 · Licencje i to, co ograniczają
Dwa benchmarki, na których opiera się ten serwis, mają bardzo różne warunki redystrybucji i to zmienia, co wolno opublikować.
- LMArena publikuje swój ranking jako zbiór danych na CC-BY-4.0, co pozwala na redystrybucję z podaniem źródła — i który zawiera granice ufności, na których opierają się powyższe miejsca istotności. To jest kanał, z którego należy korzystać; zbieranie danych z samej witryny jest zakazane przez ich regulamin.
- Artificial Analysis's free tier is "internal use only with attribution"; public redistribution requires a commercial licence, and their site terms separately limit use to personal and non-commercial purposes. So we do not publish their figures at all. Every general capability score on this site is LMArena Elo, used under CC BY 4.0 from the official dataset; the per-task scores are Design Arena’s, below. Artificial Analysis remains an internal cross-check, which is what its free tier permits; it reaches no page, export or API here.
- Warunki API Design Arena pozwalają bezpłatnie korzystać z danych rankingu, także komercyjnie, pod jednym warunkiem: publiczna prezentacja podaje Design Arena jako źródło i linkuje do designarena.ai. Elo dla zadań trafia na tę stronę przez kanał modeli OpenRouter; widok zadań, miejsca według zadań na każdej stronie modelu i ta strona podają źródło.
- Sama cena jest faktem publikowanym przez dostawcę, a to co innego niż zestawiony wynik indeksu. Ceny są weryfikowane wobec stron dostawców, a każdy wiersz odsyła do swojego źródła.
11 · Sprostowania
Ceny zmieniają się bez uprzedzenia, a strony bywają przebudowywane; część tego, co tu jest, w danym momencie będzie błędna. Jeśli znajdziesz błąd, najszybszą drogą jest podać, który model, jaka powinna być liczba i gdzie jest opublikowana — sprostowania ze źródłem pierwotnym wprowadzamy bezpośrednio.
Katalog pobrany ostatnio 2026-10-06. Logika szeregowania jest wersjonowana razem z serwisem, więc zmiana sposobu liczenia „najlepszego” jest widocznym diffem, a nie cichym przestrojeniem.