---
title: "Metodyka — jak ustalane jest „najlepsze” i gdzie dane są słabe · Undominated.ai"
canonical: https://undominated.ai/pl/methodology/
description: "Jak ta strona szereguje 364 modeli AI: granica, Elo zależne od zadania, ceny uwzględniające profil obciążenia oraz uczciwy opis tego, czego dane nie obejmują."
---

# Metodyka — jak ustalane jest „najlepsze” i gdzie dane są słabe · Undominated.ai

> Jak ta strona szereguje 364 modeli AI: granica, Elo zależne od zadania, ceny uwzględniające profil obciążenia oraz uczciwy opis tego, czego dane nie obejmują.

# Metodyka

Wszystko tutaj da się odtworzyć z tych samych publicznych źródeł, które możesz sprawdzić sam. Tam, gdzie danych jest mało albo źródła się rozchodzą, ta strona to mówi — strona o zaufaniu, która podaje wyłącznie dobre wieści, jest reklamą.

 On this page [2 · Miejsca, na których można polegać](#methodology-section-1)[8 · Gdy ten sam model jest sprzedawany dwa razy](#tiers)[9 · Skąd pochodzą dane](#methodology-section-3)[10 · Licencje i to, co ograniczają](#sources) 60% katalogu **nie ma niezależnej oceny jakości**. Ocenionych modeli: 145 z 364. Reszta jest wypisana, wyceniona i wyraźnie oznaczona jako bez oceny — i nigdy nie jest szeregowana.
 72/145 pokazanych pozycji, które są **naprawdę odrębnymi miejscami**. 94% sąsiadujących par mieści się w marginesie błędu benchmarku.
 67/364 modeli, których cena z nagłówka **nie jest całą ceną**: progi kontekstu, rozumowanie fakturowane osobno albo stawki zależne od pory doby.
 7/447 entries with variable prices withheld
 4/447 entries with suspect latency withheld; may overlap the price group

## 1 · Co znaczy „najlepszy”

Prowadzi jakość, a cena rozstrzyga remisy. Ta kolejność jest całym produktem: lista od najtańszego jest banalnie łatwa do opublikowania i niemal bezużyteczna, bo najtańszy model na tym rynku jest 12 500× tańszy od najdroższego i zwykle nie podoła zadaniu.

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are **LMArena** Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

### Dlaczego nie ma jednej oceny jakości

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are **LMArena** Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

## 2 · Miejsca, na których można polegać

Kolumna miejsca to **miejsce istotności**, a nie numer wiersza. Miejsce modelu jest o jeden większe niż liczba modeli, które biją go o więcej niż suma obu marginesów błędu. Modele, dla których ta liczba jest taka sama, dzielą miejsce. Dwa modele mieszczące się nawzajem w swoich marginesach błędu mogą mimo to zajmować różne miejsca, bo każdy jest porównywany z całym rankingiem.

SHA-256 rzutu istotnego dla miejsca (identyfikatory, wyniki, ceny wg obciążenia, znacznik granicy): 06cd12db54e2968c3de49b45a3a2a6881f374f6e58a462437784450842efb989 . Daty i znaczniki kompilacji są pominięte. Zmiana tutaj to zmiana w rankingu, a nie w oprawie.

[Sprostowania](/pl/corrections/)

### Większość kolejności w rankingu to szum

Dwa wyniki Arena liczą się jako rozdzielone dopiero wtedy, gdy różnią się o więcej niż suma 95-procentowych marginesów błędu obu modeli. Średnia tej sumy na tej liście, w punktach: 10,47. Test jest co najmniej tak surowy jak 95-procentowy przedział dla różnicy. Sąsiednie pary mieszczące się we własnej sumie: **136 z 144 (94%)**. Gdy miejsce modelu liczy się jako o jeden większe niż liczba modeli, które wyraźnie go biją, liczba odrębnych miejsc wśród pokazanych pozycji (145) wynosi **72**. Modele ex aequo na pierwszym miejscu: 4.

„Model numer 1” nie jest więc twierdzeniem, które te dane uniosą. Remisy pokazujemy jako remisy. Miejsce 1 to miejsce 1 wśród modeli ze źródła cen, które czyta ta strona: gdy LMArena stawia ponad nimi wszystkimi model, którego to źródło nie zawiera, tablica wymienia ten model i nie nadaje mu miejsca.

Ta metoda nie jest nasza. LMArena szereguje tak od lat — ich [Rank (UB)](https://news.lmarena.ai/ranking-method/) przypisuje każdemu modelowi miejsce o jeden większe niż liczba modeli statystycznie od niego lepszych, a implementację [udostępnili otwarcie](https://github.com/lmarena/arena-rank). Nietypowe jest zastosowanie tego do porównania *cen*, gdzie zachęta idzie w stronę publikowania ostrej kolejności.

Applied to the general arena board only. Other boards carry their own error, which we do not have, so they are not given a borrowed threshold.

## 3 · „Lepszy i tańszy” musi coś znaczyć

Dominacja Pareta po cenie i zdolnościach to dwuwymiarowy rzut o wiele szerszej decyzji zakupowej, a ten rzut częściej kłamie, niż nie. Model może mieć wyższy wynik i kosztować mniej, a jednocześnie nie przyjmować obrazów, ograniczać wyjście do połowy tokenów albo utrzymywać o pół miliona tokenów mniej kontekstu.

Dlatego **„zarazem lepszy i tańszy” jest zarezerwowane dla zamiennika, którego zakres możliwości jest nadzbiorem** oryginału. Spośród 133 werdyktów dominacji 113 jest ścisłych, a **20 (15%)** nazywa zamiast tego, z czego trzeba by zrezygnować. Bez tej bramki 61% surowych werdyktów dwuosiowych polecało model, który nie podołałby pracy dotychczasowego.

## 4 · Granica, a nie ocena wartości

Model leży na **granicy wartości**, gdy nie istnieje inny model, który ma co najmniej tak wysoki wynik, kosztuje nie więcej i wygrywa na jednej z tych dwóch osi. Kwalifikuje się 12 ocenionych i wycenionych modeli w dostawie standardowej. Nad każdym z pozostałych 92% znajduje się taki model, choć nie zawsze jest to porównywalny zamiennik: sekcja powyżej liczy przypadki, w których trzeba z czegoś zrezygnować.

### Dlaczego nie szeregować według jakości za złotówkę?

Bo taki iloraz nagradza taniość znacznie stromiej niż jakość. Zastosowany do tego katalogu koronuje model z wynikiem 37,8 przy pułapie około 63, a na drugim miejscu stawia model z wynikiem 14,2 — modele, których nikt nie powinien wdrażać. Każdy serwis publikujący tak liczoną kolumnę „wartości” doradza źle. My używamy granicy oraz jawnego progu jakości.

## 5 · Cena jest własnością modelu oraz obciążenia

Nie istnieje „ta” cena modelu. Streszczanie jest intensywne po stronie wejścia, generowanie kodu po stronie wyjścia, a pętla agentowa odtwarza swój kontekst w każdej turze; ten sam katalog układa się inaczej w każdym z tych przypadków. Zamiast wybrać jedną mieszankę i ją ukryć, stosunek wejścia do wyjścia i trafienia w cache są widocznymi regulatorami, które możesz zmienić.

Jeśli nie podano stawki odczytu z pamięci podręcznej, szacunek mieszany stosuje pełną stawkę wejściową wybranego progu cenowego.

| Obciążenie | Udział wyjścia | Trafienia cache | Kształt |
| --- | --- | --- | --- |
| Zrównoważone | Udział wyjścia 25% | Trafienia cache 0% | 3 tokeny wejścia na 1 wyjścia |
| Streszczanie | Udział wyjścia 5% | Trafienia cache 30% | Ogromne wejście, znikome wyjście |
| Czat | Udział wyjścia 40% | Trafienia cache 50% | Długi, cache’owany prompt systemowy |
| Generowanie kodu | Udział wyjścia 60% | Trafienia cache 20% | Dominuje wyjście |
| Agentowe | Udział wyjścia 15% | Trafienia cache 70% | Kontekst odtwarzany w każdej turze |

Trzy rzeczy regularnie unieważniają reklamowaną stawkę i wszystkie trzy widać w wierszu:

 - **Progi kontekstu.** 51 modeli zmienia stawkę po przekroczeniu progu długości promptu, część więcej niż raz — Qwen3.7 Flash przechodzi na 3,33× powyżej 32K i na 6,67× powyżej 256K. Wycenisz obciążenie długokontekstowe po cenie z nagłówka i pomylisz się o wielokrotność.
 - **Tokeny rozumowania fakturowane osobno od wyjścia.** Gdy tokeny rozumowania są rozliczane osobno, koszt zależy od liczby naliczonych tokenów i obowiązującej stawki. Uwzględnij tę opłatę w swoim oszacowaniu.
 - **Ceny zależne od pory doby.** Liczba modeli z opublikowanymi stawkami zależnymi od pory dnia: 2. Sprawdź godziny, strefę czasową i stawki; nie zakładaj jednakowej zniżki.

## 6 · Jaką cenę publikujemy

Wynik jest mierzony na własnym wdrożeniu modelu, więc cena obok niego to **cena referencyjna**: najtańsza oferta, w zrównoważonym miksie, która przechodzi każdy z poniższych testów. Stawki za wejście, wyjście i odczyt z cache tej oferty są publikowane razem, nigdy nie mieszane ze stawkami innej oferty.

 - **Działa.** Oferta, którą OpenRouter oznacza jako niedziałającą, jest wykluczona. Oferta, która w chwili odczytu jest oznaczona jako pogorszona, liczy się mimo to, jeśli działała przez co najmniej 95% ostatniej doby. Oferta, która działała przez mniej niż 80% ostatniej doby, nie liczy się, bez względu na jej obecny stan.
 - **Standardowa dostawa.** Flex, priority, fast i podobne poziomy to inny produkt i są wykluczone.
 - **Stawka standardowa.** Oferta w promocji liczy się po stawce standardowej: każda stawka podzielona przez jeden minus rabat. Cena promocyjna jest ujawniana, nigdy nie trafia do rankingu.
 - **Standardowe okno.** Cena zależna od pory dnia liczy się według stawki standardowej; godziny rabatu są ujawniane.
 - **Precyzja producenta lub lepsza.** Oferta 4-bitowa (fp4, nvfp4, mxfp4, int4) liczy się tylko wtedy, gdy producent sam serwuje 4 bity albo, gdy producent nie podaje precyzji, jego opublikowane wagi są 4-bitowe. Oferta bez podanej precyzji liczy się, gdy jest ofertą samego producenta albo odsprzedawcy modelu o zamkniętych wagach: obsługuje on wdrożenie producenta. Przy wagach otwartych albo takich, których nikt nie odnotował, oferta odsprzedawcy bez podanej precyzji jest wykluczona: nigdy nie jest odczytywana jako pełna precyzja.

Gdy żadna oferta nie przechodzi testów, model zachowuje cenę zastępczą, oznaczoną jako **cena bez równoważnej oferty** wraz z powodem, bo model bez ceny wyglądałby na nieobecny: spośród działających ofert ze standardową dostawą, każda po stawce standardowej, najtańszą od odsprzedawcy, który nie podaje precyzji, a gdy takiej nie ma, najtańszą 4-bitową. Inny poziom dostawy jest używany tylko wtedy, gdy nic innego nie działa. Model bez oferty, z której można wziąć cenę, zachowuje cenę modelu z OpenRouter.

Najtańsza oferta wykluczona przez regułę, gdy jest tańsza, pojawia się na stronie modelu jako „Teraz taniej”, z powodem: promocja i jej procent, 4 bity, poziom dostawy albo precyzja nieujawniona. Nigdy nie ustala pozycji, granicy, werdyktu ani liczby w nagłówku. Gdy oferta ustalająca cenę sama jest w promocji, pokazywana jest jej własna cena promocyjna.

W tych danych 333 modeli ma cenę referencyjną, 15 cenę bez równoważnej oferty, a 99 cenę modelu z OpenRouter, w tym wpisy batch i darmowe. 86 pokazuje teraz tańszą ofertę, w tym 11 od odsprzedawcy, który nie podaje precyzji.

Przed tą regułą każda cena tutaj była ceną modelu z OpenRouter, którą może ustalić każdy sprzedawca, łącznie z promocjami i kopiami 4-bitowymi. Zmiana jest zapisana jako §96 w dzienniku korekt, z liczbami przed i po.

## 7 · Szeregowanie zależne od zadania

Jedna globalna kolejność jest intelektualnie nieuczciwa, bo różne prace wygrywają różne modele. Prowadzimy Elo zadaniowe w **25 kategoriach** — front-end, wizualizacja danych, tworzenie gier, SVG, Android, prezentacje i więcej. Wybór zadania przestawia całą tablicę według Elo tego zadania, a nie według indeksu ogólnego.

Wyniki zadań to Elo dla poszczególnych zadań z **Design Arena**, odczytane z kanału modeli OpenRouter: [designarena.ai](https://designarena.ai).

Pokrycie różni się między kategoriami, a model nieobecny w rankingu danej kategorii jest pokazany jako niezmierzony w tym zadaniu, a nie jako w nim słaby.

## 8 · Gdy ten sam model jest sprzedawany dwa razy

Niektóre modele nie są nowymi modelami. Mówi to sam sprzedawca: **11 pozycji w tym katalogu** ich własny dostawca opisuje jako inny model z katalogu, udostępniany w inny sposób — szybszą ścieżką, w innym trybie rozumowania, z większą mocą obliczeniową na zapytanie. **10 z 11 nie ma wpisu w żadnym rankingu LMArena. Z ich 11 modeli bazowych wpis ma 11.**

Gdy ten sam model jest sprzedawany dwa razy

| Sprzedawany jako | Cena poziomu | Model bazowy | Co mówi sprzedawca |
| --- | --- | --- | --- |
| [o1-pro](/models/openai__o1-pro/) brak wpisu | $600 ×10 | [o1](/models/openai__o1/) 1365,8 | więcej mocy obliczeniowej na zapytanie |
| [o3 Pro](/models/openai__o3-pro/) brak wpisu | $80 ×10 | [o3](/models/openai__o3/) 1409,9 | więcej mocy obliczeniowej na zapytanie |
| [GPT-6 Astra Pro](/models/openai__gpt-6-astra-pro/) brak wpisu | $50 ×1 | [GPT-6 Astra](/models/openai__gpt-6-astra/) 1442,3 przy wysiłku maksymalnym | ten sam model, inny tryb obsługi |
| [GPT-5.6 Sol Pro](/models/openai__gpt-5.6-sol-pro/) brak wpisu | $20 ×1 | [GPT-5.6 Sol](/models/openai__gpt-5.6-sol/) 1456,3 przy wysiłku bardzo wysokim | ten sam model, inny tryb obsługi |
| [GPT-5.6 Terra Pro](/models/openai__gpt-5.6-terra-pro/) brak wpisu | $12 ×1 | [GPT-5.6 Terra](/models/openai__gpt-5.6-terra/) 1446,3 przy wysiłku bardzo wysokim | ten sam model, inny tryb obsługi |
| [GPT-6 Sol Pro](/models/openai__gpt-6-sol-pro/) brak wpisu | $10 ×1 | [GPT-6 Sol](/models/openai__gpt-6-sol/) 1395,4 przy wysiłku maksymalnym | ten sam model, inny tryb obsługi |
| [GPT-6.1 Sol Pro](/models/openai__gpt-6.1-sol-pro/) brak wpisu | $10 ×1 | [GPT-6.1 Sol](/models/openai__gpt-6.1-sol/) 1445,6 przy wysiłku maksymalnym | ten sam model, inny tryb obsługi |
| [o3 Mini High](/models/openai__o3-mini-high/) 1336,6 | $4,4 ×1 | [o3 Mini](/models/openai__o3-mini/) 1319,4 | ten sam model, inny tryb obsługi |
| [o4 Mini High](/models/openai__o4-mini-high/) brak wpisu | $4,4 ×1 | [o4 Mini](/models/openai__o4-mini/) 1353,2 | ten sam model, inny tryb obsługi |
| [GPT-5.6 Luna Pro](/models/openai__gpt-5.6-luna-pro/) brak wpisu | $1,2 ×1 | [GPT-5.6 Luna](/models/openai__gpt-5.6-luna/) 1431 przy wysiłku bardzo wysokim | ten sam model, inny tryb obsługi |
| [GPT-6 Luna Pro](/models/openai__gpt-6-luna-pro/) brak wpisu | $0,5 ×1 | [GPT-6 Luna](/models/openai__gpt-6-luna/) 1391,5 przy wysiłku maksymalnym | ten sam model, inny tryb obsługi |

To rozróżnienie ma znaczenie dla tego, co można wywnioskować. Tam, gdzie sprzedawca mówi o *identycznych możliwościach* — 0 z 11 — wynik modelu bazowego jest także własnym twierdzeniem sprzedawcy o danym poziomie, a jedyne, co kupujesz, to szybkość. Tam, gdzie sprzedawca mówi o większej mocy obliczeniowej lub innym trybie, żaden opublikowany pomiar nie mówi, co daje dodatkowy wydatek, z jednym wyjątkiem opisanym wyżej.

Liczymy tu wyłącznie to, co stwierdza sprzedawca. Model, którego nazwa kończy się na „Pro”, ale który jego dostawca nazywa samodzielnym modelem flagowym, nie jest tu liczony, bo byłoby to nasze twierdzenie, a nie ich — ten sam błąd, co traktowanie własnych poziomów usług dostawcy jak konkurujących sprzedawców, który kiedyś zamienił rozrzut cen 2× w opublikowane 7,2×.

Brak wpisu w rankingu LMArena nie jest werdyktem. Nie jest dowodem słabej jakości i nie oznacza, że nikt tych modeli nie oceniał — dostawcy publikują własne wyniki. Oznacza, że oś, według której ten serwis szereguje, nie ma dla nich odczytu, więc ich nie szeregujemy.

## 9 · Skąd pochodzą dane

Ceny są normalizowane z czytelnego maszynowo katalogu obejmującego wielu dostawców i weryfikowane wobec stron cenowych dostawców. Każda strona modelu odsyła do swojego źródła i daty pobrania.

 - **Konflikty są odnotowywane, a nie uśredniane.** Gdy dwa źródła podają różne ceny, ta rozbieżność jest ustaleniem. Model wystawiony przez dostawcę po 4/20 USD i sprzedawany po 2/10 USD przez agregatora ma dwie prawdziwe ceny, a to, która obowiązuje, zależy od miejsca zakupu.
 - **Wartości nieprawdopodobne trafiają do kwarantanny.** Wartość wartownicza −1 z wejścia, oznaczająca „cena ustalana przy żądaniu”, po bezmyślnym przepuszczeniu staje się −750 000 USD za milion i wygrywa każde sortowanie od najtańszego. Wszystko poza wiarygodnym zakresem jest wstrzymywane wraz z uzasadnieniem.
 - **Pewność jest podawana dla pola.** Nie jedna odznaka na wiersz. Twierdzenie, że rekord jest zweryfikowany, gdy sprawdzono tylko jego cenę, to rodzaj przesady, który kończy zaufanie przy pierwszym zauważeniu.
 - **Brak oceny to nie zero.** 219 modeli nie ma niezależnego wyniku. Są wypisane według ceny i wyłączone z porządkowania po jakości; nigdy nie są spychane na koniec, jakby je zmierzono i uznano za słabe.

## 10 · Licencje i to, co ograniczają

Dwa benchmarki, na których opiera się ten serwis, mają bardzo różne warunki redystrybucji i to zmienia, co wolno opublikować.

 - **LMArena** publikuje swój ranking jako [zbiór danych na CC-BY-4.0](https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset), co pozwala na redystrybucję z podaniem źródła — i który zawiera granice ufności, na których opierają się powyższe miejsca istotności. To jest kanał, z którego należy korzystać; zbieranie danych z samej witryny jest zakazane przez ich regulamin.
 - **Artificial Analysis**'s free tier is *"internal use only with attribution"*; public redistribution requires a commercial licence, and their site terms separately limit use to personal and non-commercial purposes. **So we do not publish their figures at all.** Every general capability score on this site is LMArena Elo, used under CC BY 4.0 from the official dataset; the per-task scores are Design Arena’s, below. Artificial Analysis remains an internal cross-check, which is what its free tier permits; it reaches no page, export or API here.
 - Warunki API **Design Arena** pozwalają bezpłatnie korzystać z danych rankingu, także komercyjnie, pod jednym warunkiem: publiczna prezentacja podaje Design Arena jako źródło i linkuje do [designarena.ai](https://designarena.ai). Elo dla zadań trafia na tę stronę przez kanał modeli OpenRouter; widok zadań, miejsca według zadań na każdej stronie modelu i ta strona podają źródło.
 - **Sama cena** jest faktem publikowanym przez dostawcę, a to co innego niż zestawiony wynik indeksu. Ceny są weryfikowane wobec stron dostawców, a każdy wiersz odsyła do swojego źródła.

## 11 · Sprostowania

Ceny zmieniają się bez uprzedzenia, a strony bywają przebudowywane; część tego, co tu jest, w danym momencie będzie błędna. Jeśli znajdziesz błąd, najszybszą drogą jest podać, który model, jaka powinna być liczba i gdzie jest opublikowana — sprostowania ze źródłem pierwotnym wprowadzamy bezpośrednio.

[Zgłoś błędną cenę](/report/)

Katalog pobrany ostatnio 2026-10-06. Logika szeregowania jest wersjonowana razem z serwisem, więc zmiana sposobu liczenia „najlepszego” jest widocznym diffem, a nie cichym przestrojeniem.

## Continue your investigation

 - [Inspect measured uncertainty · English](/significance/)
- [Read source policy](/pl/independence/)
- [See recorded corrections](/pl/corrections/)
- [Reuse accepted data · English](/api/)
