Metodologia
Tutto ciò che c’è qui è riproducibile dalle stesse fonti pubbliche che puoi verificare da solo. Dove i dati sono scarsi o le fonti discordano, questa pagina lo dice: una pagina di trasparenza che riporta solo buone notizie è pubblicità.
1 · Che cosa significa «migliore»
Comanda la qualità e il prezzo scioglie i pari merito. Quell’ordine è l’intero prodotto: una lista dal più economico è banale da pubblicare e quasi inutile, perché il modello più economico di questo mercato costa 12.500× meno del più caro e in genere non è in grado di fare il lavoro.
Capability comes from independent evaluators, never from us and never from the vendor. The general scores are LMArena Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.
Perché non esiste un unico punteggio di qualità
Capability comes from independent evaluators, never from us and never from the vendor. The general scores are LMArena Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.
2 · Posizioni su cui puoi contare
La colonna della posizione è una posizione di significatività, non un numero di riga. La posizione di un modello è uno più il numero di modelli che lo battono di più della somma dei due margini di errore. I modelli con lo stesso conteggio condividono la posizione. Due modelli entro il margine di errore l’uno dell’altro possono comunque avere posizioni diverse, perché ciascuno è confrontato con l’intera classifica.
SHA-256 della proiezione rilevante per la posizione (identificativi, punteggi, prezzi per carico di lavoro, indicatore di frontiera): 06cd12db54e2968c3de49b45a3a2a6881f374f6e58a462437784450842efb989. Date e marcature di build sono escluse. Un cambiamento qui è un cambiamento nella classifica, non nell’interfaccia.
Gran parte dell’ordine di una classifica è rumore
Due punteggi Arena contano come separati solo quando differiscono di più della somma dei margini di errore al 95% dei due modelli. Quella somma vale in media 10,47 punti su questa classifica, e il test è severo almeno quanto un intervallo al 95% sulla differenza. 136 coppie adiacenti su 144 (94%) ricadono entro la propria somma. Contando la posizione di ogni modello come uno più il numero di modelli che lo battono chiaramente, le 145 righe mostrate contengono 72 posizioni distinte, e 4 modelli condividono il primo posto.
«Il modello numero 1» non è dunque un’affermazione che questi dati sostengano. I pari merito sono mostrati come tali. La posizione 1 è la posizione 1 tra i modelli nel feed dei prezzi che questo sito legge: quando LMArena colloca sopra tutti un modello che il feed non contiene, la classifica nomina quel modello e non gli assegna una posizione.
Questo metodo non è nostro. LMArena classifica così da anni: il loro Rank (UB) assegna a ogni modello una posizione pari a uno più il numero di modelli statisticamente migliori di esso, e ne hanno pubblicato l’implementazione in open source. L’insolito è applicarlo a un confronto di prezzi, dove l’incentivo è pubblicare un ordine netto.
Applied to the general arena board only. Other boards carry their own error, which we do not have, so they are not given a borrowed threshold.
3 · «Migliore e più economico» deve voler dire qualcosa
La dominanza di Pareto su prezzo e capacità è una proiezione bidimensionale di una decisione d’acquisto molto più ampia, e quella proiezione mente più spesso di quanto non colga nel segno. Un modello può ottenere un punteggio più alto e costare meno pur non accettando immagini, limitando l’output a metà dei token o trattenendo mezzo milione di token di contesto in meno.
Perciò «migliore e più economico» è riservato a una sostituzione la cui gamma di capacità sia un sovrainsieme di quella originale. Su 133 verdetti di dominanza, 113 sono stretti e 20 (15%) indicano invece a cosa rinunceresti. Senza quel filtro, il 61% dei verdetti grezzi a due assi consigliava un modello che non era in grado di svolgere il lavoro di quello in uso.
4 · La frontiera, non un punteggio di valore
Un modello è sulla frontiera di valore quando nessun altro modello ottiene un punteggio almeno altrettanto alto senza costare di più, risultando migliore su uno dei due. 12 dei modelli valutati, con prezzo e a consegna standard rientrano. Ciascuno del restante 92% ha sopra di sé un modello del genere, anche se non sempre un sostituto diretto: la sezione qui sopra conta quelli che rinunciano a qualcosa.
Perché non ordinare per qualità per euro speso?
Perché il rapporto premia l’economicità molto più ripidamente della qualità. Applicato a questo catalogo incorona un modello che segna 37,8 su un tetto di circa 63, e mette al secondo posto uno che segna 14,2: modelli che nessuno dovrebbe mandare in produzione. Qualsiasi sito che pubblichi una colonna «valore» calcolata così sta dando consigli sbagliati. Noi usiamo invece la frontiera più una soglia di qualità esplicita.
5 · Il prezzo è una proprietà di un modello e di un carico di lavoro
«Il» prezzo di un modello non esiste. Riassumere è intensivo in ingresso, generare codice lo è in uscita, e un ciclo agentico ripete il proprio contesto a ogni turno; lo stesso catalogo si ordina diversamente in ciascun caso. Anziché scegliere una miscela e nasconderla, il rapporto ingresso:uscita e il tasso di successo della cache sono controlli che puoi vedere e modificare.
Se non è pubblicata una tariffa di lettura della cache, la stima combinata usa la tariffa di input intera della fascia selezionata.
| Carico di lavoro | Quota di uscita | Successi di cache | Forma |
|---|---|---|---|
| Bilanciato | 25% | 0% | 3 token in ingresso per 1 in uscita |
| Riassunto | 5% | 30% | Input enorme, output minimo |
| Chat | 40% | 50% | Prompt di sistema lungo e in cache |
| Gen. codice | 60% | 20% | Domina l’output |
| Agentico | 15% | 70% | Contesto ripetuto a ogni turno |
Tre cose rendono abitualmente errata la tariffa pubblicizzata, e tutte e tre compaiono nella riga:
- Fasce di contesto. 51 modelli cambiano tariffa oltre una soglia di lunghezza del prompt, alcuni più di una volta: Qwen3.7 Flash passa a 3,33× oltre 32K e a 6,67× oltre 256K. Se calcoli un carico a contesto lungo sulla tariffa in evidenza, sbagli di un multiplo.
- Token di ragionamento fatturati a parte dall’uscita. Quando i token di ragionamento vengono addebitati separatamente, il costo dipende dal volume fatturato e dalla tariffa applicabile. Includi questo importo nella stima.
- Prezzi in base all’ora del giorno. Modelli con fasce di prezzo pubblicate: 2. Verifica la fascia oraria, il fuso e le tariffe; non dare per scontato uno sconto fisso.
6 · Quale prezzo pubblichiamo
Un punteggio è misurato sulla distribuzione del modello stesso, quindi il prezzo accanto è il prezzo di riferimento: l’offerta più economica, sul mix bilanciato, che supera tutte le prove qui sotto. Le tariffe di input, output e lettura della cache di quell’offerta sono pubblicate insieme, mai mescolate con quelle di un’altra offerta.
- In servizio. Un’offerta che OpenRouter indica come non in servizio è esclusa. Un’offerta che risulta degradata al momento della lettura conta comunque se è stata in servizio per almeno il 95% dell’ultimo giorno. Un’offerta che è stata in servizio per meno dell’80% dell’ultimo giorno non conta, qualunque sia il suo stato adesso.
- Consegna standard. Flex, priority, fast e livelli simili sono un altro prodotto e sono esclusi.
- Tariffa standard. Un’offerta in promozione conta alla sua tariffa standard: ogni tariffa divisa per uno meno lo sconto. Il prezzo promozionale viene dichiarato, mai classificato.
- Fascia standard. Un prezzo che dipende dall’ora conta alla tariffa standard; le ore scontate vengono dichiarate.
- La precisione del produttore o migliore. Un’offerta a 4 bit (fp4, nvfp4, mxfp4, int4) conta solo se il produttore stesso serve a 4 bit o, quando il produttore non dichiara la precisione, se i suoi pesi pubblicati sono a 4 bit. Un’offerta che non dichiara la precisione conta se è quella del produttore stesso, o quella di un rivenditore di un modello a pesi chiusi: serve il deployment del produttore. Con pesi aperti, o che nessuno ha registrato, quella di un rivenditore che non la dichiara è esclusa: non viene mai letta come precisione piena.
Quando nessuna offerta supera le prove, il modello mantiene un prezzo di ripiego, etichettato come prezzo senza offerta equivalente con il suo motivo, perché un modello senza prezzo si leggerebbe come assente: tra le offerte in servizio con consegna standard, ciascuna alla sua tariffa standard, la più economica di un rivenditore che non dichiara la precisione e, in mancanza, la più economica a 4 bit. Un altro livello di consegna si usa solo quando non c’è altro in servizio. Un modello senza offerte da cui prendere un prezzo mantiene il prezzo del modello di OpenRouter.
L’offerta più economica che la regola esclude, quando è più economica, compare nella pagina del modello come «Più economico adesso», con il motivo: una promozione e la sua percentuale, 4 bit, un livello di consegna o precisione non dichiarata. Non determina mai una posizione, la frontiera, un verdetto né una cifra di punta. Quando l’offerta che fissa il prezzo è essa stessa in promozione, viene mostrato il suo prezzo promozionale.
Su questi dati 333 modelli hanno un prezzo di riferimento, 15 un prezzo senza offerta equivalente e 99 il prezzo del modello di OpenRouter, tra cui voci batch e gratuite. 86 mostrano adesso un’offerta più economica, 11 delle quali di un rivenditore che non dichiara la precisione.
Prima di questa regola ogni prezzo qui era il prezzo del modello di OpenRouter, che qualsiasi venditore può fissare, promozioni e copie a 4 bit incluse. La modifica è registrata come §96 nel registro delle correzioni, con le cifre prima e dopo.
7 · Classifica condizionata all’attività
Un unico ordine globale è intellettualmente disonesto, perché lavori diversi premiano modelli diversi. Portiamo un Elo per attività su 25 categorie: front-end, visualizzazione dati, sviluppo di videogiochi, SVG, Android, presentazioni e altro. Selezionare un’attività riordina l’intero tabellone sull’Elo di quell’attività anziché su un indice generale.
I punteggi per attività sono l’Elo per attività di Design Arena, letto dal feed dei modelli di OpenRouter: designarena.ai.
La copertura varia per categoria, e un modello assente dalla classifica di una categoria è mostrato come non misurato per quell’attività, non come scarso in essa.
8 · Quando lo stesso modello è venduto due volte
Alcuni modelli non sono modelli nuovi. Lo dice il venditore stesso: 11 voci di questo catalogo sono descritte dal loro stesso fornitore come un altro modello del catalogo servito in modo diverso — una corsia più veloce, una diversa modalità di ragionamento, più calcolo per richiesta. 10 delle 11 non hanno una voce in nessuna classifica di LMArena. 11 dei loro 11 modelli di base sì.
| Venduto come | Prezzo del livello | Modello di base | Cosa dice il venditore |
|---|---|---|---|
| o1-pro nessuna voce | $600 ×10 | o1 1365,8 | più calcolo per richiesta |
| o3 Pro nessuna voce | $80 ×10 | o3 1409,9 | più calcolo per richiesta |
| GPT-6 Astra Pro nessuna voce | $50 ×1 | GPT-6 Astra 1442,3 con sforzo massimo | stesso modello, modalità di servizio diversa |
| GPT-5.6 Sol Pro nessuna voce | $20 ×1 | GPT-5.6 Sol 1456,3 con sforzo molto alto | stesso modello, modalità di servizio diversa |
| GPT-5.6 Terra Pro nessuna voce | $12 ×1 | GPT-5.6 Terra 1446,3 con sforzo molto alto | stesso modello, modalità di servizio diversa |
| GPT-6 Sol Pro nessuna voce | $10 ×1 | GPT-6 Sol 1395,4 con sforzo massimo | stesso modello, modalità di servizio diversa |
| GPT-6.1 Sol Pro nessuna voce | $10 ×1 | GPT-6.1 Sol 1445,6 con sforzo massimo | stesso modello, modalità di servizio diversa |
| o3 Mini High 1336,6 | $4,4 ×1 | o3 Mini 1319,4 | stesso modello, modalità di servizio diversa |
| o4 Mini High nessuna voce | $4,4 ×1 | o4 Mini 1353,2 | stesso modello, modalità di servizio diversa |
| GPT-5.6 Luna Pro nessuna voce | $1,2 ×1 | GPT-5.6 Luna 1431 con sforzo molto alto | stesso modello, modalità di servizio diversa |
| GPT-6 Luna Pro nessuna voce | $0,5 ×1 | GPT-6 Luna 1391,5 con sforzo massimo | stesso modello, modalità di servizio diversa |
La distinzione conta per ciò che puoi concluderne. Dove il venditore dice capacità identiche — 0 dei 11 — il punteggio del modello di base è anche l’affermazione del venditore stesso sul livello, e l’unica cosa che stai comprando è la velocità. Dove il venditore dice più calcolo o una modalità diversa, nessuna misurazione pubblicata ti dice che cosa compra la spesa aggiuntiva, con l’unica eccezione indicata sopra.
Qui si conta solo ciò che dichiara il venditore. Un modello il cui nome finisce in «Pro» ma che il suo fornitore definisce un modello di punta a sé stante non viene contato qui, perché sarebbe una nostra affermazione e non sua — lo stesso errore di trattare i livelli di servizio di un fornitore come venditori in concorrenza, che una volta trasformò un divario di prezzo di 2× in un 7,2× pubblicato.
L’assenza di una voce in una classifica di LMArena non è un verdetto. Non è una prova di scarsa qualità, e non significa che nessuno li abbia valutati — i fornitori pubblicano i propri risultati. Significa che l’asse su cui questo sito classifica non ha una misura per loro, quindi non li classifichiamo.
9 · Da dove vengono i dati
I prezzi sono normalizzati da un catalogo multi-fornitore leggibile da macchina e verificati con le pagine dei prezzi dei fornitori. Ogni pagina di modello collega la propria fonte e la data di recupero.
- I conflitti sono registrati, non mediati. Quando due fonti discordano su un prezzo, quel disaccordo è il risultato. Un modello indicato a 4/20 $ dal fornitore e venduto a 2/10 $ tramite un aggregatore ha due prezzi veri, e quale valga dipende da dove compri.
- I valori implausibili vengono messi in quarantena. Un valore sentinella a monte di −1 per «prezzo definito al momento della richiesta» diventa −750.000 $ per milione se lo si lascia passare così com’è, e vince qualsiasi ordinamento per prezzo crescente. Tutto ciò che esce da un intervallo plausibile viene trattenuto con una motivazione allegata.
- La confidenza è per campo. Non un contrassegno per riga. Dichiarare verificato un record quando ne è stato controllato solo il prezzo è il tipo di esagerazione che distrugge la fiducia la prima volta che qualcuno se ne accorge.
- Non valutato non è zero. 219 modelli non hanno alcun punteggio indipendente. Sono elencati per prezzo ed esclusi dall’ordinamento per qualità; non vengono mai spinti in fondo come se fossero stati misurati e bocciati.
10 · Licenze, e che cosa vincolano
Due dei benchmark su cui questo sito si appoggia hanno condizioni di ridistribuzione molto diverse, e ciò cambia che cosa si può pubblicare.
- LMArena pubblica la propria classifica come dataset CC-BY-4.0, che consente la ridistribuzione con attribuzione e che porta con sé i limiti di confidenza da cui dipendono le posizioni di significatività qui sopra. È il canale da usare; estrarre dati dal sito stesso è vietato dalle loro condizioni.
- Artificial Analysis's free tier is "internal use only with attribution"; public redistribution requires a commercial licence, and their site terms separately limit use to personal and non-commercial purposes. So we do not publish their figures at all. Every general capability score on this site is LMArena Elo, used under CC BY 4.0 from the official dataset; the per-task scores are Design Arena’s, below. Artificial Analysis remains an internal cross-check, which is what its free tier permits; it reaches no page, export or API here.
- Le condizioni dell’API di Design Arena rendono i suoi dati di classifica liberi da usare, anche a fini commerciali, a una condizione: ogni visualizzazione pubblica cita Design Arena e rimanda a designarena.ai. Il suo Elo per attività arriva su questo sito dal feed dei modelli di OpenRouter; la vista per attività, le posizioni per attività di ogni pagina modello e questa pagina lo citano.
- Il prezzo in sé è un fatto che un fornitore pubblica, cosa diversa da un punteggio di indice compilato. I prezzi sono verificati con le pagine dei fornitori e ogni riga collega la propria fonte.
11 · Correzioni
I prezzi cambiano senza preavviso e le pagine vengono riformattate; parte di quanto c’è qui sarà errato in un dato momento. Se trovi un errore, la via più rapida è indicare quale modello, quale dovrebbe essere il valore e dove è pubblicato: le correzioni con una fonte primaria vengono applicate direttamente.
Catalogo recuperato l’ultima volta il 2026-10-06. La logica di classifica è versionata insieme al sito, così un cambiamento nel modo in cui si calcola «migliore» è un diff visibile e non una ritaratura silenziosa.