Metodologi

Semua di sini dapat direproduksi dari sumber publik yang sama yang bisa Anda periksa sendiri. Di tempat datanya tipis atau sumbernya berselisih, halaman ini mengatakannya — halaman kepercayaan yang hanya melaporkan kabar baik itu pemasaran.

60% dari katalog tidak punya nilai mutu independen. 145 dari 364 model dinilai. Sisanya tetap didaftar, diberi harga, dan ditandai jelas sebagai tidak dinilai — tidak pernah diperingkat.
72/145 posisi yang ditampilkan yang merupakan peringkat yang benar-benar berbeda. 94% pasangan bersebelahan jatuh di dalam margin galat tolok ukur.
67/364 model yang harga utamanya bukan seluruh harganya: jenjang konteks, penalaran yang ditagih terpisah, atau tarif menurut waktu.
7/447 entries with variable prices withheld
4/447 entries with suspect latency withheld; may overlap the price group

1 · Apa arti “terbaik”

Mutu memimpin dan harga memutus seri. Urutan itulah seluruh produknya: daftar termurah-dulu sepele untuk diterbitkan dan nyaris tidak berguna, sebab model termurah di pasar ini 12.500× lebih murah daripada yang termahal dan umumnya tidak sanggup mengerjakan tugasnya.

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are LMArena Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

Mengapa tidak ada satu nilai mutu tunggal

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are LMArena Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

2 · Peringkat yang bisa Anda andalkan

Kolom peringkat adalah peringkat signifikansi, bukan nomor baris. Peringkat sebuah model adalah satu ditambah jumlah model yang mengalahkannya dengan selisih melebihi gabungan kedua margin galat. Model dengan hitungan yang sama berbagi satu peringkat. Dua model yang masih berada dalam margin galat satu sama lain tetap bisa menempati peringkat berbeda, karena masing-masing dibandingkan dengan seluruh papan peringkat.

SHA-256 dari proyeksi yang relevan bagi peringkat (pengenal, nilai, harga per beban kerja, penanda batas): 06cd12db54e2968c3de49b45a3a2a6881f374f6e58a462437784450842efb989. Tanggal dan cap build dikecualikan. Perubahan di sini adalah perubahan pada peringkat, bukan pada tampilannya.

Koreksi

Sebagian besar urutan sebuah papan peringkat adalah derau

Dua skor Arena baru dihitung terpisah bila selisihnya melebihi jumlah margin galat 95% kedua model. Jumlah itu rata-rata 10,47 poin di papan peringkat ini, dan uji ini setidaknya seketat selang 95% untuk selisihnya. 136 dari 144 pasangan bersebelahan (94%) berada di dalam jumlahnya sendiri. Dengan peringkat setiap model dihitung sebagai satu ditambah jumlah model yang jelas mengalahkannya, 145 posisi yang ditampilkan memuat 72 peringkat berbeda, dan 4 model berbagi tempat pertama.

Karena itu “model nomor 1” bukanlah klaim yang didukung data ini. Hasil seri ditampilkan sebagai seri. Peringkat 1 adalah peringkat 1 di antara model dalam feed harga yang dibaca situs ini: ketika LMArena menempatkan model yang tidak ada di feed itu di atas semuanya, papan menyebut nama model itu dan tidak memberinya peringkat.

Metode ini bukan milik kami. LMArena sudah bertahun-tahun memeringkat dengan cara ini — Rank (UB) mereka memberi setiap model peringkat satu ditambah jumlah model yang secara statistik lebih baik darinya, dan mereka telah membuka kode implementasinya. Yang tidak lazim adalah menerapkannya pada perbandingan harga, di mana insentifnya justru menerbitkan urutan yang tegas.

Applied to the general arena board only. Other boards carry their own error, which we do not have, so they are not given a borrowed threshold.

3 · “Lebih baik dan lebih murah” harus benar-benar berarti begitu

Dominasi Pareto atas harga dan kemampuan adalah proyeksi dua dimensi dari keputusan pembelian yang jauh lebih luas, dan proyeksi itu lebih sering keliru daripada tidak. Sebuah model bisa bernilai lebih tinggi dan berbiaya lebih rendah sambil tidak menerima gambar, memangkas keluaran hingga separuh token, atau menahan setengah juta token konteks lebih sedikit.

Maka “sekaligus lebih baik dan lebih murah” disediakan untuk pengganti yang cakupan kemampuannya merupakan superhimpunan dari aslinya. Dari 133 putusan dominasi, 113 bersifat ketat dan 20 (15%) justru menyebut apa yang akan Anda lepaskan. Tanpa gerbang itu, 61% putusan dua sumbu yang mentah merekomendasikan model yang tidak sanggup mengerjakan tugas model yang sedang dipakai.

4 · Batas nilai, bukan skor nilai

Sebuah model berada di batas nilai ketika tidak ada model lain yang skornya setidaknya setinggi model itu, biayanya tidak lebih mahal, dan unggul pada salah satu dari keduanya. 12 dari model yang dinilai, memiliki harga, dan berpengiriman standar memenuhi syarat. Masing-masing dari 92% sisanya punya model seperti itu di atasnya, meski tidak selalu pengganti yang bisa langsung dipasang: bagian di atas menghitung yang mengorbankan sesuatu.

Mengapa tidak memeringkat berdasarkan mutu per dolar?

Karena rasio itu memberi imbalan pada kemurahan jauh lebih curam daripada pada mutu. Diterapkan pada katalog ini, ia menobatkan model yang meraih 37,8 dari plafon sekitar 63, dan menempatkan yang meraih 14,2 di posisi kedua — model yang tak seorang pun sebaiknya jalankan di produksi. Situs mana pun yang menerbitkan kolom “nilai” yang dihitung begitu sedang memberi nasihat buruk. Kami memakai batas nilai ditambah ambang mutu yang eksplisit.

5 · Harga adalah sifat dari sebuah model dan sebuah beban kerja

Tidak ada yang namanya “harga” sebuah model. Meringkas itu berat di masukan, membuat kode berat di keluaran, dan lingkar agentik memutar ulang konteksnya tiap giliran; katalog yang sama tersusun berbeda pada masing-masingnya. Alih-alih memilih satu campuran lalu menyembunyikannya, rasio masukan:keluaran dan tingkat kena cache adalah kendali yang bisa Anda lihat dan ubah.

Jika tarif baca cache tidak dipublikasikan, estimasi gabungan memakai tarif input penuh pada tingkat harga yang dipilih.

Beban kerjaPorsi keluaranKena cacheBentuk
Seimbang 25% 0%3 token masuk per 1 keluar
Ringkas 5% 30%Input raksasa, output mungil
Chat 40% 50%System prompt panjang yang di-cache
Gen kode 60% 20%Output mendominasi
Agentik 15% 70%Konteks diputar ulang tiap giliran

Tiga hal secara rutin membuat tarif yang diiklankan menjadi keliru, dan ketiganya tampil pada barisnya:

  • Jenjang konteks. 51 model berganti tarif setelah melewati ambang panjang prompt, sebagian lebih dari sekali — Qwen3.7 Flash menjadi 3,33× di atas 32K dan 6,67× di atas 256K. Hitung beban konteks panjang dari harga utama, dan Anda meleset sebesar suatu kelipatan.
  • Token penalaran yang ditagih terpisah dari keluaran. Jika token penalaran ditagih secara terpisah, biayanya bergantung pada jumlah token yang ditagih dan tarifnya. Sertakan biaya tersebut dalam perkiraan Anda.
  • Harga menurut waktu. Model dengan periode tarif yang dipublikasikan: 2. Periksa periode, zona waktu, dan tarifnya; jangan mengasumsikan diskon tetap.

6 · Harga mana yang kami terbitkan

Skor diukur pada penerapan model itu sendiri, jadi harga di sebelahnya adalah harga acuan: penawaran termurah, pada campuran seimbang, yang lolos setiap uji di bawah. Tarif input, output, dan baca cache dari penawaran itu diterbitkan bersama, tidak pernah dicampur dengan tarif penawaran lain.

  1. Aktif. Penawaran yang dicatat OpenRouter sebagai tidak aktif dikecualikan. Penawaran yang terbaca menurun pada saat pembacaan tetap dihitung bila aktif setidaknya 95% dari hari terakhir. Penawaran yang aktif kurang dari 80% dari hari terakhir tidak dihitung, apa pun statusnya saat ini.
  2. Pengiriman standar. Flex, priority, fast, dan tingkat serupa adalah produk lain dan dikecualikan.
  3. Tarif standar. Penawaran yang sedang promosi dihitung dengan tarif standarnya: setiap tarif dibagi satu dikurangi diskon. Harga promosi diungkapkan, tidak pernah diperingkat.
  4. Jendela standar. Harga yang bergantung pada jam dihitung pada tarif standarnya; jam diskon diungkapkan.
  5. Presisi pembuat model atau lebih baik. Penawaran 4-bit (fp4, nvfp4, mxfp4, int4) hanya dihitung bila pembuat model sendiri melayani 4-bit atau, bila pembuat model tidak menyatakan presisi, bobot yang diterbitkannya 4-bit. Penawaran yang tidak menyatakan presisi dihitung bila itu penawaran pembuat model sendiri, atau penawaran penjual ulang untuk model berbobot tertutup: ia melayani deployment pembuat model. Untuk bobot terbuka, atau bobot yang belum dicatat siapa pun, penawaran penjual ulang yang tidak menyatakannya dikecualikan: tidak pernah dibaca sebagai presisi penuh.

Bila tidak ada penawaran yang lolos, model memakai harga cadangan, berlabel harga tanpa penawaran setara beserta alasannya, karena model tanpa harga akan terbaca seolah tidak ada: di antara penawaran aktif dengan pengiriman standar, masing-masing dengan tarif standarnya, yang termurah dari penjual ulang yang tidak menyatakan presisi, dan bila tidak ada, penawaran 4-bit termurah. Tingkat pengiriman lain hanya dipakai bila tidak ada lagi yang aktif. Model tanpa penawaran untuk diambil harganya tetap memakai harga tingkat model dari OpenRouter.

Penawaran termurah yang dikecualikan aturan, bila lebih murah, ditampilkan di halaman model sebagai “Lebih murah saat ini”, beserta alasannya: promosi dan persentasenya, 4-bit, tingkat pengiriman, atau presisi tidak diungkapkan. Penawaran itu tidak pernah menentukan peringkat, frontier, putusan, atau angka utama. Bila penawaran yang menetapkan harga itu sendiri sedang promosi, harga promosinya sendirilah yang ditampilkan.

Pada data ini 333 model memakai harga acuan, 15 harga tanpa penawaran setara, dan 99 harga tingkat model dari OpenRouter, termasuk daftar batch dan gratis. 86 menampilkan penawaran yang lebih murah saat ini, 11 di antaranya dari penjual ulang yang tidak menyatakan presisi.

Sebelum aturan ini, setiap harga di sini adalah harga tingkat model dari OpenRouter, yang dapat ditetapkan penjual mana pun, termasuk promosi dan salinan 4-bit. Perubahan ini dicatat sebagai §96 di log koreksi, beserta angka sebelum dan sesudahnya.

7 · Peringkat bersyarat tugas

Satu urutan global tunggal itu tidak jujur secara intelektual, sebab pekerjaan yang berbeda dimenangkan model yang berbeda. Kami membawa Elo per tugas di 25 kategori — front-end, visualisasi data, pengembangan gim, SVG, Android, salindia, dan lainnya. Memilih sebuah tugas akan menyusun ulang seluruh papan menurut Elo tugas itu, bukan menurut indeks umum.

Skor tugas adalah Elo per tugas dari Design Arena, dibaca dari umpan model OpenRouter: designarena.ai.

Cakupan berbeda-beda antar kategori, dan model yang tak ada di papan sebuah kategori ditampilkan sebagai belum diukur untuk tugas itu, bukan sebagai buruk padanya.

8 · Ketika model yang sama dijual dua kali

Sebagian model bukanlah model baru. Penjualnya sendiri yang berkata begitu: 11 entri di katalog ini dijelaskan oleh vendornya sendiri sebagai model lain di katalog yang disajikan secara berbeda — jalur yang lebih cepat, mode penalaran yang berbeda, komputasi lebih banyak per kueri. 10 dari 11 tidak punya entri di papan peringkat LMArena mana pun. 11 dari 11 model dasar mereka punya.

Ketika model yang sama dijual dua kali
Dijual sebagaiHarga tingkat layananModel dasarKata penjual
o1-pro tanpa entri$600 ×10o1 1.365,8 komputasi lebih banyak per kueri
o3 Pro tanpa entri$80 ×10o3 1.409,9 komputasi lebih banyak per kueri
GPT-6 Astra Pro tanpa entri$50 ×1GPT-6 Astra 1.442,3 pada upaya maksimummodel sama, mode penyajian berbeda
GPT-5.6 Sol Pro tanpa entri$20 ×1GPT-5.6 Sol 1.456,3 pada upaya sangat tinggimodel sama, mode penyajian berbeda
GPT-5.6 Terra Pro tanpa entri$12 ×1GPT-5.6 Terra 1.446,3 pada upaya sangat tinggimodel sama, mode penyajian berbeda
GPT-6 Sol Pro tanpa entri$10 ×1GPT-6 Sol 1.395,4 pada upaya maksimummodel sama, mode penyajian berbeda
GPT-6.1 Sol Pro tanpa entri$10 ×1GPT-6.1 Sol 1.445,6 pada upaya maksimummodel sama, mode penyajian berbeda
o3 Mini High 1.336,6 $4,4 ×1o3 Mini 1.319,4 model sama, mode penyajian berbeda
o4 Mini High tanpa entri$4,4 ×1o4 Mini 1.353,2 model sama, mode penyajian berbeda
GPT-5.6 Luna Pro tanpa entri$1,2 ×1GPT-5.6 Luna 1.431 pada upaya sangat tinggimodel sama, mode penyajian berbeda
GPT-6 Luna Pro tanpa entri$0,5 ×1GPT-6 Luna 1.391,5 pada upaya maksimummodel sama, mode penyajian berbeda

Perbedaan ini penting bagi apa yang bisa Anda simpulkan. Ketika penjual menyatakan kemampuan identik — 0 dari 11 — skor model dasar juga merupakan klaim penjual sendiri tentang tingkat tersebut, dan satu-satunya yang Anda beli adalah kecepatan. Ketika penjual menyatakan komputasi lebih banyak atau mode yang berbeda, tidak ada pengukuran terbitan yang memberi tahu Anda apa yang dibeli oleh biaya tambahan itu, kecuali satu-satunya pengecualian yang disebut di atas.

Ini hanya menghitung apa yang dinyatakan penjual. Model yang namanya berakhiran “Pro” tetapi disebut vendornya sebagai model unggulan tersendiri tidak dihitung di sini, karena itu akan menjadi klaim kami, bukan klaim mereka — kesalahan yang sama dengan memperlakukan tingkat layanan milik vendor sendiri sebagai penjual yang bersaing, yang dulu pernah mengubah sebaran harga 2× menjadi 7,2× yang diterbitkan.

Tidak adanya entri di papan peringkat LMArena bukanlah putusan. Itu bukan bukti mutu yang buruk, dan bukan berarti tidak ada yang pernah mengevaluasi model-model ini — vendor menerbitkan hasil mereka sendiri. Artinya, sumbu yang dipakai situs ini untuk memeringkat tidak punya hasil ukur untuk model-model itu, sehingga kami tidak memeringkatnya.

9 · Dari mana datanya berasal

Harga dinormalkan dari katalog lintas penyedia yang dapat dibaca mesin dan disilangperiksa dengan halaman harga vendor. Setiap halaman model menautkan sumber dan tanggal pengambilannya.

  • Konflik dicatat, bukan dirata-ratakan. Ketika dua sumber berselisih tentang sebuah harga, perselisihan itulah temuannya. Model yang didaftar $4/$20 oleh vendornya dan dijual $2/$10 lewat agregator punya dua harga yang benar, dan mana yang berlaku bergantung pada tempat Anda membeli.
  • Nilai yang tidak masuk akal dikarantina. Sentinel hulu bernilai −1 untuk “dihargai saat permintaan” akan menjadi −$750.000 per juta bila diteruskan mentah-mentah, dan memenangi setiap pengurutan termurah-dulu. Apa pun di luar rentang yang masuk akal ditahan dengan alasan terlampir.
  • Keyakinan berlaku per bidang. Bukan satu lencana per baris. Mengklaim sebuah catatan terverifikasi padahal hanya harganya yang diperiksa adalah jenis pernyataan berlebihan yang mengakhiri kepercayaan begitu ada yang menyadarinya.
  • Tidak dinilai bukan nol. 219 model tidak punya nilai independen. Mereka didaftar menurut harga dan dikecualikan dari pengurutan mutu; tidak pernah dibuang ke bawah seolah-olah sudah diukur lalu gagal.

10 · Lisensi, dan apa yang dibatasinya

Dua dari tolok ukur yang menjadi sandaran situs ini punya syarat redistribusi yang sangat berbeda, dan itu mengubah apa yang boleh diterbitkan.

  • LMArena menerbitkan papan peringkatnya sebagai kumpulan data CC-BY-4.0, yang mengizinkan redistribusi dengan atribusi — dan yang membawa batas kepercayaan yang menjadi sandaran peringkat signifikansi di atas. Itulah kanal yang harus dipakai; mengeruk situsnya sendiri dilarang oleh ketentuan mereka.
  • Artificial Analysis's free tier is "internal use only with attribution"; public redistribution requires a commercial licence, and their site terms separately limit use to personal and non-commercial purposes. So we do not publish their figures at all. Every general capability score on this site is LMArena Elo, used under CC BY 4.0 from the official dataset; the per-task scores are Design Arena’s, below. Artificial Analysis remains an internal cross-check, which is what its free tier permits; it reaches no page, export or API here.
  • Ketentuan API Design Arena membebaskan penggunaan data papan peringkatnya, termasuk untuk komersial, dengan satu syarat: tampilan publik menyebut Design Arena dan menautkan ke designarena.ai. Elo per tugasnya masuk ke situs ini melalui umpan model OpenRouter; tampilan per tugas, peringkat per tugas di setiap halaman model, dan halaman ini menyebutkannya.
  • Harga itu sendiri adalah fakta yang diterbitkan vendor, dan itu berbeda dari nilai indeks yang disusun. Harga disilangperiksa dengan halaman vendor dan setiap baris menautkan sumbernya.

11 · Koreksi

Harga berubah tanpa pemberitahuan dan halaman ditata ulang; sebagian dari yang ada di sini akan keliru pada saat tertentu. Bila Anda menemukan kesalahan, jalan tercepat adalah menyebut model mana, berapa seharusnya angkanya, dan di mana angka itu diterbitkan — koreksi dengan sumber primer diterapkan langsung.

Laporkan harga yang salah

Katalog terakhir diambil 2026-10-06. Logika peringkat diversikan bersama situs, sehingga perubahan pada cara “terbaik” dihitung menjadi selisih yang terlihat, bukan penyetelan ulang yang senyap.

Bukti & tanya