---
title: "कार्यप्रणाली — “सर्वश्रेष्ठ” कैसे तय होता है, और डेटा कहाँ कमज़ोर है · Undominated.ai"
canonical: https://undominated.ai/hi/methodology/
description: "यह साइट 364 AI मॉडलों को कैसे रैंक करती है: फ्रंटियर, कार्य-सशर्त Elo, वर्कलोड-सचेत मूल्य निर्धारण, और इस बात का ईमानदार ब्यौरा कि डेटा क्या नहीं कवर करता।"
---

# कार्यप्रणाली — “सर्वश्रेष्ठ” कैसे तय होता है, और डेटा कहाँ कमज़ोर है · Undominated.ai

> यह साइट 364 AI मॉडलों को कैसे रैंक करती है: फ्रंटियर, कार्य-सशर्त Elo, वर्कलोड-सचेत मूल्य निर्धारण, और इस बात का ईमानदार ब्यौरा कि डेटा क्या नहीं कवर करता।

# पद्धति

यहाँ जो कुछ है, वह उन्हीं सार्वजनिक स्रोतों से दोहराया जा सकता है जिन्हें आप स्वयं जाँच सकते हैं। जहाँ आँकड़े कम हैं या स्रोत आपस में असहमत हैं, यह पृष्ठ वही कहता है — भरोसे का वह पृष्ठ जो केवल अच्छी खबर देता है, विज्ञापन है।

 On this page [2 · वे रैंक जिन पर भरोसा किया जा सके](#methodology-section-1)[8 · जब एक ही मॉडल दो बार बेचा जाता है](#tiers)[9 · आँकड़े कहाँ से आते हैं](#methodology-section-3)[10 · लाइसेंस, और वे किसे सीमित करते हैं](#sources) 60% सूची के पास **कोई स्वतंत्र गुणवत्ता अंक नहीं है**। 364 में से 145 मॉडल आँके गए हैं। शेष सूचीबद्ध हैं, मूल्य के साथ और स्पष्ट रूप से बिना आँके चिह्नित — इन्हें कभी क्रम में नहीं रखा जाता।
 72/145 दिखाई गई ऐसी स्थितियाँ जो **वास्तव में भिन्न रैंक** हैं। सटे हुए जोड़ों में से 94% बेंचमार्क की त्रुटि सीमा के भीतर आते हैं।
 67/364 ऐसे मॉडल जिनका मुख्य मूल्य **पूरा मूल्य नहीं है**: संदर्भ के स्तर, अलग से बिल किया गया तर्क, या समय के अनुसार दरें।
 7/447 entries with variable prices withheld
 4/447 entries with suspect latency withheld; may overlap the price group

## 1 · «सर्वश्रेष्ठ» का अर्थ

गुणवत्ता आगे रहती है और मूल्य बराबरी तोड़ता है। यही क्रम पूरा उत्पाद है: सबसे सस्ते पहले वाली सूची छापना बेहद आसान और लगभग बेकार है, क्योंकि इस बाज़ार का सबसे सस्ता मॉडल सबसे महँगे से 12,500× सस्ता है और आम तौर पर वह काम कर ही नहीं पाता।

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are **LMArena** Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

### एक ही गुणवत्ता अंक क्यों नहीं है

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are **LMArena** Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

## 2 · वे रैंक जिन पर भरोसा किया जा सके

रैंक का स्तंभ एक **सार्थकता रैंक** है, पंक्ति संख्या नहीं। किसी मॉडल की रैंक उन मॉडलों की संख्या से एक अधिक होती है जो उसे दोनों त्रुटि सीमाओं के जोड़ से ज़्यादा अंतर से पीछे छोड़ते हैं। जिन मॉडलों की यह संख्या समान हो, वे एक ही रैंक साझा करते हैं। एक-दूसरे की त्रुटि सीमा के भीतर के दो मॉडल भी अलग-अलग रैंक पा सकते हैं, क्योंकि हर एक की तुलना पूरी तालिका से होती है।

रैंक से जुड़े प्रक्षेपण (पहचानकर्ता, अंक, कार्यभार अनुसार मूल्य, सीमांत चिह्न) का SHA-256: 06cd12db54e2968c3de49b45a3a2a6881f374f6e58a462437784450842efb989 । तिथियाँ और बिल्ड चिह्न बाहर रखे जाते हैं। यहाँ बदलाव का अर्थ है क्रम में बदलाव, साज-सज्जा में नहीं।

[सुधार](/hi/corrections/)

### किसी रैंकिंग का अधिकांश क्रम शोर है

Arena के दो अंक तभी अलग माने जाते हैं जब उनका अंतर दोनों मॉडलों की 95% त्रुटि सीमाओं के जोड़ से ज़्यादा हो। इस तालिका पर यह जोड़ औसतन 10.47 अंक है, और यह परीक्षण अंतर पर 95% अंतराल से कम से कम उतना ही सख़्त है। **144 सटे युग्मों में से 136 (94%)** अपने ही जोड़ के भीतर आते हैं। किसी मॉडल की रैंक को उन मॉडलों की संख्या से एक अधिक गिनने पर जो उसे स्पष्ट रूप से पीछे छोड़ते हैं, दिखाई गई 145 पंक्तियों में **72 अलग-अलग रैंक** हैं, और 4 मॉडल संयुक्त रूप से प्रथम हैं।

अतः «नंबर 1 मॉडल» ऐसा दावा नहीं है जिसे ये आँकड़े सँभाल सकें। बराबरी को बराबरी की तरह दिखाया जाता है। रैंक 1 उन मॉडलों के बीच रैंक 1 है जो इस साइट द्वारा पढ़े जाने वाले मूल्य फ़ीड में हैं: जब LMArena किसी ऐसे मॉडल को इन सबसे ऊपर रखता है जो फ़ीड में नहीं है, तो बोर्ड उस मॉडल का नाम देता है और उसे रैंक नहीं देता।

यह विधि हमारी नहीं है। LMArena वर्षों से इसी तरह क्रम देता आया है — उनका [Rank (UB)](https://news.lmarena.ai/ranking-method/) हर मॉडल को उन मॉडलों की संख्या से एक अधिक रैंक देता है जो सांख्यिकीय रूप से उससे बेहतर हैं, और उन्होंने [क्रियान्वयन को खुला भी कर दिया है](https://github.com/lmarena/arena-rank)। असामान्य यह है कि इसे *मूल्य* की तुलना पर लगाया जाए, जहाँ प्रोत्साहन तीखा क्रम छापने का होता है।

Applied to the general arena board only. Other boards carry their own error, which we do not have, so they are not given a borrowed threshold.

## 3 · «बेहतर और सस्ता» का सचमुच वही अर्थ होना चाहिए

मूल्य और क्षमता पर पारेतो प्रभुत्व एक कहीं व्यापक खरीद-निर्णय का द्विविमीय प्रक्षेपण है, और यह प्रक्षेपण सही होने से अधिक बार भ्रामक होता है। कोई मॉडल अधिक अंक पा सकता है और कम खर्च कर सकता है, और साथ ही चित्र स्वीकार न करे, निर्गम आधे टोकनों पर रोक दे, या पाँच लाख टोकन कम संदर्भ रखे।

इसलिए **«एक साथ बेहतर और सस्ता» केवल उस प्रतिस्थापन के लिए सुरक्षित रखा गया है जिसकी क्षमता-परिधि मूल की अधिसमुच्चय हो**। 133 प्रभुत्व निर्णयों में से 113 कठोर हैं और **20 (15%)** इसके बजाय बताते हैं कि आपको क्या छोड़ना होगा। उस छननी के बिना, कच्चे द्वि-अक्षीय निर्णयों में से 61% ऐसा मॉडल सुझाते थे जो मौजूदा मॉडल का काम कर ही नहीं सकता था।

## 4 · सीमा, कोई मूल्य-अंक नहीं

कोई मॉडल **मूल्य सीमा** पर तब होता है जब कोई दूसरा मॉडल ऐसा न हो जो कम से कम उतना ऊँचा स्कोर करे, उससे ज़्यादा महँगा न हो, और दोनों में से किसी एक पर आगे हो। आँके गए, मूल्यांकित और मानक वितरण वाले मॉडलों में से 12 इस पर खरे उतरते हैं। शेष 92% में से हर एक के ऊपर ऐसा एक मॉडल है, हालाँकि वह हमेशा सीधा प्रतिस्थापन नहीं होता: ऊपर वाला खंड उन्हें गिनता है जिनमें कुछ छोड़ना पड़ता है।

### प्रति डॉलर गुणवत्ता से क्रम क्यों न दें?

क्योंकि यह अनुपात सस्तेपन को गुणवत्ता की तुलना में कहीं अधिक तीव्रता से पुरस्कृत करता है। इस सूची पर लगाने पर यह लगभग 63 की छत में 37.8 पाने वाले मॉडल को शीर्ष पर बैठा देता है, और 14.2 पाने वाले को दूसरे स्थान पर — ऐसे मॉडल जिन्हें किसी को भी उत्पादन में नहीं चलाना चाहिए। जो भी साइट इस तरह गणना किया «मूल्य» स्तंभ छापती है, वह बुरी सलाह दे रही है। हम इसके बजाय सीमा और एक स्पष्ट गुणवत्ता न्यूनतम का उपयोग करते हैं।

## 5 · मूल्य एक मॉडल और एक कार्यभार, दोनों का गुण है

किसी मॉडल का «वह» मूल्य जैसा कुछ नहीं होता। सारांश प्रवेश-प्रधान है, कोड-निर्माण निर्गम-प्रधान, और एजेंट का चक्र हर बारी में अपना संदर्भ दोहराता है; वही सूची हर स्थिति में अलग क्रम में आती है। एक मिश्रण चुनकर उसे छिपाने के बजाय, प्रवेश:निर्गम अनुपात और कैश-हिट दर ऐसे नियंत्रण हैं जिन्हें आप देख और बदल सकते हैं।

कैश पढ़ने की दर प्रकाशित न होने पर, मिश्रित लागत के अनुमान में चुने गए मूल्य स्तर की पूरी इनपुट दर लागू होती है।

| कार्यभार | निर्गम हिस्सा | कैश हिट | स्वरूप |
| --- | --- | --- | --- |
| संतुलित | निर्गम हिस्सा 25% | कैश हिट 0% | 1 आउट पर 3 टोकन इन |
| सारांश | निर्गम हिस्सा 5% | कैश हिट 30% | विशाल इनपुट, बहुत छोटा आउटपुट |
| चैट | निर्गम हिस्सा 40% | कैश हिट 50% | लंबा कैश्ड सिस्टम प्रॉम्प्ट |
| कोड जेन | निर्गम हिस्सा 60% | कैश हिट 20% | आउटपुट हावी |
| एजेंटिक | निर्गम हिस्सा 15% | कैश हिट 70% | हर टर्न पर कॉन्टेक्स्ट दोबारा भेजा जाता है |

तीन चीज़ें नियमित रूप से विज्ञापित दर को गलत कर देती हैं, और तीनों पंक्ति पर दिखाई जाती हैं:

 - **संदर्भ के स्तर।** 51 मॉडल प्रॉम्प्ट की लंबाई की एक सीमा पार करने पर दर बदल देते हैं, कुछ एक से अधिक बार — Qwen3.7 Flash 32K के पार 3.33× और 256K के पार 6.67× हो जाता है। लंबे संदर्भ वाले कार्यभार की गणना मुख्य मूल्य से करेंगे तो कई गुना चूकेंगे।
 - **निर्गम से अलग बिल किए जाने वाले तर्क-टोकन।** जब तर्क-टोकन का शुल्क अलग से लिया जाता है, तो लागत बिल किए गए टोकन की संख्या और उनकी दर पर निर्भर करती है। इस शुल्क को अपने अनुमान में शामिल करें।
 - **दिन के समय के अनुसार मूल्य।** प्रकाशित समय-आधारित दरों वाले मॉडल: 2। समय-अवधि, समय क्षेत्र और दरें जाँचें; एक तय छूट मानकर न चलें।

## 6 · हम कौन-सा मूल्य प्रकाशित करते हैं

स्कोर मॉडल की अपनी तैनाती पर मापा जाता है, इसलिए उसके साथ दिखाया गया मूल्य **संदर्भ मूल्य** है: संतुलित मिश्रण पर वह सबसे सस्ता ऑफ़र जो नीचे की हर जाँच पास करता है। उस ऑफ़र की इनपुट, आउटपुट और कैश-रीड दरें साथ में प्रकाशित होती हैं, किसी दूसरे ऑफ़र की दरों के साथ कभी मिलाई नहीं जातीं।

 - **चालू।** जिस ऑफ़र को OpenRouter बंद बताता है, उसे बाहर रखा जाता है। जो ऑफ़र पढ़ने के क्षण में कमज़ोर दिखता है, वह तब भी गिना जाता है जब वह पिछले दिन का कम से कम 95% समय चालू रहा हो। जो ऑफ़र पिछले दिन के 80% से कम समय चालू रहा, वह नहीं गिना जाता, चाहे अभी उसकी स्थिति कुछ भी हो।
 - **मानक डिलीवरी।** flex, priority, fast और ऐसे स्तर अलग उत्पाद हैं, इसलिए बाहर रखे जाते हैं।
 - **मानक दर।** प्रमोशन वाला ऑफ़र अपनी मानक दर पर गिना जाता है: हर दर को एक में से छूट घटाकर भाग दिया जाता है। प्रमोशन वाला मूल्य बताया जाता है, उसे कभी रैंक नहीं किया जाता।
 - **मानक समय-खंड।** समय के हिसाब से बदलने वाला मूल्य उसकी मानक दर पर गिना जाता है; छूट के घंटे बताए जाते हैं।
 - **निर्माता की प्रिसिज़न या उससे बेहतर।** 4-बिट ऑफ़र (fp4, nvfp4, mxfp4, int4) तभी गिना जाता है जब निर्माता खुद 4-बिट पर सर्व करता हो या, जहाँ निर्माता कोई प्रिसिज़न घोषित नहीं करता, उसके प्रकाशित वेट 4-बिट हों। जो ऑफ़र प्रिसिज़न घोषित नहीं करता वह तब गिना जाता है जब वह निर्माता का अपना हो, या बंद वेट वाले मॉडल के पुनर्विक्रेता का हो: वह निर्माता की डिप्लॉयमेंट ही सर्व करता है। खुले वेट, या जिनका रिकॉर्ड किसी ने नहीं रखा, उनके लिए किसी पुनर्विक्रेता का ऐसा ऑफ़र बाहर रखा जाता है: उसे कभी पूर्ण प्रिसिज़न नहीं माना जाता।

जब कोई ऑफ़र पास नहीं होता, तो मॉडल एक वैकल्पिक मूल्य रखता है, जिसे कारण के साथ **समकक्ष ऑफ़र के बिना मूल्य** लिखा जाता है, क्योंकि बिना मूल्य का मॉडल अनुपस्थित लगेगा: मानक डिलीवरी वाले चालू ऑफ़रों में, हर एक अपनी मानक दर पर, उस पुनर्विक्रेता का सबसे सस्ता ऑफ़र जो प्रिसिज़न घोषित नहीं करता, और वह न हो तो सबसे सस्ता 4-बिट ऑफ़र। कोई दूसरा डिलीवरी स्तर तभी लिया जाता है जब और कुछ चालू न हो। जिस मॉडल के पास मूल्य लेने के लिए कोई ऑफ़र नहीं है, वह OpenRouter का मॉडल-स्तरीय मूल्य रखता है।

नियम से बाहर किया गया सबसे सस्ता ऑफ़र, अगर वह सस्ता है, मॉडल पेज पर “अभी सस्ता” के रूप में कारण के साथ दिखाया जाता है: प्रमोशन और उसका प्रतिशत, 4-बिट, डिलीवरी स्तर, या प्रिसिज़न घोषित नहीं। यह कभी रैंक, फ्रंटियर, निष्कर्ष या मुख्य आँकड़ा तय नहीं करता। जब मूल्य तय करने वाला ऑफ़र खुद प्रमोशन पर हो, तो उसका अपना प्रमोशन वाला मूल्य ही दिखाया जाता है।

इस डेटा में 333 मॉडल का संदर्भ मूल्य है, 15 का समकक्ष ऑफ़र के बिना मूल्य है और 99 का OpenRouter का मॉडल-स्तरीय मूल्य है, जिनमें batch और मुफ़्त सूचियाँ भी हैं। 86 में अभी कोई सस्ता ऑफ़र दिखता है, जिनमें से 11 ऐसे पुनर्विक्रेता के हैं जो प्रिसिज़न घोषित नहीं करता।

इस नियम से पहले यहाँ हर मूल्य OpenRouter का मॉडल-स्तरीय मूल्य था, जिसे कोई भी विक्रेता तय कर सकता है, प्रमोशन और 4-बिट प्रतियों समेत। यह बदलाव सुधार लॉग में §96 के रूप में, पहले और बाद के आँकड़ों के साथ दर्ज है।

## 7 · कार्य-सापेक्ष क्रम

एक ही वैश्विक क्रम बौद्धिक रूप से बेईमान है, क्योंकि अलग-अलग काम अलग-अलग मॉडल जीतते हैं। हम **25 श्रेणियों** में कार्य-विशिष्ट एलो रखते हैं — फ्रंट-एंड, आँकड़ों का दृश्यीकरण, गेम विकास, SVG, Android, प्रस्तुतियाँ और अन्य। कोई कार्य चुनने पर पूरा पटल सामान्य सूचकांक के बजाय उसी कार्य के एलो पर पुनः क्रमित हो जाता है।

कार्य-स्कोर **Design Arena** का प्रति-कार्य Elo है, जिसे OpenRouter की मॉडल फ़ीड से पढ़ा गया है: [designarena.ai](https://designarena.ai)।

विस्तार श्रेणी के अनुसार बदलता है, और किसी श्रेणी की सूची में अनुपस्थित मॉडल उस कार्य के लिए अमापित दिखाया जाता है, उसमें कमज़ोर नहीं।

## 8 · जब एक ही मॉडल दो बार बेचा जाता है

कुछ मॉडल नए मॉडल नहीं हैं। विक्रेता ख़ुद यही कहता है: **इस कैटलॉग की 11 प्रविष्टियों** को उनका अपना विक्रेता कैटलॉग के ही किसी दूसरे मॉडल के रूप में बताता है, जिसे अलग ढंग से परोसा जाता है — एक तेज़ लेन, एक अलग तर्क मोड, प्रति क्वेरी अधिक कंप्यूट। **इन 11 में से 10 की किसी भी LMArena लीडरबोर्ड पर कोई प्रविष्टि नहीं है। उनके 11 आधार मॉडलों में से 11 की है।**

जब एक ही मॉडल दो बार बेचा जाता है

| किस नाम से बिकता है | स्तर की कीमत | आधार मॉडल | विक्रेता क्या कहता है |
| --- | --- | --- | --- |
| [o1-pro](/models/openai__o1-pro/) कोई प्रविष्टि नहीं | $600 ×10 | [o1](/models/openai__o1/) 1,365.8 | प्रति क्वेरी अधिक कंप्यूट |
| [o3 Pro](/models/openai__o3-pro/) कोई प्रविष्टि नहीं | $80 ×10 | [o3](/models/openai__o3/) 1,409.9 | प्रति क्वेरी अधिक कंप्यूट |
| [GPT-6 Astra Pro](/models/openai__gpt-6-astra-pro/) कोई प्रविष्टि नहीं | $50 ×1 | [GPT-6 Astra](/models/openai__gpt-6-astra/) 1,442.3 तर्क-प्रयास: अधिकतम | वही मॉडल, अलग सर्विंग मोड |
| [GPT-5.6 Sol Pro](/models/openai__gpt-5.6-sol-pro/) कोई प्रविष्टि नहीं | $20 ×1 | [GPT-5.6 Sol](/models/openai__gpt-5.6-sol/) 1,456.3 तर्क-प्रयास: अति-उच्च | वही मॉडल, अलग सर्विंग मोड |
| [GPT-5.6 Terra Pro](/models/openai__gpt-5.6-terra-pro/) कोई प्रविष्टि नहीं | $12 ×1 | [GPT-5.6 Terra](/models/openai__gpt-5.6-terra/) 1,446.3 तर्क-प्रयास: अति-उच्च | वही मॉडल, अलग सर्विंग मोड |
| [GPT-6 Sol Pro](/models/openai__gpt-6-sol-pro/) कोई प्रविष्टि नहीं | $10 ×1 | [GPT-6 Sol](/models/openai__gpt-6-sol/) 1,395.4 तर्क-प्रयास: अधिकतम | वही मॉडल, अलग सर्विंग मोड |
| [GPT-6.1 Sol Pro](/models/openai__gpt-6.1-sol-pro/) कोई प्रविष्टि नहीं | $10 ×1 | [GPT-6.1 Sol](/models/openai__gpt-6.1-sol/) 1,445.6 तर्क-प्रयास: अधिकतम | वही मॉडल, अलग सर्विंग मोड |
| [o3 Mini High](/models/openai__o3-mini-high/) 1,336.6 | $4.4 ×1 | [o3 Mini](/models/openai__o3-mini/) 1,319.4 | वही मॉडल, अलग सर्विंग मोड |
| [o4 Mini High](/models/openai__o4-mini-high/) कोई प्रविष्टि नहीं | $4.4 ×1 | [o4 Mini](/models/openai__o4-mini/) 1,353.2 | वही मॉडल, अलग सर्विंग मोड |
| [GPT-5.6 Luna Pro](/models/openai__gpt-5.6-luna-pro/) कोई प्रविष्टि नहीं | $1.2 ×1 | [GPT-5.6 Luna](/models/openai__gpt-5.6-luna/) 1,431 तर्क-प्रयास: अति-उच्च | वही मॉडल, अलग सर्विंग मोड |
| [GPT-6 Luna Pro](/models/openai__gpt-6-luna-pro/) कोई प्रविष्टि नहीं | $0.5 ×1 | [GPT-6 Luna](/models/openai__gpt-6-luna/) 1,391.5 तर्क-प्रयास: अधिकतम | वही मॉडल, अलग सर्विंग मोड |

यह अंतर इसके लिए मायने रखता है कि आप क्या निष्कर्ष निकाल सकते हैं। जहाँ विक्रेता *एक जैसी क्षमताएँ* कहता है — 11 में से 0 — वहाँ आधार मॉडल का स्कोर स्तर के बारे में भी विक्रेता का अपना दावा है, और आप केवल गति ख़रीद रहे हैं। जहाँ विक्रेता अधिक कंप्यूट या अलग मोड कहता है, वहाँ कोई प्रकाशित माप यह नहीं बताता कि अतिरिक्त ख़र्च से क्या मिलता है, ऊपर बताए गए एकमात्र अपवाद को छोड़कर।

यह केवल वही गिनता है जो विक्रेता कहता है। जिस मॉडल का नाम «Pro» पर ख़त्म होता है, पर जिसे उसका विक्रेता अपने आप में एक फ़्लैगशिप मॉडल कहता है, उसे यहाँ नहीं गिना जाता, क्योंकि वह हमारा दावा होगा, उनका नहीं — वही ग़लती जो किसी विक्रेता के अपने सेवा स्तरों को प्रतिस्पर्धी विक्रेता मान लेने में है, जिसने एक बार 2× के मूल्य अंतर को प्रकाशित 7.2× में बदल दिया था।

किसी LMArena लीडरबोर्ड पर प्रविष्टि न होना कोई निर्णय नहीं है। यह ख़राब गुणवत्ता का प्रमाण नहीं है, और इसका अर्थ यह नहीं कि किसी ने इनका मूल्यांकन नहीं किया — विक्रेता अपने परिणाम ख़ुद प्रकाशित करते हैं। इसका अर्थ है कि जिस अक्ष पर यह साइट रैंक करती है, उस पर इनका कोई माप नहीं है, इसलिए हम इन्हें रैंक नहीं करते।

## 9 · आँकड़े कहाँ से आते हैं

मूल्य कई प्रदाताओं को समेटने वाली मशीन-पठनीय सूची से सामान्यीकृत किए जाते हैं और विक्रेताओं के मूल्य पृष्ठों से मिलाए जाते हैं। हर मॉडल पृष्ठ अपने स्रोत और प्राप्ति तिथि से जुड़ा होता है।

 - **टकराव दर्ज किए जाते हैं, औसत नहीं।** जब दो स्रोत किसी मूल्य पर असहमत हों, वह असहमति ही निष्कर्ष है। जिस मॉडल को विक्रेता $4/$20 पर सूचीबद्ध करता है और जो किसी एग्रीगेटर के ज़रिए $2/$10 पर बिकता है, उसके दो सच्चे मूल्य हैं, और कौन-सा लागू होगा यह इस पर निर्भर है कि आप कहाँ से खरीदते हैं।
 - **अविश्वसनीय मान संगरोध में रखे जाते हैं।** «अनुरोध के समय मूल्य तय» के लिए ऊपरी स्रोत का −1 प्रहरी मान बिना सोचे आगे बढ़ा दिया जाए तो प्रति दस लाख −$750,000 बन जाता है, और सबसे सस्ते वाले हर क्रम में शीर्ष पर आ जाता है। जो कुछ भी विश्वसनीय परास से बाहर है, उसे कारण सहित रोका जाता है।
 - **विश्वास हर क्षेत्र के लिए अलग है।** हर पंक्ति पर एक बिल्ला नहीं। केवल मूल्य जाँचकर पूरे अभिलेख को सत्यापित बताना उसी तरह की अतिशयोक्ति है जो किसी के ध्यान देते ही भरोसा समाप्त कर देती है।
 - **बिना आँका शून्य नहीं है।** 219 मॉडलों के पास कोई स्वतंत्र अंक नहीं है। इन्हें मूल्य के अनुसार सूचीबद्ध किया जाता है और गुणवत्ता के क्रम से बाहर रखा जाता है; इन्हें कभी नीचे नहीं धकेला जाता मानो इन्हें मापा गया हो और ये असफल रहे हों।

## 10 · लाइसेंस, और वे किसे सीमित करते हैं

जिन बेंचमार्कों पर यह साइट टिकी है, उनमें से दो की पुनर्वितरण शर्तें बहुत भिन्न हैं, और इससे यह बदलता है कि क्या प्रकाशित किया जा सकता है।

 - **LMArena** अपनी रैंकिंग को [CC-BY-4.0 डेटासेट](https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset) के रूप में प्रकाशित करता है, जो श्रेय के साथ पुनर्वितरण की अनुमति देता है — और जिसमें वे विश्वास सीमाएँ भी हैं जिन पर ऊपर की सार्थकता रैंक टिकी हैं। यही वह माध्यम है जिसका उपयोग करना चाहिए; साइट को स्वयं खुरचना उनकी शर्तों द्वारा वर्जित है।
 - **Artificial Analysis**'s free tier is *"internal use only with attribution"*; public redistribution requires a commercial licence, and their site terms separately limit use to personal and non-commercial purposes. **So we do not publish their figures at all.** Every general capability score on this site is LMArena Elo, used under CC BY 4.0 from the official dataset; the per-task scores are Design Arena’s, below. Artificial Analysis remains an internal cross-check, which is what its free tier permits; it reaches no page, export or API here.
 - **Design Arena** की API शर्तें उसके लीडरबोर्ड डेटा के मुफ़्त उपयोग की अनुमति देती हैं, व्यावसायिक उपयोग सहित, एक शर्त पर: सार्वजनिक प्रदर्शन में Design Arena का श्रेय और [designarena.ai](https://designarena.ai) का लिंक हो। इसका प्रति-कार्य Elo OpenRouter की मॉडल फ़ीड से इस साइट तक आता है; कार्य-दृश्य, हर मॉडल पेज की कार्य-वार रैंकिंग और यह पेज इसका श्रेय देते हैं।
 - **मूल्य स्वयं** वह तथ्य है जिसे विक्रेता प्रकाशित करता है, और यह किसी संकलित सूचकांक अंक से भिन्न बात है। मूल्य विक्रेता पृष्ठों से मिलाए जाते हैं और हर पंक्ति अपने स्रोत से जुड़ी है।

## 11 · सुधार

मूल्य बिना सूचना बदलते हैं और पृष्ठ फिर से सजाए जाते हैं; यहाँ जो है उसका कुछ हिस्सा किसी भी क्षण गलत होगा। यदि आपको कोई त्रुटि मिले, सबसे तेज़ रास्ता यह बताना है कि कौन-सा मॉडल, आँकड़ा क्या होना चाहिए, और वह कहाँ प्रकाशित है — प्राथमिक स्रोत वाले सुधार सीधे लागू किए जाते हैं।

[ग़लत कीमत की रिपोर्ट करें](/report/)

सूची अंतिम बार 2026-10-06 को ली गई। क्रम-निर्धारण का तर्क साइट के साथ ही संस्करणबद्ध है, इसलिए «सर्वश्रेष्ठ» की गणना में बदलाव एक दिखाई देने वाला अंतर होता है, कोई चुपचाप की गई पुनःसमायोजना नहीं।

## Continue your investigation

 - [Inspect measured uncertainty · English](/significance/)
- [Read source policy](/hi/independence/)
- [See recorded corrections](/hi/corrections/)
- [Reuse accepted data · English](/api/)
