---
title: "방법론 — “최고”가 어떻게 정해지는지, 그리고 데이터가 약한 지점 · Undominated.ai"
canonical: https://undominated.ai/ko/methodology/
description: "이 사이트가 AI 모델 364개를 순위 매기는 방식: 프런티어, 과제 조건 Elo, 작업 유형을 반영한 가격, 그리고 데이터가 다루지 않는 것에 대한 정직한 설명."
---

# 방법론 — “최고”가 어떻게 정해지는지, 그리고 데이터가 약한 지점 · Undominated.ai

> 이 사이트가 AI 모델 364개를 순위 매기는 방식: 프런티어, 과제 조건 Elo, 작업 유형을 반영한 가격, 그리고 데이터가 다루지 않는 것에 대한 정직한 설명.

# 방법론

여기 있는 모든 것은 여러분이 직접 확인할 수 있는 동일한 공개 출처에서 재현할 수 있습니다. 데이터가 얇거나 출처끼리 어긋나는 곳에서는 이 페이지가 그렇다고 말합니다. 좋은 소식만 전하는 신뢰 페이지는 광고입니다.

 On this page [2 · 믿을 수 있는 순위](#methodology-section-1)[8 · 같은 모델이 두 번 팔릴 때](#tiers)[9 · 데이터의 출처](#methodology-section-3)[10 · 라이선스와 그것이 제약하는 것](#sources) 60% 의 카탈로그에는 **독립적인 품질 점수가 없습니다**. 364개 모델 중 145개가 평가되었습니다. 나머지는 가격과 함께 실리고 미평가로 분명히 표시되며, 결코 순위에 넣지 않습니다.
 72/145 표시된 자리 가운데 **정말로 구별되는 순위**인 것. 인접한 쌍의 94%는 벤치마크 오차 범위 안에 들어갑니다.
 67/364 대표 가격이 **가격의 전부가 아닌** 모델. 문맥 구간, 따로 청구되는 추론, 시간대별 요금 등이 있습니다.
 7/447 entries with variable prices withheld
 4/447 entries with suspect latency withheld; may overlap the price group

## 1 · “최고”가 뜻하는 것

품질이 앞서고 가격이 동률을 가릅니다. 그 순서가 곧 제품 전부입니다. 싼 것부터 늘어놓은 목록은 만들기가 너무 쉽고 거의 쓸모가 없습니다. 이 시장에서 가장 싼 모델은 가장 비싼 것보다 12,500× 싸고, 대개 그 일을 해내지 못하기 때문입니다.

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are **LMArena** Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

### 단일 품질 점수를 두지 않는 이유

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are **LMArena** Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

## 2 · 믿을 수 있는 순위

순위 열은 **유의성 순위**이지 행 번호가 아닙니다. 모델의 순위는 두 오차 범위를 합친 것보다 큰 차이로 그 모델을 앞서는 모델 수에 1을 더한 값입니다. 이 수가 같은 모델들은 같은 순위를 나눠 가집니다. 서로의 오차 범위 안에 있는 두 모델도 각자 보드 전체와 비교되므로 순위가 다를 수 있습니다.

순위에 관여하는 투영(식별자, 점수, 작업 부하별 가격, 프런티어 표시)의 SHA-256: 06cd12db54e2968c3de49b45a3a2a6881f374f6e58a462437784450842efb989 . 날짜와 빌드 표식은 제외합니다. 여기가 바뀌면 순위가 바뀐 것이지 겉모습이 바뀐 것이 아닙니다.

[정정](/ko/corrections/)

### 순위표 배열의 대부분은 잡음입니다

Arena 두 점수는 차이가 두 모델의 95% 오차 범위를 합친 것보다 클 때만 구분된 것으로 봅니다. 이 합은 이 보드에서 평균 10.47포인트이며, 이 검정은 차이에 대한 95% 구간과 같거나 그보다 엄격합니다. **인접한 144쌍 가운데 136쌍(94%)**이 각자의 합 안에 듭니다. 각 모델의 순위를 그 모델을 확실히 앞서는 모델 수에 1을 더한 값으로 세면, 표시된 145개 자리에는 **72개의 서로 다른 순위**가 있고, 4개 모델이 공동 1위입니다.

그러므로 “1위 모델”은 이 데이터가 감당할 수 있는 주장이 아닙니다. 동률은 동률로 보여 줍니다. 1위는 이 사이트가 읽는 가격 피드에 있는 모델들 가운데 1위입니다. 피드에 없는 모델을 LMArena가 이 모든 모델보다 위에 둔 경우, 보드는 그 모델의 이름을 밝히고 순위는 매기지 않습니다.

이 방법은 우리 것이 아닙니다. LMArena는 여러 해 전부터 이렇게 순위를 매겨 왔습니다. 그들의 [Rank (UB)](https://news.lmarena.ai/ranking-method/)는 각 모델에 통계적으로 그보다 나은 모델 수에 1을 더한 순위를 주며, 그들은 [구현도 공개](https://github.com/lmarena/arena-rank)했습니다. 특이한 것은 이를 *가격* 비교에 적용한다는 점입니다. 가격 비교에서는 또렷한 순서를 내놓으려는 유인이 작동하니까요.

Applied to the general arena board only. Other boards carry their own error, which we do not have, so they are not given a borrowed threshold.

## 3 · “더 낫고 더 싸다”는 말 그대로여야 합니다

가격과 역량에 대한 파레토 우위는 훨씬 넓은 구매 결정을 2차원으로 투영한 것이고, 그 투영은 맞을 때보다 틀릴 때가 많습니다. 어떤 모델은 점수가 더 높고 비용도 낮으면서, 동시에 이미지를 받지 못하거나 출력을 절반 토큰으로 제한하거나 문맥을 50만 토큰 적게 담을 수 있습니다.

그래서 **“더 낫고 더 싸다”는 역량 범위가 원래 모델의 상위 집합인 대체재에만 씁니다**. 133건의 우위 판정 가운데 113건이 엄격하고, **20건(15%)**은 대신 무엇을 포기하게 되는지를 밝힙니다. 그 관문이 없으면, 두 축만 본 날것의 판정 가운데 61%가 기존 모델의 일을 못 하는 모델을 추천했습니다.

## 4 · 가치 점수가 아니라 프런티어

점수가 그 이상이고 비용이 그 이하이면서 둘 중 하나에서 앞서는 다른 모델이 없을 때, 그 모델은 **가치 프런티어**에 있습니다. 평가·가격이 있고 표준 제공되는 모델 가운데 12개가 해당합니다. 나머지 92%는 각각 위에 그런 모델이 있지만, 언제나 동등 조건의 대체재인 것은 아닙니다. 무언가를 포기하게 되는 경우는 위 섹션에서 셉니다.

### 왜 1달러당 품질로 순위를 매기지 않는가

그 비율은 품질보다 저렴함을 훨씬 가파르게 보상하기 때문입니다. 이 카탈로그에 적용하면 상한 약 63 가운데 37.8을 받은 모델이 1위가 되고, 14.2를 받은 모델이 2위에 놓입니다. 아무도 실서비스에 올려서는 안 될 모델들입니다. 그렇게 계산한 “가치” 열을 공개하는 사이트는 나쁜 조언을 하고 있는 것입니다. 우리는 대신 프런티어와 명시적인 품질 하한을 씁니다.

## 5 · 가격은 모델 과 작업 부하 둘 다의 속성입니다

모델의 “그” 가격이란 없습니다. 요약은 입력이 무겁고 코드 생성은 출력이 무거우며, 에이전트 루프는 매 차례 문맥을 다시 흘려보냅니다. 같은 카탈로그도 각각에서 다르게 정렬됩니다. 하나의 배합을 골라 숨기는 대신, 입력:출력 비율과 캐시 적중률을 보이는 조절 장치로 두었습니다.

캐시 읽기 요금이 공개되지 않은 경우 혼합 비용 추정에는 선택한 가격 구간의 전체 입력 요금을 적용합니다.

| 작업 부하 | 출력 비중 | 캐시 적중 | 형태 |
| --- | --- | --- | --- |
| 균형 | 출력 비중 25% | 캐시 적중 0% | 입력 3 토큰 대 출력 1 토큰 |
| 요약 | 출력 비중 5% | 캐시 적중 30% | 입력 매우 큼, 출력 매우 작음 |
| 대화 | 출력 비중 40% | 캐시 적중 50% | 길게 캐시된 시스템 프롬프트 |
| 코드 생성 | 출력 비중 60% | 캐시 적중 20% | 출력이 대부분 |
| 에이전트 | 출력 비중 15% | 캐시 적중 70% | 매 턴 컨텍스트 재전송 |

광고된 요금을 어긋나게 만드는 것이 흔히 셋 있고, 셋 모두 행에 드러납니다.

 - **문맥 구간.** 51개 모델이 프롬프트 길이 임계값을 넘으면 요금이 바뀌고, 두 번 이상 바뀌는 것도 있습니다. Qwen3.7 Flash는 32K를 넘으면 3.33×, 256K를 넘으면 6.67×가 됩니다. 긴 문맥 작업을 대표 가격으로 계산하면 배수만큼 틀립니다.
 - **출력과 따로 청구되는 추론 토큰.** 추론 토큰이 별도로 청구되면 비용은 청구되는 토큰 수와 적용 요금에 따라 달라집니다. 이 비용을 예상 금액에 포함하세요.
 - **시간대별 가격.** 시간대별 요금 구간이 공개된 모델 수: 2. 해당 시간 구간, 기준 시간대와 요금을 확인하고 일률적인 할인율을 가정하지 마세요.

## 6 · 어떤 가격을 공개하는가

점수는 모델 자체의 배포에서 측정되므로, 그 옆의 가격은 **기준 가격**입니다. 균형 배합 기준으로 아래 테스트를 모두 통과하는 가장 저렴한 제공입니다. 그 제공의 입력, 출력, 캐시 읽기 요금은 함께 공개되며, 다른 제공의 요금과 섞지 않습니다.

 - **서비스 중.** OpenRouter가 서비스 중이 아니라고 표시한 제공은 제외합니다. 읽는 순간 저하 상태로 표시되더라도 최근 하루의 95% 이상 서비스된 제공은 계산합니다. 최근 하루의 80% 미만으로 서비스된 제공은 지금 상태와 관계없이 계산하지 않습니다.
 - **표준 제공.** flex, priority, fast 같은 등급은 다른 상품이므로 제외합니다.
 - **표준 요금.** 프로모션 중인 제공은 표준 요금으로 계산합니다. 각 요금을 (1 − 할인율)로 나눈 값입니다. 프로모션 가격은 공개하지만 순위에는 쓰지 않습니다.
 - **표준 시간대.** 시간대별 가격은 표준 요금으로 계산하고, 할인 시간은 공개합니다.
 - **제조사 정밀도 이상.** 4비트 제공(fp4, nvfp4, mxfp4, int4)은 제조사 자신이 4비트로 제공하거나, 제조사가 정밀도를 밝히지 않고 공개된 가중치가 4비트일 때만 계산합니다. 정밀도를 밝히지 않은 제공은 제조사 자신의 것이거나, 가중치가 비공개인 모델의 재판매자의 것일 때 계산합니다. 재판매자는 제조사의 배포를 제공하기 때문입니다. 가중치가 공개되었거나 기록이 없는 모델에서는 정밀도를 밝히지 않은 재판매자의 제공을 제외합니다. 전체 정밀도로 보지 않습니다.

어떤 제공도 통과하지 못하면, 모델은 대체 가격을 유지하고 이유와 함께 **동등 조건 제공이 없는 가격**으로 표시합니다. 가격이 없는 모델은 없는 것처럼 보이기 때문입니다. 표준 제공으로 서비스 중인 제공을 각각 표준 요금으로 비교해, 정밀도를 밝히지 않은 재판매자의 가장 저렴한 제공을, 없으면 가장 저렴한 4비트 제공을 씁니다. 다른 제공 등급은 서비스 중인 것이 달리 없을 때만 씁니다. 가격을 가져올 제공이 없는 모델은 OpenRouter의 모델 단위 가격을 유지합니다.

규칙이 제외한 제공 중 가장 저렴한 것이 더 저렴하면, 모델 페이지에 “지금 더 저렴함”으로 이유와 함께 표시합니다. 이유는 프로모션과 그 비율, 4비트, 제공 등급, 또는 정밀도 미공개입니다. 순위, 프런티어, 판정, 헤드라인 수치는 정하지 않습니다. 가격을 정하는 제공 자체가 프로모션 중이면 그 제공의 프로모션 가격을 표시합니다.

이 데이터에서 333개 모델이 기준 가격, 15개가 동등 조건 제공이 없는 가격, 99개가 OpenRouter의 모델 단위 가격(batch 및 무료 항목 포함)입니다. 86개 모델에 지금 더 저렴한 제공이 있으며, 그중 11개는 정밀도를 밝히지 않은 재판매자의 제공입니다.

이 규칙 전에는 여기의 모든 가격이 OpenRouter의 모델 단위 가격이었고, 어떤 판매자든 정할 수 있었으며 프로모션과 4비트 사본도 포함되었습니다. 이 변경은 정정 기록에 §96으로, 변경 전후 수치와 함께 기록되어 있습니다.

## 7 · 과제 조건부 순위

하나의 전역 순서는 지적으로 정직하지 않습니다. 일이 다르면 이기는 모델도 다르기 때문입니다. 우리는 **25개 범주**에 걸쳐 과제별 Elo를 유지합니다. 프런트엔드, 데이터 시각화, 게임 개발, SVG, Android, 슬라이드 등입니다. 과제를 고르면 일반 지수가 아니라 그 과제의 Elo로 판 전체가 다시 정렬됩니다.

과제 점수는 **Design Arena**의 과제별 Elo이며, OpenRouter의 모델 피드에서 읽어 옵니다: [designarena.ai](https://designarena.ai).

적용 범위는 범주마다 다르며, 어떤 범주의 순위표에 없는 모델은 그 과제에 약한 것이 아니라 측정되지 않은 것으로 표시됩니다.

## 8 · 같은 모델이 두 번 팔릴 때

새 모델이 아닌 모델도 있습니다. 판매자가 직접 그렇게 말합니다. **이 카탈로그의 항목 11개**는 해당 공급자 스스로가 카탈로그의 다른 모델을 다른 방식으로 제공하는 것이라고 설명합니다. 더 빠른 경로, 다른 추론 모드, 쿼리당 더 많은 연산 같은 것입니다. **11개 중 10개는 어떤 LMArena 리더보드에도 등재되어 있지 않습니다. 이들의 기반 모델 11개 중 11개는 등재되어 있습니다.**

같은 모델이 두 번 팔릴 때

| 판매명 | 등급 가격 | 기반 모델 | 판매자 설명 |
| --- | --- | --- | --- |
| [o1-pro](/models/openai__o1-pro/) 등재 없음 | $600 ×10 | [o1](/models/openai__o1/) 1,365.8 | 쿼리당 더 많은 연산 |
| [o3 Pro](/models/openai__o3-pro/) 등재 없음 | $80 ×10 | [o3](/models/openai__o3/) 1,409.9 | 쿼리당 더 많은 연산 |
| [GPT-6 Astra Pro](/models/openai__gpt-6-astra-pro/) 등재 없음 | $50 ×1 | [GPT-6 Astra](/models/openai__gpt-6-astra/) 1,442.3 추론 노력: 최대 | 같은 모델, 다른 제공 모드 |
| [GPT-5.6 Sol Pro](/models/openai__gpt-5.6-sol-pro/) 등재 없음 | $20 ×1 | [GPT-5.6 Sol](/models/openai__gpt-5.6-sol/) 1,456.3 추론 노력: 매우 높음 | 같은 모델, 다른 제공 모드 |
| [GPT-5.6 Terra Pro](/models/openai__gpt-5.6-terra-pro/) 등재 없음 | $12 ×1 | [GPT-5.6 Terra](/models/openai__gpt-5.6-terra/) 1,446.3 추론 노력: 매우 높음 | 같은 모델, 다른 제공 모드 |
| [GPT-6 Sol Pro](/models/openai__gpt-6-sol-pro/) 등재 없음 | $10 ×1 | [GPT-6 Sol](/models/openai__gpt-6-sol/) 1,395.4 추론 노력: 최대 | 같은 모델, 다른 제공 모드 |
| [GPT-6.1 Sol Pro](/models/openai__gpt-6.1-sol-pro/) 등재 없음 | $10 ×1 | [GPT-6.1 Sol](/models/openai__gpt-6.1-sol/) 1,445.6 추론 노력: 최대 | 같은 모델, 다른 제공 모드 |
| [o3 Mini High](/models/openai__o3-mini-high/) 1,336.6 | $4.4 ×1 | [o3 Mini](/models/openai__o3-mini/) 1,319.4 | 같은 모델, 다른 제공 모드 |
| [o4 Mini High](/models/openai__o4-mini-high/) 등재 없음 | $4.4 ×1 | [o4 Mini](/models/openai__o4-mini/) 1,353.2 | 같은 모델, 다른 제공 모드 |
| [GPT-5.6 Luna Pro](/models/openai__gpt-5.6-luna-pro/) 등재 없음 | $1.2 ×1 | [GPT-5.6 Luna](/models/openai__gpt-5.6-luna/) 1,431 추론 노력: 매우 높음 | 같은 모델, 다른 제공 모드 |
| [GPT-6 Luna Pro](/models/openai__gpt-6-luna-pro/) 등재 없음 | $0.5 ×1 | [GPT-6 Luna](/models/openai__gpt-6-luna/) 1,391.5 추론 노력: 최대 | 같은 모델, 다른 제공 모드 |

이 구분에 따라 무엇을 결론지을 수 있는지가 달라집니다. 판매자가 *동일한 역량*이라고 말하는 경우(11개 중 0개), 기반 모델의 점수는 그 등급에 대한 판매자 자신의 주장이기도 하며, 사는 것은 속도뿐입니다. 판매자가 더 많은 연산이나 다른 모드를 말하는 경우, 위에서 언급한 단 하나의 예외를 빼면 추가 지출로 무엇을 얻는지 알려 주는 공개된 측정은 없습니다.

여기서는 판매자가 밝힌 것만 셉니다. 이름이 “Pro”로 끝나더라도 공급자가 그 자체로 독립된 플래그십 모델이라고 부르는 모델은 여기서 세지 않습니다. 그렇게 하면 그들의 주장이 아니라 우리의 주장이 되기 때문입니다. 공급자 자신의 서비스 등급을 경쟁하는 판매자로 취급하는 것과 같은 실수이며, 이 실수로 한때 2×의 가격 차이가 7.2×로 공개된 적이 있습니다.

LMArena 리더보드에 등재되지 않은 것은 판정이 아닙니다. 품질이 낮다는 증거가 아니며, 아무도 이 모델들을 평가하지 않았다는 뜻도 아닙니다. 공급자들은 자체 결과를 공개합니다. 이 사이트가 순위를 매기는 축에 이 모델들의 측정값이 없다는 뜻이며, 그래서 순위를 매기지 않습니다.

## 9 · 데이터의 출처

가격은 여러 공급자를 아우르는 기계 판독 가능한 카탈로그에서 정규화하고 공급자의 가격 페이지와 대조합니다. 모든 모델 페이지가 자기 출처와 수집 날짜를 연결합니다.

 - **충돌은 기록하지, 평균 내지 않습니다.** 두 출처가 가격에서 어긋날 때, 그 어긋남 자체가 발견입니다. 공급자가 $4/$20으로 올리고 애그리게이터를 통해 $2/$10에 팔리는 모델에는 참인 가격이 둘 있으며, 어느 쪽이 적용되는지는 어디서 사느냐에 달렸습니다.
 - **개연성 없는 값은 격리합니다.** “요청 시점에 가격 결정”을 뜻하는 상류의 감시값 −1을 그대로 흘리면 100만당 −$750,000이 되고, 싼 것부터 정렬하면 늘 1위를 차지합니다. 그럴듯한 범위를 벗어난 값은 사유를 붙여 보류합니다.
 - **신뢰도는 항목별입니다.** 행마다 배지 하나가 아닙니다. 가격만 확인해 놓고 레코드가 검증되었다고 주장하는 것은, 누군가 알아채는 순간 신뢰가 끝나는 종류의 과장입니다.
 - **미평가는 0이 아닙니다.** 219개 모델에는 독립 점수가 없습니다. 이들은 가격순으로 싣고 품질 정렬에서는 제외하며, 측정해서 떨어진 것처럼 맨 아래로 보내지 않습니다.

## 10 · 라이선스와 그것이 제약하는 것

이 사이트가 기대는 벤치마크 둘은 재배포 조건이 매우 다르고, 그것이 무엇을 공개할 수 있는지를 바꿉니다.

 - **LMArena**는 순위표를 [CC-BY-4.0 데이터셋](https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset)으로 공개합니다. 출처를 밝히면 재배포가 허용되며, 위의 유의성 순위가 기대는 신뢰 구간도 담겨 있습니다. 써야 할 통로가 이것입니다. 사이트 자체를 긁어 가는 것은 그들의 약관이 금지합니다.
 - **Artificial Analysis**'s free tier is *"internal use only with attribution"*; public redistribution requires a commercial licence, and their site terms separately limit use to personal and non-commercial purposes. **So we do not publish their figures at all.** Every general capability score on this site is LMArena Elo, used under CC BY 4.0 from the official dataset; the per-task scores are Design Arena’s, below. Artificial Analysis remains an internal cross-check, which is what its free tier permits; it reaches no page, export or API here.
 - **Design Arena**의 API 약관은 리더보드 데이터를 상업적 이용을 포함해 무료로 쓸 수 있게 하되, 공개 표시에는 Design Arena를 출처로 밝히고 [designarena.ai](https://designarena.ai)로 링크해야 한다는 조건을 둡니다. 과제별 Elo는 OpenRouter의 모델 피드를 거쳐 이 사이트에 들어오며, 과제 보기, 각 모델 페이지의 과제별 순위, 그리고 이 페이지가 그 출처를 밝힙니다.
 - **가격 자체**는 공급자가 공개하는 사실이며, 이는 편찬된 지수 점수와는 다른 것입니다. 가격은 공급자 페이지와 대조하고 모든 행이 자기 출처를 연결합니다.

## 11 · 정정

가격은 예고 없이 바뀌고 페이지는 다시 꾸며집니다. 여기 있는 것 가운데 일부는 어느 시점에든 틀려 있을 것입니다. 오류를 발견하시면 어떤 모델인지, 수치가 무엇이어야 하는지, 그것이 어디에 공개되어 있는지 알려 주시는 것이 가장 빠릅니다. 1차 출처가 있는 정정은 바로 반영합니다.

[잘못된 가격 신고](/report/)

카탈로그 최종 수집일은 2026-10-06입니다. 순위 로직은 사이트와 함께 버전 관리되므로, “최고”를 계산하는 방식의 변경은 조용한 재조정이 아니라 눈에 보이는 차이가 됩니다.

## Continue your investigation

 - [Inspect measured uncertainty · English](/significance/)
- [Read source policy](/ko/independence/)
- [See recorded corrections](/ko/corrections/)
- [Reuse accepted data · English](/api/)
