---
title: "Metodología — cómo se decide lo «mejor», y dónde los datos son débiles · Undominated.ai"
canonical: https://undominated.ai/es/methodology/
description: "Cómo este sitio clasifica 364 modelos de IA: la frontera, el Elo condicionado a la tarea, precios según la carga de trabajo y un relato honesto de lo que los datos no cubren."
---

# Metodología — cómo se decide lo «mejor», y dónde los datos son débiles · Undominated.ai

> Cómo este sitio clasifica 364 modelos de IA: la frontera, el Elo condicionado a la tarea, precios según la carga de trabajo y un relato honesto de lo que los datos no cubren.

# Metodología

Todo lo que hay aquí es reproducible a partir de las mismas fuentes públicas que tú puedes comprobar. Cuando los datos son escasos o las fuentes discrepan, esta página lo dice: una página de confianza que solo da buenas noticias es publicidad.

 On this page [2 · Rangos en los que puedes confiar](#methodology-section-1)[8 · Cuando el mismo modelo se vende dos veces](#tiers)[9 · De dónde salen los datos](#methodology-section-3)[10 · Licencias, y qué limitan](#sources) 60% del catálogo **no tiene puntuación de calidad independiente**. 145 de 364 modelos están puntuados. El resto figura, con precio y claramente marcado como sin puntuar, y nunca se clasifica.
 72/145 posiciones representadas que son **rangos realmente distintos**. El 94% de los pares contiguos cae dentro del margen de error del benchmark.
 67/364 modelos cuyo precio de titular **no es el precio completo**: tramos de contexto, razonamiento facturado aparte o tarifas según la hora.
 7/447 entries with variable prices withheld
 4/447 entries with suspect latency withheld; may overlap the price group

## 1 · Qué significa «mejor»

Manda la calidad y el precio desempata. Ese orden es todo el producto: una lista ordenada por lo más barato es trivial de publicar y casi inútil, porque el modelo más barato de este mercado es 12.500× más barato que el más caro y por lo general no puede hacer el trabajo.

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are **LMArena** Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

### Por qué no hay una única puntuación de calidad

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are **LMArena** Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

## 2 · Rangos en los que puedes confiar

La columna de rango es un **rango de significancia**, no un número de fila. El rango de un modelo es uno más que el número de modelos que lo superan por más de la suma de ambos márgenes de error. Los modelos con el mismo recuento comparten rango. Dos modelos que están dentro del margen de error el uno del otro pueden tener rangos distintos, porque cada uno se compara con toda la tabla.

SHA-256 de la proyección relevante para el rango (identificadores, puntuaciones, precios por carga de trabajo, marca de frontera): 06cd12db54e2968c3de49b45a3a2a6881f374f6e58a462437784450842efb989 . Se excluyen fechas y marcas de compilación. Un cambio aquí es un cambio en la clasificación, no en el envoltorio.

[Correcciones](/es/corrections/)

### La mayor parte del orden de una clasificación es ruido

Dos puntuaciones de Arena solo cuentan como separadas cuando difieren en más de la suma de los márgenes de error del 95% de ambos modelos. Esa suma es de 10,47 puntos de media en esta tabla, y la prueba es al menos tan estricta como un intervalo del 95% sobre la diferencia. **136 de 144 pares contiguos (94%)** quedan dentro de su propia suma. Si el rango de cada modelo es uno más que el número de modelos que lo superan claramente, las 145 posiciones mostradas contienen **72 rangos distintos**, y 4 modelos comparten el primer puesto.

«El modelo número 1» no es, por tanto, una afirmación que estos datos sostengan. Los empates se muestran como empates. El rango 1 es el rango 1 entre los modelos de la fuente de precios que lee este sitio: cuando LMArena sitúa por encima de todos ellos un modelo que esa fuente no incluye, el tablero nombra ese modelo y no lo clasifica.

Este método no es nuestro. LMArena lleva años clasificando así: su [Rank (UB)](https://news.lmarena.ai/ranking-method/) da a cada modelo uno más que el número de modelos estadísticamente mejores que él, y han [publicado la implementación en abierto](https://github.com/lmarena/arena-rank). Lo inusual es aplicarlo a una comparación de *precios*, donde el incentivo es publicar un orden nítido.

Applied to the general arena board only. Other boards carry their own error, which we do not have, so they are not given a borrowed threshold.

## 3 · «Mejor y más barato» tiene que significarlo

La dominancia de Pareto sobre precio y capacidad es una proyección bidimensional de una decisión de compra mucho más amplia, y la proyección miente más veces de las que acierta. Un modelo puede puntuar más alto y costar menos y a la vez no aceptar imágenes, limitar la salida a la mitad de tokens o retener medio millón de tokens menos de contexto.

Por eso **«mejor y más barato» se reserva para un reemplazo cuya envolvente de capacidades sea un superconjunto** de la original. De 133 veredictos de dominancia, 113 son estrictos y **20 (15%)** nombran en cambio a qué renunciarías. Sin ese filtro, el 61% de los veredictos brutos de dos ejes recomendaba un modelo que no podía hacer el trabajo del titular.

## 4 · La frontera, no una puntuación de valor

Un modelo está en la **frontera de valor** cuando no hay otro modelo que puntúe al menos tan alto, cueste lo mismo o menos y gane en uno de los dos. 12 de los modelos puntuados, con precio y de entrega estándar cumplen. Cada modelo del otro 92% tiene por encima un modelo así, aunque no siempre un reemplazo directo: la sección anterior cuenta los que renuncian a algo.

### ¿Por qué no ordenar por calidad por dólar?

Porque la razón premia lo barato mucho más que la calidad. Aplicada a este catálogo corona a un modelo que puntúa 37,8 sobre un techo de ~63, y coloca en segundo lugar a uno que puntúa 14,2: modelos que nadie debería poner en producción. Cualquier sitio que publique una columna de «valor» calculada así está dando malos consejos. Nosotros usamos la frontera más un mínimo de calidad explícito.

## 5 · El precio es una propiedad de un modelo y de una carga de trabajo

No existe «el» precio de un modelo. Resumir es intensivo en entrada, generar código lo es en salida, y un bucle de agente repite su contexto en cada turno; el mismo catálogo se ordena distinto en cada caso. En lugar de elegir una mezcla y esconderla, la proporción entrada:salida y la tasa de aciertos de caché son controles que puedes ver y cambiar.

Si no se publica una tarifa de lectura de caché, la estimación combinada usa la tarifa de entrada completa del tramo seleccionado.

| Carga de trabajo | Proporción de salida | Aciertos de caché | Forma |
| --- | --- | --- | --- |
| Equilibrada | Proporción de salida 25% | Aciertos de caché 0% | 3 tokens de entrada por 1 de salida |
| Resumir | Proporción de salida 5% | Aciertos de caché 30% | Entrada enorme, salida mínima |
| Chat | Proporción de salida 40% | Aciertos de caché 50% | System prompt largo en caché |
| Gen. de código | Proporción de salida 60% | Aciertos de caché 20% | Domina la salida |
| Agéntica | Proporción de salida 15% | Aciertos de caché 70% | Contexto reenviado en cada turno |

Tres cosas hacen que la tarifa anunciada sea habitualmente incorrecta, y las tres se muestran en la fila:

 - **Tramos de contexto.** 51 modelos cambian de tarifa al superar un umbral de longitud de prompt, algunos más de una vez: Qwen3.7 Flash pasa a 3,33× por encima de 32K y a 6,67× por encima de 256K. Si calculas una carga de contexto largo con el precio de titular, te equivocas por un múltiplo.
 - **Tokens de razonamiento facturados aparte de la salida.** Cuando los tokens de razonamiento se cobran por separado, el coste depende del volumen facturado y de su tarifa. Incluye ese cargo en tu estimación.
 - **Precios según la hora del día.** Modelos con franjas de precios publicadas: 2. Comprueba la franja horaria, la zona horaria y las tarifas; no des por hecho un descuento fijo.

## 6 · Qué precio publicamos

Una puntuación se mide en el despliegue propio del modelo, así que el precio junto a ella es el **precio de referencia**: la oferta más barata, en la mezcla equilibrada, que supera todas las pruebas siguientes. Las tarifas de entrada, salida y lectura de caché de esa oferta se publican juntas, nunca mezcladas con las de otra oferta.

 - **En servicio.** Se excluye una oferta que OpenRouter lista como fuera de servicio. Una oferta que aparece degradada en el momento de la lectura cuenta igualmente si estuvo en servicio al menos el 95 % del último día. Una oferta que estuvo en servicio menos del 80 % del último día no cuenta, sea cual sea su estado ahora.
 - **Entrega estándar.** Flex, priority, fast y niveles similares son otro producto y se excluyen.
 - **Tarifa estándar.** Una oferta en promoción cuenta a su tarifa estándar: cada tarifa dividida entre uno menos el descuento. El precio promocional se declara, nunca se clasifica.
 - **Franja estándar.** Un precio según la hora del día cuenta a su tarifa estándar; las horas con descuento se declaran.
 - **La precisión del fabricante o mejor.** Una oferta de 4 bits (fp4, nvfp4, mxfp4, int4) cuenta solo si el propio fabricante sirve en 4 bits o, cuando el fabricante no declara precisión, sus pesos publicados son de 4 bits. Una oferta que no declara precisión cuenta si es la del propio fabricante, o la de un revendedor de un modelo de pesos cerrados: sirve el despliegue del fabricante. Con pesos abiertos, o que nadie ha registrado, la de un revendedor que no la declara queda excluida: nunca se interpreta como precisión completa.

Cuando ninguna oferta las supera, el modelo conserva un precio de respaldo, etiquetado como **precio sin oferta equivalente** con su motivo, porque un modelo sin precio se leería como ausente: entre las ofertas en servicio con entrega estándar, cada una a su tarifa estándar, la más barata de un revendedor que no declara precisión y, si no hay, la más barata de 4 bits. Otro nivel de entrega solo se usa cuando no hay nada más en servicio. Un modelo sin ninguna oferta de la que tomar un precio conserva el precio del modelo de OpenRouter.

La oferta más barata que la regla excluye, cuando es más barata, se muestra en la página del modelo como «Más barato ahora mismo», con el motivo: una promoción y su porcentaje, 4 bits, un nivel de entrega o precisión no declarada. Nunca fija una posición, la frontera, un veredicto ni una cifra principal. Cuando la oferta que fija el precio está ella misma en promoción, se muestra su propio precio promocional.

En estos datos, 333 modelos tienen un precio de referencia, 15 un precio sin oferta equivalente y 99 el precio del modelo de OpenRouter, entre ellos listados batch y gratuitos. 86 muestran ahora una oferta más barata, 11 de ellas de un revendedor que no declara precisión.

Antes de esta regla, cada precio aquí era el precio del modelo de OpenRouter, que cualquier vendedor puede fijar, promociones y copias de 4 bits incluidas. El cambio consta como §96 en el registro de correcciones, con sus cifras de antes y después.

## 7 · Clasificación condicionada a la tarea

Un único orden global es intelectualmente deshonesto, porque cada tipo de trabajo lo ganan modelos distintos. Llevamos Elo por tarea en **25 categorías**: front-end, visualización de datos, desarrollo de videojuegos, SVG, Android, presentaciones y más. Seleccionar una tarea reordena todo el tablero según el Elo de esa tarea en lugar de según un índice general.

Las puntuaciones por tarea son el Elo por tarea de **Design Arena**, leído del catálogo de modelos de OpenRouter: [designarena.ai](https://designarena.ai).

La cobertura varía según la categoría, y un modelo ausente de la clasificación de una categoría aparece como no medido en esa tarea, no como malo en ella.

## 8 · Cuando el mismo modelo se vende dos veces

Algunos modelos no son modelos nuevos. Lo dice el propio vendedor: **11 entradas de este catálogo** aparecen descritas por su propio proveedor como otro modelo del catálogo servido de otra forma: un carril más rápido, un modo de razonamiento distinto, más cómputo por consulta. **10 de las 11 no tienen entrada en ninguna clasificación de LMArena. 11 de sus 11 modelos base sí la tienen.**

Cuando el mismo modelo se vende dos veces

| Se vende como | Precio del nivel | Modelo base | Lo que dice el vendedor |
| --- | --- | --- | --- |
| [o1-pro](/models/openai__o1-pro/) sin entrada | $600 ×10 | [o1](/models/openai__o1/) 1365,8 | más cómputo por consulta |
| [o3 Pro](/models/openai__o3-pro/) sin entrada | $80 ×10 | [o3](/models/openai__o3/) 1409,9 | más cómputo por consulta |
| [GPT-6 Astra Pro](/models/openai__gpt-6-astra-pro/) sin entrada | $50 ×1 | [GPT-6 Astra](/models/openai__gpt-6-astra/) 1442,3 con esfuerzo máximo | mismo modelo, otro modo de servicio |
| [GPT-5.6 Sol Pro](/models/openai__gpt-5.6-sol-pro/) sin entrada | $20 ×1 | [GPT-5.6 Sol](/models/openai__gpt-5.6-sol/) 1456,3 con esfuerzo muy alto | mismo modelo, otro modo de servicio |
| [GPT-5.6 Terra Pro](/models/openai__gpt-5.6-terra-pro/) sin entrada | $12 ×1 | [GPT-5.6 Terra](/models/openai__gpt-5.6-terra/) 1446,3 con esfuerzo muy alto | mismo modelo, otro modo de servicio |
| [GPT-6 Sol Pro](/models/openai__gpt-6-sol-pro/) sin entrada | $10 ×1 | [GPT-6 Sol](/models/openai__gpt-6-sol/) 1395,4 con esfuerzo máximo | mismo modelo, otro modo de servicio |
| [GPT-6.1 Sol Pro](/models/openai__gpt-6.1-sol-pro/) sin entrada | $10 ×1 | [GPT-6.1 Sol](/models/openai__gpt-6.1-sol/) 1445,6 con esfuerzo máximo | mismo modelo, otro modo de servicio |
| [o3 Mini High](/models/openai__o3-mini-high/) 1336,6 | $4,4 ×1 | [o3 Mini](/models/openai__o3-mini/) 1319,4 | mismo modelo, otro modo de servicio |
| [o4 Mini High](/models/openai__o4-mini-high/) sin entrada | $4,4 ×1 | [o4 Mini](/models/openai__o4-mini/) 1353,2 | mismo modelo, otro modo de servicio |
| [GPT-5.6 Luna Pro](/models/openai__gpt-5.6-luna-pro/) sin entrada | $1,2 ×1 | [GPT-5.6 Luna](/models/openai__gpt-5.6-luna/) 1431 con esfuerzo muy alto | mismo modelo, otro modo de servicio |
| [GPT-6 Luna Pro](/models/openai__gpt-6-luna-pro/) sin entrada | $0,5 ×1 | [GPT-6 Luna](/models/openai__gpt-6-luna/) 1391,5 con esfuerzo máximo | mismo modelo, otro modo de servicio |

La distinción importa para lo que puedes concluir. Donde el vendedor dice *capacidades idénticas* (0 de los 11 niveles), la puntuación del modelo base es también la propia afirmación del vendedor sobre el nivel, y lo único que compras es velocidad. Donde el vendedor dice más cómputo o un modo distinto, ninguna medición publicada te dice qué compra el gasto adicional, con la única excepción señalada arriba.

Esto solo cuenta lo que afirma el vendedor. Un modelo cuyo nombre termina en «Pro» pero al que su proveedor llama modelo insignia por derecho propio no se cuenta aquí, porque esa sería nuestra afirmación y no la suya: el mismo error que tratar los propios niveles de servicio de un proveedor como vendedores que compiten, que una vez convirtió una horquilla de precios de 2× en un 7,2× publicado.

No tener entrada en una clasificación de LMArena no es un veredicto. No es prueba de mala calidad, ni significa que nadie los haya evaluado: los proveedores publican sus propios resultados. Significa que el eje con el que clasifica este sitio no tiene lectura para ellos, así que no los clasificamos.

## 9 · De dónde salen los datos

Los precios se normalizan a partir de un catálogo legible por máquina que abarca varios proveedores, y se contrastan con las páginas de precios de los proveedores. Cada página de modelo enlaza su fuente y su fecha de obtención.

 - **Los conflictos se registran, no se promedian.** Cuando dos fuentes discrepan sobre un precio, esa discrepancia es el hallazgo. Un modelo listado a 4/20 $ por su proveedor y vendido a 2/10 $ mediante un agregador tiene dos precios verdaderos, y cuál se aplica depende de dónde compres.
 - **Los valores inverosímiles se ponen en cuarentena.** Un centinela de origen igual a −1 para «precio fijado en el momento de la solicitud» se convierte en −750.000 $ por millón si se pasa sin más, y gana cualquier orden por lo más barato. Todo lo que quede fuera de un rango plausible se retiene con un motivo adjunto.
 - **La confianza es por campo.** No una insignia por fila. Afirmar que un registro está verificado cuando solo se comprobó su precio es la clase de exageración que acaba con la confianza la primera vez que alguien se da cuenta.
 - **Sin puntuar no es cero.** 219 modelos no tienen puntuación independiente. Se listan por precio y quedan excluidos del orden por calidad; nunca se envían al fondo como si se les hubiera medido y hubieran fallado.

## 10 · Licencias, y qué limitan

Dos de los benchmarks en los que se apoya este sitio tienen condiciones de redistribución muy distintas, y eso cambia lo que se puede publicar.

 - **LMArena** publica su clasificación como un [conjunto de datos CC-BY-4.0](https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset), que permite la redistribución con atribución, y que además incluye los límites de confianza de los que dependen los rangos de significancia anteriores. Ese es el canal a usar; extraer datos del propio sitio está prohibido por sus condiciones.
 - **Artificial Analysis**'s free tier is *"internal use only with attribution"*; public redistribution requires a commercial licence, and their site terms separately limit use to personal and non-commercial purposes. **So we do not publish their figures at all.** Every general capability score on this site is LMArena Elo, used under CC BY 4.0 from the official dataset; the per-task scores are Design Arena’s, below. Artificial Analysis remains an internal cross-check, which is what its free tier permits; it reaches no page, export or API here.
 - Las condiciones de la API de **Design Arena** permiten usar sus datos de clasificación gratis, también con fines comerciales, con una condición: toda presentación pública cita a Design Arena y enlaza a [designarena.ai](https://designarena.ai). Su Elo por tarea llega a este sitio a través del catálogo de modelos de OpenRouter; la vista por tarea, las posiciones por tarea de cada página de modelo y esta página lo citan.
 - **El precio en sí** es un hecho que publica el proveedor, cosa distinta de una puntuación de índice compilada. Los precios se contrastan con las páginas de los proveedores y cada fila enlaza su fuente.

## 11 · Correcciones

Los precios cambian sin previo aviso y las páginas se reformatean; algo de lo que hay aquí estará mal en cualquier momento dado. Si encuentras un error, la vía más rápida es decir qué modelo, cuál debería ser la cifra y dónde está publicada: las correcciones con fuente primaria se aplican directamente.

[Informar de un precio erróneo](/report/)

Catálogo obtenido por última vez el 2026-10-06. La lógica de clasificación se versiona junto con el sitio, de modo que un cambio en cómo se calcula «mejor» es un diff visible y no un reajuste silencioso.

## Continue your investigation

 - [Inspect measured uncertainty · English](/significance/)
- [Read source policy](/es/independence/)
- [See recorded corrections](/es/corrections/)
- [Reuse accepted data · English](/api/)
