---
title: "Méthodologie — comment on décide du « meilleur », et où les données sont faibles · Undominated.ai"
canonical: https://undominated.ai/fr/methodology/
description: "Comment ce site classe 364 modèles d’IA : la frontière, l’Elo conditionné à la tâche, un prix selon la charge de travail, et un compte rendu honnête de ce que les données ne couvrent pas."
---

# Méthodologie — comment on décide du « meilleur », et où les données sont faibles · Undominated.ai

> Comment ce site classe 364 modèles d’IA : la frontière, l’Elo conditionné à la tâche, un prix selon la charge de travail, et un compte rendu honnête de ce que les données ne couvrent pas.

# Méthodologie

Tout ce qui figure ici est reproductible à partir des mêmes sources publiques que vous pouvez vérifier vous-même. Là où les données sont minces ou les sources divergent, cette page le dit — une page de confiance qui ne rapporte que de bonnes nouvelles est du marketing.

 On this page [2 · Des rangs sur lesquels vous pouvez compter](#methodology-section-1)[8 · Quand le même modèle est vendu deux fois](#tiers)[9 · D’où viennent les données](#methodology-section-3)[10 · Licences, et ce qu’elles contraignent](#sources) 60% du catalogue **n’a aucun score de qualité indépendant**. 145 modèles sur 364 sont notés. Les autres sont listés, tarifés et clairement signalés comme non notés — jamais classés.
 72/145 positions affichées qui sont des **rangs réellement distincts**. 94 % des paires adjacentes tombent dans la marge d’erreur du benchmark.
 67/364 modèles dont le prix affiché **n’est pas le prix complet** : paliers de contexte, raisonnement facturé à part, ou tarifs selon l’heure.
 7/447 entries with variable prices withheld
 4/447 entries with suspect latency withheld; may overlap the price group

## 1 · Ce que « meilleur » veut dire

La qualité prime et le prix départage. Cet ordre est tout le produit : une liste du moins cher au plus cher est triviale à publier et presque inutile, car le modèle le moins cher de ce marché est 12 500× moins cher que le plus cher et, en général, ne peut pas faire le travail.

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are **LMArena** Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

### Pourquoi il n’y a pas de score de qualité unique

Capability comes from independent evaluators, never from us and never from the vendor. The general scores are **LMArena** Elo from human preference, on its general board and its document board, used under CC BY 4.0 from the official dataset. The per-task scores under a task lens are Design Arena’s, credited below.

## 2 · Des rangs sur lesquels vous pouvez compter

La colonne de rang est un **rang de significativité**, pas un numéro de ligne. Le rang d’un modèle vaut un de plus que le nombre de modèles qui le battent d’un écart supérieur à la somme des deux marges d’erreur. Les modèles pour lesquels ce nombre est le même partagent un rang. Deux modèles situés dans la marge d’erreur l’un de l’autre peuvent tout de même avoir des rangs différents, car chacun est comparé à l’ensemble du classement.

SHA-256 de la projection pertinente pour le rang (identifiants, scores, prix par charge de travail, indicateur de frontière) : 06cd12db54e2968c3de49b45a3a2a6881f374f6e58a462437784450842efb989 . Les dates et empreintes de build sont exclues. Un changement ici est un changement de classement, pas d’habillage.

[Corrections](/fr/corrections/)

### L’essentiel de l’ordre d’un classement est du bruit

Deux scores Arena ne comptent comme séparés que s’ils diffèrent d’un écart supérieur à la somme des marges d’erreur à 95 % des deux modèles. Cette somme vaut en moyenne 10,47 points sur ce classement, et le test est au moins aussi strict qu’un intervalle à 95 % sur la différence. **136 paires adjacentes sur 144 (94 %)** restent dans leur propre somme. En comptant le rang d’un modèle comme un de plus que le nombre de modèles qui le battent clairement, les 145 positions affichées portent **72 rangs distincts**, et 4 modèles sont premiers ex æquo.

« Le modèle n° 1 » n’est donc pas une affirmation que ces données soutiennent. Les égalités sont montrées comme telles. Le rang 1 est le rang 1 parmi les modèles du flux de prix que lit ce site : quand LMArena classe au-dessus de tous un modèle que ce flux ne contient pas, le tableau nomme ce modèle et ne le classe pas.

Cette méthode n’est pas la nôtre. LMArena classe ainsi depuis des années — leur [Rank (UB)](https://news.lmarena.ai/ranking-method/) donne à chaque modèle un de plus que le nombre de modèles statistiquement meilleurs que lui, et ils en ont [publié l’implémentation en open source](https://github.com/lmarena/arena-rank). Ce qui est inhabituel, c’est de l’appliquer à une comparaison de *prix*, où l’incitation est de publier un classement net.

Applied to the general arena board only. Other boards carry their own error, which we do not have, so they are not given a borrowed threshold.

## 3 · « Meilleur et moins cher » doit vouloir dire quelque chose

La dominance de Pareto sur le prix et la capacité est une projection en deux dimensions d’une décision d’achat bien plus large, et cette projection ment plus souvent qu’à son tour. Un modèle peut obtenir un meilleur score et coûter moins cher tout en n’acceptant aucune image, en plafonnant la sortie à la moitié des jetons, ou en retenant un demi-million de jetons de contexte en moins.

C’est pourquoi **« à la fois meilleur et moins cher » est réservé à un remplacement dont l’enveloppe de capacités est un sur-ensemble** de l’originale. Sur 133 verdicts de dominance, 113 sont stricts et **20 (15 %)** nomment plutôt ce que vous abandonneriez. Sans ce garde-fou, 61 % des verdicts bruts à deux axes recommandaient un modèle incapable de faire le travail du sortant.

## 4 · La frontière, pas un score de valeur

Un modèle est sur la **frontière de valeur** quand aucun autre modèle n’obtient un score au moins aussi élevé sans coûter plus cher, tout en l’emportant sur l’un des deux. 12 des modèles notés, tarifés et à livraison standard y figurent. Chacun des 92 % restants a au-dessus de lui un tel modèle, mais pas toujours un remplacement direct : la section ci-dessus compte ceux qui abandonnent quelque chose.

### Pourquoi ne pas classer par qualité rapportée au prix ?

Parce que le ratio récompense la faiblesse du prix bien plus fortement que la qualité. Appliqué à ce catalogue, il couronne un modèle notant 37,8 sur un plafond d’environ 63, et place deuxième un modèle notant 14,2 — des modèles que personne ne devrait déployer. Tout site publiant une colonne « valeur » calculée ainsi donne de mauvais conseils. Nous utilisons plutôt la frontière assortie d’un seuil de qualité explicite.

## 5 · Le prix est une propriété d’un modèle et d’une charge de travail

« Le » prix d’un modèle n’existe pas. Le résumé est intensif en entrée, la génération de code l’est en sortie, et une boucle d’agent rejoue son contexte à chaque tour ; le même catalogue s’ordonne différemment dans chaque cas. Plutôt que de choisir un mélange et de le cacher, le rapport entrée:sortie et le taux de succès du cache sont des réglages visibles et modifiables.

Si aucun tarif de lecture du cache n’est publié, l’estimation combinée utilise le plein tarif d’entrée du palier sélectionné.

| Charge de travail | Part de sortie | Succès de cache | Profil |
| --- | --- | --- | --- |
| Équilibré | Part de sortie 25% | Succès de cache 0% | 3 tokens en entrée pour 1 en sortie |
| Résumer | Part de sortie 5% | Succès de cache 30% | Entrée énorme, sortie minime |
| Chat | Part de sortie 40% | Succès de cache 50% | Long prompt système mis en cache |
| Gén. de code | Part de sortie 60% | Succès de cache 20% | La sortie domine |
| Agentique | Part de sortie 15% | Succès de cache 70% | Contexte rejoué à chaque tour |

Trois choses rendent régulièrement le tarif annoncé faux, et toutes trois apparaissent sur la ligne :

 - **Paliers de contexte.** 51 modèles changent de tarif au-delà d’un seuil de longueur de prompt, certains plus d’une fois — Qwen3.7 Flash passe à 3,33× au-delà de 32K et à 6,67× au-delà de 256K. Chiffrez une charge à long contexte à partir du prix affiché et vous vous trompez d’un multiple.
 - **Jetons de raisonnement facturés à part de la sortie.** Lorsque les jetons de raisonnement sont facturés séparément, le coût dépend de leur volume facturé et du tarif applicable. Intégrez ce montant à votre estimation.
 - **Tarification selon l’heure.** Modèles avec des plages tarifaires publiées : 2. Vérifiez la plage horaire, le fuseau et les tarifs ; ne supposez pas une remise fixe.

## 6 · Quel prix nous publions

Un score est mesuré sur le déploiement propre du modèle, donc le prix à côté est le **prix de référence** : l’offre la moins chère, sur le mélange équilibré, qui passe chacun des tests ci-dessous. Les tarifs d’entrée, de sortie et de lecture de cache de cette offre sont publiés ensemble, jamais mélangés avec ceux d’une autre offre.

 - **En service.** Une offre qu’OpenRouter indique comme hors service est exclue. Une offre signalée comme dégradée au moment de la lecture compte tout de même si elle a été en service au moins 95 % du dernier jour. Une offre qui a été en service moins de 80 % du dernier jour ne compte pas, quel que soit son état actuel.
 - **Livraison standard.** Flex, priority, fast et les niveaux semblables sont un autre produit et sont exclus.
 - **Tarif standard.** Une offre en promotion compte à son tarif standard : chaque tarif divisé par un moins la remise. Le prix promotionnel est signalé, jamais classé.
 - **Créneau standard.** Un prix qui dépend de l’heure compte à son tarif standard ; les heures de remise sont signalées.
 - **La précision du fabricant ou mieux.** Une offre en 4 bits (fp4, nvfp4, mxfp4, int4) ne compte que si le fabricant sert lui-même en 4 bits ou, quand le fabricant ne déclare aucune précision, si ses poids publiés sont en 4 bits. Une offre qui ne déclare aucune précision compte si elle est celle du fabricant lui-même, ou celle d’un revendeur pour un modèle aux poids fermés : il sert le déploiement du fabricant. Pour des poids ouverts, ou que personne n’a consignés, l’offre d’un revendeur qui n’en déclare aucune est exclue : elle n’est jamais lue comme une précision complète.

Quand aucune offre ne passe, le modèle garde un prix de repli, signalé comme **prix sans offre équivalente** avec sa raison, car un modèle sans prix se lirait comme absent : parmi les offres en service en livraison standard, chacune à son tarif standard, la moins chère d’un revendeur qui ne déclare aucune précision et, à défaut, la moins chère en 4 bits. Un autre niveau de livraison n’est utilisé que si rien d’autre n’est en service. Un modèle sans offre d’où tirer un prix garde le prix du modèle d’OpenRouter.

L’offre la moins chère que la règle exclut, quand elle est moins chère, est affichée sur la page du modèle comme « Moins cher en ce moment », avec la raison : une promotion et son pourcentage, 4 bits, un niveau de livraison ou une précision non déclarée. Elle ne fixe jamais un rang, la frontière, un verdict ni un chiffre phare. Quand l’offre qui fixe le prix est elle-même en promotion, c’est son propre prix promotionnel qui est affiché.

Sur ces données, 333 modèles portent un prix de référence, 15 un prix sans offre équivalente et 99 le prix du modèle d’OpenRouter, dont des fiches batch et gratuites. 86 affichent en ce moment une offre moins chère, dont 11 d’un revendeur qui ne déclare aucune précision.

Avant cette règle, chaque prix ici était le prix du modèle d’OpenRouter, que n’importe quel vendeur peut fixer, promotions et copies en 4 bits comprises. Le changement est consigné comme §96 dans le journal des corrections, avec ses chiffres avant et après.

## 7 · Classement conditionné à la tâche

Un ordre global unique est intellectuellement malhonnête, car des modèles différents l’emportent sur des travaux différents. Nous suivons un Elo par tâche sur **25 catégories** — front-end, visualisation de données, développement de jeux, SVG, Android, présentations et davantage. Sélectionner une tâche reclasse tout le tableau selon l’Elo de cette tâche plutôt que selon un indice général.

Les scores par tâche sont l’Elo par tâche de **Design Arena**, lu dans le flux de modèles d’OpenRouter : [designarena.ai](https://designarena.ai).

La couverture varie selon la catégorie, et un modèle absent du classement d’une catégorie est indiqué comme non mesuré pour cette tâche, non comme mauvais sur celle-ci.

## 8 · Quand le même modèle est vendu deux fois

Certains modèles ne sont pas de nouveaux modèles. Le vendeur le dit lui-même : **11 entrées de ce catalogue** sont décrites par leur propre fournisseur comme un autre modèle du catalogue servi différemment — une voie plus rapide, un autre mode de raisonnement, plus de calcul par requête. **10 des 11 n’ont d’entrée dans aucun classement LMArena. 11 de leurs 11 modèles de base en ont une.**

Quand le même modèle est vendu deux fois

| Vendu comme | Prix du niveau | Modèle de base | Ce que dit le vendeur |
| --- | --- | --- | --- |
| [o1-pro](/models/openai__o1-pro/) aucune entrée | $600 ×10 | [o1](/models/openai__o1/) 1 365,8 | plus de calcul par requête |
| [o3 Pro](/models/openai__o3-pro/) aucune entrée | $80 ×10 | [o3](/models/openai__o3/) 1 409,9 | plus de calcul par requête |
| [GPT-6 Astra Pro](/models/openai__gpt-6-astra-pro/) aucune entrée | $50 ×1 | [GPT-6 Astra](/models/openai__gpt-6-astra/) 1 442,3 avec un effort maximal | même modèle, autre mode de service |
| [GPT-5.6 Sol Pro](/models/openai__gpt-5.6-sol-pro/) aucune entrée | $20 ×1 | [GPT-5.6 Sol](/models/openai__gpt-5.6-sol/) 1 456,3 avec un effort très élevé | même modèle, autre mode de service |
| [GPT-5.6 Terra Pro](/models/openai__gpt-5.6-terra-pro/) aucune entrée | $12 ×1 | [GPT-5.6 Terra](/models/openai__gpt-5.6-terra/) 1 446,3 avec un effort très élevé | même modèle, autre mode de service |
| [GPT-6 Sol Pro](/models/openai__gpt-6-sol-pro/) aucune entrée | $10 ×1 | [GPT-6 Sol](/models/openai__gpt-6-sol/) 1 395,4 avec un effort maximal | même modèle, autre mode de service |
| [GPT-6.1 Sol Pro](/models/openai__gpt-6.1-sol-pro/) aucune entrée | $10 ×1 | [GPT-6.1 Sol](/models/openai__gpt-6.1-sol/) 1 445,6 avec un effort maximal | même modèle, autre mode de service |
| [o3 Mini High](/models/openai__o3-mini-high/) 1 336,6 | $4,4 ×1 | [o3 Mini](/models/openai__o3-mini/) 1 319,4 | même modèle, autre mode de service |
| [o4 Mini High](/models/openai__o4-mini-high/) aucune entrée | $4,4 ×1 | [o4 Mini](/models/openai__o4-mini/) 1 353,2 | même modèle, autre mode de service |
| [GPT-5.6 Luna Pro](/models/openai__gpt-5.6-luna-pro/) aucune entrée | $1,2 ×1 | [GPT-5.6 Luna](/models/openai__gpt-5.6-luna/) 1 431 avec un effort très élevé | même modèle, autre mode de service |
| [GPT-6 Luna Pro](/models/openai__gpt-6-luna-pro/) aucune entrée | $0,5 ×1 | [GPT-6 Luna](/models/openai__gpt-6-luna/) 1 391,5 avec un effort maximal | même modèle, autre mode de service |

La distinction compte pour ce que vous pouvez en conclure. Là où le vendeur dit *capacités identiques* — 0 des 11 —, le score du modèle de base est aussi la propre affirmation du vendeur au sujet du niveau, et la seule chose que vous achetez est la vitesse. Là où le vendeur dit plus de calcul ou un autre mode, aucune mesure publiée ne vous dit ce qu’achète la dépense supplémentaire, à la seule exception signalée plus haut.

Ce décompte ne retient que ce que le vendeur déclare. Un modèle dont le nom se termine par « Pro » mais que son fournisseur qualifie de modèle phare à part entière n’est pas compté ici, car ce serait notre affirmation et non la sienne — la même erreur que de traiter les propres niveaux de service d’un fournisseur comme des vendeurs concurrents, ce qui a un jour transformé un écart de prix de 2× en un 7,2× publié.

L’absence d’entrée dans un classement LMArena n’est pas un verdict. Ce n’est pas une preuve de mauvaise qualité, et cela ne veut pas dire que personne ne les a évalués — les fournisseurs publient leurs propres résultats. Cela veut dire que l’axe sur lequel ce site classe n’a aucune mesure pour eux, donc nous ne les classons pas.

## 9 · D’où viennent les données

Les prix sont normalisés à partir d’un catalogue multi-fournisseurs lisible par machine et recoupés avec les pages tarifaires des fournisseurs. Chaque page de modèle renvoie à sa source et à sa date de récupération.

 - **Les conflits sont consignés, pas moyennés.** Quand deux sources divergent sur un prix, ce désaccord est le résultat. Un modèle affiché à 4/20 $ par son fournisseur et vendu 2/10 $ via un agrégateur a deux prix vrais, et celui qui s’applique dépend de l’endroit où vous achetez.
 - **Les valeurs invraisemblables sont mises en quarantaine.** Une sentinelle amont de −1 signifiant « prix fixé au moment de la requête » devient −750 000 $ par million si on la laisse passer telle quelle, et remporte tout tri par prix croissant. Tout ce qui sort d’une plage plausible est retenu avec un motif joint.
 - **La confiance est par champ.** Pas un badge par ligne. Prétendre qu’un enregistrement est vérifié alors que seul son prix l’a été est le genre d’exagération qui met fin à la confiance dès que quelqu’un s’en aperçoit.
 - **Non noté ne vaut pas zéro.** 219 modèles n’ont aucun score indépendant. Ils sont listés par prix et exclus du classement par qualité, jamais relégués en bas comme s’ils avaient été mesurés et avaient échoué.

## 10 · Licences, et ce qu’elles contraignent

Deux des benchmarks sur lesquels ce site s’appuie ont des conditions de redistribution très différentes, et cela change ce qui peut être publié.

 - **LMArena** publie son classement sous forme de [jeu de données CC-BY-4.0](https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset), ce qui permet la redistribution avec attribution — et qui porte les bornes de confiance dont dépendent les rangs de significativité ci-dessus. C’est le canal à utiliser ; extraire le site lui-même est interdit par leurs conditions.
 - **Artificial Analysis**'s free tier is *"internal use only with attribution"*; public redistribution requires a commercial licence, and their site terms separately limit use to personal and non-commercial purposes. **So we do not publish their figures at all.** Every general capability score on this site is LMArena Elo, used under CC BY 4.0 from the official dataset; the per-task scores are Design Arena’s, below. Artificial Analysis remains an internal cross-check, which is what its free tier permits; it reaches no page, export or API here.
 - Les conditions de l’API de **Design Arena** rendent ses données de classement libres d’utilisation, y compris commerciale, à une condition : tout affichage public cite Design Arena et renvoie vers [designarena.ai](https://designarena.ai). Son Elo par tâche arrive sur ce site par le flux de modèles d’OpenRouter ; la vue par tâche, les rangs par tâche de chaque page de modèle et cette page le citent.
 - **Le prix lui-même** est un fait publié par un fournisseur, ce qui diffère d’un score d’indice compilé. Les prix sont recoupés avec les pages des fournisseurs et chaque ligne renvoie à sa source.

## 11 · Corrections

Les prix changent sans préavis et les pages sont remaniées ; une partie de ce qui figure ici sera fausse à un moment donné. Si vous trouvez une erreur, le plus rapide est d’indiquer quel modèle, quel devrait être le chiffre, et où il est publié — les corrections accompagnées d’une source primaire sont appliquées directement.

[Signaler un prix erroné](/report/)

Catalogue récupéré pour la dernière fois le 2026-10-06. La logique de classement est versionnée avec le site : un changement dans la façon dont « meilleur » est calculé est donc un diff visible et non un réglage silencieux.

## Continue your investigation

 - [Inspect measured uncertainty · English](/significance/)
- [Read source policy](/fr/independence/)
- [See recorded corrections](/fr/corrections/)
- [Reuse accepted data · English](/api/)
