---
title: "Auto-hébergement — quel modèle à poids ouverts tient sur cette machine · Undominated.ai"
canonical: https://undominated.ai/fr/self-host/
description: "À partir de la RAM et de la mémoire GPU, classe les modèles à poids ouverts du catalogue qui tiennent réellement. La qualité prime. Non noté ne vaut pas zéro. Un nombre de paramètres absent n’est pas une supposition."
---

# Auto-hébergement — quel modèle à poids ouverts tient sur cette machine · Undominated.ai

> À partir de la RAM et de la mémoire GPU, classe les modèles à poids ouverts du catalogue qui tiennent réellement. La qualité prime. Non noté ne vaut pas zéro. Un nombre de paramètres absent n’est pas une supposition.

# Auto-hébergement

La RAM et la présence d’un GPU suffisent. Tout le reste est facultatif. Le classement est une arithmétique sur des nombres de paramètres sourcés — NVIDIA ne désigne pas le vainqueur.

 25 lignes du catalogue marquées poids ouverts. Rien d’autre n’est candidat.
 25 d’entre elles ont un nombre de paramètres sourcé. Les autres sont indiquées comme inconnues, pas devinées.
 1 Gio de marge d’exécution, annoncée, non mesurée sur votre machine.

 [CPU 16 GiB](/self-host/cpu-16gb/)[8 GiB GPU](/self-host/8gb/)[10 GiB GPU](/self-host/10gb/)[12 GiB GPU](/self-host/12gb/)[16 GiB GPU](/self-host/16gb/)[20 GiB GPU](/self-host/20gb/)[24 GiB GPU](/self-host/24gb/)[32 GiB GPU](/self-host/32gb/)[40 GiB GPU](/self-host/40gb/)[48 GiB GPU](/self-host/48gb/)[80 GiB GPU](/self-host/80gb/)[94 GiB GPU](/self-host/94gb/)[96 GiB GPU](/self-host/96gb/)[192 GiB GPU](/self-host/192gb/)
 [RTX 5090](/self-host/rtx-5090/)[RTX 5080](/self-host/rtx-5080/)[RTX 5070 Ti](/self-host/rtx-5070-ti/)[RTX 5070](/self-host/rtx-5070/)[RTX 5060 Ti 16](/self-host/rtx-5060-ti-16/)[RTX 5060 Ti 8](/self-host/rtx-5060-ti-8/)[RTX 5060](/self-host/rtx-5060/)[RTX 5050](/self-host/rtx-5050/)[RTX 4090](/self-host/rtx-4090/)[RTX 4080](/self-host/rtx-4080/)[RTX 4070 Ti](/self-host/rtx-4070-ti/)[RTX 4070](/self-host/rtx-4070/)[RTX 4060 Ti 16](/self-host/rtx-4060-ti-16/)[RTX 4060 Ti 8](/self-host/rtx-4060-ti-8/)[RTX 4060](/self-host/rtx-4060/)[RTX 3090](/self-host/rtx-3090/)[RTX 3080 Ti](/self-host/rtx-3080-ti/)[RTX 3080 12](/self-host/rtx-3080-12/)[RTX 3080](/self-host/rtx-3080/)[RTX 3070 Ti](/self-host/rtx-3070-ti/)[RTX 3070](/self-host/rtx-3070/)[RTX 3060 Ti](/self-host/rtx-3060-ti/)[RTX 3060 8](/self-host/rtx-3060-8/)[RTX 3060](/self-host/rtx-3060/)[RTX A6000](/self-host/rtx-a6000/)[RTX A5000](/self-host/rtx-a5000/)[RTX A4000](/self-host/rtx-a4000/)[RTX 6000 ADA](/self-host/rtx-6000-ada/)[RTX 5000 ADA](/self-host/rtx-5000-ada/)[RTX PRO 6000 Blackwell](/self-host/rtx-pro-6000-blackwell/)[RTX PRO 5000 Blackwell](/self-host/rtx-pro-5000-blackwell/)[A100 80](/self-host/a100-80/)[A100 40](/self-host/a100-40/)[H100 NVL](/self-host/h100-nvl/)[H100](/self-host/h100/)[L40S](/self-host/l40s/)[T4](/self-host/t4/)[RX 7900 XTX](/self-host/rx-7900-xtx/)[RX 7900 XT](/self-host/rx-7900-xt/)[RX 6900 XT](/self-host/rx-6900-xt/)[RX 6800 XT](/self-host/rx-6800-xt/)[MI300X](/self-host/mi300x/)
 RAM système Gio GPU Aucun (CPU) NVIDIA AMD Apple Intel
 Mémoire GPU GiB Requis sauf si vous nommez une carte que nous listons. Apple : laissez vide ; la RAM est le pool. Nom du GPU (facultatif) Nombre de GPU Système (facultatif — logiciel uniquement) Ignorer Linux Windows macOS
 Contexte à provisionner 4K 8K 16K 32K
 Le cache KV grandit avec cette valeur. Nous ne présumons pas le maximum de la fiche du modèle.

7 modèles à poids ouverts profilés sur 25 tiennent dans 24 Gio (vram) à un contexte de 8192. Le mieux noté qui tient : Gemma 4 31B (Q5_K_M).

 ** ** **
 Poids 21,106 GiB KV non estimé Exécution 1 GiB Marge 1,9 GiB / 24 GiB

VRAM as entered. Driver reservation is inside the 1 GiB overhead, not extra.

48 Gio porte la quantification de Gemma 4 31B à Q8_0. Même modèle, pas un score d’intelligence supérieur.

## Parmi les modèles qui tiennent

Meilleur Elo LMArena parmi ceux qui tiennent : Gemma 4 31B 1443,4. L’Elo est une échelle de préférence humaine, pas l’indice d’intelligence.

The arena boards are separate scales and are never blended. A missing cell is unmeasured, not zero. A model’s highest axis is relative to its own scores, not a claim it leads the catalogue.

## Modèles notés qui tiennent

| Modèle | Préférence humaine | Quantification qui tient | Gio estimés | Marge |
| --- | --- | --- | --- | --- |
| [Gemma 4 31B](/models/google__gemma-4-31b-it/) vision vidéo raisonnement outils | 1443,4 | Q5_K_M | 22,106 | 1,894 |
| [Qwen3.8 27B](/models/qwen__qwen3.8-27b/) vision vidéo raisonnement outils | 1440,7 | Q5_K_M | 20,063 | 3,938 |
| [Phi 4](/models/microsoft__phi-4/) | 1216,7 | Q8_0 | 17,438 | 6,563 |

 - KV heads and head dim are not in the public size table we used. Cache is not estimated.
- KV cache not estimated — layer/head geometry is not in the sourced profile. Longer context may not fit.

## Tiennent, non notés

 - [Muse Glimmer 30B](/models/meta__muse-glimmer-30b/) — Q5_K_M, 21,756 GiB non noté vision raisonnement outils
- [Ministral 3 14B 2512](/models/mistralai__ministral-14b-2512/) — Q8_0, 17,019 GiB non noté vision outils
- [Ministral 3 8B 2512](/models/mistralai__ministral-8b-2512/) — F16, 19,663 GiB non noté vision outils
- [Ministral 3 3B 2512](/models/mistralai__ministral-3b-2512/) — F16, 9,413 GiB non noté vision outils

## Ce qu’une mise à niveau achète vraiment

Le goulet d’étranglement est la mémoire GPU. Plus de RAM système ne chargera pas davantage de poids sur cette carte.

| Gio estimés | Débloque | Exemple | Prix catalogue |
| --- | --- | --- | --- |
| 48 GiB | [Gemma 4 31B](/models/google__gemma-4-31b-it/) — Q8_0 même modèle, quantification supérieure | rtx a6000, rtx 6000 ada, rtx pro 6000 blackwell | Aucun prix grand public dans ce fichier |

Le modèle du catalogue immédiatement mieux noté est Kimi K3, et même en Q4_K_M il réclame 1691,5 Gio. Ce n’est pas une carte de bureau.

NVIDIA 'Starting at' list prices as published 2026-08-25, not a store quote and not a used-market index. Street prices in August 2026 are often much higher (Tom's Hardware Newegg median RTX 5090 $4,699 vs $1,999 list). Last-gen 24 GB cards (4090, 3090) have no current NVIDIA starting-at in this file. Datacenter cards have no consumer list here. RAM DIMMs are not priced — they move weekly.

Les mises à niveau utilisent la même formule que le classement. Les prix catalogue sont les « à partir de » NVIDIA, datés du 2026-08-25. Les prix réels sont souvent plus élevés. Les cartes 24 Go d’occasion et les GPU de datacenter n’ont pas de prix catalogue ici. Les barrettes de RAM ne sont pas chiffrées.

## Ne tiennent pas, ou non profilés

 - cohere/command-a-plus — even Q4_K_M wants 132.618 GiB; pool is 24 GiB
- deepseek/deepseek-v4-flash-vision-exp — even Q4_K_M wants 184.902 GiB; pool is 24 GiB
- z-ai/glm-5.3 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
- qwen/qwen3.8-2.4t-a95b — even Q4_K_M wants 1450.719 GiB; pool is 24 GiB
- moonshotai/kimi-k3 — even Q4_K_M wants 1691.5 GiB; pool is 24 GiB
- z-ai/glm-5.2 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
- moonshotai/kimi-k2.7-code — even Q4_K_M wants 604.75 GiB; pool is 24 GiB
- nvidia/nemotron-3-ultra-550b-a55b — even Q4_K_M wants 333.063 GiB; pool is 24 GiB
- minimax/minimax-m3 — even Q4_K_M wants 259.405 GiB; pool is 24 GiB
- deepseek/deepseek-v4-pro — even Q4_K_M wants 967 GiB; pool is 24 GiB
- deepseek/deepseek-v4-flash — even Q4_K_M wants 172.465 GiB; pool is 24 GiB
- mistralai/mistral-small-2603 — even Q4_K_M wants 73.2 GiB; pool is 24 GiB
- mistralai/mistral-large-2512 — even Q4_K_M wants 408.531 GiB; pool is 24 GiB
- deepseek/deepseek-v3.2 — even Q4_K_M wants 406.116 GiB; pool is 24 GiB
- openai/gpt-oss-120b — even Q4_K_M wants 72.201 GiB; pool is 24 GiB
- meta-llama/llama-4-maverick — even Q4_K_M wants 242.5 GiB; pool is 24 GiB
- meta-llama/llama-4-scout — even Q4_K_M wants 66.809 GiB; pool is 24 GiB
- cohere/command-a — even Q4_K_M wants 68.016 GiB; pool is 24 GiB

## Détails supplémentaires (facultatif)

Ne change pas le classement. Analyse facultative par IA de vos notes au regard des chiffres ci-dessus, avec les modèles les plus puissants de NVIDIA NIM.

 Analyser avec l’IA

## Comment le chiffre est obtenu

Poids : la taille GGUF mesurée quand nous l’avons, sinon paramètres totaux × bits par poids ÷ 8. Q4_K_M est traité comme 4,83 bits par paramètre. La mémoire des MoE utilise les paramètres totaux, pas les paramètres actifs.

Cache KV, quand la géométrie des couches et des têtes est sourcée : 2 × kvLayers × kvHeads × headDim × contexte × 2 octets (FP16, lot 1). Les modèles hybrides utilisent le nombre de couches d’attention, pas toutes les couches. Si la géométrie manque, le cache est omis et cela est indiqué.

1 Gio sont ajoutés pour CUDA et l’exécution. La mémoire unifiée d’Apple utilise la RAM comme pool. Le CPU seul est un ajustement mémoire, pas une promesse de vitesse. La génération de DDR est ignorée pour l’ajustement : elle change la bande passante, pas le fait que les poids tiennent en mémoire.

Seules les lignes du catalogue avec openWeights=true sont candidates. Il en existe 25 ; 25 ont des tailles sourcées. Les modèles non notés qui tiennent sont listés à part. Un meilleur score ne signifie pas un remplacement direct.

Le type de RAM (DDR4/DDR5/LPDDR) n’est pas un champ. Il ne change pas le fait qu’un modèle tienne.

## Continue your investigation

 - [Inspect open-weight models · English](/open-weights/)
- [Compare model variants · English](/families/)
- [Review requirements · English](/compare/)
- [Find serving tools · English](/tools/)
