Zelf hosten
RAM en of je een GPU hebt is genoeg. Al het andere is optioneel. De rangschikking is rekenwerk op parameteraantallen met bron — NVIDIA kiest de winnaar niet.
6 van 20 geprofileerde modellen met open gewichten passen in 24 GiB (vram) bij context 8192. Best beoordeeld dat past: Qwen3.8 27B (Q5_K_M).
VRAM as entered. Driver reservation is inside the 1 GiB overhead, not extra.
32 GiB tilt de kwantisatie van Qwen3.8 27B naar Q8_0. Hetzelfde model, geen hogere intelligentiescore.
Onder de modellen die passen
Qwen3.8 27B heeft de hoogste Artificial Analysis-scores voor intelligentie (52), programmeren (68.1) en agentisch (50.9) onder de modellen die passen.
Hoogste LMArena-Elo onder de modellen die passen: Gemma 4 31B 1441.7. Elo is een schaal van menselijke voorkeur, niet de intelligentie-index.
De Artificial Analysis-indexen en de LMArena-Elo zijn verschillende schalen. Een lege cel is niet gemeten, niet nul. De hoogste as van een model is relatief aan zijn eigen scores, geen bewering dat het de catalogus aanvoert.
Beoordeelde modellen die passen
| Model | Algemeen | Programmeren | Agentisch | Menselijke voorkeur | Kwantisatie die past | Geschatte GiB | Speelruimte |
|---|---|---|---|---|---|---|---|
| Qwen3.8 27B | 52 | 68.1 | 50.9 | 1440.8 | Q5_K_M | 20.063 | 3.938 |
| Gemma 4 31B | 29.7 | 43.4 | 14.4 | 1441.7 | Q5_K_M | 22.106 | 1.894 |
| Olmo 3 32B Think | — | — | — | 1298.5 | Q4_K_M | 22.32 | 1.68 |
| Granite 4.1 8B | — | 9.5 | — | 1291.6 | F16 | 18.25 | 5.75 |
| Phi 4 | — | — | — | 1216.8 | Q8_0 | 17.438 | 6.563 |
- Hybrid: only 16 of 64 layers are Gated Attention. KV uses kvLayers=16, not nLayers=64. Measured Q4 is Unsloth UD-Q4_K_M, not a vanilla Q4_K_M.
Passen, niet beoordeeld
- Muse Glimmer 30B — Q5_K_M, 21.756 GiB niet beoordeeld beeldredenerengereedschappen
Wat een upgrade werkelijk oplevert
Het knelpunt is het GPU-geheugen. Meer systeem-RAM laadt geen extra gewichten op deze kaart.
| Geschatte GiB | Ontsluit | Voorbeeld | Adviesprijs |
|---|---|---|---|
| 32 GiB | Qwen3.8 27B — Q8_0zelfde model, hogere kwantisatie | GeForce RTX 5090 (32 GiB) | USD 1999 vanaf |
Het eerstvolgende hoger beoordeelde catalogusmodel is Kimi K3, en zelfs Q4_K_M vraagt 1691.5 GiB. Dat is geen desktopkaart.
NVIDIA 'Starting at' list prices as published 2026-08-25, not a store quote and not a used-market index. Street prices in August 2026 are often much higher (Tom's Hardware Newegg median RTX 5090 $4,699 vs $1,999 list). Last-gen 24 GB cards (4090, 3090) have no current NVIDIA starting-at in this file. Datacenter cards have no consumer list here. RAM DIMMs are not priced — they move weekly.
Upgrades gebruiken dezelfde pasformule als de rangschikking. Adviesprijzen zijn de vanaf-prijzen van NVIDIA, gedateerd 2026-08-25. Straatprijzen liggen vaak hoger. Tweedehands kaarten van 24 GB en datacenter-GPU’s hebben hier geen adviesprijs. RAM-modules worden niet geprijsd.
Passen niet, of niet geprofileerd
- qwen/qwen3.8-2.4t-a95b — even Q4_K_M wants 1450.719 GiB; pool is 24 GiB
- moonshotai/kimi-k3 — even Q4_K_M wants 1691.5 GiB; pool is 24 GiB
- z-ai/glm-5.2 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
- moonshotai/kimi-k2.7-code — even Q4_K_M wants 604.75 GiB; pool is 24 GiB
- nvidia/nemotron-3-ultra-550b-a55b — even Q4_K_M wants 333.063 GiB; pool is 24 GiB
- minimax/minimax-m3 — even Q4_K_M wants 259.405 GiB; pool is 24 GiB
- deepseek/deepseek-v4-pro — even Q4_K_M wants 967 GiB; pool is 24 GiB
- deepseek/deepseek-v4-flash — even Q4_K_M wants 172.465 GiB; pool is 24 GiB
- mistralai/mistral-small-2603 — even Q4_K_M wants 73.2 GiB; pool is 24 GiB
- deepseek/deepseek-v3.2 — even Q4_K_M wants 406.116 GiB; pool is 24 GiB
- openai/gpt-oss-120b — even Q4_K_M wants 72.201 GiB; pool is 24 GiB
- meta-llama/llama-4-maverick — even Q4_K_M wants 242.5 GiB; pool is 24 GiB
- meta-llama/llama-4-scout — even Q4_K_M wants 66.809 GiB; pool is 24 GiB
- cohere/command-a — even Q4_K_M wants 68.016 GiB; pool is 24 GiB
Extra details (optioneel)
Verandert de rangschikking niet. Optionele AI-analyse van je aantekeningen tegenover de cijfers hierboven, met de sterkste modellen van NVIDIA NIM.
Hoe het getal tot stand komt
Gewichten: een gemeten GGUF-grootte als wij die hebben, anders totale parameters × bits per gewicht ÷ 8. Q4_K_M wordt behandeld als 4,83 bits per parameter. MoE-geheugen gebruikt de totale parameters, niet de actieve.
KV-cache, wanneer de geometrie van lagen en koppen een bron heeft: 2 × kvLayers × kvHeads × headDim × context × 2 bytes (FP16, batch 1). Hybride modellen gebruiken het aantal attentielagen, niet elke laag. Ontbreekt de geometrie, dan wordt de cache weggelaten en wordt dat vermeld.
Er wordt 1 GiB opgeteld voor CUDA en de runtime. Apple’s uniforme geheugen gebruikt het RAM als pool. Alleen CPU is een geheugenpassing, geen snelheidsbelofte. De DDR-generatie wordt genegeerd voor de passing — die verandert de bandbreedte, niet of de gewichten in het geheugen staan.
Alleen catalogusregels met openWeights=true komen in aanmerking. Er bestaan 20 zulke regels; 20 hebben groottes met bron. Niet-beoordeelde modellen die passen staan apart vermeld. Een hogere score betekent geen directe vervanging.
Het RAM-type (DDR4/DDR5/LPDDR) is geen veld. Het verandert niets aan of een model past.