Zelf hosten

RAM en of je een GPU hebt is genoeg. Al het andere is optioneel. De rangschikking is rekenwerk op parameteraantallen met bron — NVIDIA kiest de winnaar niet.

25 catalogusregels gemarkeerd als open gewichten. Niets anders komt in aanmerking.
25 daarvan hebben een parameteraantal met bron. De rest staat als onbekend, niet als gok.
1 GiB speelruimte voor de runtime, opgegeven, niet gemeten op jouw machine.
GPU
Besturingssysteem (optioneel — alleen software)
Te begroten context
De KV-cache groeit hiermee mee. Wij gaan niet uit van het maximum op de modelkaart.

7 van 25 geprofileerde modellen met open gewichten passen in 24 GiB (vram) bij context 8192. Best beoordeeld dat past: Gemma 4 31B (Q5_K_M).

Gewichten 21,106 GiB KV niet geschat Runtime 1 GiB Speelruimte 1,9 GiB / 24 GiB

VRAM as entered. Driver reservation is inside the 1 GiB overhead, not extra.

48 GiB tilt de kwantisatie van Gemma 4 31B naar Q8_0. Hetzelfde model, geen hogere intelligentiescore.

Onder de modellen die passen

Hoogste LMArena-Elo onder de modellen die passen: Gemma 4 31B 1443,4. Elo is een schaal van menselijke voorkeur, niet de intelligentie-index.

The arena boards are separate scales and are never blended. A missing cell is unmeasured, not zero. A model’s highest axis is relative to its own scores, not a claim it leads the catalogue.

Beoordeelde modellen die passen

ModelMenselijke voorkeurKwantisatie die pastGeschatte GiBSpeelruimte
Gemma 4 31B
beeldvideoredenerengereedschappen
1443,4Q5_K_M22,1061,894
Qwen3.8 27B
beeldvideoredenerengereedschappen
1440,7Q5_K_M20,0633,938
Phi 4 1216,7Q8_017,4386,563
  • KV heads and head dim are not in the public size table we used. Cache is not estimated.
  • KV cache not estimated — layer/head geometry is not in the sourced profile. Longer context may not fit.

Passen, niet beoordeeld

Wat een upgrade werkelijk oplevert

Het knelpunt is het GPU-geheugen. Meer systeem-RAM laadt geen extra gewichten op deze kaart.

Geschatte GiBOntsluitVoorbeeldAdviesprijs
48 GiBGemma 4 31B — Q8_0zelfde model, hogere kwantisatiertx a6000, rtx 6000 ada, rtx pro 6000 blackwellGeen consumentenprijs in dit bestand

Het eerstvolgende hoger beoordeelde catalogusmodel is Kimi K3, en zelfs Q4_K_M vraagt 1691,5 GiB. Dat is geen desktopkaart.

NVIDIA 'Starting at' list prices as published 2026-08-25, not a store quote and not a used-market index. Street prices in August 2026 are often much higher (Tom's Hardware Newegg median RTX 5090 $4,699 vs $1,999 list). Last-gen 24 GB cards (4090, 3090) have no current NVIDIA starting-at in this file. Datacenter cards have no consumer list here. RAM DIMMs are not priced — they move weekly.

Upgrades gebruiken dezelfde pasformule als de rangschikking. Adviesprijzen zijn de vanaf-prijzen van NVIDIA, gedateerd 2026-08-25. Straatprijzen liggen vaak hoger. Tweedehands kaarten van 24 GB en datacenter-GPU’s hebben hier geen adviesprijs. RAM-modules worden niet geprijsd.

Passen niet, of niet geprofileerd

  • cohere/command-a-plus — even Q4_K_M wants 132.618 GiB; pool is 24 GiB
  • deepseek/deepseek-v4-flash-vision-exp — even Q4_K_M wants 184.902 GiB; pool is 24 GiB
  • z-ai/glm-5.3 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
  • qwen/qwen3.8-2.4t-a95b — even Q4_K_M wants 1450.719 GiB; pool is 24 GiB
  • moonshotai/kimi-k3 — even Q4_K_M wants 1691.5 GiB; pool is 24 GiB
  • z-ai/glm-5.2 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
  • moonshotai/kimi-k2.7-code — even Q4_K_M wants 604.75 GiB; pool is 24 GiB
  • nvidia/nemotron-3-ultra-550b-a55b — even Q4_K_M wants 333.063 GiB; pool is 24 GiB
  • minimax/minimax-m3 — even Q4_K_M wants 259.405 GiB; pool is 24 GiB
  • deepseek/deepseek-v4-pro — even Q4_K_M wants 967 GiB; pool is 24 GiB
  • deepseek/deepseek-v4-flash — even Q4_K_M wants 172.465 GiB; pool is 24 GiB
  • mistralai/mistral-small-2603 — even Q4_K_M wants 73.2 GiB; pool is 24 GiB
  • mistralai/mistral-large-2512 — even Q4_K_M wants 408.531 GiB; pool is 24 GiB
  • deepseek/deepseek-v3.2 — even Q4_K_M wants 406.116 GiB; pool is 24 GiB
  • openai/gpt-oss-120b — even Q4_K_M wants 72.201 GiB; pool is 24 GiB
  • meta-llama/llama-4-maverick — even Q4_K_M wants 242.5 GiB; pool is 24 GiB
  • meta-llama/llama-4-scout — even Q4_K_M wants 66.809 GiB; pool is 24 GiB
  • cohere/command-a — even Q4_K_M wants 68.016 GiB; pool is 24 GiB

Extra details (optioneel)

Verandert de rangschikking niet. Optionele AI-analyse van je aantekeningen tegenover de cijfers hierboven, met de sterkste modellen van NVIDIA NIM.

Hoe het getal tot stand komt

Gewichten: een gemeten GGUF-grootte als wij die hebben, anders totale parameters × bits per gewicht ÷ 8. Q4_K_M wordt behandeld als 4,83 bits per parameter. MoE-geheugen gebruikt de totale parameters, niet de actieve.

KV-cache, wanneer de geometrie van lagen en koppen een bron heeft: 2 × kvLayers × kvHeads × headDim × context × 2 bytes (FP16, batch 1). Hybride modellen gebruiken het aantal attentielagen, niet elke laag. Ontbreekt de geometrie, dan wordt de cache weggelaten en wordt dat vermeld.

Er wordt 1 GiB opgeteld voor CUDA en de runtime. Apple’s uniforme geheugen gebruikt het RAM als pool. Alleen CPU is een geheugenpassing, geen snelheidsbelofte. De DDR-generatie wordt genegeerd voor de passing — die verandert de bandbreedte, niet of de gewichten in het geheugen staan.

Alleen catalogusregels met openWeights=true komen in aanmerking. Er bestaan 25 zulke regels; 25 hebben groottes met bron. Niet-beoordeelde modellen die passen staan apart vermeld. Een hogere score betekent geen directe vervanging.

Het RAM-type (DDR4/DDR5/LPDDR) is geen veld. Het verandert niets aan of een model past.

Bewijs & vragen