Egen drift
RAM och huruvida du har en GPU räcker. Allt annat är valfritt. Rangordningen är aritmetik på källbelagda parameterantal — NVIDIA utser inte vinnaren.
6 av 20 profilerade modeller med öppna vikter får plats i 24 GiB (vram) vid kontext 8192. Bäst betygsatt som får plats: Qwen3.8 27B (Q5_K_M).
VRAM as entered. Driver reservation is inside the 1 GiB overhead, not extra.
32 GiB höjer kvantiseringen av Qwen3.8 27B till Q8_0. Samma modell, inte en högre intelligenspoäng.
Bland modeller som får plats
Qwen3.8 27B har högst Artificial Analysis-poäng i intelligens (52), kodning (68.1) och agentiskt (50.9) bland modeller som får plats.
Högst LMArena-Elo bland dem som får plats: Gemma 4 31B 1441.7. Elo är en skala för mänsklig preferens, inte intelligensindexet.
Artificial Analysis-index och LMArena-Elo är olika skalor. En tom cell är omätt, inte noll. En modells starkaste axel är relativ till dess egna poäng, inte ett påstående om att den leder katalogen.
Betygsatta modeller som får plats
| Modell | Allmänt | Kodning | Agentiskt | Mänsklig preferens | Kvantisering som får plats | Uppskattade GiB | Marginal |
|---|---|---|---|---|---|---|---|
| Qwen3.8 27B | 52 | 68.1 | 50.9 | 1440.8 | Q5_K_M | 20.063 | 3.938 |
| Gemma 4 31B | 29.7 | 43.4 | 14.4 | 1441.7 | Q5_K_M | 22.106 | 1.894 |
| Olmo 3 32B Think | — | — | — | 1298.5 | Q4_K_M | 22.32 | 1.68 |
| Granite 4.1 8B | — | 9.5 | — | 1291.6 | F16 | 18.25 | 5.75 |
| Phi 4 | — | — | — | 1216.8 | Q8_0 | 17.438 | 6.563 |
- Hybrid: only 16 of 64 layers are Gated Attention. KV uses kvLayers=16, not nLayers=64. Measured Q4 is Unsloth UD-Q4_K_M, not a vanilla Q4_K_M.
Får plats, obetygsatta
- Muse Glimmer 30B — Q5_K_M, 21.756 GiB obetygsatt synresonemangverktyg
Vad en uppgradering faktiskt ger
Flaskhalsen är GPU-minnet. Mer system-RAM laddar inte fler vikter på det här kortet.
| Uppskattade GiB | Låser upp | Exempel | Listpris |
|---|---|---|---|
| 32 GiB | Qwen3.8 27B — Q8_0samma modell, högre kvantisering | GeForce RTX 5090 (32 GiB) | USD 1999 från |
Nästa högre betygsatta katalogmodell är Kimi K3, och även Q4_K_M kräver 1691.5 GiB. Det är inget skrivbordskort.
NVIDIA 'Starting at' list prices as published 2026-08-25, not a store quote and not a used-market index. Street prices in August 2026 are often much higher (Tom's Hardware Newegg median RTX 5090 $4,699 vs $1,999 list). Last-gen 24 GB cards (4090, 3090) have no current NVIDIA starting-at in this file. Datacenter cards have no consumer list here. RAM DIMMs are not priced — they move weekly.
Uppgraderingar använder samma passformsformel som rangordningen. Listpriser är NVIDIA:s från-priser, daterade 2026-08-25. Gatupriser är ofta högre. Begagnade 24 GB-kort och datacenter-GPU:er saknar listpris här. RAM-moduler prissätts inte.
Får inte plats, eller inte profilerade
- qwen/qwen3.8-2.4t-a95b — even Q4_K_M wants 1450.719 GiB; pool is 24 GiB
- moonshotai/kimi-k3 — even Q4_K_M wants 1691.5 GiB; pool is 24 GiB
- z-ai/glm-5.2 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
- moonshotai/kimi-k2.7-code — even Q4_K_M wants 604.75 GiB; pool is 24 GiB
- nvidia/nemotron-3-ultra-550b-a55b — even Q4_K_M wants 333.063 GiB; pool is 24 GiB
- minimax/minimax-m3 — even Q4_K_M wants 259.405 GiB; pool is 24 GiB
- deepseek/deepseek-v4-pro — even Q4_K_M wants 967 GiB; pool is 24 GiB
- deepseek/deepseek-v4-flash — even Q4_K_M wants 172.465 GiB; pool is 24 GiB
- mistralai/mistral-small-2603 — even Q4_K_M wants 73.2 GiB; pool is 24 GiB
- deepseek/deepseek-v3.2 — even Q4_K_M wants 406.116 GiB; pool is 24 GiB
- openai/gpt-oss-120b — even Q4_K_M wants 72.201 GiB; pool is 24 GiB
- meta-llama/llama-4-maverick — even Q4_K_M wants 242.5 GiB; pool is 24 GiB
- meta-llama/llama-4-scout — even Q4_K_M wants 66.809 GiB; pool is 24 GiB
- cohere/command-a — even Q4_K_M wants 68.016 GiB; pool is 24 GiB
Ytterligare detaljer (valfritt)
Ändrar inte rangordningen. Valfri AI-analys av dina anteckningar mot siffrorna ovan, med NVIDIA NIM:s starkaste modeller.
Så tas siffran fram
Vikter: en uppmätt GGUF-storlek när vi har en, annars totala parametrar × bitar per vikt ÷ 8. Q4_K_M behandlas som 4,83 bitar per parameter. MoE-minne använder totala parametrar, inte aktiva.
KV-cache, när lager- och huvudgeometrin är källbelagd: 2 × kvLayers × kvHeads × headDim × kontext × 2 byte (FP16, batch 1). Hybridmodeller använder antalet attentionlager, inte alla lager. Saknas geometrin utelämnas cachen, och det anges.
1 GiB läggs till för CUDA och körtid. Apples enhetliga minne använder RAM som pool. Enbart CPU är en minnespassning, inte ett hastighetspåstående. DDR-generationen ignoreras för passningen — den ändrar bandbredd, inte om vikterna ryms i minnet.
Endast katalograder med openWeights=true är kandidater. Det finns 20 sådana rader; 20 har källbelagda storlekar. Obetygsatta modeller som får plats listas separat. En högre poäng betyder inte ett rakt byte.
RAM-typ (DDR4/DDR5/LPDDR) är inte ett fält. Den ändrar inte om en modell får plats.