Selbst hosten
RAM und ob Sie eine GPU haben, reichen. Alles andere ist optional. Die Rangfolge ist Arithmetik auf belegten Parameterzahlen — NVIDIA wählt den Sieger nicht.
6 von 20 profilierten Open-Weight-Modellen passen in 24 GiB (vram) bei 8192 Kontext. Bestes bewertetes, das passt: Qwen3.8 27B (Q5_K_M).
VRAM as entered. Driver reservation is inside the 1 GiB overhead, not extra.
32 GiB hebt das Quant von Qwen3.8 27B auf Q8_0. Dasselbe Modell, kein höherer Artificial-Analysis-Wert.
Unter den Modellen, die passen
Qwen3.8 27B hat unter den passenden Modellen die höchsten Artificial-Analysis-Werte für Intelligence (52), Coding (68.1) und Agentic (50.9).
Höchste LMArena-Elo unter den passenden Modellen: Gemma 4 31B 1441.7. Elo ist eine menschliche Präferenzskala, kein Intelligence-Index.
Artificial-Analysis-Indizes und LMArena-Elo sind verschiedene Skalen. Eine leere Zelle ist ungemessen, nicht null. Die höchste Achse eines Modells gilt relativ zu seinen eigenen Werten, nicht als Führungsanspruch im Katalog.
Bewertete Modelle, die passen
| Modell | Allgemein | Programmieren | Agenten | Menschliche Präferenz | Quant, das passt | Geschätzte GiB | Spielraum |
|---|---|---|---|---|---|---|---|
| Qwen3.8 27B | 52 | 68.1 | 50.9 | 1440.8 | Q5_K_M | 20.063 | 3.938 |
| Gemma 4 31B | 29.7 | 43.4 | 14.4 | 1441.7 | Q5_K_M | 22.106 | 1.894 |
| Olmo 3 32B Think | — | — | — | 1298.5 | Q4_K_M | 22.32 | 1.68 |
| Granite 4.1 8B | — | 9.5 | — | 1291.6 | F16 | 18.25 | 5.75 |
| Phi 4 | — | — | — | 1216.8 | Q8_0 | 17.438 | 6.563 |
- Hybrid: only 16 of 64 layers are Gated Attention. KV uses kvLayers=16, not nLayers=64. Measured Q4 is Unsloth UD-Q4_K_M, not a vanilla Q4_K_M.
Passt, unbewertet
- Muse Glimmer 30B — Q5_K_M, 21.756 GiB unbewertet BildReasoningWerkzeuge
Was ein Upgrade tatsächlich kauft
Der Engpass für die Passung ist der GPU-Speicher. Mehr System-RAM lädt keine zusätzlichen Gewichte auf diese Karte.
| Geschätzte GiB | Neu möglich | Beispiel | Listenpreis |
|---|---|---|---|
| 32 GiB | Qwen3.8 27B — Q8_0dasselbe Modell, höheres Quant | GeForce RTX 5090 (32 GiB) | ab 1999 USD |
Das nächste höher bewertete Katalogmodell ist Kimi K3, und selbst Q4_K_M will 1691.5 GiB. Das ist keine Desktop-Karte.
NVIDIA 'Starting at' list prices as published 2026-08-25, not a store quote and not a used-market index. Street prices in August 2026 are often much higher (Tom's Hardware Newegg median RTX 5090 $4,699 vs $1,999 list). Last-gen 24 GB cards (4090, 3090) have no current NVIDIA starting-at in this file. Datacenter cards have no consumer list here. RAM DIMMs are not priced — they move weekly.
Upgrades nutzen dieselbe Passungsformel wie die Rangfolge. Listenpreise sind NVIDIA-Starting-at, Stand 2026-08-25. Straßenpreise liegen oft höher. Gebrauchte 24-GiB-Karten und Rechenzentrums-GPUs haben hier keine Liste. RAM-Riegel sind nicht bepreist.
Passt nicht, oder nicht profiliert
- qwen/qwen3.8-2.4t-a95b — even Q4_K_M wants 1450.719 GiB; pool is 24 GiB
- moonshotai/kimi-k3 — even Q4_K_M wants 1691.5 GiB; pool is 24 GiB
- z-ai/glm-5.2 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
- moonshotai/kimi-k2.7-code — even Q4_K_M wants 604.75 GiB; pool is 24 GiB
- nvidia/nemotron-3-ultra-550b-a55b — even Q4_K_M wants 333.063 GiB; pool is 24 GiB
- minimax/minimax-m3 — even Q4_K_M wants 259.405 GiB; pool is 24 GiB
- deepseek/deepseek-v4-pro — even Q4_K_M wants 967 GiB; pool is 24 GiB
- deepseek/deepseek-v4-flash — even Q4_K_M wants 172.465 GiB; pool is 24 GiB
- mistralai/mistral-small-2603 — even Q4_K_M wants 73.2 GiB; pool is 24 GiB
- deepseek/deepseek-v3.2 — even Q4_K_M wants 406.116 GiB; pool is 24 GiB
- openai/gpt-oss-120b — even Q4_K_M wants 72.201 GiB; pool is 24 GiB
- meta-llama/llama-4-maverick — even Q4_K_M wants 242.5 GiB; pool is 24 GiB
- meta-llama/llama-4-scout — even Q4_K_M wants 66.809 GiB; pool is 24 GiB
- cohere/command-a — even Q4_K_M wants 68.016 GiB; pool is 24 GiB
Zusatzangaben (optional)
Ändert die Rangfolge nicht. Optionale KI-Analyse Ihrer Angaben gegen die Zahlen oben, mit den stärksten Modellen von NVIDIA NIM.
Wie die Zahl entsteht
Gewichte: eine gemessene GGUF-Größe, wenn wir eine haben, sonst Gesamtparameter × Bits pro Gewicht ÷ 8. Q4_K_M gilt als 4,83 Bits/Param. MoE-Speicher nutzt Gesamtparameter, nicht aktive Parameter.
KV-Cache, wenn Schicht- und Kopfgeometrie belegt ist: 2 × kvLayers × kvHeads × headDim × Kontext × 2 Bytes (FP16, Batch 1). Hybridmodelle nutzen die Zahl der Attention-Schichten, nicht jede Schicht. Fehlt die Geometrie, entfällt der Cache und das steht da.
1 GiB kommen für CUDA/Laufzeit dazu. Apples Unified Memory nutzt RAM als Pool. Nur-CPU ist eine Speicherpassung, kein Geschwindigkeitsversprechen. Die DDR-Generation ändert die Bandbreite, nicht ob die Gewichte in den Speicher passen.
Nur Katalogzeilen mit openWeights=true sind Kandidaten. 20 solche Zeilen gibt es; 20 haben belegte Größen. Unbewertete, die passen, stehen getrennt. Eine höhere Zahl heißt kein Drop-in-Ersatz.
RAM-Typ (DDR4/DDR5/LPDDR) ist kein Feld. Er ändert nicht, ob ein Modell passt.