---
title: "Selbst hosten — welches Open-Weight-Modell auf diese Maschine passt · Undominated.ai"
canonical: https://undominated.ai/de/self-host/
description: "Aus RAM und GPU-Speicher die Open-Weight-Modelle des Katalogs rangieren, die tatsächlich passen. Qualität führt. Unbewertet ist nicht null. Eine fehlende Parameterzahl ist keine Schätzung."
---

# Selbst hosten — welches Open-Weight-Modell auf diese Maschine passt · Undominated.ai

> Aus RAM und GPU-Speicher die Open-Weight-Modelle des Katalogs rangieren, die tatsächlich passen. Qualität führt. Unbewertet ist nicht null. Eine fehlende Parameterzahl ist keine Schätzung.

# Selbst hosten

RAM und ob Sie eine GPU haben, reichen. Alles andere ist optional. Die Rangfolge ist Arithmetik auf belegten Parameterzahlen — NVIDIA wählt den Sieger nicht.

 20 Katalogzeilen mit open-weight. Nichts anderes ist Kandidat.
 20 davon haben eine belegte Parameterzahl. Der Rest steht als unbekannt, nicht geraten.
 1 GiB Laufzeit-Zuschlag, benannt, nicht auf Ihrer Maschine gemessen.

 System-RAM GiB GPU Keine (CPU) NVIDIA AMD Apple Intel
 GPU-Speicher GiB Pflicht, sofern Sie keine Karte aus der Liste nennen. Apple: leer lassen; RAM ist der Pool. GPU-Name (optional) GPU-Anzahl Betriebssystem (optional — nur Software) Überspringen Linux Windows macOS
 Kontext, der budgetiert wird 4K 8K 16K 32K
 Der KV-Cache wächst damit. Wir nehmen nicht das Maximum der Modellkarte an.

6 von 20 profilierten Open-Weight-Modellen passen in 24 GiB (vram) bei 8192 Kontext. Bestes bewertetes, das passt: Qwen3.8 27B (Q5_K_M).

 ** ** ** **
 Gewichte 18.563 GiB KV-Cache 0.5 GiB Laufzeit 1 GiB Spielraum 3.9 GiB / 24 GiB

VRAM as entered. Driver reservation is inside the 1 GiB overhead, not extra.

32 GiB hebt das Quant von Qwen3.8 27B auf Q8_0. Dasselbe Modell, kein höherer Artificial-Analysis-Wert.

## Unter den Modellen, die passen

Qwen3.8 27B hat unter den passenden Modellen die höchsten Artificial-Analysis-Werte für Intelligence (52), Coding (68.1) und Agentic (50.9).

Höchste LMArena-Elo unter den passenden Modellen: Gemma 4 31B 1441.7. Elo ist eine menschliche Präferenzskala, kein Intelligence-Index.

Artificial-Analysis-Indizes und LMArena-Elo sind verschiedene Skalen. Eine leere Zelle ist ungemessen, nicht null. Die höchste Achse eines Modells gilt relativ zu seinen eigenen Werten, nicht als Führungsanspruch im Katalog.

## Bewertete Modelle, die passen

| Modell | Allgemein | Programmieren | Agenten | Menschliche Präferenz | Quant, das passt | Geschätzte GiB | Spielraum |
| --- | --- | --- | --- | --- | --- | --- | --- |
| Qwen3.8 27B AA-Spitze: Programmieren Bild Video Reasoning Werkzeuge | 52 | 68.1 | 50.9 | 1440.8 | Q5_K_M | 20.063 | 3.938 |
| Gemma 4 31B AA-Spitze: Programmieren Bild Video Reasoning Werkzeuge | 29.7 | 43.4 | 14.4 | 1441.7 | Q5_K_M | 22.106 | 1.894 |
| Olmo 3 32B Think Reasoning | — | — | — | 1298.5 | Q4_K_M | 22.32 | 1.68 |
| Granite 4.1 8B Werkzeuge | — | 9.5 | — | 1291.6 | F16 | 18.25 | 5.75 |
| Phi 4 | — | — | — | 1216.8 | Q8_0 | 17.438 | 6.563 |

 - Hybrid: only 16 of 64 layers are Gated Attention. KV uses kvLayers=16, not nLayers=64. Measured Q4 is Unsloth UD-Q4_K_M, not a vanilla Q4_K_M.

## Passt, unbewertet

 - [Muse Glimmer 30B](/models/meta__muse-glimmer-30b/) — Q5_K_M, 21.756 GiB unbewertet Bild Reasoning Werkzeuge

## Was ein Upgrade tatsächlich kauft

Der Engpass für die Passung ist der GPU-Speicher. Mehr System-RAM lädt keine zusätzlichen Gewichte auf diese Karte.

| Geschätzte GiB | Neu möglich | Beispiel | Listenpreis |
| --- | --- | --- | --- |
| 32 GiB | Qwen3.8 27B — Q8_0 dasselbe Modell, höheres Quant | GeForce RTX 5090 (32 GiB) | ab 1999 USD |

Das nächste höher bewertete Katalogmodell ist Kimi K3, und selbst Q4_K_M will 1691.5 GiB. Das ist keine Desktop-Karte.

NVIDIA 'Starting at' list prices as published 2026-08-25, not a store quote and not a used-market index. Street prices in August 2026 are often much higher (Tom's Hardware Newegg median RTX 5090 $4,699 vs $1,999 list). Last-gen 24 GB cards (4090, 3090) have no current NVIDIA starting-at in this file. Datacenter cards have no consumer list here. RAM DIMMs are not priced — they move weekly.

Upgrades nutzen dieselbe Passungsformel wie die Rangfolge. Listenpreise sind NVIDIA-Starting-at, Stand 2026-08-25. Straßenpreise liegen oft höher. Gebrauchte 24-GiB-Karten und Rechenzentrums-GPUs haben hier keine Liste. RAM-Riegel sind nicht bepreist.

## Passt nicht, oder nicht profiliert

 - qwen/qwen3.8-2.4t-a95b — even Q4_K_M wants 1450.719 GiB; pool is 24 GiB
- moonshotai/kimi-k3 — even Q4_K_M wants 1691.5 GiB; pool is 24 GiB
- z-ai/glm-5.2 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
- moonshotai/kimi-k2.7-code — even Q4_K_M wants 604.75 GiB; pool is 24 GiB
- nvidia/nemotron-3-ultra-550b-a55b — even Q4_K_M wants 333.063 GiB; pool is 24 GiB
- minimax/minimax-m3 — even Q4_K_M wants 259.405 GiB; pool is 24 GiB
- deepseek/deepseek-v4-pro — even Q4_K_M wants 967 GiB; pool is 24 GiB
- deepseek/deepseek-v4-flash — even Q4_K_M wants 172.465 GiB; pool is 24 GiB
- mistralai/mistral-small-2603 — even Q4_K_M wants 73.2 GiB; pool is 24 GiB
- deepseek/deepseek-v3.2 — even Q4_K_M wants 406.116 GiB; pool is 24 GiB
- openai/gpt-oss-120b — even Q4_K_M wants 72.201 GiB; pool is 24 GiB
- meta-llama/llama-4-maverick — even Q4_K_M wants 242.5 GiB; pool is 24 GiB
- meta-llama/llama-4-scout — even Q4_K_M wants 66.809 GiB; pool is 24 GiB
- cohere/command-a — even Q4_K_M wants 68.016 GiB; pool is 24 GiB

## Zusatzangaben (optional)

Ändert die Rangfolge nicht. Optionale KI-Analyse Ihrer Angaben gegen die Zahlen oben, mit den stärksten Modellen von NVIDIA NIM.

 Mit KI analysieren

## Wie die Zahl entsteht

Gewichte: eine gemessene GGUF-Größe, wenn wir eine haben, sonst Gesamtparameter × Bits pro Gewicht ÷ 8. Q4_K_M gilt als 4,83 Bits/Param. MoE-Speicher nutzt Gesamtparameter, nicht aktive Parameter.

KV-Cache, wenn Schicht- und Kopfgeometrie belegt ist: 2 × kvLayers × kvHeads × headDim × Kontext × 2 Bytes (FP16, Batch 1). Hybridmodelle nutzen die Zahl der Attention-Schichten, nicht jede Schicht. Fehlt die Geometrie, entfällt der Cache und das steht da.

1 GiB kommen für CUDA/Laufzeit dazu. Apples Unified Memory nutzt RAM als Pool. Nur-CPU ist eine Speicherpassung, kein Geschwindigkeitsversprechen. Die DDR-Generation ändert die Bandbreite, nicht ob die Gewichte in den Speicher passen.

Nur Katalogzeilen mit openWeights=true sind Kandidaten. 20 solche Zeilen gibt es; 20 haben belegte Größen. Unbewertete, die passen, stehen getrennt. Eine höhere Zahl heißt kein Drop-in-Ersatz.

RAM-Typ (DDR4/DDR5/LPDDR) ist kein Feld. Er ändert nicht, ob ein Modell passt.
