---
title: "Selbst hosten — welches Open-Weight-Modell auf diese Maschine passt · Undominated.ai"
canonical: https://undominated.ai/de/self-host/
description: "Aus RAM und GPU-Speicher die Open-Weight-Modelle des Katalogs rangieren, die tatsächlich passen. Qualität führt. Unbewertet ist nicht null. Eine fehlende Parameterzahl ist keine Schätzung."
---

# Selbst hosten — welches Open-Weight-Modell auf diese Maschine passt · Undominated.ai

> Aus RAM und GPU-Speicher die Open-Weight-Modelle des Katalogs rangieren, die tatsächlich passen. Qualität führt. Unbewertet ist nicht null. Eine fehlende Parameterzahl ist keine Schätzung.

# Selbst hosten

RAM und ob Sie eine GPU haben, reichen. Alles andere ist optional. Die Rangfolge ist Arithmetik auf belegten Parameterzahlen — NVIDIA wählt den Sieger nicht.

 25 Katalogzeilen mit open-weight. Nichts anderes ist Kandidat.
 25 davon haben eine belegte Parameterzahl. Der Rest steht als unbekannt, nicht geraten.
 1 GiB Laufzeit-Zuschlag, benannt, nicht auf Ihrer Maschine gemessen.

 [CPU 16 GiB](/self-host/cpu-16gb/)[8 GiB GPU](/self-host/8gb/)[10 GiB GPU](/self-host/10gb/)[12 GiB GPU](/self-host/12gb/)[16 GiB GPU](/self-host/16gb/)[20 GiB GPU](/self-host/20gb/)[24 GiB GPU](/self-host/24gb/)[32 GiB GPU](/self-host/32gb/)[40 GiB GPU](/self-host/40gb/)[48 GiB GPU](/self-host/48gb/)[80 GiB GPU](/self-host/80gb/)[94 GiB GPU](/self-host/94gb/)[96 GiB GPU](/self-host/96gb/)[192 GiB GPU](/self-host/192gb/)
 [RTX 5090](/self-host/rtx-5090/)[RTX 5080](/self-host/rtx-5080/)[RTX 5070 Ti](/self-host/rtx-5070-ti/)[RTX 5070](/self-host/rtx-5070/)[RTX 5060 Ti 16](/self-host/rtx-5060-ti-16/)[RTX 5060 Ti 8](/self-host/rtx-5060-ti-8/)[RTX 5060](/self-host/rtx-5060/)[RTX 5050](/self-host/rtx-5050/)[RTX 4090](/self-host/rtx-4090/)[RTX 4080](/self-host/rtx-4080/)[RTX 4070 Ti](/self-host/rtx-4070-ti/)[RTX 4070](/self-host/rtx-4070/)[RTX 4060 Ti 16](/self-host/rtx-4060-ti-16/)[RTX 4060 Ti 8](/self-host/rtx-4060-ti-8/)[RTX 4060](/self-host/rtx-4060/)[RTX 3090](/self-host/rtx-3090/)[RTX 3080 Ti](/self-host/rtx-3080-ti/)[RTX 3080 12](/self-host/rtx-3080-12/)[RTX 3080](/self-host/rtx-3080/)[RTX 3070 Ti](/self-host/rtx-3070-ti/)[RTX 3070](/self-host/rtx-3070/)[RTX 3060 Ti](/self-host/rtx-3060-ti/)[RTX 3060 8](/self-host/rtx-3060-8/)[RTX 3060](/self-host/rtx-3060/)[RTX A6000](/self-host/rtx-a6000/)[RTX A5000](/self-host/rtx-a5000/)[RTX A4000](/self-host/rtx-a4000/)[RTX 6000 ADA](/self-host/rtx-6000-ada/)[RTX 5000 ADA](/self-host/rtx-5000-ada/)[RTX PRO 6000 Blackwell](/self-host/rtx-pro-6000-blackwell/)[RTX PRO 5000 Blackwell](/self-host/rtx-pro-5000-blackwell/)[A100 80](/self-host/a100-80/)[A100 40](/self-host/a100-40/)[H100 NVL](/self-host/h100-nvl/)[H100](/self-host/h100/)[L40S](/self-host/l40s/)[T4](/self-host/t4/)[RX 7900 XTX](/self-host/rx-7900-xtx/)[RX 7900 XT](/self-host/rx-7900-xt/)[RX 6900 XT](/self-host/rx-6900-xt/)[RX 6800 XT](/self-host/rx-6800-xt/)[MI300X](/self-host/mi300x/)
 System-RAM GiB GPU Keine (CPU) NVIDIA AMD Apple Intel
 GPU-Speicher GiB Pflicht, sofern Sie keine Karte aus der Liste nennen. Apple: leer lassen; RAM ist der Pool. GPU-Name (optional) GPU-Anzahl Betriebssystem (optional — nur Software) Überspringen Linux Windows macOS
 Kontext, der budgetiert wird 4K 8K 16K 32K
 Der KV-Cache wächst damit. Wir nehmen nicht das Maximum der Modellkarte an.

7 von 25 profilierten Open-Weight-Modellen passen in 24 GiB (vram) bei 8192 Kontext. Bestes bewertetes, das passt: Gemma 4 31B (Q5_K_M).

 ** ** **
 Gewichte 21,106 GiB KV nicht geschätzt Laufzeit 1 GiB Spielraum 1,9 GiB / 24 GiB

VRAM as entered. Driver reservation is inside the 1 GiB overhead, not extra.

48 GiB hebt das Quant von Gemma 4 31B auf Q8_0. Dasselbe Modell, kein höherer Artificial-Analysis-Wert.

## Unter den Modellen, die passen

Höchste LMArena-Elo unter den passenden Modellen: Gemma 4 31B 1443,4. Elo ist eine menschliche Präferenzskala, kein Intelligence-Index.

Die Arena-Boards sind getrennte Skalen und werden nie vermischt. Eine leere Zelle bedeutet ungemessen, nicht null. Die stärkste Achse eines Modells bezieht sich auf seine eigenen Werte und ist keine Aussage darüber, dass es den Katalog anführt.

## Bewertete Modelle, die passen

| Modell | Menschliche Präferenz | Quant, das passt | Geschätzte GiB | Spielraum |
| --- | --- | --- | --- | --- |
| [Gemma 4 31B](/models/google__gemma-4-31b-it/) Bild Video Reasoning Werkzeuge | 1443,4 | Q5_K_M | 22,106 | 1,894 |
| [Qwen3.8 27B](/models/qwen__qwen3.8-27b/) Bild Video Reasoning Werkzeuge | 1440,7 | Q5_K_M | 20,063 | 3,938 |
| [Phi 4](/models/microsoft__phi-4/) | 1216,7 | Q8_0 | 17,438 | 6,563 |

 - KV heads and head dim are not in the public size table we used. Cache is not estimated.
- KV cache not estimated — layer/head geometry is not in the sourced profile. Longer context may not fit.

## Passt, unbewertet

 - [Muse Glimmer 30B](/models/meta__muse-glimmer-30b/) — Q5_K_M, 21,756 GiB unbewertet Bild Reasoning Werkzeuge
- [Ministral 3 14B 2512](/models/mistralai__ministral-14b-2512/) — Q8_0, 17,019 GiB unbewertet Bild Werkzeuge
- [Ministral 3 8B 2512](/models/mistralai__ministral-8b-2512/) — F16, 19,663 GiB unbewertet Bild Werkzeuge
- [Ministral 3 3B 2512](/models/mistralai__ministral-3b-2512/) — F16, 9,413 GiB unbewertet Bild Werkzeuge

## Was ein Upgrade tatsächlich kauft

Der Engpass für die Passung ist der GPU-Speicher. Mehr System-RAM lädt keine zusätzlichen Gewichte auf diese Karte.

| Geschätzte GiB | Neu möglich | Beispiel | Listenpreis |
| --- | --- | --- | --- |
| 48 GiB | [Gemma 4 31B](/models/google__gemma-4-31b-it/) — Q8_0 dasselbe Modell, höheres Quant | rtx a6000, rtx 6000 ada, rtx pro 6000 blackwell | Kein Endkunden-Listenpreis in dieser Datei |

Das nächste höher bewertete Katalogmodell ist Kimi K3, und selbst Q4_K_M will 1691,5 GiB. Das ist keine Desktop-Karte.

NVIDIA 'Starting at' list prices as published 2026-08-25, not a store quote and not a used-market index. Street prices in August 2026 are often much higher (Tom's Hardware Newegg median RTX 5090 $4,699 vs $1,999 list). Last-gen 24 GB cards (4090, 3090) have no current NVIDIA starting-at in this file. Datacenter cards have no consumer list here. RAM DIMMs are not priced — they move weekly.

Upgrades nutzen dieselbe Passungsformel wie die Rangfolge. Listenpreise sind NVIDIA-Starting-at, Stand 2026-08-25. Straßenpreise liegen oft höher. Gebrauchte 24-GiB-Karten und Rechenzentrums-GPUs haben hier keine Liste. RAM-Riegel sind nicht bepreist.

## Passt nicht, oder nicht profiliert

 - cohere/command-a-plus — even Q4_K_M wants 132.618 GiB; pool is 24 GiB
- deepseek/deepseek-v4-flash-vision-exp — even Q4_K_M wants 184.902 GiB; pool is 24 GiB
- z-ai/glm-5.3 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
- qwen/qwen3.8-2.4t-a95b — even Q4_K_M wants 1450.719 GiB; pool is 24 GiB
- moonshotai/kimi-k3 — even Q4_K_M wants 1691.5 GiB; pool is 24 GiB
- z-ai/glm-5.2 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
- moonshotai/kimi-k2.7-code — even Q4_K_M wants 604.75 GiB; pool is 24 GiB
- nvidia/nemotron-3-ultra-550b-a55b — even Q4_K_M wants 333.063 GiB; pool is 24 GiB
- minimax/minimax-m3 — even Q4_K_M wants 259.405 GiB; pool is 24 GiB
- deepseek/deepseek-v4-pro — even Q4_K_M wants 967 GiB; pool is 24 GiB
- deepseek/deepseek-v4-flash — even Q4_K_M wants 172.465 GiB; pool is 24 GiB
- mistralai/mistral-small-2603 — even Q4_K_M wants 73.2 GiB; pool is 24 GiB
- mistralai/mistral-large-2512 — even Q4_K_M wants 408.531 GiB; pool is 24 GiB
- deepseek/deepseek-v3.2 — even Q4_K_M wants 406.116 GiB; pool is 24 GiB
- openai/gpt-oss-120b — even Q4_K_M wants 72.201 GiB; pool is 24 GiB
- meta-llama/llama-4-maverick — even Q4_K_M wants 242.5 GiB; pool is 24 GiB
- meta-llama/llama-4-scout — even Q4_K_M wants 66.809 GiB; pool is 24 GiB
- cohere/command-a — even Q4_K_M wants 68.016 GiB; pool is 24 GiB

## Zusatzangaben (optional)

Ändert die Rangfolge nicht. Optionale KI-Analyse Ihrer Angaben gegen die Zahlen oben, mit den stärksten Modellen von NVIDIA NIM.

 Mit KI analysieren

## Wie die Zahl entsteht

Gewichte: eine gemessene GGUF-Größe, wenn wir eine haben, sonst Gesamtparameter × Bits pro Gewicht ÷ 8. Q4_K_M gilt als 4,83 Bits/Param. MoE-Speicher nutzt Gesamtparameter, nicht aktive Parameter.

KV-Cache, wenn Schicht- und Kopfgeometrie belegt ist: 2 × kvLayers × kvHeads × headDim × Kontext × 2 Bytes (FP16, Batch 1). Hybridmodelle nutzen die Zahl der Attention-Schichten, nicht jede Schicht. Fehlt die Geometrie, entfällt der Cache und das steht da.

1 GiB kommen für CUDA/Laufzeit dazu. Apples Unified Memory nutzt RAM als Pool. Nur-CPU ist eine Speicherpassung, kein Geschwindigkeitsversprechen. Die DDR-Generation ändert die Bandbreite, nicht ob die Gewichte in den Speicher passen.

Nur Katalogzeilen mit openWeights=true sind Kandidaten. 25 solche Zeilen gibt es; 25 haben belegte Größen. Unbewertete, die passen, stehen getrennt. Eine höhere Zahl heißt kein Drop-in-Ersatz.

RAM-Typ (DDR4/DDR5/LPDDR) ist kein Feld. Er ändert nicht, ob ein Modell passt.

## Continue your investigation

 - [Inspect open-weight models](/de/open-weights/)
- [Compare model variants · English](/families/)
- [Review requirements · English](/compare/)
- [Find serving tools · English](/tools/)
