---
title: "स्वयं-होस्टिंग — इस मशीन पर कौन-सा खुले-भार वाला मॉडल समाता है · Undominated.ai"
canonical: https://undominated.ai/hi/self-host/
description: "RAM और GPU मेमोरी के आधार पर सूची के उन खुले-भार वाले मॉडलों को क्रम में रखता है जो वास्तव में समाते हैं। गुणवत्ता आगे रहती है। बिना आँका शून्य नहीं है। पैरामीटर संख्या का अभाव अनुमान नहीं है।"
---

# स्वयं-होस्टिंग — इस मशीन पर कौन-सा खुले-भार वाला मॉडल समाता है · Undominated.ai

> RAM और GPU मेमोरी के आधार पर सूची के उन खुले-भार वाले मॉडलों को क्रम में रखता है जो वास्तव में समाते हैं। गुणवत्ता आगे रहती है। बिना आँका शून्य नहीं है। पैरामीटर संख्या का अभाव अनुमान नहीं है।

# स्वयं-होस्टिंग

RAM और यह कि आपके पास GPU है या नहीं — इतना पर्याप्त है। बाकी सब वैकल्पिक है। क्रम स्रोत-सहित पैरामीटर संख्याओं पर गणित है; विजेता NVIDIA नहीं चुनता।

 25 सूची पंक्तियाँ खुले-भार के रूप में चिह्नित हैं। इसके अलावा कुछ भी उम्मीदवार नहीं है।
 25 में स्रोत-सहित पैरामीटर संख्या है। शेष को अनुमानित नहीं, अज्ञात के रूप में सूचीबद्ध किया गया है।
 1 GiB रनटाइम गुंजाइश — यह घोषित है, आपकी मशीन पर मापी नहीं गई।

 [CPU 16 GiB](/self-host/cpu-16gb/)[8 GiB GPU](/self-host/8gb/)[10 GiB GPU](/self-host/10gb/)[12 GiB GPU](/self-host/12gb/)[16 GiB GPU](/self-host/16gb/)[20 GiB GPU](/self-host/20gb/)[24 GiB GPU](/self-host/24gb/)[32 GiB GPU](/self-host/32gb/)[40 GiB GPU](/self-host/40gb/)[48 GiB GPU](/self-host/48gb/)[80 GiB GPU](/self-host/80gb/)[94 GiB GPU](/self-host/94gb/)[96 GiB GPU](/self-host/96gb/)[192 GiB GPU](/self-host/192gb/)
 [RTX 5090](/self-host/rtx-5090/)[RTX 5080](/self-host/rtx-5080/)[RTX 5070 Ti](/self-host/rtx-5070-ti/)[RTX 5070](/self-host/rtx-5070/)[RTX 5060 Ti 16](/self-host/rtx-5060-ti-16/)[RTX 5060 Ti 8](/self-host/rtx-5060-ti-8/)[RTX 5060](/self-host/rtx-5060/)[RTX 5050](/self-host/rtx-5050/)[RTX 4090](/self-host/rtx-4090/)[RTX 4080](/self-host/rtx-4080/)[RTX 4070 Ti](/self-host/rtx-4070-ti/)[RTX 4070](/self-host/rtx-4070/)[RTX 4060 Ti 16](/self-host/rtx-4060-ti-16/)[RTX 4060 Ti 8](/self-host/rtx-4060-ti-8/)[RTX 4060](/self-host/rtx-4060/)[RTX 3090](/self-host/rtx-3090/)[RTX 3080 Ti](/self-host/rtx-3080-ti/)[RTX 3080 12](/self-host/rtx-3080-12/)[RTX 3080](/self-host/rtx-3080/)[RTX 3070 Ti](/self-host/rtx-3070-ti/)[RTX 3070](/self-host/rtx-3070/)[RTX 3060 Ti](/self-host/rtx-3060-ti/)[RTX 3060 8](/self-host/rtx-3060-8/)[RTX 3060](/self-host/rtx-3060/)[RTX A6000](/self-host/rtx-a6000/)[RTX A5000](/self-host/rtx-a5000/)[RTX A4000](/self-host/rtx-a4000/)[RTX 6000 ADA](/self-host/rtx-6000-ada/)[RTX 5000 ADA](/self-host/rtx-5000-ada/)[RTX PRO 6000 Blackwell](/self-host/rtx-pro-6000-blackwell/)[RTX PRO 5000 Blackwell](/self-host/rtx-pro-5000-blackwell/)[A100 80](/self-host/a100-80/)[A100 40](/self-host/a100-40/)[H100 NVL](/self-host/h100-nvl/)[H100](/self-host/h100/)[L40S](/self-host/l40s/)[T4](/self-host/t4/)[RX 7900 XTX](/self-host/rx-7900-xtx/)[RX 7900 XT](/self-host/rx-7900-xt/)[RX 6900 XT](/self-host/rx-6900-xt/)[RX 6800 XT](/self-host/rx-6800-xt/)[MI300X](/self-host/mi300x/)
 सिस्टम RAM GiB GPU कोई नहीं (CPU) NVIDIA AMD Apple Intel
 GPU मेमोरी GiB अनिवार्य, जब तक आप हमारी सूची का कोई कार्ड न बताएँ। Apple: इसे खाली छोड़ें; RAM ही पूल है। GPU का नाम (वैकल्पिक) GPU की संख्या ऑपरेटिंग सिस्टम (वैकल्पिक — केवल सॉफ़्टवेयर हेतु) छोड़ें Linux Windows macOS
 नियोजित संदर्भ 4K 8K 16K 32K
 KV कैश इसी के साथ बढ़ता है। हम मॉडल कार्ड की अधिकतम सीमा नहीं मान लेते।

25 प्रोफ़ाइल किए गए खुले-भार मॉडलों में से 7, 8192 संदर्भ पर 24 GiB (vram) में समाते हैं। समाने वालों में सर्वोच्च आँका गया: Gemma 4 31B (Q5_K_M)।

 ** ** **
 भार 21.106 GiB KV अनुमानित नहीं रनटाइम 1 GiB गुंजाइश 1.9 GiB / 24 GiB

VRAM as entered. Driver reservation is inside the 1 GiB overhead, not extra.

48 GiB Gemma 4 31B का क्वांटीकरण Q8_0 तक बढ़ाता है। वही मॉडल है, बुद्धिमत्ता अंक ऊँचा नहीं होता।

## समाने वाले मॉडलों में

समाने वालों में सर्वाधिक LMArena एलो: Gemma 4 31B 1443.4। एलो मानवीय पसंद का पैमाना है, बुद्धिमत्ता सूचकांक नहीं।

The arena boards are separate scales and are never blended. A missing cell is unmeasured, not zero. A model’s highest axis is relative to its own scores, not a claim it leads the catalogue.

## समाने वाले आँके गए मॉडल

| मॉडल | मानवीय पसंद | जो क्वांटीकरण समाता है | अनुमानित GiB | गुंजाइश |
| --- | --- | --- | --- | --- |
| [Gemma 4 31B](/models/google__gemma-4-31b-it/) दृष्टि वीडियो तर्क उपकरण | 1443.4 | Q5_K_M | 22.106 | 1.894 |
| [Qwen3.8 27B](/models/qwen__qwen3.8-27b/) दृष्टि वीडियो तर्क उपकरण | 1440.7 | Q5_K_M | 20.063 | 3.938 |
| [Phi 4](/models/microsoft__phi-4/) | 1216.7 | Q8_0 | 17.438 | 6.563 |

 - KV heads and head dim are not in the public size table we used. Cache is not estimated.
- KV cache not estimated — layer/head geometry is not in the sourced profile. Longer context may not fit.

## समाते हैं, बिना आँके

 - [Muse Glimmer 30B](/models/meta__muse-glimmer-30b/) — Q5_K_M, 21.756 GiB बिना आँका दृष्टि तर्क उपकरण
- [Ministral 3 14B 2512](/models/mistralai__ministral-14b-2512/) — Q8_0, 17.019 GiB बिना आँका दृष्टि उपकरण
- [Ministral 3 8B 2512](/models/mistralai__ministral-8b-2512/) — F16, 19.663 GiB बिना आँका दृष्टि उपकरण
- [Ministral 3 3B 2512](/models/mistralai__ministral-3b-2512/) — F16, 9.413 GiB बिना आँका दृष्टि उपकरण

## उन्नयन वास्तव में क्या देता है

अड़चन GPU मेमोरी है। अधिक सिस्टम RAM इस कार्ड पर और भार नहीं चढ़ाएगा।

| अनुमानित GiB | क्या खुलता है | उदाहरण | सूची मूल्य |
| --- | --- | --- | --- |
| 48 GiB | [Gemma 4 31B](/models/google__gemma-4-31b-it/) — Q8_0 वही मॉडल, ऊँचा क्वांटीकरण | rtx a6000, rtx 6000 ada, rtx pro 6000 blackwell | इस फ़ाइल में उपभोक्ता मूल्य नहीं |

सूची में अगला अधिक ऊँचा आँका गया मॉडल Kimi K3 है, और Q4_K_M पर भी उसे 1691.5 GiB चाहिए। वह डेस्कटॉप कार्ड नहीं है।

NVIDIA 'Starting at' list prices as published 2026-08-25, not a store quote and not a used-market index. Street prices in August 2026 are often much higher (Tom's Hardware Newegg median RTX 5090 $4,699 vs $1,999 list). Last-gen 24 GB cards (4090, 3090) have no current NVIDIA starting-at in this file. Datacenter cards have no consumer list here. RAM DIMMs are not priced — they move weekly.

उन्नयन वही समाने का सूत्र प्रयोग करते हैं जो क्रम में है। सूची मूल्य NVIDIA के आरंभिक मूल्य हैं, 2026-08-25 के अनुसार। बाज़ार मूल्य प्रायः अधिक होते हैं। प्रयुक्त 24 GB कार्ड और डेटासेंटर GPU का यहाँ सूची मूल्य नहीं है। RAM मॉड्यूल का मूल्य नहीं दिया गया।

## नहीं समाते, या प्रोफ़ाइल नहीं

 - cohere/command-a-plus — even Q4_K_M wants 132.618 GiB; pool is 24 GiB
- deepseek/deepseek-v4-flash-vision-exp — even Q4_K_M wants 184.902 GiB; pool is 24 GiB
- z-ai/glm-5.3 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
- qwen/qwen3.8-2.4t-a95b — even Q4_K_M wants 1450.719 GiB; pool is 24 GiB
- moonshotai/kimi-k3 — even Q4_K_M wants 1691.5 GiB; pool is 24 GiB
- z-ai/glm-5.2 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
- moonshotai/kimi-k2.7-code — even Q4_K_M wants 604.75 GiB; pool is 24 GiB
- nvidia/nemotron-3-ultra-550b-a55b — even Q4_K_M wants 333.063 GiB; pool is 24 GiB
- minimax/minimax-m3 — even Q4_K_M wants 259.405 GiB; pool is 24 GiB
- deepseek/deepseek-v4-pro — even Q4_K_M wants 967 GiB; pool is 24 GiB
- deepseek/deepseek-v4-flash — even Q4_K_M wants 172.465 GiB; pool is 24 GiB
- mistralai/mistral-small-2603 — even Q4_K_M wants 73.2 GiB; pool is 24 GiB
- mistralai/mistral-large-2512 — even Q4_K_M wants 408.531 GiB; pool is 24 GiB
- deepseek/deepseek-v3.2 — even Q4_K_M wants 406.116 GiB; pool is 24 GiB
- openai/gpt-oss-120b — even Q4_K_M wants 72.201 GiB; pool is 24 GiB
- meta-llama/llama-4-maverick — even Q4_K_M wants 242.5 GiB; pool is 24 GiB
- meta-llama/llama-4-scout — even Q4_K_M wants 66.809 GiB; pool is 24 GiB
- cohere/command-a — even Q4_K_M wants 68.016 GiB; pool is 24 GiB

## अतिरिक्त विवरण (वैकल्पिक)

इससे क्रम नहीं बदलता। NVIDIA NIM के सबसे सक्षम मॉडलों से, ऊपर दिए आँकड़ों के सापेक्ष आपकी टिप्पणियों का वैकल्पिक AI विश्लेषण।

 AI से विश्लेषण करें

## यह संख्या कैसे बनती है

भार: जब मापा गया GGUF आकार उपलब्ध हो तब वही, अन्यथा कुल पैरामीटर × प्रति भार बिट ÷ 8। Q4_K_M को प्रति पैरामीटर 4.83 बिट माना जाता है। MoE की मेमोरी सक्रिय नहीं, कुल पैरामीटर से गिनी जाती है।

KV कैश, जब परत और शीर्ष की संरचना स्रोत-सहित हो: 2 × kvLayers × kvHeads × headDim × संदर्भ × 2 बाइट (FP16, बैच 1)। संकर मॉडल सभी परतों के बजाय ध्यान-परतों की संख्या लेते हैं। संरचना न होने पर कैश छोड़ दिया जाता है और यह बताया जाता है।

CUDA और रनटाइम के लिए 1 GiB जोड़े जाते हैं। Apple की एकीकृत मेमोरी RAM को ही पूल मानती है। केवल CPU मेमोरी की दृष्टि से समाना है, गति का दावा नहीं। समाने के आकलन में DDR पीढ़ी की उपेक्षा की जाती है — वह बैंडविड्थ बदलती है, यह नहीं कि भार मेमोरी में बैठते हैं या नहीं।

केवल openWeights=true वाली सूची पंक्तियाँ उम्मीदवार हैं। ऐसी 25 पंक्तियाँ हैं; 25 के आकार स्रोत-सहित हैं। समाने वाले बिना आँके मॉडल अलग सूचीबद्ध हैं। ऊँचा अंक सीधा प्रतिस्थापन नहीं दर्शाता।

RAM का प्रकार (DDR4/DDR5/LPDDR) कोई क्षेत्र नहीं है। इससे यह नहीं बदलता कि मॉडल समाता है या नहीं।

## Continue your investigation

 - [Inspect open-weight models · English](/open-weights/)
- [Compare model variants · English](/families/)
- [Review requirements · English](/compare/)
- [Find serving tools · English](/tools/)
