स्वयं-होस्टिंग
RAM और यह कि आपके पास GPU है या नहीं — इतना पर्याप्त है। बाकी सब वैकल्पिक है। क्रम स्रोत-सहित पैरामीटर संख्याओं पर गणित है; विजेता NVIDIA नहीं चुनता।
20 प्रोफ़ाइल किए गए खुले-भार मॉडलों में से 6, 8192 संदर्भ पर 24 GiB (vram) में समाते हैं। समाने वालों में सर्वोच्च आँका गया: Qwen3.8 27B (Q5_K_M)।
VRAM as entered. Driver reservation is inside the 1 GiB overhead, not extra.
32 GiB Qwen3.8 27B का क्वांटीकरण Q8_0 तक बढ़ाता है। वही मॉडल है, बुद्धिमत्ता अंक ऊँचा नहीं होता।
समाने वाले मॉडलों में
समाने वाले मॉडलों में Qwen3.8 27B के Artificial Analysis अंक बुद्धिमत्ता (52), प्रोग्रामिंग (68.1) और एजेंटिक (50.9) — तीनों में सर्वाधिक हैं।
समाने वालों में सर्वाधिक LMArena एलो: Gemma 4 31B 1441.7। एलो मानवीय पसंद का पैमाना है, बुद्धिमत्ता सूचकांक नहीं।
Artificial Analysis सूचकांक और LMArena एलो अलग-अलग पैमाने हैं। खाली खाना अमापित है, शून्य नहीं। किसी मॉडल की सर्वोच्च धुरी उसके अपने अंकों के सापेक्ष है, यह दावा नहीं कि वह सूची में अग्रणी है।
समाने वाले आँके गए मॉडल
| मॉडल | सामान्य | कोडिंग | एजेंटिक | मानवीय पसंद | जो क्वांटीकरण समाता है | अनुमानित GiB | गुंजाइश |
|---|---|---|---|---|---|---|---|
| Qwen3.8 27B | 52 | 68.1 | 50.9 | 1440.8 | Q5_K_M | 20.063 | 3.938 |
| Gemma 4 31B | 29.7 | 43.4 | 14.4 | 1441.7 | Q5_K_M | 22.106 | 1.894 |
| Olmo 3 32B Think | — | — | — | 1298.5 | Q4_K_M | 22.32 | 1.68 |
| Granite 4.1 8B | — | 9.5 | — | 1291.6 | F16 | 18.25 | 5.75 |
| Phi 4 | — | — | — | 1216.8 | Q8_0 | 17.438 | 6.563 |
- Hybrid: only 16 of 64 layers are Gated Attention. KV uses kvLayers=16, not nLayers=64. Measured Q4 is Unsloth UD-Q4_K_M, not a vanilla Q4_K_M.
समाते हैं, बिना आँके
- Muse Glimmer 30B — Q5_K_M, 21.756 GiB बिना आँका दृष्टितर्कउपकरण
उन्नयन वास्तव में क्या देता है
अड़चन GPU मेमोरी है। अधिक सिस्टम RAM इस कार्ड पर और भार नहीं चढ़ाएगा।
| अनुमानित GiB | क्या खुलता है | उदाहरण | सूची मूल्य |
|---|---|---|---|
| 32 GiB | Qwen3.8 27B — Q8_0वही मॉडल, ऊँचा क्वांटीकरण | GeForce RTX 5090 (32 GiB) | USD 1999 से आरंभ |
सूची में अगला अधिक ऊँचा आँका गया मॉडल Kimi K3 है, और Q4_K_M पर भी उसे 1691.5 GiB चाहिए। वह डेस्कटॉप कार्ड नहीं है।
NVIDIA 'Starting at' list prices as published 2026-08-25, not a store quote and not a used-market index. Street prices in August 2026 are often much higher (Tom's Hardware Newegg median RTX 5090 $4,699 vs $1,999 list). Last-gen 24 GB cards (4090, 3090) have no current NVIDIA starting-at in this file. Datacenter cards have no consumer list here. RAM DIMMs are not priced — they move weekly.
उन्नयन वही समाने का सूत्र प्रयोग करते हैं जो क्रम में है। सूची मूल्य NVIDIA के आरंभिक मूल्य हैं, 2026-08-25 के अनुसार। बाज़ार मूल्य प्रायः अधिक होते हैं। प्रयुक्त 24 GB कार्ड और डेटासेंटर GPU का यहाँ सूची मूल्य नहीं है। RAM मॉड्यूल का मूल्य नहीं दिया गया।
नहीं समाते, या प्रोफ़ाइल नहीं
- qwen/qwen3.8-2.4t-a95b — even Q4_K_M wants 1450.719 GiB; pool is 24 GiB
- moonshotai/kimi-k3 — even Q4_K_M wants 1691.5 GiB; pool is 24 GiB
- z-ai/glm-5.2 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
- moonshotai/kimi-k2.7-code — even Q4_K_M wants 604.75 GiB; pool is 24 GiB
- nvidia/nemotron-3-ultra-550b-a55b — even Q4_K_M wants 333.063 GiB; pool is 24 GiB
- minimax/minimax-m3 — even Q4_K_M wants 259.405 GiB; pool is 24 GiB
- deepseek/deepseek-v4-pro — even Q4_K_M wants 967 GiB; pool is 24 GiB
- deepseek/deepseek-v4-flash — even Q4_K_M wants 172.465 GiB; pool is 24 GiB
- mistralai/mistral-small-2603 — even Q4_K_M wants 73.2 GiB; pool is 24 GiB
- deepseek/deepseek-v3.2 — even Q4_K_M wants 406.116 GiB; pool is 24 GiB
- openai/gpt-oss-120b — even Q4_K_M wants 72.201 GiB; pool is 24 GiB
- meta-llama/llama-4-maverick — even Q4_K_M wants 242.5 GiB; pool is 24 GiB
- meta-llama/llama-4-scout — even Q4_K_M wants 66.809 GiB; pool is 24 GiB
- cohere/command-a — even Q4_K_M wants 68.016 GiB; pool is 24 GiB
अतिरिक्त विवरण (वैकल्पिक)
इससे क्रम नहीं बदलता। NVIDIA NIM के सबसे सक्षम मॉडलों से, ऊपर दिए आँकड़ों के सापेक्ष आपकी टिप्पणियों का वैकल्पिक AI विश्लेषण।
यह संख्या कैसे बनती है
भार: जब मापा गया GGUF आकार उपलब्ध हो तब वही, अन्यथा कुल पैरामीटर × प्रति भार बिट ÷ 8। Q4_K_M को प्रति पैरामीटर 4.83 बिट माना जाता है। MoE की मेमोरी सक्रिय नहीं, कुल पैरामीटर से गिनी जाती है।
KV कैश, जब परत और शीर्ष की संरचना स्रोत-सहित हो: 2 × kvLayers × kvHeads × headDim × संदर्भ × 2 बाइट (FP16, बैच 1)। संकर मॉडल सभी परतों के बजाय ध्यान-परतों की संख्या लेते हैं। संरचना न होने पर कैश छोड़ दिया जाता है और यह बताया जाता है।
CUDA और रनटाइम के लिए 1 GiB जोड़े जाते हैं। Apple की एकीकृत मेमोरी RAM को ही पूल मानती है। केवल CPU मेमोरी की दृष्टि से समाना है, गति का दावा नहीं। समाने के आकलन में DDR पीढ़ी की उपेक्षा की जाती है — वह बैंडविड्थ बदलती है, यह नहीं कि भार मेमोरी में बैठते हैं या नहीं।
केवल openWeights=true वाली सूची पंक्तियाँ उम्मीदवार हैं। ऐसी 20 पंक्तियाँ हैं; 20 के आकार स्रोत-सहित हैं। समाने वाले बिना आँके मॉडल अलग सूचीबद्ध हैं। ऊँचा अंक सीधा प्रतिस्थापन नहीं दर्शाता।
RAM का प्रकार (DDR4/DDR5/LPDDR) कोई क्षेत्र नहीं है। इससे यह नहीं बदलता कि मॉडल समाता है या नहीं।