Kendi sunucunda barındırma

RAM ve GPU’nuz olup olmadığı yeterlidir. Gerisi isteğe bağlıdır. Sıralama, kaynağı belirtilmiş parametre sayıları üzerindeki aritmetiktir — kazananı NVIDIA seçmez.

20 katalog satırı açık ağırlıklı olarak işaretli. Başka hiçbir şey aday değil.
20 tanesinin parametre sayısı kaynaklı. Geri kalanı tahmin edilmiş değil, bilinmiyor olarak listelenir.
1 GiB çalışma payı; belirtilmiştir, makinenizde ölçülmemiştir.
GPU
İşletim sistemi (isteğe bağlı — yalnızca yazılım)
Ayrılacak bağlam
KV önbelleği bununla birlikte büyür. Model kartındaki azami değeri varsaymayız.

20 profillenmiş açık ağırlıklı modelden 6 tanesi 8192 bağlamında 24 GiB (vram) içine sığıyor. Sığanlar arasında en iyi puanlı: Qwen3.8 27B (Q5_K_M).

Ağırlıklar 18.563 GiB KV önbelleği 0.5 GiB Çalışma zamanı 1 GiB Pay 3.9 GiB / 24 GiB

VRAM as entered. Driver reservation is inside the 1 GiB overhead, not extra.

32 GiB, Qwen3.8 27B modelinin nicelemesini Q8_0 düzeyine çıkarır. Aynı model; daha yüksek bir zekâ puanı değil.

Sığan modeller arasında

Qwen3.8 27B, sığan modeller arasında zekâ (52), kodlama (68.1) ve etmen (50.9) alanlarında en yüksek Artificial Analysis puanlarına sahip.

Sığanlar arasında en yüksek LMArena Elo: Gemma 4 31B 1441.7. Elo bir insan tercihi ölçeğidir, zekâ endeksi değildir.

Artificial Analysis endeksleri ile LMArena Elo farklı ölçeklerdir. Boş bir hücre ölçülmemiştir, sıfır değildir. Bir modelin en yüksek ekseni kendi puanlarına görecelidir; katalogda başı çektiği iddiası değildir.

Sığan puanlanmış modeller

ModelGenelKodlamaAjanİnsan tercihiSığan nicelemeTahmini GiBPay
Qwen3.8 27B
AA zirvesi: Kodlama görüvideoakıl yürütmearaçlar
5268.150.91440.8Q5_K_M20.0633.938
Gemma 4 31B
AA zirvesi: Kodlama görüvideoakıl yürütmearaçlar
29.743.414.41441.7Q5_K_M22.1061.894
Olmo 3 32B Think
akıl yürütme
1298.5Q4_K_M22.321.68
Granite 4.1 8B
araçlar
9.51291.6F1618.255.75
Phi 4 1216.8Q8_017.4386.563
  • Hybrid: only 16 of 64 layers are Gated Attention. KV uses kvLayers=16, not nLayers=64. Measured Q4 is Unsloth UD-Q4_K_M, not a vanilla Q4_K_M.

Sığıyor, puanlanmamış

  • Muse Glimmer 30B — Q5_K_M, 21.756 GiB puanlanmamış görüakıl yürütmearaçlar

Yükseltme aslında ne kazandırır

Darboğaz GPU belleğidir. Daha fazla sistem RAM’i bu karta ek ağırlık yüklemez.

Tahmini GiBŞunu açarÖrnekListe fiyatı
32 GiBQwen3.8 27B — Q8_0aynı model, daha yüksek nicelemeGeForce RTX 5090 (32 GiB)USD 1999 başlangıç

Katalogda bir üst puanlı model Kimi K3 ve Q4_K_M düzeyinde bile 1691.5 GiB istiyor. Bu bir masaüstü kartı değil.

NVIDIA 'Starting at' list prices as published 2026-08-25, not a store quote and not a used-market index. Street prices in August 2026 are often much higher (Tom's Hardware Newegg median RTX 5090 $4,699 vs $1,999 list). Last-gen 24 GB cards (4090, 3090) have no current NVIDIA starting-at in this file. Datacenter cards have no consumer list here. RAM DIMMs are not priced — they move weekly.

Yükseltmeler sıralamayla aynı sığdırma formülünü kullanır. Liste fiyatları NVIDIA’nın 2026-08-25 tarihli “başlangıç” fiyatlarıdır. Piyasa fiyatları çoğu zaman daha yüksektir. İkinci el 24 GB kartların ve veri merkezi GPU’larının burada liste fiyatı yoktur. RAM modülleri fiyatlandırılmaz.

Sığmıyor veya profillenmemiş

  • qwen/qwen3.8-2.4t-a95b — even Q4_K_M wants 1450.719 GiB; pool is 24 GiB
  • moonshotai/kimi-k3 — even Q4_K_M wants 1691.5 GiB; pool is 24 GiB
  • z-ai/glm-5.2 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
  • moonshotai/kimi-k2.7-code — even Q4_K_M wants 604.75 GiB; pool is 24 GiB
  • nvidia/nemotron-3-ultra-550b-a55b — even Q4_K_M wants 333.063 GiB; pool is 24 GiB
  • minimax/minimax-m3 — even Q4_K_M wants 259.405 GiB; pool is 24 GiB
  • deepseek/deepseek-v4-pro — even Q4_K_M wants 967 GiB; pool is 24 GiB
  • deepseek/deepseek-v4-flash — even Q4_K_M wants 172.465 GiB; pool is 24 GiB
  • mistralai/mistral-small-2603 — even Q4_K_M wants 73.2 GiB; pool is 24 GiB
  • deepseek/deepseek-v3.2 — even Q4_K_M wants 406.116 GiB; pool is 24 GiB
  • openai/gpt-oss-120b — even Q4_K_M wants 72.201 GiB; pool is 24 GiB
  • meta-llama/llama-4-maverick — even Q4_K_M wants 242.5 GiB; pool is 24 GiB
  • meta-llama/llama-4-scout — even Q4_K_M wants 66.809 GiB; pool is 24 GiB
  • cohere/command-a — even Q4_K_M wants 68.016 GiB; pool is 24 GiB

Ek ayrıntılar (isteğe bağlı)

Sıralamayı değiştirmez. NVIDIA NIM’in en güçlü modellerini kullanarak notlarınızın yukarıdaki sayılarla karşılaştırıldığı isteğe bağlı yapay zekâ çözümlemesi.

Bu sayı nasıl bulunuyor

Ağırlıklar: elimizde varsa ölçülmüş GGUF boyutu, yoksa toplam parametre × ağırlık başına bit ÷ 8. Q4_K_M parametre başına 4,83 bit sayılır. MoE belleği etkin parametreleri değil, toplam parametreleri kullanır.

KV önbelleği, katman ve başlık geometrisi kaynaklıysa: 2 × kvLayers × kvHeads × headDim × bağlam × 2 bayt (FP16, yığın 1). Melez modeller her katmanı değil, dikkat katmanı sayısını kullanır. Geometri eksikse önbellek dışarıda bırakılır ve bu belirtilir.

CUDA ve çalışma zamanı için 1 GiB eklenir. Apple’ın birleşik belleği havuz olarak RAM’i kullanır. Yalnızca CPU bir bellek uyumudur, hız iddiası değildir. DDR kuşağı uyum hesabında yok sayılır — bant genişliğini değiştirir, ağırlıkların belleğe sığıp sığmadığını değil.

Yalnızca openWeights=true olan katalog satırları adaydır. Bu tür 20 satır var; 20 tanesinin boyutu kaynaklı. Sığan puanlanmamış modeller ayrıca listelenir. Daha yüksek puan, doğrudan yerine geçme anlamına gelmez.

RAM türü (DDR4/DDR5/LPDDR) bir alan değildir. Bir modelin sığıp sığmadığını değiştirmez.