Kendi sunucunda barındırma

RAM ve GPU’nuz olup olmadığı yeterlidir. Gerisi isteğe bağlıdır. Sıralama, kaynağı belirtilmiş parametre sayıları üzerindeki aritmetiktir — kazananı NVIDIA seçmez.

25 katalog satırı açık ağırlıklı olarak işaretli. Başka hiçbir şey aday değil.
25 tanesinin parametre sayısı kaynaklı. Geri kalanı tahmin edilmiş değil, bilinmiyor olarak listelenir.
1 GiB çalışma payı; belirtilmiştir, makinenizde ölçülmemiştir.
GPU
İşletim sistemi (isteğe bağlı — yalnızca yazılım)
Ayrılacak bağlam
KV önbelleği bununla birlikte büyür. Model kartındaki azami değeri varsaymayız.

25 profillenmiş açık ağırlıklı modelden 7 tanesi 8192 bağlamında 24 GiB (vram) içine sığıyor. Sığanlar arasında en iyi puanlı: Gemma 4 31B (Q5_K_M).

Ağırlıklar 21,106 GiB KV kestirilmedi Çalışma zamanı 1 GiB Pay 1,9 GiB / 24 GiB

VRAM as entered. Driver reservation is inside the 1 GiB overhead, not extra.

48 GiB, Gemma 4 31B modelinin nicelemesini Q8_0 düzeyine çıkarır. Aynı model; daha yüksek bir zekâ puanı değil.

Sığan modeller arasında

Sığanlar arasında en yüksek LMArena Elo: Gemma 4 31B 1443,4. Elo bir insan tercihi ölçeğidir, zekâ endeksi değildir.

The arena boards are separate scales and are never blended. A missing cell is unmeasured, not zero. A model’s highest axis is relative to its own scores, not a claim it leads the catalogue.

Sığan puanlanmış modeller

Modelİnsan tercihiSığan nicelemeTahmini GiBPay
Gemma 4 31B
görüvideoakıl yürütmearaçlar
1443,4Q5_K_M22,1061,894
Qwen3.8 27B
görüvideoakıl yürütmearaçlar
1440,7Q5_K_M20,0633,938
Phi 4 1216,7Q8_017,4386,563
  • KV heads and head dim are not in the public size table we used. Cache is not estimated.
  • KV cache not estimated — layer/head geometry is not in the sourced profile. Longer context may not fit.

Sığıyor, puanlanmamış

Yükseltme aslında ne kazandırır

Darboğaz GPU belleğidir. Daha fazla sistem RAM’i bu karta ek ağırlık yüklemez.

Tahmini GiBŞunu açarÖrnekListe fiyatı
48 GiBGemma 4 31B — Q8_0aynı model, daha yüksek nicelemertx a6000, rtx 6000 ada, rtx pro 6000 blackwellBu dosyada tüketici listesi yok

Katalogda bir üst puanlı model Kimi K3 ve Q4_K_M düzeyinde bile 1691,5 GiB istiyor. Bu bir masaüstü kartı değil.

NVIDIA 'Starting at' list prices as published 2026-08-25, not a store quote and not a used-market index. Street prices in August 2026 are often much higher (Tom's Hardware Newegg median RTX 5090 $4,699 vs $1,999 list). Last-gen 24 GB cards (4090, 3090) have no current NVIDIA starting-at in this file. Datacenter cards have no consumer list here. RAM DIMMs are not priced — they move weekly.

Yükseltmeler sıralamayla aynı sığdırma formülünü kullanır. Liste fiyatları NVIDIA’nın 2026-08-25 tarihli “başlangıç” fiyatlarıdır. Piyasa fiyatları çoğu zaman daha yüksektir. İkinci el 24 GB kartların ve veri merkezi GPU’larının burada liste fiyatı yoktur. RAM modülleri fiyatlandırılmaz.

Sığmıyor veya profillenmemiş

  • cohere/command-a-plus — even Q4_K_M wants 132.618 GiB; pool is 24 GiB
  • deepseek/deepseek-v4-flash-vision-exp — even Q4_K_M wants 184.902 GiB; pool is 24 GiB
  • z-ai/glm-5.3 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
  • qwen/qwen3.8-2.4t-a95b — even Q4_K_M wants 1450.719 GiB; pool is 24 GiB
  • moonshotai/kimi-k3 — even Q4_K_M wants 1691.5 GiB; pool is 24 GiB
  • z-ai/glm-5.2 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
  • moonshotai/kimi-k2.7-code — even Q4_K_M wants 604.75 GiB; pool is 24 GiB
  • nvidia/nemotron-3-ultra-550b-a55b — even Q4_K_M wants 333.063 GiB; pool is 24 GiB
  • minimax/minimax-m3 — even Q4_K_M wants 259.405 GiB; pool is 24 GiB
  • deepseek/deepseek-v4-pro — even Q4_K_M wants 967 GiB; pool is 24 GiB
  • deepseek/deepseek-v4-flash — even Q4_K_M wants 172.465 GiB; pool is 24 GiB
  • mistralai/mistral-small-2603 — even Q4_K_M wants 73.2 GiB; pool is 24 GiB
  • mistralai/mistral-large-2512 — even Q4_K_M wants 408.531 GiB; pool is 24 GiB
  • deepseek/deepseek-v3.2 — even Q4_K_M wants 406.116 GiB; pool is 24 GiB
  • openai/gpt-oss-120b — even Q4_K_M wants 72.201 GiB; pool is 24 GiB
  • meta-llama/llama-4-maverick — even Q4_K_M wants 242.5 GiB; pool is 24 GiB
  • meta-llama/llama-4-scout — even Q4_K_M wants 66.809 GiB; pool is 24 GiB
  • cohere/command-a — even Q4_K_M wants 68.016 GiB; pool is 24 GiB

Ek ayrıntılar (isteğe bağlı)

Sıralamayı değiştirmez. NVIDIA NIM’in en güçlü modellerini kullanarak notlarınızın yukarıdaki sayılarla karşılaştırıldığı isteğe bağlı yapay zekâ çözümlemesi.

Bu sayı nasıl bulunuyor

Ağırlıklar: elimizde varsa ölçülmüş GGUF boyutu, yoksa toplam parametre × ağırlık başına bit ÷ 8. Q4_K_M parametre başına 4,83 bit sayılır. MoE belleği etkin parametreleri değil, toplam parametreleri kullanır.

KV önbelleği, katman ve başlık geometrisi kaynaklıysa: 2 × kvLayers × kvHeads × headDim × bağlam × 2 bayt (FP16, yığın 1). Melez modeller her katmanı değil, dikkat katmanı sayısını kullanır. Geometri eksikse önbellek dışarıda bırakılır ve bu belirtilir.

CUDA ve çalışma zamanı için 1 GiB eklenir. Apple’ın birleşik belleği havuz olarak RAM’i kullanır. Yalnızca CPU bir bellek uyumudur, hız iddiası değildir. DDR kuşağı uyum hesabında yok sayılır — bant genişliğini değiştirir, ağırlıkların belleğe sığıp sığmadığını değil.

Yalnızca openWeights=true olan katalog satırları adaydır. Bu tür 25 satır var; 25 tanesinin boyutu kaynaklı. Sığan puanlanmamış modeller ayrıca listelenir. Daha yüksek puan, doğrudan yerine geçme anlamına gelmez.

RAM türü (DDR4/DDR5/LPDDR) bir alan değildir. Bir modelin sığıp sığmadığını değiştirmez.

Kanıt ve sorular