Swa-hosting

RAM dan apakah Anda punya GPU sudah cukup. Selebihnya opsional. Peringkat adalah aritmetika atas jumlah parameter bersumber — bukan NVIDIA yang memilih pemenangnya.

25 baris katalog ditandai bobot terbuka. Selain itu bukan kandidat.
25 di antaranya punya jumlah parameter bersumber. Sisanya tercantum sebagai tidak diketahui, bukan ditebak.
1 GiB kelonggaran runtime, dinyatakan, bukan diukur di mesin Anda.
GPU
Sistem operasi (opsional — hanya perangkat lunak)
Konteks yang dianggarkan
Cache KV tumbuh mengikutinya. Kami tidak mengandaikan angka maksimum pada kartu model.

7 dari 25 model bobot terbuka berprofil muat dalam 24 GiB (vram) pada konteks 8192. Terbaik yang muat: Gemma 4 31B (Q5_K_M).

Bobot 21,106 GiB KV tidak diperkirakan Runtime 1 GiB Kelonggaran 1,9 GiB / 24 GiB

VRAM as entered. Driver reservation is inside the 1 GiB overhead, not extra.

48 GiB menaikkan kuantisasi Gemma 4 31B ke Q8_0. Model yang sama, bukan skor kecerdasan yang lebih tinggi.

Di antara model yang muat

Elo LMArena tertinggi di antara yang muat: Gemma 4 31B 1443,4. Elo adalah skala preferensi manusia, bukan indeks kecerdasan.

The arena boards are separate scales and are never blended. A missing cell is unmeasured, not zero. A model’s highest axis is relative to its own scores, not a claim it leads the catalogue.

Model bernilai yang muat

ModelPreferensi manusiaKuantisasi yang muatPerkiraan GiBKelonggaran
Gemma 4 31B
penglihatanvideopenalaranperkakas
1443,4Q5_K_M22,1061,894
Qwen3.8 27B
penglihatanvideopenalaranperkakas
1440,7Q5_K_M20,0633,938
Phi 4 1216,7Q8_017,4386,563
  • KV heads and head dim are not in the public size table we used. Cache is not estimated.
  • KV cache not estimated — layer/head geometry is not in the sourced profile. Longer context may not fit.

Muat, tanpa nilai

Apa yang sebenarnya dibeli oleh peningkatan

Kendalanya adalah memori GPU. Menambah RAM sistem tidak akan memuat bobot tambahan ke kartu ini.

Perkiraan GiBMembukaContohHarga daftar
48 GiBGemma 4 31B — Q8_0model sama, kuantisasi lebih tinggirtx a6000, rtx 6000 ada, rtx pro 6000 blackwellTidak ada harga konsumen di berkas ini

Model katalog bernilai lebih tinggi berikutnya adalah Kimi K3, dan bahkan Q4_K_M menuntut 1691,5 GiB. Itu bukan kartu desktop.

NVIDIA 'Starting at' list prices as published 2026-08-25, not a store quote and not a used-market index. Street prices in August 2026 are often much higher (Tom's Hardware Newegg median RTX 5090 $4,699 vs $1,999 list). Last-gen 24 GB cards (4090, 3090) have no current NVIDIA starting-at in this file. Datacenter cards have no consumer list here. RAM DIMMs are not priced — they move weekly.

Peningkatan memakai rumus kecocokan yang sama dengan peringkat. Harga daftar adalah harga mulai dari NVIDIA, bertanggal 2026-08-25. Harga pasar sering lebih tinggi. Kartu 24 GB bekas dan GPU pusat data tidak punya harga daftar di sini. Modul RAM tidak diberi harga.

Tidak muat, atau tanpa profil

  • cohere/command-a-plus — even Q4_K_M wants 132.618 GiB; pool is 24 GiB
  • deepseek/deepseek-v4-flash-vision-exp — even Q4_K_M wants 184.902 GiB; pool is 24 GiB
  • z-ai/glm-5.3 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
  • qwen/qwen3.8-2.4t-a95b — even Q4_K_M wants 1450.719 GiB; pool is 24 GiB
  • moonshotai/kimi-k3 — even Q4_K_M wants 1691.5 GiB; pool is 24 GiB
  • z-ai/glm-5.2 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
  • moonshotai/kimi-k2.7-code — even Q4_K_M wants 604.75 GiB; pool is 24 GiB
  • nvidia/nemotron-3-ultra-550b-a55b — even Q4_K_M wants 333.063 GiB; pool is 24 GiB
  • minimax/minimax-m3 — even Q4_K_M wants 259.405 GiB; pool is 24 GiB
  • deepseek/deepseek-v4-pro — even Q4_K_M wants 967 GiB; pool is 24 GiB
  • deepseek/deepseek-v4-flash — even Q4_K_M wants 172.465 GiB; pool is 24 GiB
  • mistralai/mistral-small-2603 — even Q4_K_M wants 73.2 GiB; pool is 24 GiB
  • mistralai/mistral-large-2512 — even Q4_K_M wants 408.531 GiB; pool is 24 GiB
  • deepseek/deepseek-v3.2 — even Q4_K_M wants 406.116 GiB; pool is 24 GiB
  • openai/gpt-oss-120b — even Q4_K_M wants 72.201 GiB; pool is 24 GiB
  • meta-llama/llama-4-maverick — even Q4_K_M wants 242.5 GiB; pool is 24 GiB
  • meta-llama/llama-4-scout — even Q4_K_M wants 66.809 GiB; pool is 24 GiB
  • cohere/command-a — even Q4_K_M wants 68.016 GiB; pool is 24 GiB

Detail tambahan (opsional)

Tidak mengubah peringkat. Analisis AI opsional atas catatan Anda terhadap angka di atas, memakai model terkuat NVIDIA NIM.

Bagaimana angka itu dibuat

Bobot: ukuran GGUF terukur bila kami punya, jika tidak parameter total × bit per bobot ÷ 8. Q4_K_M diperlakukan sebagai 4,83 bit per parameter. Memori MoE memakai parameter total, bukan parameter aktif.

Cache KV, bila geometri lapisan dan kepala bersumber: 2 × kvLayers × kvHeads × headDim × konteks × 2 bita (FP16, batch 1). Model hibrida memakai jumlah lapisan atensi, bukan semua lapisan. Bila geometri tidak ada, cache dihilangkan dan hal itu dinyatakan.

1 GiB ditambahkan untuk CUDA dan runtime. Memori terpadu Apple memakai RAM sebagai kumpulannya. Hanya CPU adalah kecocokan memori, bukan klaim kecepatan. Generasi DDR diabaikan untuk kecocokan — ia mengubah bandwidth, bukan apakah bobot muat di memori.

Hanya baris katalog dengan openWeights=true yang menjadi kandidat. Ada 25 baris seperti itu; 25 punya ukuran bersumber. Model tanpa nilai yang muat didaftar terpisah. Skor lebih tinggi tidak berarti pengganti langsung.

Jenis RAM (DDR4/DDR5/LPDDR) bukan sebuah kolom. Ia tidak mengubah apakah sebuah model muat.

Bukti & tanya