Swa-hosting
RAM dan apakah Anda punya GPU sudah cukup. Selebihnya opsional. Peringkat adalah aritmetika atas jumlah parameter bersumber — bukan NVIDIA yang memilih pemenangnya.
6 dari 20 model bobot terbuka berprofil muat dalam 24 GiB (vram) pada konteks 8192. Terbaik yang muat: Qwen3.8 27B (Q5_K_M).
VRAM as entered. Driver reservation is inside the 1 GiB overhead, not extra.
32 GiB menaikkan kuantisasi Qwen3.8 27B ke Q8_0. Model yang sama, bukan skor kecerdasan yang lebih tinggi.
Di antara model yang muat
Qwen3.8 27B memiliki skor Artificial Analysis tertinggi untuk kecerdasan (52), pemrograman (68.1), dan agentik (50.9) di antara model yang muat.
Elo LMArena tertinggi di antara yang muat: Gemma 4 31B 1441.7. Elo adalah skala preferensi manusia, bukan indeks kecerdasan.
Indeks Artificial Analysis dan Elo LMArena adalah skala berbeda. Sel kosong berarti belum diukur, bukan nol. Sumbu tertinggi sebuah model relatif terhadap skornya sendiri, bukan klaim memimpin katalog.
Model bernilai yang muat
| Model | Umum | Coding | Agentik | Preferensi manusia | Kuantisasi yang muat | Perkiraan GiB | Kelonggaran |
|---|---|---|---|---|---|---|---|
| Qwen3.8 27B | 52 | 68.1 | 50.9 | 1440.8 | Q5_K_M | 20.063 | 3.938 |
| Gemma 4 31B | 29.7 | 43.4 | 14.4 | 1441.7 | Q5_K_M | 22.106 | 1.894 |
| Olmo 3 32B Think | — | — | — | 1298.5 | Q4_K_M | 22.32 | 1.68 |
| Granite 4.1 8B | — | 9.5 | — | 1291.6 | F16 | 18.25 | 5.75 |
| Phi 4 | — | — | — | 1216.8 | Q8_0 | 17.438 | 6.563 |
- Hybrid: only 16 of 64 layers are Gated Attention. KV uses kvLayers=16, not nLayers=64. Measured Q4 is Unsloth UD-Q4_K_M, not a vanilla Q4_K_M.
Muat, tanpa nilai
- Muse Glimmer 30B — Q5_K_M, 21.756 GiB tidak dinilai penglihatanpenalaranperkakas
Apa yang sebenarnya dibeli oleh peningkatan
Kendalanya adalah memori GPU. Menambah RAM sistem tidak akan memuat bobot tambahan ke kartu ini.
| Perkiraan GiB | Membuka | Contoh | Harga daftar |
|---|---|---|---|
| 32 GiB | Qwen3.8 27B — Q8_0model sama, kuantisasi lebih tinggi | GeForce RTX 5090 (32 GiB) | USD 1999 mulai dari |
Model katalog bernilai lebih tinggi berikutnya adalah Kimi K3, dan bahkan Q4_K_M menuntut 1691.5 GiB. Itu bukan kartu desktop.
NVIDIA 'Starting at' list prices as published 2026-08-25, not a store quote and not a used-market index. Street prices in August 2026 are often much higher (Tom's Hardware Newegg median RTX 5090 $4,699 vs $1,999 list). Last-gen 24 GB cards (4090, 3090) have no current NVIDIA starting-at in this file. Datacenter cards have no consumer list here. RAM DIMMs are not priced — they move weekly.
Peningkatan memakai rumus kecocokan yang sama dengan peringkat. Harga daftar adalah harga mulai dari NVIDIA, bertanggal 2026-08-25. Harga pasar sering lebih tinggi. Kartu 24 GB bekas dan GPU pusat data tidak punya harga daftar di sini. Modul RAM tidak diberi harga.
Tidak muat, atau tanpa profil
- qwen/qwen3.8-2.4t-a95b — even Q4_K_M wants 1450.719 GiB; pool is 24 GiB
- moonshotai/kimi-k3 — even Q4_K_M wants 1691.5 GiB; pool is 24 GiB
- z-ai/glm-5.2 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
- moonshotai/kimi-k2.7-code — even Q4_K_M wants 604.75 GiB; pool is 24 GiB
- nvidia/nemotron-3-ultra-550b-a55b — even Q4_K_M wants 333.063 GiB; pool is 24 GiB
- minimax/minimax-m3 — even Q4_K_M wants 259.405 GiB; pool is 24 GiB
- deepseek/deepseek-v4-pro — even Q4_K_M wants 967 GiB; pool is 24 GiB
- deepseek/deepseek-v4-flash — even Q4_K_M wants 172.465 GiB; pool is 24 GiB
- mistralai/mistral-small-2603 — even Q4_K_M wants 73.2 GiB; pool is 24 GiB
- deepseek/deepseek-v3.2 — even Q4_K_M wants 406.116 GiB; pool is 24 GiB
- openai/gpt-oss-120b — even Q4_K_M wants 72.201 GiB; pool is 24 GiB
- meta-llama/llama-4-maverick — even Q4_K_M wants 242.5 GiB; pool is 24 GiB
- meta-llama/llama-4-scout — even Q4_K_M wants 66.809 GiB; pool is 24 GiB
- cohere/command-a — even Q4_K_M wants 68.016 GiB; pool is 24 GiB
Detail tambahan (opsional)
Tidak mengubah peringkat. Analisis AI opsional atas catatan Anda terhadap angka di atas, memakai model terkuat NVIDIA NIM.
Bagaimana angka itu dibuat
Bobot: ukuran GGUF terukur bila kami punya, jika tidak parameter total × bit per bobot ÷ 8. Q4_K_M diperlakukan sebagai 4,83 bit per parameter. Memori MoE memakai parameter total, bukan parameter aktif.
Cache KV, bila geometri lapisan dan kepala bersumber: 2 × kvLayers × kvHeads × headDim × konteks × 2 bita (FP16, batch 1). Model hibrida memakai jumlah lapisan atensi, bukan semua lapisan. Bila geometri tidak ada, cache dihilangkan dan hal itu dinyatakan.
1 GiB ditambahkan untuk CUDA dan runtime. Memori terpadu Apple memakai RAM sebagai kumpulannya. Hanya CPU adalah kecocokan memori, bukan klaim kecepatan. Generasi DDR diabaikan untuk kecocokan — ia mengubah bandwidth, bukan apakah bobot muat di memori.
Hanya baris katalog dengan openWeights=true yang menjadi kandidat. Ada 20 baris seperti itu; 20 punya ukuran bersumber. Model tanpa nilai yang muat didaftar terpisah. Skor lebih tinggi tidak berarti pengganti langsung.
Jenis RAM (DDR4/DDR5/LPDDR) bukan sebuah kolom. Ia tidak mengubah apakah sebuah model muat.