Swa-hosting

RAM dan apakah Anda punya GPU sudah cukup. Selebihnya opsional. Peringkat adalah aritmetika atas jumlah parameter bersumber — bukan NVIDIA yang memilih pemenangnya.

20 baris katalog ditandai bobot terbuka. Selain itu bukan kandidat.
20 di antaranya punya jumlah parameter bersumber. Sisanya tercantum sebagai tidak diketahui, bukan ditebak.
1 GiB kelonggaran runtime, dinyatakan, bukan diukur di mesin Anda.
GPU
Sistem operasi (opsional — hanya perangkat lunak)
Konteks yang dianggarkan
Cache KV tumbuh mengikutinya. Kami tidak mengandaikan angka maksimum pada kartu model.

6 dari 20 model bobot terbuka berprofil muat dalam 24 GiB (vram) pada konteks 8192. Terbaik yang muat: Qwen3.8 27B (Q5_K_M).

Bobot 18.563 GiB Cache KV 0.5 GiB Runtime 1 GiB Kelonggaran 3.9 GiB / 24 GiB

VRAM as entered. Driver reservation is inside the 1 GiB overhead, not extra.

32 GiB menaikkan kuantisasi Qwen3.8 27B ke Q8_0. Model yang sama, bukan skor kecerdasan yang lebih tinggi.

Di antara model yang muat

Qwen3.8 27B memiliki skor Artificial Analysis tertinggi untuk kecerdasan (52), pemrograman (68.1), dan agentik (50.9) di antara model yang muat.

Elo LMArena tertinggi di antara yang muat: Gemma 4 31B 1441.7. Elo adalah skala preferensi manusia, bukan indeks kecerdasan.

Indeks Artificial Analysis dan Elo LMArena adalah skala berbeda. Sel kosong berarti belum diukur, bukan nol. Sumbu tertinggi sebuah model relatif terhadap skornya sendiri, bukan klaim memimpin katalog.

Model bernilai yang muat

ModelUmumCodingAgentikPreferensi manusiaKuantisasi yang muatPerkiraan GiBKelonggaran
Qwen3.8 27B
Puncak AA: Coding penglihatanvideopenalaranperkakas
5268.150.91440.8Q5_K_M20.0633.938
Gemma 4 31B
Puncak AA: Coding penglihatanvideopenalaranperkakas
29.743.414.41441.7Q5_K_M22.1061.894
Olmo 3 32B Think
penalaran
1298.5Q4_K_M22.321.68
Granite 4.1 8B
perkakas
9.51291.6F1618.255.75
Phi 4 1216.8Q8_017.4386.563
  • Hybrid: only 16 of 64 layers are Gated Attention. KV uses kvLayers=16, not nLayers=64. Measured Q4 is Unsloth UD-Q4_K_M, not a vanilla Q4_K_M.

Muat, tanpa nilai

  • Muse Glimmer 30B — Q5_K_M, 21.756 GiB tidak dinilai penglihatanpenalaranperkakas

Apa yang sebenarnya dibeli oleh peningkatan

Kendalanya adalah memori GPU. Menambah RAM sistem tidak akan memuat bobot tambahan ke kartu ini.

Perkiraan GiBMembukaContohHarga daftar
32 GiBQwen3.8 27B — Q8_0model sama, kuantisasi lebih tinggiGeForce RTX 5090 (32 GiB)USD 1999 mulai dari

Model katalog bernilai lebih tinggi berikutnya adalah Kimi K3, dan bahkan Q4_K_M menuntut 1691.5 GiB. Itu bukan kartu desktop.

NVIDIA 'Starting at' list prices as published 2026-08-25, not a store quote and not a used-market index. Street prices in August 2026 are often much higher (Tom's Hardware Newegg median RTX 5090 $4,699 vs $1,999 list). Last-gen 24 GB cards (4090, 3090) have no current NVIDIA starting-at in this file. Datacenter cards have no consumer list here. RAM DIMMs are not priced — they move weekly.

Peningkatan memakai rumus kecocokan yang sama dengan peringkat. Harga daftar adalah harga mulai dari NVIDIA, bertanggal 2026-08-25. Harga pasar sering lebih tinggi. Kartu 24 GB bekas dan GPU pusat data tidak punya harga daftar di sini. Modul RAM tidak diberi harga.

Tidak muat, atau tanpa profil

  • qwen/qwen3.8-2.4t-a95b — even Q4_K_M wants 1450.719 GiB; pool is 24 GiB
  • moonshotai/kimi-k3 — even Q4_K_M wants 1691.5 GiB; pool is 24 GiB
  • z-ai/glm-5.2 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
  • moonshotai/kimi-k2.7-code — even Q4_K_M wants 604.75 GiB; pool is 24 GiB
  • nvidia/nemotron-3-ultra-550b-a55b — even Q4_K_M wants 333.063 GiB; pool is 24 GiB
  • minimax/minimax-m3 — even Q4_K_M wants 259.405 GiB; pool is 24 GiB
  • deepseek/deepseek-v4-pro — even Q4_K_M wants 967 GiB; pool is 24 GiB
  • deepseek/deepseek-v4-flash — even Q4_K_M wants 172.465 GiB; pool is 24 GiB
  • mistralai/mistral-small-2603 — even Q4_K_M wants 73.2 GiB; pool is 24 GiB
  • deepseek/deepseek-v3.2 — even Q4_K_M wants 406.116 GiB; pool is 24 GiB
  • openai/gpt-oss-120b — even Q4_K_M wants 72.201 GiB; pool is 24 GiB
  • meta-llama/llama-4-maverick — even Q4_K_M wants 242.5 GiB; pool is 24 GiB
  • meta-llama/llama-4-scout — even Q4_K_M wants 66.809 GiB; pool is 24 GiB
  • cohere/command-a — even Q4_K_M wants 68.016 GiB; pool is 24 GiB

Detail tambahan (opsional)

Tidak mengubah peringkat. Analisis AI opsional atas catatan Anda terhadap angka di atas, memakai model terkuat NVIDIA NIM.

Bagaimana angka itu dibuat

Bobot: ukuran GGUF terukur bila kami punya, jika tidak parameter total × bit per bobot ÷ 8. Q4_K_M diperlakukan sebagai 4,83 bit per parameter. Memori MoE memakai parameter total, bukan parameter aktif.

Cache KV, bila geometri lapisan dan kepala bersumber: 2 × kvLayers × kvHeads × headDim × konteks × 2 bita (FP16, batch 1). Model hibrida memakai jumlah lapisan atensi, bukan semua lapisan. Bila geometri tidak ada, cache dihilangkan dan hal itu dinyatakan.

1 GiB ditambahkan untuk CUDA dan runtime. Memori terpadu Apple memakai RAM sebagai kumpulannya. Hanya CPU adalah kecocokan memori, bukan klaim kecepatan. Generasi DDR diabaikan untuk kecocokan — ia mengubah bandwidth, bukan apakah bobot muat di memori.

Hanya baris katalog dengan openWeights=true yang menjadi kandidat. Ada 20 baris seperti itu; 20 punya ukuran bersumber. Model tanpa nilai yang muat didaftar terpisah. Skor lebih tinggi tidak berarti pengganti langsung.

Jenis RAM (DDR4/DDR5/LPDDR) bukan sebuah kolom. Ia tidak mengubah apakah sebuah model muat.