---
title: "Swa-hosting — model bobot terbuka mana yang muat di mesin ini · Undominated.ai"
canonical: https://undominated.ai/id/self-host/
description: "Dari RAM dan memori GPU, mengurutkan model bobot terbuka di katalog yang benar-benar muat. Mutu memimpin. Tidak dinilai bukan nol. Jumlah parameter yang hilang bukan tebakan."
---

# Swa-hosting — model bobot terbuka mana yang muat di mesin ini · Undominated.ai

> Dari RAM dan memori GPU, mengurutkan model bobot terbuka di katalog yang benar-benar muat. Mutu memimpin. Tidak dinilai bukan nol. Jumlah parameter yang hilang bukan tebakan.

# Swa-hosting

RAM dan apakah Anda punya GPU sudah cukup. Selebihnya opsional. Peringkat adalah aritmetika atas jumlah parameter bersumber — bukan NVIDIA yang memilih pemenangnya.

 20 baris katalog ditandai bobot terbuka. Selain itu bukan kandidat.
 20 di antaranya punya jumlah parameter bersumber. Sisanya tercantum sebagai tidak diketahui, bukan ditebak.
 1 GiB kelonggaran runtime, dinyatakan, bukan diukur di mesin Anda.

 RAM sistem GiB GPU Tidak ada (CPU) NVIDIA AMD Apple Intel
 Memori GPU GiB Wajib kecuali Anda menyebut kartu yang kami daftar. Apple: kosongkan; RAM adalah kumpulannya. Nama GPU (opsional) Jumlah GPU Sistem operasi (opsional — hanya perangkat lunak) Lewati Linux Windows macOS
 Konteks yang dianggarkan 4K 8K 16K 32K
 Cache KV tumbuh mengikutinya. Kami tidak mengandaikan angka maksimum pada kartu model.

6 dari 20 model bobot terbuka berprofil muat dalam 24 GiB (vram) pada konteks 8192. Terbaik yang muat: Qwen3.8 27B (Q5_K_M).

 ** ** ** **
 Bobot 18.563 GiB Cache KV 0.5 GiB Runtime 1 GiB Kelonggaran 3.9 GiB / 24 GiB

VRAM as entered. Driver reservation is inside the 1 GiB overhead, not extra.

32 GiB menaikkan kuantisasi Qwen3.8 27B ke Q8_0. Model yang sama, bukan skor kecerdasan yang lebih tinggi.

## Di antara model yang muat

Qwen3.8 27B memiliki skor Artificial Analysis tertinggi untuk kecerdasan (52), pemrograman (68.1), dan agentik (50.9) di antara model yang muat.

Elo LMArena tertinggi di antara yang muat: Gemma 4 31B 1441.7. Elo adalah skala preferensi manusia, bukan indeks kecerdasan.

Indeks Artificial Analysis dan Elo LMArena adalah skala berbeda. Sel kosong berarti belum diukur, bukan nol. Sumbu tertinggi sebuah model relatif terhadap skornya sendiri, bukan klaim memimpin katalog.

## Model bernilai yang muat

| Model | Umum | Coding | Agentik | Preferensi manusia | Kuantisasi yang muat | Perkiraan GiB | Kelonggaran |
| --- | --- | --- | --- | --- | --- | --- | --- |
| Qwen3.8 27B Puncak AA: Coding penglihatan video penalaran perkakas | 52 | 68.1 | 50.9 | 1440.8 | Q5_K_M | 20.063 | 3.938 |
| Gemma 4 31B Puncak AA: Coding penglihatan video penalaran perkakas | 29.7 | 43.4 | 14.4 | 1441.7 | Q5_K_M | 22.106 | 1.894 |
| Olmo 3 32B Think penalaran | — | — | — | 1298.5 | Q4_K_M | 22.32 | 1.68 |
| Granite 4.1 8B perkakas | — | 9.5 | — | 1291.6 | F16 | 18.25 | 5.75 |
| Phi 4 | — | — | — | 1216.8 | Q8_0 | 17.438 | 6.563 |

 - Hybrid: only 16 of 64 layers are Gated Attention. KV uses kvLayers=16, not nLayers=64. Measured Q4 is Unsloth UD-Q4_K_M, not a vanilla Q4_K_M.

## Muat, tanpa nilai

 - [Muse Glimmer 30B](/models/meta__muse-glimmer-30b/) — Q5_K_M, 21.756 GiB tidak dinilai penglihatan penalaran perkakas

## Apa yang sebenarnya dibeli oleh peningkatan

Kendalanya adalah memori GPU. Menambah RAM sistem tidak akan memuat bobot tambahan ke kartu ini.

| Perkiraan GiB | Membuka | Contoh | Harga daftar |
| --- | --- | --- | --- |
| 32 GiB | Qwen3.8 27B — Q8_0 model sama, kuantisasi lebih tinggi | GeForce RTX 5090 (32 GiB) | USD 1999 mulai dari |

Model katalog bernilai lebih tinggi berikutnya adalah Kimi K3, dan bahkan Q4_K_M menuntut 1691.5 GiB. Itu bukan kartu desktop.

NVIDIA 'Starting at' list prices as published 2026-08-25, not a store quote and not a used-market index. Street prices in August 2026 are often much higher (Tom's Hardware Newegg median RTX 5090 $4,699 vs $1,999 list). Last-gen 24 GB cards (4090, 3090) have no current NVIDIA starting-at in this file. Datacenter cards have no consumer list here. RAM DIMMs are not priced — they move weekly.

Peningkatan memakai rumus kecocokan yang sama dengan peringkat. Harga daftar adalah harga mulai dari NVIDIA, bertanggal 2026-08-25. Harga pasar sering lebih tinggi. Kartu 24 GB bekas dan GPU pusat data tidak punya harga daftar di sini. Modul RAM tidak diberi harga.

## Tidak muat, atau tanpa profil

 - qwen/qwen3.8-2.4t-a95b — even Q4_K_M wants 1450.719 GiB; pool is 24 GiB
- moonshotai/kimi-k3 — even Q4_K_M wants 1691.5 GiB; pool is 24 GiB
- z-ai/glm-5.2 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
- moonshotai/kimi-k2.7-code — even Q4_K_M wants 604.75 GiB; pool is 24 GiB
- nvidia/nemotron-3-ultra-550b-a55b — even Q4_K_M wants 333.063 GiB; pool is 24 GiB
- minimax/minimax-m3 — even Q4_K_M wants 259.405 GiB; pool is 24 GiB
- deepseek/deepseek-v4-pro — even Q4_K_M wants 967 GiB; pool is 24 GiB
- deepseek/deepseek-v4-flash — even Q4_K_M wants 172.465 GiB; pool is 24 GiB
- mistralai/mistral-small-2603 — even Q4_K_M wants 73.2 GiB; pool is 24 GiB
- deepseek/deepseek-v3.2 — even Q4_K_M wants 406.116 GiB; pool is 24 GiB
- openai/gpt-oss-120b — even Q4_K_M wants 72.201 GiB; pool is 24 GiB
- meta-llama/llama-4-maverick — even Q4_K_M wants 242.5 GiB; pool is 24 GiB
- meta-llama/llama-4-scout — even Q4_K_M wants 66.809 GiB; pool is 24 GiB
- cohere/command-a — even Q4_K_M wants 68.016 GiB; pool is 24 GiB

## Detail tambahan (opsional)

Tidak mengubah peringkat. Analisis AI opsional atas catatan Anda terhadap angka di atas, memakai model terkuat NVIDIA NIM.

 Analisis dengan AI

## Bagaimana angka itu dibuat

Bobot: ukuran GGUF terukur bila kami punya, jika tidak parameter total × bit per bobot ÷ 8. Q4_K_M diperlakukan sebagai 4,83 bit per parameter. Memori MoE memakai parameter total, bukan parameter aktif.

Cache KV, bila geometri lapisan dan kepala bersumber: 2 × kvLayers × kvHeads × headDim × konteks × 2 bita (FP16, batch 1). Model hibrida memakai jumlah lapisan atensi, bukan semua lapisan. Bila geometri tidak ada, cache dihilangkan dan hal itu dinyatakan.

1 GiB ditambahkan untuk CUDA dan runtime. Memori terpadu Apple memakai RAM sebagai kumpulannya. Hanya CPU adalah kecocokan memori, bukan klaim kecepatan. Generasi DDR diabaikan untuk kecocokan — ia mengubah bandwidth, bukan apakah bobot muat di memori.

Hanya baris katalog dengan openWeights=true yang menjadi kandidat. Ada 20 baris seperti itu; 20 punya ukuran bersumber. Model tanpa nilai yang muat didaftar terpisah. Skor lebih tinggi tidak berarti pengganti langsung.

Jenis RAM (DDR4/DDR5/LPDDR) bukan sebuah kolom. Ia tidak mengubah apakah sebuah model muat.
