---
title: "Self-hosting — quale modello a pesi aperti sta su questa macchina · Undominated.ai"
canonical: https://undominated.ai/it/self-host/
description: "A partire da RAM e memoria GPU, ordina i modelli a pesi aperti del catalogo che ci stanno davvero. Comanda la qualità. Non valutato non è zero. Un conteggio di parametri assente non è una supposizione."
---

# Self-hosting — quale modello a pesi aperti sta su questa macchina · Undominated.ai

> A partire da RAM e memoria GPU, ordina i modelli a pesi aperti del catalogo che ci stanno davvero. Comanda la qualità. Non valutato non è zero. Un conteggio di parametri assente non è una supposizione.

# Self-hosting

Bastano la RAM e sapere se hai una GPU. Tutto il resto è facoltativo. La classifica è aritmetica su conteggi di parametri con fonte: NVIDIA non sceglie il vincitore.

 20 righe del catalogo contrassegnate come pesi aperti. Nient’altro è candidato.
 20 di queste hanno un conteggio di parametri con fonte. Le altre risultano sconosciute, non indovinate.
 1 GiB di margine di esecuzione, dichiarato, non misurato sulla tua macchina.

 RAM di sistema GiB GPU Nessuna (CPU) NVIDIA AMD Apple Intel
 Memoria GPU GiB Obbligatorio, salvo che indichi una scheda presente nel nostro elenco. Apple: lascia vuoto; la RAM è il pool. Nome della GPU (facoltativo) Numero di GPU Sistema operativo (facoltativo — solo software) Salta Linux Windows macOS
 Contesto da prevedere 4K 8K 16K 32K
 La cache KV cresce con questo valore. Non diamo per scontato il massimo della scheda del modello.

6 su 20 modelli a pesi aperti profilati stanno in 24 GiB (vram) con contesto 8192. Il migliore valutato che ci sta: Qwen3.8 27B (Q5_K_M).

 ** ** ** **
 Pesi 18.563 GiB Cache KV 0.5 GiB Runtime 1 GiB Margine 3.9 GiB / 24 GiB

VRAM as entered. Driver reservation is inside the 1 GiB overhead, not extra.

32 GiB porta la quantizzazione di Qwen3.8 27B a Q8_0. Stesso modello, non un punteggio di intelligenza più alto.

## Tra i modelli che ci stanno

Qwen3.8 27B ha i punteggi Artificial Analysis più alti in intelligenza (52), programmazione (68.1) e agentico (50.9) tra i modelli che ci stanno.

Elo LMArena più alto tra quelli che ci stanno: Gemma 4 31B 1441.7. L’Elo è una scala di preferenza umana, non l’indice di intelligenza.

Gli indici Artificial Analysis e l’Elo LMArena sono scale diverse. Una cella vuota non è misurata, non vale zero. L’asse più alto di un modello è relativo ai suoi stessi punteggi, non un’affermazione che guidi il catalogo.

## Modelli valutati che ci stanno

| Modello | Generale | Programmazione | Agentico | Preferenza umana | Quantizzazione che ci sta | GiB stimati | Margine |
| --- | --- | --- | --- | --- | --- | --- | --- |
| Qwen3.8 27B Picco AA: Programmazione visione video ragionamento strumenti | 52 | 68.1 | 50.9 | 1440.8 | Q5_K_M | 20.063 | 3.938 |
| Gemma 4 31B Picco AA: Programmazione visione video ragionamento strumenti | 29.7 | 43.4 | 14.4 | 1441.7 | Q5_K_M | 22.106 | 1.894 |
| Olmo 3 32B Think ragionamento | — | — | — | 1298.5 | Q4_K_M | 22.32 | 1.68 |
| Granite 4.1 8B strumenti | — | 9.5 | — | 1291.6 | F16 | 18.25 | 5.75 |
| Phi 4 | — | — | — | 1216.8 | Q8_0 | 17.438 | 6.563 |

 - Hybrid: only 16 of 64 layers are Gated Attention. KV uses kvLayers=16, not nLayers=64. Measured Q4 is Unsloth UD-Q4_K_M, not a vanilla Q4_K_M.

## Ci stanno, non valutati

 - [Muse Glimmer 30B](/models/meta__muse-glimmer-30b/) — Q5_K_M, 21.756 GiB non valutato visione ragionamento strumenti

## Cosa compra davvero un aggiornamento

Il collo di bottiglia è la memoria GPU. Più RAM di sistema non caricherà altri pesi su questa scheda.

| GiB stimati | Sblocca | Esempio | Prezzo di listino |
| --- | --- | --- | --- |
| 32 GiB | Qwen3.8 27B — Q8_0 stesso modello, quantizzazione superiore | GeForce RTX 5090 (32 GiB) | USD 1999 a partire da |

Il modello di catalogo subito meglio valutato è Kimi K3, e persino Q4_K_M richiede 1691.5 GiB. Non è una scheda da desktop.

NVIDIA 'Starting at' list prices as published 2026-08-25, not a store quote and not a used-market index. Street prices in August 2026 are often much higher (Tom's Hardware Newegg median RTX 5090 $4,699 vs $1,999 list). Last-gen 24 GB cards (4090, 3090) have no current NVIDIA starting-at in this file. Datacenter cards have no consumer list here. RAM DIMMs are not priced — they move weekly.

Gli aggiornamenti usano la stessa formula di adattamento della classifica. I prezzi di listino sono gli «a partire da» di NVIDIA, datati 2026-08-25. I prezzi reali sono spesso più alti. Le schede da 24 GB usate e le GPU da datacenter non hanno listino qui. I moduli di RAM non sono quotati.

## Non ci stanno, o non profilati

 - qwen/qwen3.8-2.4t-a95b — even Q4_K_M wants 1450.719 GiB; pool is 24 GiB
- moonshotai/kimi-k3 — even Q4_K_M wants 1691.5 GiB; pool is 24 GiB
- z-ai/glm-5.2 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
- moonshotai/kimi-k2.7-code — even Q4_K_M wants 604.75 GiB; pool is 24 GiB
- nvidia/nemotron-3-ultra-550b-a55b — even Q4_K_M wants 333.063 GiB; pool is 24 GiB
- minimax/minimax-m3 — even Q4_K_M wants 259.405 GiB; pool is 24 GiB
- deepseek/deepseek-v4-pro — even Q4_K_M wants 967 GiB; pool is 24 GiB
- deepseek/deepseek-v4-flash — even Q4_K_M wants 172.465 GiB; pool is 24 GiB
- mistralai/mistral-small-2603 — even Q4_K_M wants 73.2 GiB; pool is 24 GiB
- deepseek/deepseek-v3.2 — even Q4_K_M wants 406.116 GiB; pool is 24 GiB
- openai/gpt-oss-120b — even Q4_K_M wants 72.201 GiB; pool is 24 GiB
- meta-llama/llama-4-maverick — even Q4_K_M wants 242.5 GiB; pool is 24 GiB
- meta-llama/llama-4-scout — even Q4_K_M wants 66.809 GiB; pool is 24 GiB
- cohere/command-a — even Q4_K_M wants 68.016 GiB; pool is 24 GiB

## Dettagli aggiuntivi (facoltativo)

Non cambia la classifica. Analisi facoltativa con IA delle tue note rispetto ai numeri qui sopra, usando i modelli più potenti di NVIDIA NIM.

 Analizza con l’IA

## Come si ottiene il numero

Pesi: la dimensione GGUF misurata quando la abbiamo, altrimenti parametri totali × bit per peso ÷ 8. Q4_K_M è trattato come 4,83 bit per parametro. La memoria dei MoE usa i parametri totali, non quelli attivi.

Cache KV, quando la geometria di livelli e teste ha una fonte: 2 × kvLayers × kvHeads × headDim × contesto × 2 byte (FP16, batch 1). I modelli ibridi usano il numero di livelli di attenzione, non tutti i livelli. Se manca la geometria, la cache viene omessa e lo si dichiara.

Si aggiungono 1 GiB per CUDA e il runtime. La memoria unificata di Apple usa la RAM come pool. Solo CPU è un adattamento di memoria, non una promessa di velocità. La generazione di DDR è ignorata ai fini dell’adattamento: cambia la banda, non se i pesi stanno in memoria.

Solo le righe di catalogo con openWeights=true sono candidate. Esistono 20 righe di questo tipo; 20 hanno dimensioni con fonte. I modelli non valutati che ci stanno sono elencati a parte. Un punteggio più alto non significa una sostituzione diretta.

Il tipo di RAM (DDR4/DDR5/LPDDR) non è un campo. Non cambia se un modello ci sta.
