---
title: "Autoalojamiento — qué modelo de pesos abiertos cabe en esta máquina · Undominated.ai"
canonical: https://undominated.ai/es/self-host/
description: "A partir de la RAM y la memoria de GPU, ordena los modelos de pesos abiertos del catálogo que realmente caben. Manda la calidad. Sin puntuar no es cero. Un recuento de parámetros ausente no es una suposición."
---

# Autoalojamiento — qué modelo de pesos abiertos cabe en esta máquina · Undominated.ai

> A partir de la RAM y la memoria de GPU, ordena los modelos de pesos abiertos del catálogo que realmente caben. Manda la calidad. Sin puntuar no es cero. Un recuento de parámetros ausente no es una suposición.

# Autoalojamiento

Bastan la RAM y si tienes GPU. Todo lo demás es opcional. La clasificación es aritmética sobre recuentos de parámetros con fuente: NVIDIA no elige al ganador.

 25 filas del catálogo marcadas como pesos abiertos. Nada más es candidato.
 25 de ellas tienen un recuento de parámetros con fuente. El resto aparece como desconocido, no adivinado.
 1 GiB de margen de ejecución, declarado, no medido en tu máquina.

 [CPU 16 GiB](/self-host/cpu-16gb/)[8 GiB GPU](/self-host/8gb/)[10 GiB GPU](/self-host/10gb/)[12 GiB GPU](/self-host/12gb/)[16 GiB GPU](/self-host/16gb/)[20 GiB GPU](/self-host/20gb/)[24 GiB GPU](/self-host/24gb/)[32 GiB GPU](/self-host/32gb/)[40 GiB GPU](/self-host/40gb/)[48 GiB GPU](/self-host/48gb/)[80 GiB GPU](/self-host/80gb/)[94 GiB GPU](/self-host/94gb/)[96 GiB GPU](/self-host/96gb/)[192 GiB GPU](/self-host/192gb/)
 [RTX 5090](/self-host/rtx-5090/)[RTX 5080](/self-host/rtx-5080/)[RTX 5070 Ti](/self-host/rtx-5070-ti/)[RTX 5070](/self-host/rtx-5070/)[RTX 5060 Ti 16](/self-host/rtx-5060-ti-16/)[RTX 5060 Ti 8](/self-host/rtx-5060-ti-8/)[RTX 5060](/self-host/rtx-5060/)[RTX 5050](/self-host/rtx-5050/)[RTX 4090](/self-host/rtx-4090/)[RTX 4080](/self-host/rtx-4080/)[RTX 4070 Ti](/self-host/rtx-4070-ti/)[RTX 4070](/self-host/rtx-4070/)[RTX 4060 Ti 16](/self-host/rtx-4060-ti-16/)[RTX 4060 Ti 8](/self-host/rtx-4060-ti-8/)[RTX 4060](/self-host/rtx-4060/)[RTX 3090](/self-host/rtx-3090/)[RTX 3080 Ti](/self-host/rtx-3080-ti/)[RTX 3080 12](/self-host/rtx-3080-12/)[RTX 3080](/self-host/rtx-3080/)[RTX 3070 Ti](/self-host/rtx-3070-ti/)[RTX 3070](/self-host/rtx-3070/)[RTX 3060 Ti](/self-host/rtx-3060-ti/)[RTX 3060 8](/self-host/rtx-3060-8/)[RTX 3060](/self-host/rtx-3060/)[RTX A6000](/self-host/rtx-a6000/)[RTX A5000](/self-host/rtx-a5000/)[RTX A4000](/self-host/rtx-a4000/)[RTX 6000 ADA](/self-host/rtx-6000-ada/)[RTX 5000 ADA](/self-host/rtx-5000-ada/)[RTX PRO 6000 Blackwell](/self-host/rtx-pro-6000-blackwell/)[RTX PRO 5000 Blackwell](/self-host/rtx-pro-5000-blackwell/)[A100 80](/self-host/a100-80/)[A100 40](/self-host/a100-40/)[H100 NVL](/self-host/h100-nvl/)[H100](/self-host/h100/)[L40S](/self-host/l40s/)[T4](/self-host/t4/)[RX 7900 XTX](/self-host/rx-7900-xtx/)[RX 7900 XT](/self-host/rx-7900-xt/)[RX 6900 XT](/self-host/rx-6900-xt/)[RX 6800 XT](/self-host/rx-6800-xt/)[MI300X](/self-host/mi300x/)
 RAM del sistema GiB GPU Ninguna (CPU) NVIDIA AMD Apple Intel
 Memoria de GPU GiB Obligatorio salvo que indiques una tarjeta de nuestra lista. Apple: déjalo; la RAM es el conjunto. Nombre de la GPU (opcional) Número de GPU Sistema operativo (opcional — solo software) Omitir Linux Windows macOS
 Contexto a presupuestar 4K 8K 16K 32K
 La caché KV crece con esto. No damos por supuesto el máximo de la ficha del modelo.

7 de 25 modelos de pesos abiertos perfilados caben en 24 GiB (vram) con contexto 8192. El mejor puntuado que cabe: Gemma 4 31B (Q5_K_M).

 ** ** **
 Pesos 21,106 GiB KV no estimada Ejecución 1 GiB Margen 1,9 GiB / 24 GiB

VRAM as entered. Driver reservation is inside the 1 GiB overhead, not extra.

48 GiB eleva la cuantización de Gemma 4 31B a Q8_0. El mismo modelo, no una puntuación de inteligencia mayor.

## Entre los modelos que caben

Mayor Elo de LMArena entre los que caben: Gemma 4 31B 1443,4. El Elo es una escala de preferencia humana, no el índice de inteligencia.

The arena boards are separate scales and are never blended. A missing cell is unmeasured, not zero. A model’s highest axis is relative to its own scores, not a claim it leads the catalogue.

## Modelos puntuados que caben

| Modelo | Preferencia humana | Cuantización que cabe | GiB estimados | Margen |
| --- | --- | --- | --- | --- |
| [Gemma 4 31B](/models/google__gemma-4-31b-it/) visión vídeo razonamiento herramientas | 1443,4 | Q5_K_M | 22,106 | 1,894 |
| [Qwen3.8 27B](/models/qwen__qwen3.8-27b/) visión vídeo razonamiento herramientas | 1440,7 | Q5_K_M | 20,063 | 3,938 |
| [Phi 4](/models/microsoft__phi-4/) | 1216,7 | Q8_0 | 17,438 | 6,563 |

 - KV heads and head dim are not in the public size table we used. Cache is not estimated.
- KV cache not estimated — layer/head geometry is not in the sourced profile. Longer context may not fit.

## Caben, sin puntuar

 - [Muse Glimmer 30B](/models/meta__muse-glimmer-30b/) — Q5_K_M, 21,756 GiB sin puntuar visión razonamiento herramientas
- [Ministral 3 14B 2512](/models/mistralai__ministral-14b-2512/) — Q8_0, 17,019 GiB sin puntuar visión herramientas
- [Ministral 3 8B 2512](/models/mistralai__ministral-8b-2512/) — F16, 19,663 GiB sin puntuar visión herramientas
- [Ministral 3 3B 2512](/models/mistralai__ministral-3b-2512/) — F16, 9,413 GiB sin puntuar visión herramientas

## Qué compra realmente una mejora

El cuello de botella es la memoria de GPU. Más RAM del sistema no cargará más pesos en esta tarjeta.

| GiB estimados | Desbloquea | Ejemplo | Precio de lista |
| --- | --- | --- | --- |
| 48 GiB | [Gemma 4 31B](/models/google__gemma-4-31b-it/) — Q8_0 mismo modelo, cuantización superior | rtx a6000, rtx 6000 ada, rtx pro 6000 blackwell | Sin precio de consumo en este archivo |

El siguiente modelo del catálogo mejor puntuado es Kimi K3, y ni siquiera Q4_K_M baja de 1691,5 GiB. Eso no es una tarjeta de escritorio.

NVIDIA 'Starting at' list prices as published 2026-08-25, not a store quote and not a used-market index. Street prices in August 2026 are often much higher (Tom's Hardware Newegg median RTX 5090 $4,699 vs $1,999 list). Last-gen 24 GB cards (4090, 3090) have no current NVIDIA starting-at in this file. Datacenter cards have no consumer list here. RAM DIMMs are not priced — they move weekly.

Las mejoras usan la misma fórmula de ajuste que la clasificación. Los precios de lista son «desde» de NVIDIA, con fecha 2026-08-25. El precio de calle suele ser mayor. Las tarjetas de 24 GB de segunda mano y las GPU de centro de datos no tienen precio de lista aquí. Los módulos de RAM no llevan precio.

## No caben, o no perfilados

 - cohere/command-a-plus — even Q4_K_M wants 132.618 GiB; pool is 24 GiB
- deepseek/deepseek-v4-flash-vision-exp — even Q4_K_M wants 184.902 GiB; pool is 24 GiB
- z-ai/glm-5.3 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
- qwen/qwen3.8-2.4t-a95b — even Q4_K_M wants 1450.719 GiB; pool is 24 GiB
- moonshotai/kimi-k3 — even Q4_K_M wants 1691.5 GiB; pool is 24 GiB
- z-ai/glm-5.2 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
- moonshotai/kimi-k2.7-code — even Q4_K_M wants 604.75 GiB; pool is 24 GiB
- nvidia/nemotron-3-ultra-550b-a55b — even Q4_K_M wants 333.063 GiB; pool is 24 GiB
- minimax/minimax-m3 — even Q4_K_M wants 259.405 GiB; pool is 24 GiB
- deepseek/deepseek-v4-pro — even Q4_K_M wants 967 GiB; pool is 24 GiB
- deepseek/deepseek-v4-flash — even Q4_K_M wants 172.465 GiB; pool is 24 GiB
- mistralai/mistral-small-2603 — even Q4_K_M wants 73.2 GiB; pool is 24 GiB
- mistralai/mistral-large-2512 — even Q4_K_M wants 408.531 GiB; pool is 24 GiB
- deepseek/deepseek-v3.2 — even Q4_K_M wants 406.116 GiB; pool is 24 GiB
- openai/gpt-oss-120b — even Q4_K_M wants 72.201 GiB; pool is 24 GiB
- meta-llama/llama-4-maverick — even Q4_K_M wants 242.5 GiB; pool is 24 GiB
- meta-llama/llama-4-scout — even Q4_K_M wants 66.809 GiB; pool is 24 GiB
- cohere/command-a — even Q4_K_M wants 68.016 GiB; pool is 24 GiB

## Detalles adicionales (opcional)

No cambia la clasificación. Análisis opcional con IA de tus notas frente a las cifras anteriores, usando los modelos más potentes de NVIDIA NIM.

 Analizar con IA

## Cómo se obtiene la cifra

Pesos: el tamaño GGUF medido cuando lo tenemos; si no, parámetros totales × bits por peso ÷ 8. Q4_K_M se trata como 4,83 bits por parámetro. La memoria de los MoE usa los parámetros totales, no los activos.

Caché KV, cuando la geometría de capas y cabezales tiene fuente: 2 × kvLayers × kvHeads × headDim × contexto × 2 bytes (FP16, lote 1). Los modelos híbridos usan el número de capas de atención, no todas. Si falta la geometría, se omite la caché y así se indica.

Se añaden 1 GiB para CUDA y el entorno de ejecución. La memoria unificada de Apple usa la RAM como conjunto. Solo CPU es un ajuste de memoria, no una afirmación de velocidad. La generación de DDR se ignora para el ajuste: cambia el ancho de banda, no si los pesos caben en memoria.

Solo son candidatas las filas del catálogo con openWeights=true. Existen 25 filas así; 25 tienen tamaños con fuente. Los modelos sin puntuar que caben se listan aparte. Una puntuación mayor no implica un reemplazo directo.

El tipo de RAM (DDR4/DDR5/LPDDR) no es un campo. No cambia si un modelo cabe.

## Continue your investigation

 - [Inspect open-weight models · English](/open-weights/)
- [Compare model variants · English](/families/)
- [Review requirements · English](/compare/)
- [Find serving tools · English](/tools/)
