---
title: "셀프 호스팅 — 이 기기에 어떤 공개 가중치 모델이 들어가는가 · Undominated.ai"
canonical: https://undominated.ai/ko/self-host/
description: "RAM과 GPU 메모리를 바탕으로 카탈로그의 공개 가중치 모델 중 실제로 들어가는 것을 순위 매깁니다. 품질이 먼저입니다. 미평가는 0이 아닙니다. 매개변수 수가 없다는 것은 추측이 아닙니다."
---

# 셀프 호스팅 — 이 기기에 어떤 공개 가중치 모델이 들어가는가 · Undominated.ai

> RAM과 GPU 메모리를 바탕으로 카탈로그의 공개 가중치 모델 중 실제로 들어가는 것을 순위 매깁니다. 품질이 먼저입니다. 미평가는 0이 아닙니다. 매개변수 수가 없다는 것은 추측이 아닙니다.

# 셀프 호스팅

RAM과 GPU 보유 여부면 충분합니다. 나머지는 선택입니다. 순위는 출처가 있는 매개변수 수에 대한 산술이며, 승자를 정하는 것은 NVIDIA가 아닙니다.

 20 개의 카탈로그 행이 공개 가중치로 표시되어 있습니다. 그 밖의 것은 후보가 아닙니다.
 20 개가 출처 있는 매개변수 수를 가집니다. 나머지는 추측이 아니라 알 수 없음으로 표시됩니다.
 1 GiB의 실행 여유. 명시된 값이며 기기에서 측정한 값이 아닙니다.

 시스템 RAM GiB GPU 없음(CPU) NVIDIA AMD Apple Intel
 GPU 메모리 GiB 저희가 수록한 카드를 지정하지 않으면 필수입니다. Apple은 비워 두세요. RAM이 곧 풀입니다. GPU 이름(선택) GPU 개수 운영체제(선택 — 소프트웨어 추천용) 건너뛰기 Linux Windows macOS
 확보할 컨텍스트 4K 8K 16K 32K
 KV 캐시는 이 값에 따라 커집니다. 모델 카드의 최댓값을 가정하지 않습니다.

프로파일된 공개 가중치 모델 20개 중 6개가 컨텍스트 8192에서 24 GiB(vram)에 들어갑니다. 들어가는 것 중 최고 평가: Qwen3.8 27B(Q5_K_M).

 ** ** ** **
 가중치 18.563 GiB KV 캐시 0.5 GiB 런타임 1 GiB 여유 3.9 GiB / 24 GiB

VRAM as entered. Driver reservation is inside the 1 GiB overhead, not extra.

32 GiB는 Qwen3.8 27B의 양자화를 Q8_0로 올립니다. 같은 모델이며, 지능 점수가 오르는 것이 아닙니다.

## 들어가는 모델 중에서

들어가는 모델 중 Qwen3.8 27B이(가) Artificial Analysis의 지능(52), 코딩(68.1), 에이전트(50.9) 점수 모두 가장 높습니다.

들어가는 모델 중 LMArena Elo 최고: Gemma 4 31B 1441.7. Elo는 사람의 선호 척도이지 지능 지수가 아닙니다.

Artificial Analysis 지수와 LMArena Elo는 서로 다른 척도입니다. 빈 칸은 측정되지 않은 것이지 0이 아닙니다. 어떤 모델의 최고 축은 그 모델 자신의 점수에 대한 상대값이며, 카탈로그 1위라는 주장이 아닙니다.

## 들어가는 평가된 모델

| 모델 | 일반 | 코딩 | 에이전트 | 인간 선호도 | 들어가는 양자화 | 추정 GiB | 여유 |
| --- | --- | --- | --- | --- | --- | --- | --- |
| Qwen3.8 27B AA 최고: 코딩 시각 영상 추론 도구 | 52 | 68.1 | 50.9 | 1440.8 | Q5_K_M | 20.063 | 3.938 |
| Gemma 4 31B AA 최고: 코딩 시각 영상 추론 도구 | 29.7 | 43.4 | 14.4 | 1441.7 | Q5_K_M | 22.106 | 1.894 |
| Olmo 3 32B Think 추론 | — | — | — | 1298.5 | Q4_K_M | 22.32 | 1.68 |
| Granite 4.1 8B 도구 | — | 9.5 | — | 1291.6 | F16 | 18.25 | 5.75 |
| Phi 4 | — | — | — | 1216.8 | Q8_0 | 17.438 | 6.563 |

 - Hybrid: only 16 of 64 layers are Gated Attention. KV uses kvLayers=16, not nLayers=64. Measured Q4 is Unsloth UD-Q4_K_M, not a vanilla Q4_K_M.

## 들어감, 미평가

 - [Muse Glimmer 30B](/models/meta__muse-glimmer-30b/) — Q5_K_M, 21.756 GiB 미평가 시각 추론 도구

## 업그레이드가 실제로 사주는 것

병목은 GPU 메모리입니다. 시스템 RAM을 늘려도 이 카드에 가중치가 더 올라가지 않습니다.

| 추정 GiB | 열리는 것 | 예 | 정가 |
| --- | --- | --- | --- |
| 32 GiB | Qwen3.8 27B — Q8_0 같은 모델, 더 높은 양자화 | GeForce RTX 5090 (32 GiB) | USD 1999부터 |

다음으로 평가가 높은 카탈로그 모델은 Kimi K3이며, Q4_K_M에서도 1691.5 GiB를 요구합니다. 데스크톱 카드가 아닙니다.

NVIDIA 'Starting at' list prices as published 2026-08-25, not a store quote and not a used-market index. Street prices in August 2026 are often much higher (Tom's Hardware Newegg median RTX 5090 $4,699 vs $1,999 list). Last-gen 24 GB cards (4090, 3090) have no current NVIDIA starting-at in this file. Datacenter cards have no consumer list here. RAM DIMMs are not priced — they move weekly.

업그레이드는 순위와 동일한 적합 공식을 씁니다. 정가는 NVIDIA의 시작가이며 2026-08-25 기준입니다. 실제 판매가는 대개 더 높습니다. 중고 24GB 카드와 데이터센터 GPU는 여기에 정가가 없습니다. RAM 모듈은 가격을 매기지 않습니다.

## 들어가지 않거나 프로파일 없음

 - qwen/qwen3.8-2.4t-a95b — even Q4_K_M wants 1450.719 GiB; pool is 24 GiB
- moonshotai/kimi-k3 — even Q4_K_M wants 1691.5 GiB; pool is 24 GiB
- z-ai/glm-5.2 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
- moonshotai/kimi-k2.7-code — even Q4_K_M wants 604.75 GiB; pool is 24 GiB
- nvidia/nemotron-3-ultra-550b-a55b — even Q4_K_M wants 333.063 GiB; pool is 24 GiB
- minimax/minimax-m3 — even Q4_K_M wants 259.405 GiB; pool is 24 GiB
- deepseek/deepseek-v4-pro — even Q4_K_M wants 967 GiB; pool is 24 GiB
- deepseek/deepseek-v4-flash — even Q4_K_M wants 172.465 GiB; pool is 24 GiB
- mistralai/mistral-small-2603 — even Q4_K_M wants 73.2 GiB; pool is 24 GiB
- deepseek/deepseek-v3.2 — even Q4_K_M wants 406.116 GiB; pool is 24 GiB
- openai/gpt-oss-120b — even Q4_K_M wants 72.201 GiB; pool is 24 GiB
- meta-llama/llama-4-maverick — even Q4_K_M wants 242.5 GiB; pool is 24 GiB
- meta-llama/llama-4-scout — even Q4_K_M wants 66.809 GiB; pool is 24 GiB
- cohere/command-a — even Q4_K_M wants 68.016 GiB; pool is 24 GiB

## 추가 정보(선택)

순위를 바꾸지 않습니다. NVIDIA NIM의 가장 강력한 모델로, 위 수치에 비추어 메모를 선택적으로 분석합니다.

 AI로 분석

## 이 수치를 구하는 방법

가중치: 측정된 GGUF 크기가 있으면 그것을, 없으면 전체 매개변수 × 가중치당 비트 ÷ 8을 씁니다. Q4_K_M은 매개변수당 4.83비트로 봅니다. MoE 메모리는 활성 매개변수가 아니라 전체 매개변수를 씁니다.

KV 캐시는 층과 헤드 구조에 출처가 있을 때: 2 × kvLayers × kvHeads × headDim × 컨텍스트 × 2바이트(FP16, 배치 1). 혼합 모델은 모든 층이 아니라 어텐션 층 수를 씁니다. 구조가 없으면 캐시를 빼고 그 사실을 밝힙니다.

CUDA와 런타임을 위해 1 GiB를 더합니다. Apple의 통합 메모리는 RAM을 풀로 씁니다. CPU 전용은 메모리 적합이지 속도 주장이 아닙니다. DDR 세대는 적합 판정에서 무시합니다. 대역폭은 달라지지만 가중치가 메모리에 올라가는지는 달라지지 않습니다.

openWeights=true인 카탈로그 행만 후보입니다. 그런 행은 20개이며 20개가 출처 있는 크기를 가집니다. 들어가는 미평가 모델은 따로 싣습니다. 점수가 높다고 그대로 대체되는 것은 아닙니다.

RAM 종류(DDR4/DDR5/LPDDR)는 항목이 아닙니다. 모델이 들어가는지 여부를 바꾸지 않습니다.
