---
title: "Tự vận hành — mô hình trọng số mở nào vừa với máy này · Undominated.ai"
canonical: https://undominated.ai/vi/self-host/
description: "Từ RAM và bộ nhớ GPU, xếp hạng các mô hình trọng số mở trong danh mục thực sự vừa. Chất lượng dẫn dắt. Chưa chấm điểm không phải là không. Thiếu số tham số không phải là phỏng đoán."
---

# Tự vận hành — mô hình trọng số mở nào vừa với máy này · Undominated.ai

> Từ RAM và bộ nhớ GPU, xếp hạng các mô hình trọng số mở trong danh mục thực sự vừa. Chất lượng dẫn dắt. Chưa chấm điểm không phải là không. Thiếu số tham số không phải là phỏng đoán.

# Tự vận hành

Chỉ cần RAM và việc bạn có GPU hay không. Mọi thứ khác là tùy chọn. Xếp hạng là phép tính trên số tham số có dẫn nguồn — NVIDIA không chọn người thắng.

 25 dòng danh mục được đánh dấu trọng số mở. Ngoài ra không có ứng viên nào.
 25 trong số đó có số tham số dẫn nguồn. Phần còn lại ghi là không rõ, chứ không phải đoán.
 1 GiB dự phòng cho môi trường chạy, là con số công bố chứ không đo trên máy bạn.

 [CPU 16 GiB](/self-host/cpu-16gb/)[8 GiB GPU](/self-host/8gb/)[10 GiB GPU](/self-host/10gb/)[12 GiB GPU](/self-host/12gb/)[16 GiB GPU](/self-host/16gb/)[20 GiB GPU](/self-host/20gb/)[24 GiB GPU](/self-host/24gb/)[32 GiB GPU](/self-host/32gb/)[40 GiB GPU](/self-host/40gb/)[48 GiB GPU](/self-host/48gb/)[80 GiB GPU](/self-host/80gb/)[94 GiB GPU](/self-host/94gb/)[96 GiB GPU](/self-host/96gb/)[192 GiB GPU](/self-host/192gb/)
 [RTX 5090](/self-host/rtx-5090/)[RTX 5080](/self-host/rtx-5080/)[RTX 5070 Ti](/self-host/rtx-5070-ti/)[RTX 5070](/self-host/rtx-5070/)[RTX 5060 Ti 16](/self-host/rtx-5060-ti-16/)[RTX 5060 Ti 8](/self-host/rtx-5060-ti-8/)[RTX 5060](/self-host/rtx-5060/)[RTX 5050](/self-host/rtx-5050/)[RTX 4090](/self-host/rtx-4090/)[RTX 4080](/self-host/rtx-4080/)[RTX 4070 Ti](/self-host/rtx-4070-ti/)[RTX 4070](/self-host/rtx-4070/)[RTX 4060 Ti 16](/self-host/rtx-4060-ti-16/)[RTX 4060 Ti 8](/self-host/rtx-4060-ti-8/)[RTX 4060](/self-host/rtx-4060/)[RTX 3090](/self-host/rtx-3090/)[RTX 3080 Ti](/self-host/rtx-3080-ti/)[RTX 3080 12](/self-host/rtx-3080-12/)[RTX 3080](/self-host/rtx-3080/)[RTX 3070 Ti](/self-host/rtx-3070-ti/)[RTX 3070](/self-host/rtx-3070/)[RTX 3060 Ti](/self-host/rtx-3060-ti/)[RTX 3060 8](/self-host/rtx-3060-8/)[RTX 3060](/self-host/rtx-3060/)[RTX A6000](/self-host/rtx-a6000/)[RTX A5000](/self-host/rtx-a5000/)[RTX A4000](/self-host/rtx-a4000/)[RTX 6000 ADA](/self-host/rtx-6000-ada/)[RTX 5000 ADA](/self-host/rtx-5000-ada/)[RTX PRO 6000 Blackwell](/self-host/rtx-pro-6000-blackwell/)[RTX PRO 5000 Blackwell](/self-host/rtx-pro-5000-blackwell/)[A100 80](/self-host/a100-80/)[A100 40](/self-host/a100-40/)[H100 NVL](/self-host/h100-nvl/)[H100](/self-host/h100/)[L40S](/self-host/l40s/)[T4](/self-host/t4/)[RX 7900 XTX](/self-host/rx-7900-xtx/)[RX 7900 XT](/self-host/rx-7900-xt/)[RX 6900 XT](/self-host/rx-6900-xt/)[RX 6800 XT](/self-host/rx-6800-xt/)[MI300X](/self-host/mi300x/)
 RAM hệ thống GiB GPU Không có (CPU) NVIDIA AMD Apple Intel
 Bộ nhớ GPU GiB Bắt buộc trừ khi bạn nêu tên một card có trong danh sách của chúng tôi. Apple: bỏ trống; RAM chính là bể nhớ. Tên GPU (tùy chọn) Số GPU Hệ điều hành (tùy chọn — chỉ để gợi ý phần mềm) Bỏ qua Linux Windows macOS
 Ngữ cảnh cần dự trù 4K 8K 16K 32K
 Bộ đệm KV lớn lên theo giá trị này. Chúng tôi không mặc định lấy mức tối đa trên thẻ mô hình.

7 trong 25 mô hình trọng số mở đã lập hồ sơ vừa với 24 GiB (vram) ở ngữ cảnh 8192. Mô hình được chấm cao nhất mà vừa: Gemma 4 31B (Q5_K_M).

 ** ** **
 Trọng số 21,106 GiB chưa ước tính KV Môi trường chạy 1 GiB Dư địa 1,9 GiB / 24 GiB

VRAM as entered. Driver reservation is inside the 1 GiB overhead, not extra.

48 GiB nâng mức lượng tử hóa của Gemma 4 31B lên Q8_0. Vẫn là mô hình đó, không phải điểm trí tuệ cao hơn.

## Trong số các mô hình vừa

Elo LMArena cao nhất trong số vừa: Gemma 4 31B 1443,4. Elo là thang đo ưa thích của con người, không phải chỉ số trí tuệ.

The arena boards are separate scales and are never blended. A missing cell is unmeasured, not zero. A model’s highest axis is relative to its own scores, not a claim it leads the catalogue.

## Mô hình đã chấm điểm và vừa

| Mô hình | Người dùng ưa thích | Mức lượng tử hóa vừa | GiB ước tính | Dư địa |
| --- | --- | --- | --- | --- |
| [Gemma 4 31B](/models/google__gemma-4-31b-it/) thị giác video suy luận công cụ | 1443,4 | Q5_K_M | 22,106 | 1,894 |
| [Qwen3.8 27B](/models/qwen__qwen3.8-27b/) thị giác video suy luận công cụ | 1440,7 | Q5_K_M | 20,063 | 3,938 |
| [Phi 4](/models/microsoft__phi-4/) | 1216,7 | Q8_0 | 17,438 | 6,563 |

 - KV heads and head dim are not in the public size table we used. Cache is not estimated.
- KV cache not estimated — layer/head geometry is not in the sourced profile. Longer context may not fit.

## Vừa, chưa chấm điểm

 - [Muse Glimmer 30B](/models/meta__muse-glimmer-30b/) — Q5_K_M, 21,756 GiB chưa chấm điểm thị giác suy luận công cụ
- [Ministral 3 14B 2512](/models/mistralai__ministral-14b-2512/) — Q8_0, 17,019 GiB chưa chấm điểm thị giác công cụ
- [Ministral 3 8B 2512](/models/mistralai__ministral-8b-2512/) — F16, 19,663 GiB chưa chấm điểm thị giác công cụ
- [Ministral 3 3B 2512](/models/mistralai__ministral-3b-2512/) — F16, 9,413 GiB chưa chấm điểm thị giác công cụ

## Nâng cấp thực sự mua được gì

Nút thắt là bộ nhớ GPU. Thêm RAM hệ thống sẽ không nạp thêm trọng số lên card này.

| GiB ước tính | Mở ra | Ví dụ | Giá niêm yết |
| --- | --- | --- | --- |
| 48 GiB | [Gemma 4 31B](/models/google__gemma-4-31b-it/) — Q8_0 cùng mô hình, mức lượng tử hóa cao hơn | rtx a6000, rtx 6000 ada, rtx pro 6000 blackwell | Không có giá tiêu dùng trong tệp này |

Mô hình kế tiếp trong danh mục được chấm cao hơn là Kimi K3, và ngay cả Q4_K_M cũng đòi 1691,5 GiB. Đó không phải card để bàn.

NVIDIA 'Starting at' list prices as published 2026-08-25, not a store quote and not a used-market index. Street prices in August 2026 are often much higher (Tom's Hardware Newegg median RTX 5090 $4,699 vs $1,999 list). Last-gen 24 GB cards (4090, 3090) have no current NVIDIA starting-at in this file. Datacenter cards have no consumer list here. RAM DIMMs are not priced — they move weekly.

Nâng cấp dùng đúng công thức vừa vặn như phần xếp hạng. Giá niêm yết là giá khởi điểm của NVIDIA, tính đến 2026-08-25. Giá thị trường thường cao hơn. Card 24 GB đã qua sử dụng và GPU trung tâm dữ liệu không có giá niêm yết ở đây. Thanh RAM không được định giá.

## Không vừa, hoặc chưa lập hồ sơ

 - cohere/command-a-plus — even Q4_K_M wants 132.618 GiB; pool is 24 GiB
- deepseek/deepseek-v4-flash-vision-exp — even Q4_K_M wants 184.902 GiB; pool is 24 GiB
- z-ai/glm-5.3 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
- qwen/qwen3.8-2.4t-a95b — even Q4_K_M wants 1450.719 GiB; pool is 24 GiB
- moonshotai/kimi-k3 — even Q4_K_M wants 1691.5 GiB; pool is 24 GiB
- z-ai/glm-5.2 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
- moonshotai/kimi-k2.7-code — even Q4_K_M wants 604.75 GiB; pool is 24 GiB
- nvidia/nemotron-3-ultra-550b-a55b — even Q4_K_M wants 333.063 GiB; pool is 24 GiB
- minimax/minimax-m3 — even Q4_K_M wants 259.405 GiB; pool is 24 GiB
- deepseek/deepseek-v4-pro — even Q4_K_M wants 967 GiB; pool is 24 GiB
- deepseek/deepseek-v4-flash — even Q4_K_M wants 172.465 GiB; pool is 24 GiB
- mistralai/mistral-small-2603 — even Q4_K_M wants 73.2 GiB; pool is 24 GiB
- mistralai/mistral-large-2512 — even Q4_K_M wants 408.531 GiB; pool is 24 GiB
- deepseek/deepseek-v3.2 — even Q4_K_M wants 406.116 GiB; pool is 24 GiB
- openai/gpt-oss-120b — even Q4_K_M wants 72.201 GiB; pool is 24 GiB
- meta-llama/llama-4-maverick — even Q4_K_M wants 242.5 GiB; pool is 24 GiB
- meta-llama/llama-4-scout — even Q4_K_M wants 66.809 GiB; pool is 24 GiB
- cohere/command-a — even Q4_K_M wants 68.016 GiB; pool is 24 GiB

## Chi tiết thêm (tùy chọn)

Không làm thay đổi xếp hạng. Phân tích AI tùy chọn cho ghi chú của bạn, đối chiếu với các con số ở trên, dùng những mô hình mạnh nhất của NVIDIA NIM.

 Phân tích bằng AI

## Con số này được tính ra sao

Trọng số: dùng kích thước GGUF đo được nếu có, nếu không thì tổng tham số × bit mỗi trọng số ÷ 8. Q4_K_M được tính là 4,83 bit mỗi tham số. Bộ nhớ của MoE dùng tổng tham số, không phải tham số hoạt động.

Bộ đệm KV, khi hình học lớp và đầu có dẫn nguồn: 2 × kvLayers × kvHeads × headDim × ngữ cảnh × 2 byte (FP16, lô 1). Mô hình lai dùng số lớp chú ý, không phải mọi lớp. Nếu thiếu hình học, bộ đệm được bỏ qua và điều đó được nêu rõ.

Cộng thêm 1 GiB cho CUDA và môi trường chạy. Bộ nhớ hợp nhất của Apple dùng RAM làm bể nhớ. Chỉ dùng CPU là sự vừa vặn về bộ nhớ, không phải lời hứa về tốc độ. Thế hệ DDR bị bỏ qua khi xét vừa vặn — nó đổi băng thông, không đổi việc trọng số có nằm được trong bộ nhớ hay không.

Chỉ những dòng danh mục có openWeights=true mới là ứng viên. Có 25 dòng như vậy; 25 dòng có kích thước dẫn nguồn. Các mô hình chưa chấm điểm mà vừa được liệt kê riêng. Điểm cao hơn không có nghĩa là thay thế trực tiếp.

Loại RAM (DDR4/DDR5/LPDDR) không phải một trường dữ liệu. Nó không đổi việc một mô hình có vừa hay không.

## Continue your investigation

 - [Inspect open-weight models · English](/open-weights/)
- [Compare model variants · English](/families/)
- [Review requirements · English](/compare/)
- [Find serving tools · English](/tools/)
