Власний хостинг

Достатньо ОЗП і того, чи є у вас GPU. Решта — необов’язкова. Ранжування — це арифметика за числами параметрів із джерелом: переможця обирає не NVIDIA.

20 рядків каталогу позначено як відкриті ваги. Ніщо інше не розглядається.
20 з них мають число параметрів із джерелом. Решта зазначена як невідома, а не вгадана.
1 ГіБ запасу на середовище виконання — заявленого, а не виміряного на вашій машині.
GPU
ОС (необов’язково — лише для добору ПЗ)
Запланований контекст
Кеш KV зростає разом із ним. Ми не беремо максимум із картки моделі.

6 із 20 профільованих моделей з відкритими вагами вміщуються в 24 ГіБ (vram) за контексту 8192. Найкраща за оцінкою з тих, що вміщуються: Qwen3.8 27B (Q5_K_M).

Ваги 18.563 GiB Кеш KV 0.5 GiB Середовище виконання 1 GiB Запас 3.9 GiB / 24 GiB

VRAM as entered. Driver reservation is inside the 1 GiB overhead, not extra.

32 ГіБ піднімає квантування Qwen3.8 27B до Q8_0. Та сама модель, а не вища оцінка інтелекту.

Серед моделей, що вміщуються

У Qwen3.8 27B найвищі оцінки Artificial Analysis за інтелектом (52), програмуванням (68.1) та агентністю (50.9) серед моделей, що вміщуються.

Найвище Ело LMArena серед тих, що вміщуються: Gemma 4 31B 1441.7. Ело — шкала людських уподобань, а не індекс інтелекту.

Індекси Artificial Analysis та Ело LMArena — різні шкали. Порожня комірка означає «не виміряно», а не нуль. Найсильніша вісь моделі співвідноситься з її власними оцінками, а не стверджує лідерство в каталозі.

Оцінені моделі, що вміщуються

МодельЗагальніКодуванняАгентніЛюдські вподобанняПридатне квантуванняОцінка, ГіБЗапас
Qwen3.8 27B
Пік AA: Кодування зірвідеоміркуванняінструменти
5268.150.91440.8Q5_K_M20.0633.938
Gemma 4 31B
Пік AA: Кодування зірвідеоміркуванняінструменти
29.743.414.41441.7Q5_K_M22.1061.894
Olmo 3 32B Think
міркування
1298.5Q4_K_M22.321.68
Granite 4.1 8B
інструменти
9.51291.6F1618.255.75
Phi 4 1216.8Q8_017.4386.563
  • Hybrid: only 16 of 64 layers are Gated Attention. KV uses kvLayers=16, not nLayers=64. Measured Q4 is Unsloth UD-Q4_K_M, not a vanilla Q4_K_M.

Вміщуються, без оцінки

  • Muse Glimmer 30B — Q5_K_M, 21.756 GiB без оцінки зірміркуванняінструменти

Що насправді дає апгрейд

Вузьке місце — пам’ять GPU. Більше системної ОЗП не завантажить додаткові ваги на цю карту.

Оцінка, ГіБВідкриваєПрикладПрайсова ціна
32 GiBQwen3.8 27B — Q8_0та сама модель, вище квантуванняGeForce RTX 5090 (32 GiB)USD 1999 від

Наступна за оцінкою модель каталогу — Kimi K3, і навіть у Q4_K_M їй потрібно 1691.5 ГіБ. Це не настільна карта.

NVIDIA 'Starting at' list prices as published 2026-08-25, not a store quote and not a used-market index. Street prices in August 2026 are often much higher (Tom's Hardware Newegg median RTX 5090 $4,699 vs $1,999 list). Last-gen 24 GB cards (4090, 3090) have no current NVIDIA starting-at in this file. Datacenter cards have no consumer list here. RAM DIMMs are not priced — they move weekly.

Апгрейди використовують ту саму формулу вміщення, що й ранжування. Прайсові ціни — це ціни NVIDIA «від», станом на 2026-08-25. Ринкові ціни часто вищі. У вживаних карт на 24 ГБ і GPU для ЦОД прайсу тут немає. Модулі ОЗП не оцінюються.

Не вміщуються або не профільовані

  • qwen/qwen3.8-2.4t-a95b — even Q4_K_M wants 1450.719 GiB; pool is 24 GiB
  • moonshotai/kimi-k3 — even Q4_K_M wants 1691.5 GiB; pool is 24 GiB
  • z-ai/glm-5.2 — even Q4_K_M wants 455.624 GiB; pool is 24 GiB
  • moonshotai/kimi-k2.7-code — even Q4_K_M wants 604.75 GiB; pool is 24 GiB
  • nvidia/nemotron-3-ultra-550b-a55b — even Q4_K_M wants 333.063 GiB; pool is 24 GiB
  • minimax/minimax-m3 — even Q4_K_M wants 259.405 GiB; pool is 24 GiB
  • deepseek/deepseek-v4-pro — even Q4_K_M wants 967 GiB; pool is 24 GiB
  • deepseek/deepseek-v4-flash — even Q4_K_M wants 172.465 GiB; pool is 24 GiB
  • mistralai/mistral-small-2603 — even Q4_K_M wants 73.2 GiB; pool is 24 GiB
  • deepseek/deepseek-v3.2 — even Q4_K_M wants 406.116 GiB; pool is 24 GiB
  • openai/gpt-oss-120b — even Q4_K_M wants 72.201 GiB; pool is 24 GiB
  • meta-llama/llama-4-maverick — even Q4_K_M wants 242.5 GiB; pool is 24 GiB
  • meta-llama/llama-4-scout — even Q4_K_M wants 66.809 GiB; pool is 24 GiB
  • cohere/command-a — even Q4_K_M wants 68.016 GiB; pool is 24 GiB

Додаткові відомості (необов’язково)

Не змінює ранжування. Необов’язковий розбір ваших нотаток за допомогою ШІ на тлі наведених вище чисел, на найсильніших моделях NVIDIA NIM.

Як отримано це число

Ваги: виміряний розмір GGUF, якщо він у нас є, інакше загальна кількість параметрів × біти на вагу ÷ 8. Q4_K_M рахується як 4,83 біта на параметр. Пам’ять MoE рахується за загальною кількістю параметрів, а не за активними.

Кеш KV, коли геометрія шарів і голів має джерело: 2 × kvLayers × kvHeads × headDim × контекст × 2 байти (FP16, пакет 1). Гібридні моделі використовують кількість шарів уваги, а не всі шари. Якщо геометрії немає, кеш не враховується, і про це сказано.

Додається 1 ГіБ на CUDA і середовище виконання. Єдина пам’ять Apple використовує ОЗП як пул. Режим лише на CPU — це вміщення за пам’яттю, а не твердження про швидкість. Покоління DDR при доборі ігнорується: воно змінює пропускну здатність, а не те, чи вміщуються ваги в пам’ять.

Кандидатами є лише рядки каталогу з openWeights=true. Таких рядків 20; у 20 є розміри з джерелом. Моделі без оцінки, що вміщуються, перелічено окремо. Вища оцінка не означає прямої заміни.

Тип ОЗП (DDR4/DDR5/LPDDR) не є полем. Він не впливає на те, чи вміщується модель.