ПОЧЕМУ 4090 ВСЁ ЕЩЁ ЛУЧШИЙ БЫТОВОЙ ВЫБОР В 2026
RTX 5090 вышла, у неё 32 ГБ и выше пропускная способность памяти, но 4090 никуда не делась. По рынку б/у она стоит заметно дешевле, а разница в 8 ГБ VRAM решает не так много сценариев, как кажется. Для локального LLM важны три числа: объём памяти (24 ГБ GDDR6X), пропускная способность (около 1 ТБ/с) и тензорные ядра. Именно bandwidth упирается в скорость генерации токенов — LLM-инференс это memory-bound задача, а не compute-bound.
На практике 4090 выдаёт по замерам сообщества порядка 130–160 токенов/с на модели 7B в Q4 и 40–60 токенов/с на 13B–14B. Это быстрее, чем читает человек, так что для чата, кодинга и суммаризации карта избыточно комфортна. Свежие релизы моделей и квантов удобно отслеживать в каталоге REDDYX — GGUF-версии обычно появляются в течение суток после выхода весов.
КАК СЧИТАТЬ, ЧТО ВЛЕЗЕТ В 24 ГБ
Главная ошибка новичка — смотреть только на размер файла модели. VRAM расходуется на три вещи:
- Веса модели — основной кусок, зависит от числа параметров и квантизации.
- KV-кэш — растёт линейно с длиной контекста. На 32K токенов у модели 13B это легко 3–5 ГБ сверху.
- Оверхед — CUDA-контекст, буферы, фрагментация. Закладывайте 1–2 ГБ запаса.
Грубая формула для весов: число параметров (млрд) × байт на параметр. FP16 — 2 байта, Q8 — примерно 1 байт, Q4 — около 0,5 байта. То есть модель 14B в Q4 весит порядка 8–9 ГБ, оставляя 14–15 ГБ под контекст и оверхед. Модель 34B в Q4 — около 19–20 ГБ, тут уже придётся урезать контекст.
КВАНТИЗАЦИЯ: ЧТО ЭТО И КАКУЮ БРАТЬ
Квантизация — сжатие весов из FP16 в целочисленные форматы меньшей разрядности. Меньше бит на вес — меньше VRAM и быстрее инференс, но растёт потеря качества. В формате GGUF (стандарт для llama.cpp и Ollama) обозначения выглядят как Q4_K_M, Q5_K_M, Q6_K.
Практические рекомендации по форматам
- Q4_K_M — золотая середина. Потеря качества почти незаметна на глаз, экономия памяти максимальна. Дефолт для 90% случаев.
- Q5_K_M / Q6_K — если VRAM позволяет и нужна точность в коде или математике.
- Q8_0 — практически без потерь, но занимает вдвое больше Q4. Для мелких моделей 7B это осмысленно.
- Q3 и ниже — только если иначе модель не влезает. На больших моделях (30B+) Q3 иногда лучше, чем Q4 меньшей модели.
Правило большого пальца: большая модель в агрессивном кванте обычно умнее маленькой модели в щадящем. 34B в Q3_K_M часто обходит 13B в Q6 на задачах рассуждения.
КАКИЕ МОДЕЛИ ВЛЕЗУТ: ТАБЛИЦА
Цифры ниже — ориентировочные, для контекста порядка 8K токенов. При росте контекста добавляйте память под KV-кэш.
| Модель (класс) | Квант | VRAM весов | Влезает в 24 ГБ? | Скорость (ток/с) |
|---|---|---|---|---|
| 7B–8B | Q8_0 | ~8 ГБ | Да, с большим контекстом | 120–160 |
| 13B–14B | Q4_K_M | ~8–9 ГБ | Да, контекст до 32K+ | 45–65 |
| 13B–14B | Q6_K | ~11–12 ГБ | Да, комфортно | 40–55 |
| 30B–34B | Q4_K_M | ~19–20 ГБ | Да, но контекст урезать | 25–40 |
| 30B–34B | Q5_K_M | ~23 ГБ | Впритык, риск OOM | 20–35 |
| MoE ~30B (акт. ~3B) | Q4_K_M | ~18 ГБ | Да, быстрый инференс | 60–90 |
| 70B | Q4_K_M | ~40 ГБ | Нет, нужен оффлоад в RAM | 3–8 |
Отдельно про MoE-архитектуры (Mixture of Experts): они стали массовыми в 2025–2026. Общий размер большой, но на каждый токен активируется малая доля параметров. Такие модели дают качество крупной модели при скорости мелкой — при условии, что все веса влезли в VRAM. Для 4090 это одно из лучших направлений.
ЗАПУСК ЧЕРЕЗ OLLAMA: САМЫЙ ПРОСТОЙ ПУТЬ
Ollama — обёртка над llama.cpp с человеческим CLI и автоуправлением моделями. Ставится в пару команд, сама качает GGUF и раскладывает по GPU.
# Установка (Linux/Mac)
curl -fsSL https://ollama.com/install.sh | sh
# Запуск модели 14B в дефолтном кванте
ollama run qwen2.5:14b
# Явно задать квант через тег
ollama run qwen2.5:14b-instruct-q4_K_M
# Проверить, что реально висит на GPU
ollama ps
# STATUS должен показывать 100% GPU, не CPU
# Увеличить контекст (по умолчанию часто 2K–4K)
ollama run qwen2.5:14b
>>> /set parameter num_ctx 32768
Важная деталь: если ollama ps показывает частичный оффлоад на CPU, скорость падает в разы. Значит, модель + контекст не влезли в VRAM — берите квант поменьше или урезайте num_ctx.
ЗАПУСК ЧЕРЕЗ LLAMA.CPP: КОГДА НУЖЕН КОНТРОЛЬ
Если хочется ручного управления слоями, батчами и оффлоадом — идём напрямую в llama.cpp. Это тот же движок, что под капотом Ollama, но с полным доступом к флагам.
# Сборка с CUDA
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j
# Запуск сервера с OpenAI-совместимым API
./build/bin/llama-server \
-m models/qwen2.5-14b-instruct-q4_k_m.gguf \
-ngl 99 \ # все слои на GPU
-c 32768 \ # контекст 32K
--flash-attn \ # экономит VRAM на KV-кэше
--port 8080
# Проверка через curl (API как у OpenAI)
curl http://localhost:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"messages":[{"role":"user","content":"Привет"}]}'
Флаг -ngl 99 означает «выгрузить все слои на GPU». Если VRAM не хватает, ставьте меньшее число — часть слоёв уйдёт в RAM, скорость упадёт, но модель запустится. Флаг --flash-attn в 2026 включён почти всегда — он серьёзно снижает потребление памяти под длинный контекст.
ТОНКАЯ НАСТРОЙКА ПОД 24 ГБ
Несколько приёмов, чтобы выжать максимум из карты:
- KV-кэш квантизация. В llama.cpp флаги
--cache-type-k q8_0 --cache-type-v q8_0ужимают кэш вдвое почти без потери качества. Освобождает несколько ГБ под большой контекст. - Закрывайте всё лишнее. Браузер с сотней вкладок, DE на том же GPU — легко съедают 1–2 ГБ. На выделенной инференс-машине держите дисплей на встройке.
- Batch-инференс для нагрузки. Если гоняете API под несколько запросов, посмотрите на vLLM — он эффективнее по throughput, чем llama.cpp, за счёт paged attention. Но vLLM хуже дружит с агрессивными GGUF-квантами; под него берут AWQ или GPTQ.
- Мониторьте
nvidia-smi. Если память под 23,5 ГБ — вы на грани OOM при первом же длинном промпте.
OLLAMA ПРОТИВ LLAMA.CPP ПРОТИВ VLLM: ЧТО ВЫБРАТЬ
Коротко по назначению:
- Ollama — быстрый старт, локальный чат, эксперименты. Один человек, один запрос за раз.
- llama.cpp — тот же движок, но с полным контролем. Нужен, когда упираетесь в ограничения обёртки.
- vLLM — продакшн-API, много параллельных запросов, максимальный throughput. Тяжелее в настройке, требует FP16/AWQ-веса.
Для домашнего использования на одной 4090 связка Ollama или llama.cpp закрывает почти всё. vLLM оправдан, когда карта обслуживает приложение с реальной нагрузкой. Подборки инструментов инференса и свежих квантов удобно мониторить в каталоге REDDYX.
Частые вопросы
Какая самая большая модель влезет на RTX 4090?
Плотная модель класса 30B–34B в квантизации Q4_K_M занимает около 19–20 ГБ и помещается в 24 ГБ VRAM с урезанным контекстом. Модели 70B целиком не влезают — требуется частичный оффлоад в оперативную память, что резко снижает скорость до единиц токенов в секунду.
Что такое квантизация и зачем она нужна?
Квантизация — сжатие весов модели из 16-битного формата в 4- или 8-битный. Это уменьшает потребление VRAM в 2–4 раза и ускоряет инференс ценой небольшой потери качества. Формат Q4_K_M считается оптимальным балансом и подходит для большинства задач.
Ollama или llama.cpp — что лучше для новичка?
Ollama проще: одна команда качает и запускает модель, автоматически раскладывая слои по GPU. llama.cpp — тот же движок под капотом, но с ручным контролем над слоями, контекстом и оффлоадом. Начинать стоит с Ollama, переходить на llama.cpp — когда упираетесь в её ограничения.
Хватит ли 24 ГБ VRAM для локального LLM в 2026?
Да, для подавляющего большинства задач. Модели 7B–14B работают в высоком качестве с большим контекстом, 30B–34B — в разумной квантизации. Ограничения начинаются на моделях 70B и выше, где нужна карта на 48+ ГБ или несколько GPU.
Локальный инференс на 4090 в 2026 — это не компромисс, а полноценная рабочая станция для приватного ИИ без облачных счетов и утечек данных. Модели и кванты обновляются буквально ежедневно, и упустить удачный релиз легко. Чтобы держать руку на пульсе, загляните в Telegram-канал REDDYX AI — новые репозитории каждые 30-60 минут.