Карточка проекта — звёзды, техстек, ссылка на исходники — в каталоге REDDYX: ollama/ollama.
ПОЧЕМУ APPLE SILICON СЧИТАЕТСЯ ИНАЧЕ, ЧЕМ ВИДЕОКАРТА
На ПК с дискретной видеокартой модель должна поместиться именно в VRAM — если не помещается, часть слоёв уходит на CPU и всё резко замедляется. На Mac с чипами M-серии память единая: GPU обращается к тем же чипам RAM, что и CPU, без отдельной видеопамяти. Из системных 16 ГБ реально доступно под модель обычно 10-12 ГБ — часть держит macOS и фоновые процессы.
СКОЛЬКО ПАМЯТИ РЕАЛЬНО НУЖНО: ТАБЛИЦА
| Модель (GGUF Q4_K_M) | Размер на диске | Минимум RAM для комфортной работы | Подходит для Mac |
|---|---|---|---|
| Llama 3.2 3B | ~2 ГБ | 8 ГБ | Любой M1 и новее |
| Qwen2.5 7B / Llama 3.1 8B | ~4.5-5 ГБ | 16 ГБ | M1/M2/M3/M4 базовый |
| Qwen2.5-Coder 14B | ~9 ГБ | 24-32 ГБ | Pro/Max с 32 ГБ+ |
| Mixtral 8x7B (MoE) | ~26 ГБ | 48-64 ГБ | Max/Ultra 64 ГБ |
| Llama 3.1 70B | ~40 ГБ | 64-96 ГБ | Max/Ultra 96 ГБ+ |
Правило прикидки на глаз: для Q4-квантизации размер модели в гигабайтах примерно равен половине числа параметров в миллиардах (7B ≈ 4 ГБ, 14B ≈ 8 ГБ). К этому всегда добавляйте 2-4 ГБ на контекстное окно и систему.
КАК ПРОВЕРИТЬ, ПОТЯНЕТ ЛИ ВАШ MAC, ДО СКАЧИВАНИЯ
# узнать объём unified memory
sysctl hw.memsize
# запустить модель и посмотреть реальное потребление
ollama run qwen2.5:7b
# в другом терминале — мониторинг
sudo powermetrics --samplers gpu_power -i1000 -n5
Если во время генерации macOS начинает активно свопить (видно по замедлению всей системы, не только модели) — модель слишком большая для вашей памяти, берите квантизацию ниже (Q4 вместо Q8) или модель меньше.
КВАНТИЗАЦИЯ: ГДЕ ГРАНИЦА КАЧЕСТВА
- Q8 — почти без потери качества, но вдвое тяжелее Q4. Берите, если память позволяет с запасом.
- Q4_K_M — golden mean, стандартный выбор для большинства задач на Mac.
- Q2-Q3 — заметная деградация качества, только когда память совсем в обрез.
Ollama по умолчанию тянет Q4_K_M при простом ollama pull model — явно указывать квантизацию нужно только для отклонения от дефолта: ollama pull qwen2.5:7b-instruct-q8_0.
Частые вопросы
Какую модель реально запустить на MacBook M1 Pro 16 ГБ?
Комфортно — любую модель 7-8B в Q4 (Llama 3.1 8B, Qwen2.5 7B). 13-14B тоже запустится, но с меньшим запасом под контекст и другие приложения — закройте тяжёлый браузер перед запуском.
Почему модель тормозит, хотя памяти вроде хватает?
Проверьте, не ушла ли часть модели в своп — на SSD это в разы медленнее unified memory. Также длинный контекст (много истории диалога) сам по себе ест память сверх размера весов модели.
Есть ли разница между M1 и M4 по скорости, если модель одна и та же?
Да, ощутимая — у новых чипов быстрее память и больше ядер GPU, генерация токенов в секунду растёт заметно от поколения к поколению даже при одинаковом объёме RAM.
Разбираем свежие open-source инструменты каждый день — от локальных LLM до security-сканеров. Если хотите первыми видеть, что реально работает в 2026 — подписывайтесь на Telegram-канал REDDYX AI — новые репозитории каждые 30-60 минут.
