УСТАНОВКА ЗА ОДНУ КОМАНДУ
Ollama к 2026 году стал стандартом де-факто для локального запуска LLM — 95 000+ звёзд на GitHub. Причина простая: он прячет всю возню с весами, квантизацией и бэкендами за интерфейсом уровня docker run.
macOS
На Apple Silicon это самый беспроблемный вариант: Metal-ускорение работает из коробки, ничего доустанавливать не нужно.
brew install ollama
brew services start ollama
ollama run llama3.1:8b
Либо скачать .dmg с ollama.com — тогда приложение само пропишется в автозагрузку и появится иконка в меню-баре.
Linux
curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama
ollama run llama3.1:8b
Скрипт сам создаёт systemd-юнит и пользователя ollama. Если у вас NVIDIA — он же подтянет CUDA-бэкенд, но только при наличии рабочего драйвера (проверка ниже).
Windows и Windows Server
Начиная с нативной сборки, WSL больше не обязателен — есть обычный установщик. Для Windows Server, где GUI часто отключён, ставим тихо:
winget install Ollama.Ollama
# или тихая установка:
OllamaSetup.exe /VERYSILENT /NORESTART
После установки открывайте новое окно терминала — иначе ollama не найдётся в PATH. Это причина номер один «команда не распознана» сразу после установки.
СКОЛЬКО ПАМЯТИ НУЖНО: ТАБЛИЦА
Главная ошибка новичка — скачать модель, а потом считать, влезет ли она. Считать надо до. Практическое правило для Q4-квантизации (самый ходовой уровень сжатия): примерно 1 ГБ памяти на 1 миллиард параметров, плюс запас под контекст.
| Модель | Параметров | RAM/VRAM при Q4 | Комфортное железо |
|---|---|---|---|
| llama3.2:3b | 3B | ~3 ГБ | любой ноутбук от 8 ГБ |
| llama3.1:8b | 8B | ~5 ГБ | 16 ГБ RAM / RTX 3060 |
| qwen2.5-coder:14b | 14B | ~9 ГБ | M-серия 16 ГБ / RTX 4070 |
| gemma2:27b | 27B | ~17 ГБ | 32 ГБ RAM / RTX 4090 |
| llama3.3:70b | 70B | ~42 ГБ | 64+ ГБ / 2×4090 / Mac Studio |
Контекст ест сверху. При 32k токенов добавьте примерно 2-4 ГБ, при 128k — уже до 15 ГБ в зависимости от архитектуры. Если упёрлись — включайте квантизацию KV-кэша, она даёт в 3-3,5 раза больше контекста на той же памяти.
ОШИБКА 1: ВСЁ РАБОТАЕТ, НО ЧУДОВИЩНО МЕДЛЕННО
Симптом: 1-2 токена в секунду, ответ на простой вопрос идёт минуту. Причина почти всегда одна — модель целиком крутится на CPU, GPU не задействован.
Проверка на NVIDIA:
nvidia-smi
ollama ps
В выводе ollama ps смотрите колонку PROCESSOR. Если там 100% CPU — GPU не подхватился. Что делать:
- Драйвер старый. Нужна версия 525+, реально стабильно работает с 550+. Это причина большинства провалов детекции.
- Модель не влезла в VRAM. Ollama выгружает лишние слои на CPU. Берите квант поменьше или модель компактнее.
- Несовпадение версий CUDA toolkit. Ollama тянет свой рантайм, конфликт с системным CUDA ломает детекцию.
На Apple Silicon такой проблемы нет: Metal работает через системные фреймворки. Если на Mac медленно — значит модель просто больше объёма унифицированной памяти и началась подкачка.
ОШИБКА 2: НЕ ДОСТУЧАТЬСЯ ПО СЕТИ (localhost:11434)
По умолчанию Ollama слушает только 127.0.0.1:11434. С другой машины, из Docker-контейнера или с телефона вы туда не попадёте — это не баг, а осознанный дефолт безопасности.
Открыть наружу на Linux:
systemctl edit ollama
# добавить:
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
systemctl daemon-reload && systemctl restart ollama
На macOS:
launchctl setenv OLLAMA_HOST "0.0.0.0:11434"
brew services restart ollama
На Windows — переменная среды OLLAMA_HOST со значением 0.0.0.0:11434, затем перезапуск службы.
Важно про безопасность. У Ollama нет встроенной авторизации. Выставив порт в интернет напрямую, вы отдаёте свою видеокарту кому угодно. Закрывайте файрволом до доверенной подсети или ставьте перед ним nginx с basic-auth.
ОШИБКА 3: КАКУЮ МОДЕЛЬ ВООБЩЕ БРАТЬ
Ollama тянет модели из своего реестра, но никто не мешает подсунуть свой GGUF-файл — например, скачанный с Hugging Face.
# через реестр
ollama pull qwen2.5-coder:14b
# свой GGUF-файл
cat > Modelfile <<'EOF'
FROM ./model-q4_k_m.gguf
PARAMETER num_ctx 8192
EOF
ollama create mymodel -f Modelfile
Ориентир по задачам на середину 2026:
- Код — qwen2.5-coder, deepseek-coder-v2
- Русский язык — qwen2.5, gemma2, из локальных вариантов — семейство GigaChat
- Слабое железо — llama3.2:3b, phi-4-mini
- Рассуждения — deepseek-r1 и его дистилляты
Свежие релизы и их локальные сборки удобно отслеживать в каталоге репозиториев REDDYX — там видно, что появилось за неделю и сколько собрало звёзд.
ЗАПУСК КАК СЕРВИС НА СЕРВЕРЕ
Для Windows Server и Linux-серверов важно, чтобы Ollama пережил перезагрузку и не зависел от сессии пользователя.
# Linux — уже настроено установщиком, просто включить автозапуск
systemctl enable --now ollama
# проверка снаружи
curl http://SERVER_IP:11434/api/tags
На Windows Server удобнее обернуть в службу через NSSM, если стандартный установщик поставил Ollama в пользовательский автозапуск, а не в системные службы.
Полезные переменные для сервера:
| Переменная | Что делает |
|---|---|
OLLAMA_KEEP_ALIVE | Сколько держать модель в памяти после запроса (по умолчанию 5м, для сервера ставят -1) |
OLLAMA_MAX_LOADED_MODELS | Сколько моделей держать одновременно |
OLLAMA_NUM_PARALLEL | Параллельных запросов к одной модели |
OLLAMA_MODELS | Куда складывать веса (вынести на большой диск) |
ПОДКЛЮЧЕНИЕ К ПРИЛОЖЕНИЯМ: OPENAI-СОВМЕСТИМЫЙ API
Ollama отдаёт OpenAI-совместимый эндпоинт — это значит, что почти любой инструмент, умеющий работать с OpenAI, переключается на локальную модель сменой base_url.
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama", # любое непустое значение
)
r = client.chat.completions.create(
model="llama3.1:8b",
messages=[{"role": "user", "content": "Привет"}],
)
print(r.choices[0].message.content)
Так подключаются Open WebUI, Continue, Cline, LangChain и десятки других клиентов.
FAQ
Можно ли обучать модель на MacBook через Ollama?
Ollama — это инференс, обучение он не делает. Для дообучения на Apple Silicon смотрите MLX от Apple или LoRA-тюнинг через unsloth на арендованной GPU — на ноутбуке полноценный файнтюн даже небольшой модели упрётся в память и время.
Почему Ollama не видит скачанный GGUF?
Файл сам по себе не подхватывается — нужен Modelfile с директивой FROM и команда ollama create. Просто положить .gguf в папку моделей недостаточно.
Какой командой скачать Ollama на Linux?
curl -fsSL https://ollama.com/install.sh | sh — универсальный вариант для Debian/Ubuntu/Fedora/Arch. В некоторых дистрибутивах есть пакет в репозитории, но он часто отстаёт на несколько версий.
Сколько моделей можно держать загруженными одновременно?
Зависит от памяти и OLLAMA_MAX_LOADED_MODELS. Практически: две модели по 8B на 32 ГБ RAM живут спокойно, дальше начинается выгрузка и тормоза при переключении.
