localhost:11434 и совместима с OpenAI-форматом API, поэтому подключается и к Cursor, и к open-source Continue за пару настроек, без единого байта кода наружу.Карточка проекта — звёзды, техстек, ссылка на исходники — в каталоге REDDYX: continuedev/continue. Сам движок — в карточке ollama/ollama.
ПОЧЕМУ ЛОКАЛЬНОЕ АВТОДОПОЛНЕНИЕ ВООБЩЕ НУЖНО
Три причины переходить на локальную модель: код не покидает машину (NDA, закрытые репозитории), нет счёта за токены при активном использовании весь день, и нет зависимости от доступности внешнего API. Плата — качество автодополнения обычно чуть ниже топовых облачных моделей, особенно на сложном архитектурном рефакторинге.
ПОДКЛЮЧЕНИЕ К CONTINUE (OPEN SOURCE)
Continue — open-source расширение для VS Code и JetBrains, изначально спроектированное под любые модели, включая локальные. Конфиг config.json:
{
"models": [
{
"title": "Ollama Qwen Coder",
"provider": "ollama",
"model": "qwen2.5-coder:7b",
"apiBase": "http://localhost:11434"
}
],
"tabAutocompleteModel": {
"title": "Autocomplete",
"provider": "ollama",
"model": "qwen2.5-coder:1.5b-base"
}
}
Для автодополнения строки (tab-complete) держите модель поменьше и быструю — задержка критична, пока вы печатаете. Для чата и рефакторинга по запросу — модель побольше, задержка в 2-3 секунды там не мешает.
ПОДКЛЮЧЕНИЕ К CURSOR
Cursor — закрытый форк VS Code, но поддерживает кастомный OpenAI-совместимый endpoint для чата (не для встроенного tab-автодополнения — оно у Cursor завязано на собственные модели). В настройках: Models → Add Custom Model → указать base URL http://localhost:11434/v1 и любое имя модели, которое у вас скачано в Ollama.
Практика показывает: полностью заменить фирменное автодополнение Cursor локальной моделью не выйдет — но чат-помощник и объяснение кода через локальный endpoint работают полноценно.
КАКУЮ МОДЕЛЬ БРАТЬ ДЛЯ КОДА
| Задача | Модель | Почему |
|---|---|---|
| Tab-автодополнение (низкая задержка) | qwen2.5-coder:1.5b / 3b | Отвечает за десятки-сотни миллисекунд |
| Чат-рефакторинг | qwen2.5-coder:7b / 14b | Баланс качества и скорости на локальном железе |
| Сложный многофайловый анализ | Облачная модель через тот же прокси | Локальные модели пока уступают на длинном контексте |
ОТКРЫТЬ OLLAMA ПО СЕТИ ДЛЯ IDE НА ДРУГОЙ МАШИНЕ
# на сервере с Ollama — слушать не только localhost
OLLAMA_HOST=0.0.0.0:11434 ollama serve
# в IDE на клиентской машине указать apiBase
# http://IP_СЕРВЕРА:11434
Так можно держать мощную машину с GPU в сети, а работать с ноутбука — конфиг в IDE не меняется, кроме адреса.
Частые вопросы
Просядет ли качество автодополнения по сравнению с Copilot?
На простых шаблонных вставках разница почти не заметна. На сложной архитектурной логике специализированные облачные модели пока стабильно точнее — это честный компромисс за приватность.
Можно ли использовать одну и ту же Ollama для нескольких IDE одновременно?
Да, Ollama — обычный HTTP-сервер, к нему может обращаться сколько угодно клиентов параллельно, ограничение только в производительности железа.
Нужна ли видеокарта для комфортного автодополнения?
Желательна для моделей от 7B — на чистом CPU задержка автодополнения может стать раздражающей. Для моделей 1.5-3B современный CPU или Apple Silicon справляется приемлемо.
Разбираем свежие open-source инструменты каждый день — от локальных LLM до security-сканеров. Если хотите первыми видеть, что реально работает в 2026 — подписывайтесь на Telegram-канал REDDYX AI — новые репозитории каждые 30-60 минут.
