ПОЧЕМУ EDGE AI ВЗОРВАЛСЯ ИМЕННО СЕЙЧАС
Ещё пару лет назад фраза «запускаю LLM на телефоне» звучала как понты. Модель либо не влезала в память, либо грела корпус до состояния сковородки и сажала батарею за 15 минут. К 2026 году сошлись три вещи одновременно, и картина поменялась.
Первое — железо. Флагманские SoC (Snapdragon 8 Elite, Apple A18/A19, Dimensity 9400) несут NPU с производительностью в десятки TOPS. Это выделенный блок под матричные операции, а не универсальные ядра CPU. Второе — квантование. Модель в формате Q4 (4 бита на вес) весит в 4 раза меньше, чем fp16, и на телефоне это разница между «не запускается» и «работает шустро». Третье — движки инференса дозрели: llama.cpp, MediaPipe, ONNX Runtime, MLC — все получили нормальную поддержку мобильных бэкендов.
Смысл edge AI простой: вычисление происходит на устройстве пользователя, а не на сервере. Никакого round-trip до дата-центра, никакой оплаты за токены, и данные не покидают телефон. Для целого класса задач это не «приятный бонус», а обязательное требование.
ЧТО ТАКОЕ ИНФЕРЕНС НА УСТРОЙСТВЕ И ГДЕ ГРАНИЦА
Инференс — это прогон уже обученной модели, то есть получение предсказания. Обучать на телефоне никто в здравом уме не будет (кроме лёгкого on-device fine-tuning вроде LoRA), а вот гонять готовую модель — вполне.
Ключевое ограничение — оперативка. Не путайте с накопителем: модель в 4B параметров в Q4 занимает примерно 2.2-2.5 ГБ, и её нужно целиком держать в RAM во время работы. На телефоне с 8 ГБ памяти это уже впритык, потому что iOS и Android агрессивно убивают приложения, жрущие много памяти. Поэтому на мобилках правит бал диапазон 0.5B-4B параметров. Всё, что выше 7-8B — это уже про топовые устройства с 12-16 ГБ и терпимостью к разряду батареи.
- 0.5B-1B — классификация, извлечение сущностей, простые ответы, автодополнение. Летает даже на среднем железе.
- 2B-4B — осмысленный чат, суммаризация, перевод, RAG над локальными документами. Сладкая точка 2026 года.
- 7B+ — только флагманы, ощутимый нагрев, tokens/sec падает.
ДВИЖКИ: ЧЕМ ЗАПУСКАТЬ В 2026
Выбор фреймворка решает больше, чем выбор модели. Ниже — сравнение того, что реально используют, а не то, что красиво выглядит в README. Цифры производительности обобщённые, по замерам сообщества на флагманах — на вашем железе будет свой результат.
| Движок | Платформа | Ускорение | Формат | Когда брать |
|---|---|---|---|---|
| llama.cpp | Android, iOS, всё | CPU, Metal, отчасти NPU | GGUF | Максимум контроля, любые модели |
| MediaPipe LLM | Android, iOS, Web | GPU/NPU | .task / TFLite | Быстрый старт от Google, готовые API |
| MLC LLM | Android, iOS | GPU (Vulkan/Metal) | MLC-компиляция | Высокий tokens/sec, но сложнее сборка |
| ONNX Runtime | Android, iOS | NNAPI, CoreML, QNN | ONNX | Не только LLM: зрение, аудио |
| Apple Foundation Models | iOS/macOS | Neural Engine | системный | Нативно на Apple, ноль весов в бандле |
Отдельно отмечу: Apple в своей системной модели даёт доступ к on-device LLM прямо через фреймворк, и вам не нужно тащить гигабайты весов в приложение — они уже в системе. Аналогично Google двигает Gemini Nano на Android через AICore. Это меняет экономику: вес приложения не раздувается, а обновление модели прилетает с ОС. Свежие релизы движков и мобильных моделей удобно отслеживать в каталоге REDDYX.
ПРИВАТНОСТЬ КАК ГЛАВНЫЙ АРГУМЕНТ
Тут edge AI выигрывает у облака вчистую. Когда инференс идёт локально, промпт пользователя, его переписка, медицинские заметки, финансовые данные — ничего не улетает на чужой сервер. Это не абстракция, а конкретные бизнес-требования.
- GDPR и локальные законы о данных. Если данные не покидают устройство, половина юридических рисков просто испаряется.
- Оффлайн-работа. Модель работает в самолёте, в метро, в поле без связи. Облачный ассистент там мёртв.
- Нет утечки через логи провайдера. Вы не зависите от того, как облачный вендор хранит и обучается на ваших запросах.
- Латентность. Первый токен приходит за десятки миллисекунд, без сетевого round-trip.
Обратная сторона: приватность стоит ресурсов устройства. Вы платите не токенами облаку, а батареей и памятью пользователя. Это честный размен, и его надо закладывать в архитектуру.
РАБОЧИЙ ПРИМЕР: ЗАПУСК LLM НА ТЕЛЕФОНЕ
Самый доступный путь для прототипа — llama.cpp с квантованной GGUF-моделью. Сначала соберём и проверим на десктопе, потом ту же модель кладём в мобильный бандл. Вот минимальный рабочий цикл на Python-биндингах, который гоняет модель локально:
pip install llama-cpp-python
# скачиваем квантованную модель ~2B в Q4 (GGUF)
# затем в коде:
from llama_cpp import Llama
llm = Llama(
model_path="./model-2b-q4_k_m.gguf",
n_ctx=2048, # окно контекста
n_threads=6, # ядра CPU
n_gpu_layers=-1, # выгрузить слои на GPU/Metal, если есть
)
out = llm(
"Кратко объясни, что такое edge AI:",
max_tokens=256,
temperature=0.4,
stop=["\n\n"],
)
print(out["choices"][0]["text"].strip())
На Android этот же GGUF заводится через JNI-обёртку llama.cpp или готовые библиотеки; на iOS — через Swift-биндинги с бэкендом Metal. Флаг n_gpu_layers — критичный: он выгружает слои на графику и на мобилке даёт ощутимый прирост tokens/sec. Для продакшена на Android многие берут MediaPipe, где API короче:
// Android, MediaPipe LLM Inference API (Kotlin)
val options = LlmInference.LlmInferenceOptions.builder()
.setModelPath("/data/local/tmp/model.task")
.setMaxTokens(512)
.setPreferredBackend(Backend.GPU)
.build()
val llm = LlmInference.createFromOptions(context, options)
val response = llm.generateResponse("Суммируй этот текст: ...")
Log.d("EdgeAI", response)
ЗАМЕРЫ, БАТАРЕЯ И НАГРЕВ — ЧЕСТНО
Что реально ждать по производительности. По замерам сообщества на флагманах 2025-2026 модель 2-4B в Q4 выдаёт ориентировочно 15-40 tokens/sec на GPU/NPU-бэкенде. На CPU-only цифра падает в разы. Это не абсолютная истина — зависит от SoC, теплового троттлинга и длины контекста.
Практические грабли, о которых не пишут в туториалах:
- Тепловой троттлинг. Первые 30 секунд модель летит, потом SoC греется и частота падает. Длинную генерацию стоит бить на куски.
- Prefill vs decode. Обработка длинного промпта (prefill) грузит железо иначе, чем генерация токенов (decode). Большой RAG-контекст может дать заметную задержку до первого токена.
- Память под контекст. KV-кэш растёт с длиной контекста. Окно в 8K токенов на 4B-модели может добавить сотни мегабайт сверху к весам.
- Холодный старт. Загрузка весов с накопителя в RAM — это секунды. Держите модель тёплой, если UX требует мгновенного ответа.
КОГДА EDGE, А КОГДА ОБЛАКО
Не надо тащить всё на устройство из принципа. Здоровая архитектура 2026 года — гибрид. Простое и приватное — локально, тяжёлое и редкое — в облако.
- Локально: автодополнение, классификация, извлечение данных из фото/текста, оффлайн-перевод, приватный чат по личным заметкам, wake-word и распознавание речи.
- Облако: сложные рассуждения на 70B+, генерация изображений/видео, задачи с огромным контекстом, всё где качество важнее приватности и латентности.
Паттерн «router»: маленькая on-device модель сама решает, потянет ли она запрос, и эскалирует в облако только сложное. Так вы режете облачные счета и держите приватность там, где она нужна.
С ЧЕГО НАЧАТЬ ПРЯМО СЕЙЧАС
- Возьмите готовую квантованную модель 1-3B в GGUF и прогоните её на десктопе через llama-cpp-python — оцените качество под свою задачу.
- Замерьте tokens/sec и память. Если не влезаете в бюджет — берите модель меньше или квант агрессивнее (Q4 вместо Q8).
- Перенесите на телефон через MediaPipe (быстрый старт) или llama.cpp (полный контроль).
- Профилируйте нагрев и батарею на реальном устройстве, а не на эмуляторе — эмулятор врёт про производительность.
- Заложите гибридный fallback в облако для запросов, которые модель не тянет.
Инструменты и новые on-device модели появляются буквально каждую неделю — самые свежие релизы под мобильный инференс собраны в каталоге REDDYX.
Частые вопросы
Какая модель влезет на телефон с 8 ГБ RAM?
Комфортно — модели до 4B параметров в квантовании Q4 (вес весов около 2.2-2.5 ГБ). Учитывайте, что ОС и другие приложения тоже едят память, а KV-кэш растёт с длиной контекста, поэтому реальный запас меньше номинала.
Edge AI работает без интернета?
Да, в этом весь смысл. После того как веса модели загружены на устройство, инференс идёт полностью локально и не требует сети. Это ключевое отличие от облачных ассистентов и главный аргумент за приватность.
Насколько это безопаснее облака по приватности?
При инференсе на устройстве промпты и данные пользователя физически не покидают телефон, что снимает риски утечки через логи провайдера и упрощает соответствие GDPR. Проверяйте только, чтобы приложение не отправляло данные телеметрии стороной.
Какой движок выбрать новичку?
Для быстрого прототипа на Android — MediaPipe LLM Inference API (короткий код, GPU из коробки). Для максимального контроля и любых моделей на всех платформах — llama.cpp с форматом GGUF. Для нативной интеграции на Apple — системные Foundation Models без веса в бандле.
Мобильный инференс — самая быстрорастущая ниша ИИ в 2026-м, и пропустить релиз новой on-device модели легко. Если хотите держать руку на пульсе без ручного мониторинга GitHub — залетайте в Telegram-канал REDDYX AI — новые репозитории каждые 30-60 минут.