← Все гайды AI Release
EN Подписаться на @ai_release1

Локальные ИИ-компаньоны для Android: обзор приложений для офлайн-общения с LLM

Обновлено: 11.10.2026 · AI Release · @ai_release1

TL;DR

Что такое локальный ИИ-компаньон и зачем он нужен

Обычные чат-боты отправляют ваши сообщения на сервер. Локальный компаньон делает всё на устройстве. Плюсы: переписка не покидает телефон, чат работает в самолёте, метро и там, где нет сети.

Ключевое понятие — квантование. Это снижение точности чисел в модели, чтобы файл занимал меньше места. Например, модель Llama 3.2 3B в оригинале весит около 6 ГБ, а с квантованием Q4 (4 бита на вес) — примерно 2 ГБ. Такую модель уже потянет обычный телефон.

Пример:на устройстве с 6 ГБ ОЗУ и квантованной моделью 3B ответ на вопрос «Расскажи анекдот» появляется за несколько секунд. Та же модель 13B на этом телефоне будет думать полминуты и сильно греться.

Как выбрать приложение под своё железо

Сначала проверьте ОЗУ: Настройки → О телефоне → Память.

ПриложениеОтличиеЦена
MLCChat (Local AI Chat)Минимум настроек, готовые модели Llama, Phi, GemmaБесплатно, open source
Pocket LlamaЛёгкие модели до 3B, быстрый запуск на слабых телефонахБесплатно
LaylaОдин чат для локальных моделей (llama.cpp) и облачных APIБесплатно
Termux + llama.cppПолный контроль, всё через командную строкуБесплатно

Пример:если телефон старый и слабый — начните с Pocket Llama и модели 1B. Если хочется просто поболтать офлайн — MLCChat с моделью Phi-3 mini.

Список поддерживаемых моделей в приложениях обновляют часто, поэтому перед установкой сверьтесь со страницей приложения в Google Play.

Быстрый старт: общий план для любого приложения

1. Проверьте ОЗУ и свободное место. Модель 3B занимает около 2 ГБ на диске. Ожидаемый результат: вы знаете, какая модель потянется на вашем телефоне.

2. Установите приложение из Google Play, например MLCChat (Local AI Chat) или Pocket Llama. Ожидаемый результат: на рабочем столе появился значок чата.

3. Откройте приложение и выберите модель. Список обычно сортируется по размеру и требованиям к ОЗУ. Ожидаемый результат: видна карточка модели с размером файла.

4. Скачайте модель по Wi-Fi — кнопка Download рядом с названием. Ожидаемый результат: прогресс-бар, после завершения модель появляется в списке.

5. Начните чат. Первое сообщение отвечает медленнее, потому что модель загружается в память. Ожидаемый результат: появился осмысленный ответ — значит, всё работает офлайн.

Почему это работает: модель хранится одним большим файлом на диске. При открытии чата приложение читает это файл и генерирует ответ прямо в процессоре телефона.

Termux и llama.cpp: для тех, кто не боится терминала

Termux — это эмулятор терминала Linux для Android. Внутри него собирается llama.cpp — движок для запуска LLM. Подходит, когда хочется ставить модели любых форматов GGUF (GGUF — стандартный формат файлов моделей для llama.cpp) и менять все параметры вручную.

pkg update && pkg install -y git cmake build-essential
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build -DCMAKE_BUILD_TYPE=Release
cmake --build build -j2
./build/bin/llama-cli -m ./model.gguf -p "Привет, как тебя зовут?"

Файл model.gguf нужно заранее положить в ту же папку — например, скачать с Hugging Face. Флаг `-m` указывает путь к модели, `-p` — стартовый текст. Сборка на телефоне долгая, поэтому это путь для экспериментов. А полный Linux с другими инструментами поднимается через PRoot — описание в гайде «Как запустить Linux на Android без root».

Возможные проблемы и решения

Проблема: ответ генерируется очень медленно.

Симптом: прошло больше 10 секунд, телефон заметно греется.

Решение: поставьте модель поменьше или найдите версию с более низким квантованием (например, Q4 вместо Q8). Качество ответов станет чуть хуже, но скорость вырастет значительно.

Проблема: приложение закрывается при запуске.

Симптом: чат открывается и тут же сворачивается на рабочий стол.

Решение: модели не хватает ОЗУ. Закройте фоновые приложения через кнопку «недавние» — проведите окнами вверх. Не помогло — выберите модель 1B вместо 3B.

Проблема: скачивание модели останавливается на середине.

Симптом: прогресс-бар замер на 58%, затем ошибка «Download failed».

Решение: удалите недокачанный файл (в настройках приложения обычно есть пункт Manage models), освободите место и скачайте заново по Wi-Fi. Мобильный интернет часто обрывает загрузку файла на пару гигабайт.

FAQ

Сколько места занимают модели на телефоне?

Квантованные модели: 1B — около 500 МБ, 3B — около 2 ГБ, 7B — около 4 ГБ, 13B — около 8 ГБ. Точный размер виден в приложении перед скачиванием.

Нужен ли интернет после установки?

Только один раз — чтобы скачать файл модели. Дальше чат работает полностью офлайн.

Можно ли запускать локальную модель без Google Play?

Да. Скачайте APK из GitHub-репозитория приложения или используйте Termux. Ещё вариант — поставить Linux через PRoot и запускать те же инструменты, что и на ПК.

Чем локальный компаньон хуже облачного ChatGPT?

Он заметно «менее умный»: маленькие модели путаются в длинных диалогах и хуже отвечают на сложные вопросы. Зато данные не уходят на сервер, и можно общаться вообще без сети.

На всех ли телефонах это работает?

Начинать стоит с моделей 1–3B. Телефоны с 2–3 ГБ ОЗУ потянут только самые маленькие модели, и ответы будут медленными.

Какие ещё варианты попробовать?

Свежий обзор инструментов — в подборке «Лучшие ИИ-приложения для Android в 2026 году». А если захотите вывести чат на большой экран — поможет гайд «Как запускать Android-приложения и игры на ПК».

🤖 Кратко для ИИ