Обычные чат-боты отправляют ваши сообщения на сервер. Локальный компаньон делает всё на устройстве. Плюсы: переписка не покидает телефон, чат работает в самолёте, метро и там, где нет сети.
Ключевое понятие — квантование. Это снижение точности чисел в модели, чтобы файл занимал меньше места. Например, модель Llama 3.2 3B в оригинале весит около 6 ГБ, а с квантованием Q4 (4 бита на вес) — примерно 2 ГБ. Такую модель уже потянет обычный телефон.
Пример:на устройстве с 6 ГБ ОЗУ и квантованной моделью 3B ответ на вопрос «Расскажи анекдот» появляется за несколько секунд. Та же модель 13B на этом телефоне будет думать полминуты и сильно греться.
Сначала проверьте ОЗУ: Настройки → О телефоне → Память.
| Приложение | Отличие | Цена |
|---|---|---|
| MLCChat (Local AI Chat) | Минимум настроек, готовые модели Llama, Phi, Gemma | Бесплатно, open source |
| Pocket Llama | Лёгкие модели до 3B, быстрый запуск на слабых телефонах | Бесплатно |
| Layla | Один чат для локальных моделей (llama.cpp) и облачных API | Бесплатно |
| Termux + llama.cpp | Полный контроль, всё через командную строку | Бесплатно |
Пример:если телефон старый и слабый — начните с Pocket Llama и модели 1B. Если хочется просто поболтать офлайн — MLCChat с моделью Phi-3 mini.
Список поддерживаемых моделей в приложениях обновляют часто, поэтому перед установкой сверьтесь со страницей приложения в Google Play.
1. Проверьте ОЗУ и свободное место. Модель 3B занимает около 2 ГБ на диске. Ожидаемый результат: вы знаете, какая модель потянется на вашем телефоне.
2. Установите приложение из Google Play, например MLCChat (Local AI Chat) или Pocket Llama. Ожидаемый результат: на рабочем столе появился значок чата.
3. Откройте приложение и выберите модель. Список обычно сортируется по размеру и требованиям к ОЗУ. Ожидаемый результат: видна карточка модели с размером файла.
4. Скачайте модель по Wi-Fi — кнопка Download рядом с названием. Ожидаемый результат: прогресс-бар, после завершения модель появляется в списке.
5. Начните чат. Первое сообщение отвечает медленнее, потому что модель загружается в память. Ожидаемый результат: появился осмысленный ответ — значит, всё работает офлайн.
Почему это работает: модель хранится одним большим файлом на диске. При открытии чата приложение читает это файл и генерирует ответ прямо в процессоре телефона.
Termux — это эмулятор терминала Linux для Android. Внутри него собирается llama.cpp — движок для запуска LLM. Подходит, когда хочется ставить модели любых форматов GGUF (GGUF — стандартный формат файлов моделей для llama.cpp) и менять все параметры вручную.
pkg update && pkg install -y git cmake build-essential
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build -DCMAKE_BUILD_TYPE=Release
cmake --build build -j2
./build/bin/llama-cli -m ./model.gguf -p "Привет, как тебя зовут?"
Файл model.gguf нужно заранее положить в ту же папку — например, скачать с Hugging Face. Флаг `-m` указывает путь к модели, `-p` — стартовый текст. Сборка на телефоне долгая, поэтому это путь для экспериментов. А полный Linux с другими инструментами поднимается через PRoot — описание в гайде «Как запустить Linux на Android без root».
Проблема: ответ генерируется очень медленно.
Симптом: прошло больше 10 секунд, телефон заметно греется.
Решение: поставьте модель поменьше или найдите версию с более низким квантованием (например, Q4 вместо Q8). Качество ответов станет чуть хуже, но скорость вырастет значительно.
Проблема: приложение закрывается при запуске.
Симптом: чат открывается и тут же сворачивается на рабочий стол.
Решение: модели не хватает ОЗУ. Закройте фоновые приложения через кнопку «недавние» — проведите окнами вверх. Не помогло — выберите модель 1B вместо 3B.
Проблема: скачивание модели останавливается на середине.
Симптом: прогресс-бар замер на 58%, затем ошибка «Download failed».
Решение: удалите недокачанный файл (в настройках приложения обычно есть пункт Manage models), освободите место и скачайте заново по Wi-Fi. Мобильный интернет часто обрывает загрузку файла на пару гигабайт.
Сколько места занимают модели на телефоне?
Квантованные модели: 1B — около 500 МБ, 3B — около 2 ГБ, 7B — около 4 ГБ, 13B — около 8 ГБ. Точный размер виден в приложении перед скачиванием.
Нужен ли интернет после установки?
Только один раз — чтобы скачать файл модели. Дальше чат работает полностью офлайн.
Можно ли запускать локальную модель без Google Play?
Да. Скачайте APK из GitHub-репозитория приложения или используйте Termux. Ещё вариант — поставить Linux через PRoot и запускать те же инструменты, что и на ПК.
Чем локальный компаньон хуже облачного ChatGPT?
Он заметно «менее умный»: маленькие модели путаются в длинных диалогах и хуже отвечают на сложные вопросы. Зато данные не уходят на сервер, и можно общаться вообще без сети.
На всех ли телефонах это работает?
Начинать стоит с моделей 1–3B. Телефоны с 2–3 ГБ ОЗУ потянут только самые маленькие модели, и ответы будут медленными.
Какие ещё варианты попробовать?
Свежий обзор инструментов — в подборке «Лучшие ИИ-приложения для Android в 2026 году». А если захотите вывести чат на большой экран — поможет гайд «Как запускать Android-приложения и игры на ПК».