# PII-фильтр перед облачными моделями: почему селф-хост LLM не нужен

> 2026-10-06 · AI Release · @ai_release1

> #PII #LLM #guardrails #селф-хост #облачные

### ⚡ Главное за 5 секунд - Суть: автор отказался от полного селф-хоста LLM и поставил собственный PII-фильтр перед облачными моделями. - Где доступно: используется self-hosted guardrails-llm-filter от Cloud.ru (Apache-2.0) как прокси между клиентом и облачной моделью. - Ограничение: в режиме enforce фильтр заменяет персональные данные и секреты плейсхолдерами, в detect — только пишет в журнал; при сбое маскирования запрос может уйти без обработки, что теперь отслеживается как инцидент. ### 🔍 Что обнаружено За последние два месяца автор протестировал для селф-хоста RTX PRO 6000 96GB, RTX4090 48GB и даже H200, купил RTX5070ti и V100 32GB и прогнал большое количество бенчмарков. После роста цен на железо и череды утечек персональных данных у LLM-провайдеров он сосредоточился на фильтрации. Первый фильтр запущен 17 сентября, а 22 сентября система упала: из-за отсутствия домашней директории у системного пользователя go build не собрал бинарник, Ansible не пересобрал его, и systemd безуспешно пытался запустить процесс более 2 600 раз около четырёх часов. Причиной оказался режим detect, случайно оставленный в настройках; после фикса enforce прописан и в стартовом значении, и в применённых настройках. До этого автор использовал хук внутри клиента, но тот не мог вернуть исходные значения в ответе — в ответах моделей появлялись плейсхолдеры [EMAIL_01] и [EMAIL_02]. После перехода на guardrails-llm-filter обработка идёт и по запросу, и по ответу. LiteLLM отклонили из-за тестов: промежуточный прокси ломает общий префикс, из-за чего экономия кэша промптов падает примерно на 90%, а у автора почти 1.5B кэшированных токенов за три недели. ### 💡 Почему это важно Практическая польза в том, что для контроля чувствительных данных не обязательно поднимать LLM на своём железе: достаточно очищать запросы и ответы на своей стороне. Автор продолжает пользоваться топовыми облачными моделями, снижая риск утечки, а локальные Gemma4 и Qwen3.8 оставил в stand-by на ноутбуке и LXC с RTX5070ti для других задач. Это рабочий компромисс между производительностью облачных моделей и приватностью, причём без отказа от облака. ### 🧩 Контекст Селф-хост изначально рассматривался как основной вариант, но тесты RTX PRO 6000 96GB, RTX4090 48GB, H200 и покупка RTX5070ti с V100 32GB показали, что локальные модели пока не дотягивают до топовых облачных. Параллельно автор увидел бешеный рост цен на железо и череду утечек к провайдерам LLM, что ускорило поиск решения. Сейчас система фильтрации стоит между облаком и всем трафиком, а два монитора в OneUptime контролируют heartbeat и fail-open метрики: в метриках только счётчики, типы данных и задержки, без текстов запросов. После сегодняшнего рестарта с заменой GPU фильтр поднялся в enforce с шестью типами данных и полностью прочитанными настройками.

[Источник](https://habr.com/ru/articles/1091236/)
