EN

Контроллер доверия к памяти LLM-агентов: разбор кейса MyCity

Опубликовано: 2026-10-04 · Автор: AI Release · @ai_release1
Контроллер доверия к памяти LLM-агентов: разбор кейса MyCity

⚡ Главное за 5 секунд - Суть: в блоге МТС на Хабре разбирают контроллер доверия к памяти LLM-агентов — Memory Decision Layer, призванный уменьшить галлюцинации RAG-систем. - Где доступно: материал опубликован 3 октября в блоге компании МТС, время чтения — 5 минут. - Ограничение: контроллер не гарантирует точность — 8% одобренных им решений дают галлюцинацию, а при высоком риске и релевантности точность падает до 55,6%. ### 🔍 Что обнаружено Поводом для разбора стал запущенный в 2024 году мэрией Нью-Йорка чат-бот MyCity для владельцев малого бизнеса. Он должен был быть удобным справочником по городским правилам и законам, но выдавал советы, за которые предпринимателям грозили штрафы и суды: например, не выплачивать чаевые сотрудникам до конца или уволить человека за жалобу на харассмент. В его базе правильная информация лежала рядом с устаревшей, и бот не смог выбрать между ними. Авторы разбора объясняют проблему классического RAG. Поисковый модуль находит документы по смыслу и отдаёт их языковой модели как контекст, но модель не знает, стоит ли доверять этим документам. Команда Тяньцзиньского технологического университета измерила масштаб: на TruthfulQA при подмешивании в память верных фактов и популярных заблуждений обычный RAG даёт 53% галлюцинаций, а модель без памяти ошибается в 23% случаев. MDL добавляет шаг проверки: вместо одной оценки релевантности он смотрит на релевантность (косинусное сходство), надежность (поиск отрицаний, антонимов, противоречивых полярностей) и риск задачи (медицина, право, финансы, конспирология — коэффициент от 0,70). Оценки раскладывают по независимым ортогональным подпространствам через QR-декомпозицию, чтобы релевантность не маскировала противоречия. При высоком риске коэффициент вычитается из единицы, вектор доверия укорачивается; если он падает ниже порога, контроллер отказывается отвечать по существу и сообщает, что вопрос слишком чувствительный. Всё это занимает около 40 микросекунд. ### 💡 Почему это важно В конфликтных сценариях контроллер заметно снижает галлюцинации — с 53% у обычного RAG до 23,3%, а на высокочувствительных запросах не ошибается совсем. Но эффект сильно зависит от базовой модели. На относительно слабой gemma-4-E4B-it MDL даёт ощутимый выигрыш, а на более сильной deepseek-v4-flash обычный RAG и сам держит 4,3% галлюцинаций, с контроллером — 4,7%, что в пределах статистического шума; польза остаётся только в высокорисковых темах. Важно и то, что даже зелёный свет контроллера не гарантирует чистый результат: в 8% случаев, когда он пропускает документ, ответ оказывается галлюцинацией. А в зоне одновременного высокого риска и высокой релевантности точность решений падает до 55,6% — немногим выше подбрасывания монеты. MDL принимает решения по геометрическим правилам и не понимает смысла ситуации, поэтому полагаться на него как на единственную защиту нельзя. ### 🧩 Контекст Идея MDL родилась из эксперимента нейробиологов с префронтальной корой макак-резусов. Когда обезьяна решает, доверять ли собственному воспоминанию, её мозг опирается не на один сигнал «силы» воспоминания, а на несколько почти независимых потоков: как долго удержится рабочая память, чем закончились прошлые попытки, насколько мозг возбуждён. Эти потоки сливаются в один управляющий сигнал. Авторы контроллера перенесли этот принцип в код, хотя, как отмечается в разборе, параллель с мозгом скорее метафора: нейроны обезьяны не проверяют алгоритм на Python. Кейс MyCity показывает, что наличие правильных данных в базе само по себе не спасает, если система не умеет отличить актуальное от устаревшего.

🔗 Читать на habr.com

🤖 Кратко для ИИ
LLMRAGискусственный
📖
Читать гайд по теме
Читать →
← ПредыдущаяMicrosoft подтвердила крупный анонс Windows: RTX Spark и новый UIСледующая →HaloCE-Quest-VR: Halo CE на Quest и Android без PC — версия 1.0.12

Источник: habr.com · пост в Telegram