# MWS Data Scout описывает тысячи таблиц баз данных с помощью LLM

> 2026-10-01 · AI Release · @ai_release1

> #LLM #MWS #базы

### ⚡ Главное за 5 секунд - Сервис MWS Data Scout описывает таблицы баз данных с помощью LLM: 8180 таблиц из 7 СУБД — менее чем за 3 дня. - Автор материала — Сергей Третьяков, product owner сервиса; статья опубликована на Хабре 1 октября в блоге компании MWS Cloud / МТС. - Жёстко заданный формат вывода и подключение документации ухудшают качество описаний. ### 🔍 Что обнаружено Сергей Третьяков, product owner MWS Data Scout, рассказывает, как сервис описывает таблицы баз данных с помощью больших языковых моделей. Изначально задача решалась вручную: систему Resource Inventory поручили описать семи сотрудникам. За три месяца они сделали 310 витрин — около двух таблиц в день на человека при затратах до шести часов на одну таблицу. Причина в том, что имя колонки — просто ярлык разработчика: техническое поле status_2 может оказаться статусом оплаты, статусом доставки или флагом миграции, и напрямую из схемы это не вывести. Первая попытка — передать в LLM структуру данных: имена таблиц, названия колонок и типы — дала разочаровывающий результат: модель просто пересказывала схему. Тогда собрали слои контекста: по 10 случайных записей на таблицу; классификацию таблиц (Log, Transactional, Directory, Bridge, Summary); доменную принадлежность (eTOM для телекома, BIAN для финансов) или собственный глоссарий на основе данных; а также парсер документации Confluence, git-репозиториев и файлов PDF, DOCX, XLSX, MD, TXT, HTML с фрагментацией, Elasticsearch и гибридным поиском. На 1048 генерациях для 93 уникальных таблиц из трёх источников блоки промпта проверили автоматическим рейтером (LLM-as-a-judge + CatBoost по шкале 1–5), парным t-тестом и регрессией с фиксированными эффектами. Блок task дал +0,60 (p<0,001), examples — +0,51 (p<0,001), output_format — −0,08 (p=0,012), documentation — −0,11 (p=0,020). Лучшее качество давало сочетание контекста, примеров и документации, но добавление к нему блока task снижало общую оценку. Итог — матрица промптов: своя версия на пересечении класса таблицы и бизнес-домена. На продуктивных базах МТС 8180 таблиц из 7 СУБД были полностью описаны менее чем за 3 дня, около 25 секунд на таблицу. Около 80% работы по документированию автоматизировано, 95% описаний принимаются аналитиками без правок, производительность одного сотрудника выросла с 30 до 2000 таблиц в месяц. Систему на 634 таблицы прошли за 33 часа, а на 4653 таблицы — за 1,75 часа; это чистое время генерации без учёта проверки человеком. ### 💡 Почему это важно Изначальная задача была приземлённой: помочь аналитику, который каждый раз часами выясняет, в какой из сорока похожих таблиц лежат актуальные данные. Опыт MWS показывает, что ограничитель качества — не объём контекста, а его состав: нельзя собирать промпт по принципу «добавим всё, что у нас есть». Промпт для финансового справочника и промпт для лога клиентских кликов — разные сущности, которые развиваются независимо друг от друга. ### 🧩 Контекст MWS Data Scout начался с одного эксперимента. Когда работа начиналась, ИИ-агентов над корпоративными данными ещё не существовало, а о том, что готовый слой описаний пригодится и им, команда узнала позже. Масштаб задачи: только в одном кластере MWS находится более 600 баз данных, и ландшафт растёт быстрее, чем люди успевают его документировать. Помимо текстов система выполняет сопутствующие задачи и строит ER-диаграммы, включая скрытые связи.

[Источник](https://habr.com/ru/companies/mws/articles/1086560/)
