# ML-пайплайн для финмониторинга: почему одной классификации мало

> 2026-09-27 · AI Release · @ai_release1

> #MLOps #машинное #финмониторинг #Data

### ⚡ Главное за 5 секунд - Старший инженер данных Максим Коцюба (опыт в ВТБ и Сбере) собрал сквозной ML/MLOps-пайплайн для поиска подозрительных транзакций и довёл его до рабочего кода. - Вместо бинарной классификации модель ранжирует операции по степени риска: это позволяет аналитикам работать с приоритетной очередью, а не тонуть в ложных срабатываниях. - Исходный код и MVP проекта опубликованы на GitHub — но это не готовая инструкция, а разбор, где стандартный подход даёт сбой. ### 🔍 Что обнаружено Максим Коцюба, старший инженер по данным с опытом в ВТБ и Сбер и выпускник онлайн-магистратуры «Инженерия данных» НИУ ВШЭ и Нетологии, в выпускной работе построил сквозной ML/MLOps-пайплайн. Он не просто классифицирует операции, а ранжирует их по степени риска. Проблема актуальна: действующие rule-based системы дают более 90% ложных срабатываний, и разбор этого потока съедает бóльшую часть рабочего времени аналитиков. За 15 лет нагрузка выросла кратно: с 2010 по 2025 год объём операций по картам увеличился с 3,1 до 72,7 млрд (в 23 раза), а число действующих кредитных организаций сократилось с 1058 до 353 (почти на 67%). В пересчёте на одну организацию нагрузка выросла примерно в 70 раз — с 2,9 до 206 млн операций на субъект. В экспериментах использовали датасет SAML-D: доля подозрительных операций в нём — всего 0,119%. При таком сильном дисбалансе метрики ранжирования Precision@k и Lift@k оказались куда показательнее метрик классификации. Для топ-100 обе модели показали Precision@100 = 1,00. Для топ-500 показатели закономерно снизились: Precision@500 у LightGBM составил 0,322, у XGBoost — 0,310. Порог классификации 0,5 автор называет просто непригодным для эксплуатации: в реальности его должны определять допустимая нагрузка на аналитиков и требуемая полнота выявления. ### 💡 Почему это важно Ключевой вывод: модель полезна не как инструмент окончательного решения, а как механизм риск-ориентированного ранжирования. Она формирует риск-скор, на основе которого операции упорядочиваются по степени потенциального риска, и аналитик в первую очередь работает с наиболее рискованными. Это решает проблему узкого места ручного разбора при растущем объёме операций. Кроме того, санкционные ограничения усиливают потребность в локально разворачиваемых решениях: зарубежное ПО и инфраструктура могут терять доступность, лицензирование и техническую поддержку, поэтому важно иметь воспроизводимый контур, который можно поддерживать самостоятельно. ### 🧩 Контекст При постановке задачи оценивались rule-based механизмы, готовые коммерческие AML-платформы (SAS AML, NICE Actimize) и вариант разработки силами самого банка. У каждого подхода были ограничения: rule-based системы требуют времени на адаптацию к новым мошенническим схемам, коммерческие платформы остаются закрытыми, где сложно исследовать логику, а внутренняя разработка упирается в ручной и неавтоматизированный процесс обучения моделей. Правила в финансовом мониторинге по-прежнему необходимы из-за их прозрачности, но основной вопрос — как организовать работу с ML-моделью после её появления: обучение, сравнение версий, развёртывание, мониторинг и повторное обучение. Поэтому автор смотрел на весь процесс целиком — от подготовки данных до применения и мониторинга.

[Источник](https://habr.com/ru/companies/netologyru/articles/1086592/)
