Как мультимодальные модели в e-commerce научились понимать товар, а не картинку
Опубликовано: 2026-10-02 · Автор: AI Release · @ai_release1
⚡ Главное за 5 секунд - Визуальный поиск отвечает на вопрос «что здесь похоже?», но не на вопрос «это тот же товар или просто похожий?» - Идея дополнять картинку текстом и атрибутами уже проверена в Pinterest Visual Discovery, Fashion IQ и FashionBERT. - Ограничение: одна фотография не несёт материал, состав и часть характеристик товара. ### 🔍 Что обнаружено Владимир Старыгин, старший исследователь команды ритейла в tevian, разбирает эволюцию мультимодальных моделей для e-commerce. Базовая схема визуального поиска выглядит так: фотография товара проходит через визуальный энкодер и превращается в вектор, каталог заранее превращается в такой же набор эмбеддингов, после чего остаётся посчитать расстояния между векторами. В задачах поиска принято использовать косинусную схожесть, хотя встречается и евклидово расстояние. Чем ближе векторы, тем выше товар в выдаче. Схема работает, пока нужная информация действительно есть на обоих изображениях, — а это условие выполняется далеко не всегда. У одного SKU может быть пять фотографий, название, описание и десяток характеристик: на одном снимке виден силуэт, на другом подошва, на третьем логотип, на четвёртом размерная сетка. В характеристиках при этом может быть указан материал, который по фотографии не определить. Две белые футболки — обычный хлопок и спортивная синтетика — при одинаковом ракурсе и похожем крое визуально окажутся очень близкими. Ещё в 2017 году Pinterest описывал систему Visual Discovery, где признаки свёрточной сети использовались для поиска визуально похожих изображений и объектов, а Pinterest Lens позволял выбрать предмет на фотографии и искать похожие объекты внутри каталога. Дальше появилась Fashion IQ с задачей interactive fashion retrieval: пользователь словами объясняет, чем искомый предмет должен отличаться от исходного, и уточняет запрос новыми формулировками, если картинка выдана неверно. Условный запрос — «мне нравится это платье, но хочу похожее с длинными рукавами». Основная архитектура — мультимодальный трансформер, объединяющий признаки изображения, атрибуты товара, текстовую обратную связь пользователя и историю предыдущих шагов диалога. ### 💡 Почему это важно Ключевой вопрос, вокруг которого развивается мультимодальная часть e-commerce: что именно упаковывать в эмбеддинг — одну фотографию или представление самого товара, собранное из всей доступной информации. У товара уже есть несколько источников: фотографии показывают форму, цвет и визуальные детали, название может содержать модель и назначение, характеристики — размер, материал и состав, иногда к этому добавляется поведение пользователей. Для поиска конкретного SKU различие принципиально: две модели кроссовок одного бренда с одинаковым цветом и почти не отличающимся силуэтом, но другой подошвой и небольшой вставкой на пятке — для запроса «что-нибудь похожее» оба результата нормальны, а для точного поиска один из них уже ошибка. ### 🧩 Контекст Промежуточным эпизодом до CLIP стал FashionBERT: в 2020 году, ещё до появления ViT, авторы разбивали изображение товара на пат
⚡ Главное за 5 секунд - Визуальный поиск отвечает на вопрос «что здесь похоже?», но не на вопрос «это тот же товар или просто похожий?» - Идея дополнять картинку текстом и атрибутами уже проверена в Pinterest Visual Discovery, Fashion IQ и FashionBERT.
- Ограничение: одна фотография не несёт материал, состав и часть характеристик товара.
🔍 Что обнаружено Владимир Старыгин, старший исследователь команды ритейла в tevian, разбирает эволюцию мультимодальных моделей для e-commerce.
Базовая схема визуального поиска выглядит так: фотография товара проходит через визуальный энкодер и превращается в вектор, каталог заранее превращается в такой же набор эмбеддингов, после чего остаётся посчитать расстояния между векторами.
В задачах поиска принято использовать косинусную схожесть, хотя встречается и евклидово расстояние.
Чем ближе векторы, тем выше товар в выдаче.
Схема работает, пока нужная информация действительно есть на обоих изображениях, — а это условие выполняется далеко не всегда.
У одного SKU может быть пять фотографий, название, описание и десяток характеристик: на одном снимке виден силуэт, на другом подошва, на третьем логотип, на четвёртом размерная сетка.