Интеграция, маппинг и консолидация

Как объединить 3,3 млн строк разрозненных данных в единую систему аналитики

Заказчик: Эфко

Мы умеем превращать хаотичные данные из разных источников в единую корпоративную систему данных, готовую для аналитики и AI. Автоматизировали сопоставление торговых точек и SKU из внешних источников с корпоративными справочниками — для последующей аналитики цен, ассортимента и представленности.

Описание проекта

Необходимо было объединить данные о представленности товаров в торговых сетях с корпоративными справочниками SKU и торговых точек. Исходные данные поступали из парсинга маркетплейса/онлайн-витрин. В исходной выборке было более +3,3 млн строк и ежедневная обработка новых поступлений. Основная сложность заключалась в том, что один и тот же товар и одна и та же торговая точка могли быть представлены в разных источниках в различных форматах. Для дальнейшей аналитики необходимо было привести их к единой системе идентификаторов — NID SKU и NID торговой точки.

Задачи клиента

- Сопоставить торговые точки из данных парсинга с корпоративным справочником ТТ и определить для каждой точки единый NID_TT. - Сопоставить SKU из внешних источников с внутренним справочником продукции и определить единый NID_SKU. - Нормализовать названия торговых сетей, адреса, категории, бренды и товарные наименования. - Обработать различия в написании SKU: сокращения, порядок слов, единицы измерения, вес и объем упаковки. - Выявить новые SKU и торговые точки, отсутствующие в справочниках. - Подготовить итоговый массив данных, пригодный для последующей загрузки в DWH и построения аналитики в Power BI.

Решение

Разработан многоэтапный pipeline обработки и сопоставления данных на Python/Pandas. 01. Нормализовали данные Привели адреса, сети, бренды и названия товаров к единому формату. 02. Сопоставили торговые точки Определили единый NID_TT. 03. Сопоставили товары Определили единый NID_SKU даже при различиях в названиях, весе, объеме и порядке слов. 04. Автоматизировали обработку Новые данные проходят тот же pipeline без ручной обработки. т.е. БЫЛО Разные источники ↓ разные названия SKU ↓ разные форматы адресов ↓ дубли ↓ ручное сопоставление ↓ сложно объединить данные СТАЛО Внешние источники ↓ автоматический mapping ↓ единый NID_SKU ↓ единый NID_TT ↓ DWH ↓ Power BI

Результат

В результате создан автоматизированный процесс, который превращает разрозненные данные парсинга в структурированный аналитический датасет с едиными идентификаторами товаров и торговых точек. + 3,3 млн строк преобразованы в структурированный аналитический массив. Товары и торговые точки получили единые корпоративные идентификаторы. Ручной mapping заменен автоматизированным процессом. Новые SKU и ТТ автоматически выявляются системой. DWH + Power BI получают данные в едином формате. Затрачиваемое время на поддержку процесса 15 мин в цикле, вместо 5-10 часов без автоматизации