Интеграция, маппинг и консолидация

Как объединить 3,3 млн строк разрозненных данных в единую систему аналитики

Заказчик: Эфко

Мы умеем превращать хаотичные данные из разных источников в единую корпоративную систему данных, готовую для аналитики и AI. Автоматизировали сопоставление торговых точек и SKU из внешних источников с корпоративными справочниками — для последующей аналитики цен, ассортимента и представленности.

Описание проекта

Необходимо было объединить данные о представленности товаров в торговых сетях с корпоративными справочниками SKU и торговых точек. Исходные данные поступали из парсинга маркетплейса/онлайн-витрин. В исходной выборке было более +3,3 млн строк и ежедневная обработка новых поступлений.

Основная сложность заключалась в том, что один и тот же товар и одна и та же торговая точка могли быть представлены в разных источниках в различных форматах. Для дальнейшей аналитики необходимо было привести их к единой системе идентификаторов — NID SKU и NID торговой точки.

Задачи клиента

  • Сопоставить торговые точки из данных парсинга с корпоративным справочником ТТ и определить для каждой точки единый NID_TT.
  • Сопоставить SKU из внешних источников с внутренним справочником продукции и определить единый NID_SKU.
  • Нормализовать названия торговых сетей, адреса, категории, бренды и товарные наименования.
  • Обработать различия в написании SKU: сокращения, порядок слов, единицы измерения, вес и объем упаковки.
  • Выявить новые SKU и торговые точки, отсутствующие в справочниках.
  • Подготовить итоговый массив данных, пригодный для последующей загрузки в DWH и построения аналитики в Power BI.

Решение

Разработан многоэтапный pipeline обработки и сопоставления данных на Python/Pandas.

  1. Нормализовали данные

Привели адреса, сети, бренды и названия товаров к единому формату.

  1. Сопоставили торговые точки

Определили единый NID_TT.

  1. Сопоставили товары

Определили единый NID_SKU даже при различиях в названиях, весе, объеме и порядке слов.

  1. Автоматизировали обработку

Новые данные проходят тот же pipeline без ручной обработки.

т.е. БЫЛО

Разные источники
↓
разные названия SKU
↓
разные форматы адресов
↓
дубли
↓
ручное сопоставление
↓
сложно объединить данные

СТАЛО

Внешние источники
↓
автоматический mapping
↓
единый NID_SKU
↓
единый NID_TT
↓
DWH
↓
Power BI

Результат

В результате создан автоматизированный процесс, который превращает разрозненные данные парсинга в структурированный аналитический датасет с едиными идентификаторами товаров и торговых точек.

+ 3,3 млн строк
преобразованы в структурированный аналитический массив.

Товары и торговые точки
получили единые корпоративные идентификаторы.

Ручной mapping
заменен автоматизированным процессом.

Новые SKU и ТТ
автоматически выявляются системой.

DWH + Power BI
получают данные в едином формате.

Затрачиваемое время на поддержку процесса 15 мин в цикле, вместо 5-10 часов без автоматизации