Описание проекта
Автоматизировали обработку большого массива ценовых данных: 67 файлов по ~200 МБ каждый, содержащих исторические данные за определённый период. Изначально все файлы имели единую, но неудобную для дальнейшего анализа структуру.
Необходимо было автоматически отбирать из общего массива только нужные товарные позиции, переименовывать поля и преобразовывать исходную структуру данных в формат, удобный для загрузки и дальнейшей аналитики.
Задачи клиента
- Обработать 67 крупных файлов с ценовыми данными.
- Выделить из общего массива только необходимые позиции.
- Привести названия товаров и полей к требуемому формату.
- Преобразовать два количественных столбца исходных данных в один показатель, разместив значения в строках.
- Исключить ручную обработку файлов.
- Сделать процесс динамическим, чтобы новые поступающие данные автоматически проходили те же преобразования.
Решение
Мы убрали ручную обработку больших массивов данных и создали динамический конвейер, который автоматически обрабатывает новые данные по тем же правилам
Система последовательно загружает данные, отбирает необходимые позиции, переименовывает поля, преобразует структуру количественных показателей и формирует итоговый набор данных в требуемом формате.
Ключевым элементом стала динамическая обработка: логика преобразования не привязана к конкретным 67 файлам. При поступлении новых данных они автоматически проходят тот же сценарий обработки и преобразуются в единую структуру.
Результат
Было
67 файлов (истории + новое поступление) → ручная обработка → фильтрация → переименование → преобразование → подготовка к аналитике
↓
Стало
Новые файлы → автоматическая обработка → готовый набор данных
Ручная обработка исключена, 13,4 ГБ данных обработались автоматически, новые файлы не требуют переписывания логики, единый алгоритм обработки
Было: 10 часов на обновление, в неделю
Стало: автоматический запуск, 15 мин на проверку
Экономия: 10 часов каждого цикла