Анализ источников данных. Изучаем все системы-источники: ERP (1С, SAP), CRM (Битрикс24, amoCRM, Salesforce), базы данных (PostgreSQL, Oracle, MSSQL), файлы (Excel, CSV, XML), API внешних сервисов, облачные хранилища (Yandex Object Storage, Amazon S3). Описываем сущности, атрибуты, ключевые поля, частоту обновления.
Проектирование модели данных. Создаем интеграционные контракты, определяем интеграционные ключи и тип загрузки (полная, инкрементальная, потоковая). Проектируем детальный слой (ODS), слой исторических данных (DDS), слой витрин (DM). Создаём S2T-документы (source-to-target) для каждой витрины.
Разработка ETL/ELT-пайплайнов. Создаем процессы извлечения, трансформации и загрузки данных. Используем Apache Airflow для оркестрации, Apache NiFi для потоковой интеграции, PySpark для больших объемов, dbt для трансформаций внутри хранилища. Настраиваем мониторинг, алертинг и обработку ошибок.
Разработка витрин данных. Создаем витрины для различных подразделений: финансы, продажи, маркетинг, логистика, HR. Обеспечиваем единую точку правды (single source of truth) — все подразделения работают с согласованными данными.
Управление качеством данных. Встраиваем проверки на всех этапах: completeness, consistency, accuracy, timeliness, validity. Используем Great Expectations для автоматизации проверок.