Каталог данных — это структурированное описание корпоративной информации, которое помогает сделать данные понятными как для сотрудников, так и для автоматизированных систем.
В современной архитектуре корпоративных ИИ-решений каталог данных становится не просто справочником таблиц и полей, а частью системы управления метаданными (metadata management). Он фиксирует не только технические характеристики данных, но и их бизнес-смысл: назначение показателей, владельцев данных, источники информации, правила использования и связи между объектами.
Его задача заключается не только в хранении списка таблиц и полей. Каталог фиксирует:
- что означает конкретный показатель;
- из каких источников он формируется;
- как связан с другими объектами данных;
- в каких бизнес-сценариях используется;
- какие ограничения необходимо учитывать при работе с ним.
В зависимости от уровня зрелости компании каталог данных может включать:
- описание таблиц и отдельных полей;
- бизнес-глоссарий;
- описание физической, логической и концептуальной моделей данных;
- информацию об источниках данных;
- связи между объектами;
- правила преобразования информации;
- описание аналитических витрин;
- владельцев данных и ответственных за их качество;
- информацию о происхождении данных (data lineage).
Data lineage позволяет отслеживать полный путь информации: от момента появления в исходной системе до использования в отчетах, аналитических моделях или ИИ-агентах.
Например, если сотрудник спрашивает у ИИ-агента о показателе выручки, система должна понимать не только название метрики, но и то, из каких источников она рассчитывается, какие преобразования применялись и почему именно этот показатель считается корректным.
Главная ценность каталога заключается в том, что он переносит знания о данных из опыта отдельных сотрудников в структурированный формат.
Во многих компаниях понимание того, какой показатель использовать для конкретного отчета, где находится нужная информация и как рассчитывается определенная метрика, хранится только у нескольких специалистов.
Например, финансовый аналитик может знать, что для расчета реальной выручки необходимо использовать не поле TOTAL_SUM, а показатель из подготовленной аналитической витрины, где уже учтены возвраты, скидки и корректировки.
Если такой сотрудник покидает компанию, часть экспертизы может быть потеряна.
Каталог данных позволяет сохранить эти знания и сделать их доступными для ИИ-агентов.
Например, если в компании существует несколько показателей, связанных с выручкой, каталог может определить:
- какой показатель является основным;
- в каких отчетах он используется;
- как рассчитывается метрика;
- какие источники данных лежат в ее основе;
- какие ограничения необходимо учитывать.
Для ИИ-агента такой уровень описания становится дополнительным контекстом. Вместо самостоятельной попытки определить назначение каждого поля модель получает структурированное объяснение и может использовать информацию более точно.
При этом компании не обязательно сразу создавать сложную корпоративную платформу управления данными.
На начальном этапе достаточно описать те источники и объекты, с которыми будет работать конкретный ИИ-агент.
Даже базовый каталог с описанием ключевых таблиц, показателей и правил их использования способен значительно повысить качество и стабильность работы системы.
Однако одного каталога данных недостаточно.
Он отвечает на вопрос: что представляют собой данные и где они находятся.
Но для полноценной работы ИИ-агенту необходимо понимать еще и смысл пользовательских запросов, бизнес-терминов и процессов.
Именно эту задачу решает семантический слой.