27 июля 2026 года AWS объявила о расширении функциональности сервиса AWS Glue Data Quality. Теперь сервис поддерживает обнаружение аномалий при оценке качества данных на основе Каталога данных AWS Glue (GDC), а также позволяет записывать результаты оценки в таблицы GDC. Эти возможности работают как с ETL-заданиями, так и с оценками Каталога, обеспечивая единообразный подход к контролю качества данных независимо от типа рабочего процесса.
Обнаружение аномалий на основе машинного обучения
Новая функция обнаружения аномалий использует прогнозирование временных рядов на основе машинного обучения. Она позволяет выявлять неожиданные изменения в статистике данных, такие как внезапное падение количества уникальных значений или скачки числа строк в таблицах GDC. При этом не требуется писать правила с явными пороговыми значениями — система автоматически определяет отклонения от ожидаемого поведения.
Это особенно полезно для инженеров по обработке данных, которые отслеживают сотни таблиц в GDC и нуждаются в автоматическом выявлении проблем. Вместо ручной настройки порогов для каждой таблицы, ML-модель анализирует исторические данные и сигнализирует о значимых изменениях.
Запись результатов в Data Catalog
Вторая новая возможность — хранение результатов оценки качества данных в таблицах GDC. Результаты применения правил качества данных, метрики профилирования и прогнозы аномалий (с доверительными границами) записываются обратно в таблицы Каталога. Это формирует доступную для запросов запись всех проверок качества.
Независимо от того, выполняется ли оценка в задании ETL или непосредственно в таблице Каталога, результаты можно запросить в любое время с помощью стандартного SQL. Это упрощает аудит и анализ истории изменений качества данных.
Доступность
Обнаружение аномалий и хранение результатов в Каталоге доступны во всех коммерческих регионах AWS и регионах AWS GovCloud (США). Для начала работы AWS рекомендует обратиться к документации по AWS Glue Data Quality.
Что это значит
Новые возможности AWS Glue Data Quality снижают ручную нагрузку на инженеров данных: автоматическое обнаружение аномалий помогает быстрее находить проблемы, а централизованное хранение результатов упрощает анализ и аудит. Это шаг к более автоматизированному управлению качеством данных в облаке.

Комментарии · 0
Войдите, чтобы участвовать в обсуждении.