28 июля 2026 года компания Amazon Web Services (AWS) объявила о поддержке типа данных Variant в Amazon S3 Tables. Эта возможность, определенная в спецификации Apache Iceberg версии 3 (V3), позволяет записывать полуструктурированные данные, такие как JSON, непосредственно в таблицы S3 без необходимости заранее задавать фиксированную схему. Это упрощает и ускоряет загрузку данных, сохраняя при этом эффективность аналитических запросов.
Что такое тип данных Variant и как он работает
Тип данных Variant в Apache Iceberg V3 предназначен для работы с полуструктурированными данными. При записи данных движки, совместимые с Iceberg V3, автоматически «расщепляют» их на скрытые столбцы и генерируют статистику столбцов Parquet. Эти статистики используются системами выполнения запросов для оптимизаций, таких как исключение файлов (file pruning), что сокращает объем данных, сканируемых аналитическими запросами.
Таким образом, пользователи могут загружать данные быстрее, не тратя время на проектирование схемы, и при этом получать высокую производительность запросов.
Обслуживание таблиц и сжатие данных
Amazon S3 Tables также обеспечивают автоматическое обслуживание таблиц, включая сжатие (compaction) столбцов Variant. Это позволяет консолидировать данные из множества мелких файлов в более крупные, которые эффективнее читаются движками Iceberg. Такое обслуживание снижает накладные расходы на хранение и ускоряет выполнение запросов.
Доступность в регионах AWS
Поддержка Variant в S3 Tables доступна в следующих регионах AWS:
- US East (N. Virginia)
- US East (Ohio)
- US West (Oregon)
- Asia Pacific (Mumbai)
- Asia Pacific (Seoul)
- Asia Pacific (Singapore)
- Asia Pacific (Sydney)
- Asia Pacific (Tokyo)
- Canada (Central)
- Europe (Frankfurt)
- Europe (Ireland)
- Europe (London)
- Europe (Paris)
- Europe (Stockholm)
- South America (São Paulo)
Информация опубликована в официальном блоге AWS What's New.
Что это значит
Поддержка типа данных Variant в S3 Tables упрощает работу с полуструктурированными данными в AWS, снижая барьер для аналитики JSON и подобных форматов. Это особенно актуально для сценариев, где данные поступают в нерегулярном виде и требуют быстрой загрузки без предварительной схемы. Вместе с автоматическим обслуживанием таблиц это может сократить операционные затраты и ускорить время получения инсайтов.

Комментарии · 0
Войдите, чтобы участвовать в обсуждении.