Открытый лейкхаус на Apache Iceberg
Описание услуги
Я строю открытые дата-лейкхаусы на Apache Iceberg, чтобы ваша аналитика получила поведение полноценного хранилища прямо поверх объектного стораджа — без дорогого проприетарного движка и без привязки данных к одному вендору. Я проектирую раскладку таблиц, поднимаю каталог и превращаю россыпь сырых Parquet-файлов в управляемые версионируемые таблицы, которые читает любой движок. Задача простая: дать вам ACID-транзакции, надёжную эволюцию схемы и предсказуемую скорость, при этом данные остаются в открытых форматах, которыми вы владеете полностью.
Стартуем с вашего текущего состояния — сырые файлы, каша из Hive-таблиц или дорогое хранилище, от которого вы хотите отвязаться. Я моделирую таблицы, подбираю партиционирование и сортировку под то, как вы реально пишете запросы, и включаю скрытое партиционирование, чтобы аналитики не воевали с колонками разбиения вручную. Настраиваю эволюцию схемы так, что добавление и переименование колонок не переписывают историю, поднимаю time travel и откат снапшотов — плохая загрузка чинится одной строкой, а не превращается в инцидент. Со стороны движков интегрирую Spark для батча и обслуживания, Trino для интерактивного SQL и Flink для стриминга — все на одних таблицах через общий каталог, с документацией и обучением команды.
— Проектирование таблиц Iceberg, партиционирование и сортировка
— Каталог, миграция с Hive или сырого Parquet
— Эволюция схемы, time travel и откат снапшотов
— Интеграция Spark, Trino и Flink на общих таблицах
Стартуем с вашего текущего состояния — сырые файлы, каша из Hive-таблиц или дорогое хранилище, от которого вы хотите отвязаться. Я моделирую таблицы, подбираю партиционирование и сортировку под то, как вы реально пишете запросы, и включаю скрытое партиционирование, чтобы аналитики не воевали с колонками разбиения вручную. Настраиваю эволюцию схемы так, что добавление и переименование колонок не переписывают историю, поднимаю time travel и откат снапшотов — плохая загрузка чинится одной строкой, а не превращается в инцидент. Со стороны движков интегрирую Spark для батча и обслуживания, Trino для интерактивного SQL и Flink для стриминга — все на одних таблицах через общий каталог, с документацией и обучением команды.
— Проектирование таблиц Iceberg, партиционирование и сортировка
— Каталог, миграция с Hive или сырого Parquet
— Эволюция схемы, time travel и откат снапшотов
— Интеграция Spark, Trino и Flink на общих таблицах
Связаться с фрилансером
Закажите услугу или задайте вопрос исполнителю.
Контакты фрилансера
E-mailПоказать
