Відкритий лейкхаус на Apache Iceberg
Опис послуги
Я будую відкриті дата-лейкхауси на Apache Iceberg, щоб ваша аналітика отримала поведінку повноцінного сховища просто поверх об'єктного стораджу — без дорогого пропрієтарного рушія і без прив'язки даних до одного вендора. Я проєктую розкладку таблиць, піднімаю каталог і перетворюю розсип сирих Parquet-файлів на керовані версіоновані таблиці, які читає будь-який рушій. Мета проста: дати вам ACID-транзакції, надійну еволюцію схеми та передбачувану швидкість, при цьому дані лишаються у відкритих форматах, якими ви володієте повністю.
Стартуємо з вашого поточного стану — сирі файли, каша з Hive-таблиць або дороге сховище, від якого ви хочете відв'язатися. Я моделюю таблиці, добираю партиціонування та сортування під те, як ви насправді пишете запити, і вмикаю приховане партиціонування, щоб аналітики не воювали з колонками розбиття вручну. Налаштовую еволюцію схеми так, що додавання та перейменування колонок не переписують історію, піднімаю time travel і відкат снапшотів — погане завантаження лагодиться одним рядком, а не перетворюється на інцидент. З боку рушіїв інтегрую Spark для батчу й обслуговування, Trino для інтерактивного SQL і Flink для стримінгу — усі на одних таблицях через спільний каталог, з документацією та навчанням команди.
— Проєктування таблиць Iceberg, партиціонування та сортування
— Каталог, міграція з Hive або сирого Parquet
— Еволюція схеми, time travel і відкат снапшотів
— Інтеграція Spark, Trino та Flink на спільних таблицях
Стартуємо з вашого поточного стану — сирі файли, каша з Hive-таблиць або дороге сховище, від якого ви хочете відв'язатися. Я моделюю таблиці, добираю партиціонування та сортування під те, як ви насправді пишете запити, і вмикаю приховане партиціонування, щоб аналітики не воювали з колонками розбиття вручну. Налаштовую еволюцію схеми так, що додавання та перейменування колонок не переписують історію, піднімаю time travel і відкат снапшотів — погане завантаження лагодиться одним рядком, а не перетворюється на інцидент. З боку рушіїв інтегрую Spark для батчу й обслуговування, Trino для інтерактивного SQL і Flink для стримінгу — усі на одних таблицях через спільний каталог, з документацією та навчанням команди.
— Проєктування таблиць Iceberg, партиціонування та сортування
— Каталог, міграція з Hive або сирого Parquet
— Еволюція схеми, time travel і відкат снапшотів
— Інтеграція Spark, Trino та Flink на спільних таблицях
Зв'язатися з фрилансером
Замовте послугу або поставте питання виконавцю.
Контакти фрилансера
E-mailПоказати
