Дата-платформа на Databricks и Delta Lake
Описание услуги
Я строю промышленные дата-платформы на Databricks и веду проект от первой строки кода до сдачи, чтобы вашим аналитикам и дата-сайентистам можно было доверять каждой таблице. Моя специализация — lakehouse: я проектирую конвейеры на Spark, которые забирают данные из баз, API, файлов и потоковых источников, а затем складывают их в таблицы Delta — версионируемые, транзакционно безопасные и быстрые в выборках. Работаю по медальонной архитектуре, проводя данные через слои bronze, silver и gold, так что очистка, дедупликация и бизнес-логика живут каждый в своём понятном и тестируемом этапе, а не в одном запутанном скрипте, который страшно трогать.
Обычно я закрываю весь жизненный цикл платформы. Настраиваю воркспейсы, кластеры и job-вычисления с разумным автоскейлингом, чтобы вы не платили за простой, и оркеструю всё через Databricks Workflows или ваш существующий планировщик — с повторными запусками, оповещениями и проверками качества данных. Со стороны управления внедряю Unity Catalog: единый каталог для таблиц, томов и моделей, доступ на уровне строк и столбцов, происхождение данных и аудит, чтобы безопасность и соответствие требованиям были заложены изначально, а не прикручены потом. Отдельно занимаюсь производительностью: партиционирование, Z-order, liquid clustering и уплотнение файлов держат в узде и стоимость, и задержку запросов.
В результате вы получаете сопровождаемый фундамент, а не разовое демо. Я пишу модульный и покрытый тестами код на PySpark и SQL, документирую модель и регламенты запуска, передаю конвейеры, которые ваша команда сможет развивать сама. Мигрируете ли вы старое хранилище, поднимаете первый lakehouse или готовите чистые витрины признаков для машинного обучения — я привношу прагматизм, чтобы выпустить надёжное решение в срок.
— Конвейеры Spark и Delta Lake по схеме bronze/silver/gold
— Оркестрация Workflows, CI/CD и контроль качества данных
— Управление через Unity Catalog: происхождение и доступ
— Тюнинг производительности и стоимости кластеров и запросов
Обычно я закрываю весь жизненный цикл платформы. Настраиваю воркспейсы, кластеры и job-вычисления с разумным автоскейлингом, чтобы вы не платили за простой, и оркеструю всё через Databricks Workflows или ваш существующий планировщик — с повторными запусками, оповещениями и проверками качества данных. Со стороны управления внедряю Unity Catalog: единый каталог для таблиц, томов и моделей, доступ на уровне строк и столбцов, происхождение данных и аудит, чтобы безопасность и соответствие требованиям были заложены изначально, а не прикручены потом. Отдельно занимаюсь производительностью: партиционирование, Z-order, liquid clustering и уплотнение файлов держат в узде и стоимость, и задержку запросов.
В результате вы получаете сопровождаемый фундамент, а не разовое демо. Я пишу модульный и покрытый тестами код на PySpark и SQL, документирую модель и регламенты запуска, передаю конвейеры, которые ваша команда сможет развивать сама. Мигрируете ли вы старое хранилище, поднимаете первый lakehouse или готовите чистые витрины признаков для машинного обучения — я привношу прагматизм, чтобы выпустить надёжное решение в срок.
— Конвейеры Spark и Delta Lake по схеме bronze/silver/gold
— Оркестрация Workflows, CI/CD и контроль качества данных
— Управление через Unity Catalog: происхождение и доступ
— Тюнинг производительности и стоимости кластеров и запросов
Связаться с фрилансером
Закажите услугу или задайте вопрос исполнителю.
Контакты фрилансера
E-mailПоказать
