← к выдаче
разработка

Data Platform Engineer

Москвасегодня

Описание от работодателя

Компания "Retail Expert" - поставщик данных о ритейле, который берет на себя не только сбор, структурирование и подготовку информации к анализу, но и сам анализ. Мы специализируемся в IT разработках и продаже аналитики, исследований и консалтинга для ТОПов FMCG уже более 10 лет. Наша миссия — обеспечить нашим клиентам максимально точное определение настоящего и планирование их будущего. Наши эксперты всегда идут в ногу со временем и используют в своей работе передовые технологии, чтобы обеспечить сервис высокого уровня быстро, качественно и эффективно. В данный момент, в связи с расширением штата и увеличением объема работы мы находимся в поисках Data Platform Engineer, который совмещает data engineering, backend и platform: проектирует архитектуру, развивает ETL и Python-проекты, поддерживает сервисы и инфраструктуру - от MSSQL и Airflow до Docker/Kubernetes и мониторинга. Чем предстоит заниматься: Разработка ETL/ELT пайплайнов: Проектирование и реализация инкрементальной загрузки и трансформации больших объемов данных с использованием PySpark . Проектирование DWH и витрин: Создание схем таблиц в ClickHouse для витрин, кубов и отчетности Power BI. Настройка движков MergeTree, партиционирования, materialized views и оптимизация производительности запросов. Построение Lakehouse-архитектуры: Развитие слоя хранения с нуля (Raw → Staging → Marts) на базе S3-совместимого хранилища с использованием форматов Parquet и Apache Iceberg . Миграция данных: Перенос логики и данных из legacy-систем ( MSSQL , хранимые процедуры) в новую целевую архитектуру. Поддержка и оптимизация Python-пайплайнов: Работа с текущим стеком на Python/Polars (хеширование, дробление файлов), рефакторинг и повышение отказоустойчивости. Оркестрация: Разработка и поддержка DAG-ов в Apache Airflow для управления всеми процессами обработки данных. Проактивная оптимизация: Самостоятельный поиск узких мест в текущих решениях, предложение и реализация улучшений без ожидания отдельной постановки задачи. Требования Hard skills: Python (продвинутый): pandas, Polars, PySpark, FastAPI(написание пайпланов как код) SQL / MSSQL / PG - проектирование БД, оптимизация запросов Apache Airflow - разработка и поддержка DAG-ов PySpark - трансформация и агрегация данных Data Lake / Lakehouse: S3, Parquet, Iceberg Docker - контейнеризация, деплой и оркестрация сервисов ClickHouse — именно проектирование схем, не только SELECT Pandas, Polars Будет плюсом: опыт с dbt, Great Expectations, Trino, опыт работы с LLM в разработке Работа с продакшн-данными Мы предлагаем: Возможность работать с реальной задачей — построить Lakehouse и схемы ClickHouse практически с нуля, а не поддерживать чужое Офис на м. Бутырская Официальное трудоустройство Конкурентную зарплату по итогам собеседования