Data Engineer (Hadoop / Spark)
Описание от работодателя
«Детмир Тех» развивает цифровую экосистему группы компаний «Детский мир». Мы создаём продукты для миллионов клиентов и сервисы, которые помогают бизнесу принимать решения на основе данных.
Ищем Data Engineer в команду Big Data Platform. Платформа построена на Hadoop 3 и Apache Spark и является основным источником данных для всей группы компаний.
Главная задача — развивать надёжную и производительную платформу обработки больших объёмов данных: проектировать пайплайны, оптимизировать Spark-приложения, развивать Data Lake и совершенствовать архитектуру Hadoop-кластера.
Чем предстоит заниматься:
Разрабатывать и оптимизировать batch-процессы на Apache Spark.
Проектировать ETL/ELT-пайплайны для обработки больших объёмов данных.
Создавать и поддерживать витрины данных в Hadoop.
Оптимизировать Spark jobs: partitioning, shuffle, data skew, использование памяти и ресурсов кластера.
Развивать архитектуру Data Lake и подходы к организации и хранению данных.
Организовывать загрузку и передачу данных через Kafka и S3 API (MinIO).
Автоматизировать процессы с помощью Apache Airflow и Apache NiFi.
Поддерживать трансформации данных в dbt Core.
Развивать и поддерживать витрины данных в ClickHouse.
Оптимизировать запросы и процессы загрузки данных в ClickHouse, разбираться с проблемами производительности.
Поддерживать аналитическую платформу на Apache Superset, решать возникающие технические проблемы.
Внедрять проверки качества данных и мониторинг пайплайнов.
Исследовать причины сбоев и деградации производительности.
Помогать аналитикам и дата-сайентистам эффективно работать с платформой.
Участвовать в развитии внутренних инструментов и стандартов Data Engineering.
Участвовать в развёртывании и эксплуатации компонентов платформы в Kubernetes.
Что для нас важно:
От трёх лет опыта работы с Hadoop и Apache Spark.
Знание основных компонентов Hadoop и принципов работы HDFS и Spark.
Глубокое понимание архитектуры Spark и принципов распределённых вычислений.
Опыт разработки и оптимизации Spark batch jobs.
Уверенное владение SQL.
Опыт проектирования DWH или Data Lake.
Опыт построения ETL/ELT-процессов.
Практический опыт работы с Apache Airflow.
Знание форматов хранения данных.
Понимание принципов партиционирования и организации данных в Data Lake.
Умение диагностировать проблемы с shuffle, partitioning, data skew, памятью и использованием ресурсов кластера.
Умение анализировать производительность распределённых приложений и находить узкие места.
Умение писать чистый, тестируемый и поддерживаемый код.
Готовность принимать технические решения и отвечать за результат.
Будет преимуществом :
Опыт разработки на Scala.
Знание Kafka и принципов потоковой обработки данных.
Опыт работы с ClickHouse и оптимизации запросов.
Опыт работы с Apache Superset.
Знакомство с Apache NiFi и dbt Core.
Опыт эксплуатации приложений в Kubernetes.
Знание Docker, Helm и GitLab CI/CD.
Опыт работы с DataHub или другими Data Catalog решениями.
Опыт построения мониторинга data-платформ и пайплайнов.
Знакомство с VictoriaMetrics, Grafana, Hue или Jupyter.
Опыт работы с большими Hadoop-кластерами и высокими объёмами данных.
Наш стек:
Хранение и обработка: Hadoop 3, HDFS, Apache Spark
Доставка и обмен данными: Kafka, S3
Оркестрация и трансформации: Apache Airflow, Apache NiFi, dbt Core
Аналитические хранилища: ClickHouse
Ad-hoc аналитика: Hue, Jupyter
Каталог данных: DataHub
BI и визуализация: Apache Superset, Grafana
Мониторинг: VictoriaMetrics, Grafana
Инфраструктура: Kubernetes, Docker, Helm
CI/CD: GitLab CI/CD
Мы предлагаем:
Официальное оформление в соответствии с ТК РФ в IT-аккредитованную компанию;
Совокупный доход: оклад + годовой бонус;
График работы: 5/2 (гибридный формат работы);
Вакансия открыта для кандидатов, проживающих в РФ, удалённый формат работы из других стран не рассматривается;
Техника для работы;
Полис ДМС;
Программа Best Benefits;
Внутреннее обучение;
Спортивные и развлекательные мероприятия, участие в корпоративной жизни компании.
Присоединяйтесь к нам и станьте частью истории бренда с историей!