← к выдаче
разработка

Senior Data Engineer / Spark Developer

Upvanta sp. z o.o.Wrocław28 дн. назад

Коротко

Designs and develops data reconciliation and processing solutions in a Data Lakehouse architecture using Apache Spark, MongoDB, and Apache Iceberg, optimizing · Needs: 4+ years commercial Apache Spark; PySpark, Spark SQL, DataFrame API, Structured Streaming; MongoDB Spark Connector; Apache Iceberg; Data Lake/Lakehouse

Описание от работодателя

O projekcie Do zespołu Data Platform poszukujemy doświadczonego Spark / Data Lakehouse Developera, który będzie odpowiedzialny za projektowanie i rozwój rozwiązań do przetwarzania, synchronizacji oraz rekoncyliacji danych w środowisku Big Data. Osoba na tym stanowisku będzie współtworzyć nowoczesną architekturę Data Lakehouse opartą o Apache Spark, MongoDB oraz Apache Iceberg, dbając o jakość, wydajność i niezawodność procesów danych. Daily tasks: - Projektowanie i implementacja procesów rekoncyliacji danych w Apache Spark (PySpark, Spark SQL). - Porównywanie danych pomiędzy warstwą ODS (MongoDB) a systemami źródłowymi oraz identyfikowanie rozbieżności. - Tworzenie i rozwój reguł jakości danych, wykrywanie braków, duplikatów oraz anomalii. - Budowa i utrzymanie warstw Data Lakehouse w modelu Raw / Bronze / Silver / Gold. - Praca z Apache Iceberg i zarządzanie wersjonowanymi zbiorami danych. - Optymalizacja wydajności procesów Spark oraz kosztów przetwarzania danych. - Tworzenie i rozwijanie pipeline'ów CI/CD dla aplikacji Spark. - Implementacja monitoringu, metryk i alertowania dla procesów danych. - Automatyzacja wdrożeń z wykorzystaniem Docker, Kubernetes oraz Spark Operator. - Analiza i rozwiązywanie problemów związanych z jakością, spójnością i dostępnością danych. - Tworzenie dokumentacji technicznej, diagramów architektury oraz runbooków. - Współpraca z Data Engineerami, DevOps Engineerami, Analitykami Biznesowymi i zespołami produktowymi. - Udział w code review oraz mentoring mniej doświadczonych członków zespołu. Minimum 4 lata doświadczenia komercyjnego w pracy z Apache Spark. Bardzo dobra znajomość PySpark, Spark SQL, DataFrame API oraz Structured Streaming. Doświadczenie w integracji Apache Spark z MongoDB przy wykorzystaniu MongoDB Spark Connector. Praktyczna znajomość Apache Iceberg oraz zarządzania wersjonowanymi tabelami danych. Doświadczenie w budowie rozwiązań Data Lake lub Data Lakehouse. Dobra znajomość języka Python. Doświadczenie z Jenkins oraz budową pipeline'ów CI/CD. Znajomość narzędzi monitoringu i observability, w szczególności Prometheus oraz Grafana. Doświadczenie w pracy zgodnie z metodykami Agile (Scrum lub Kanban). Praktyczna znajomość Jira i Confluence. Gotowość do pracy z biura 1-2 dni w tygodniu (Wrocław) Mile widziane Doświadczenie z Delta Lake lub Apache Hudi. Znajomość Kubernetes, Docker oraz Spark Operator. Doświadczenie w pracy z rozwiązaniami OpenTelemetry lub Dynatrace. Znajomość zagadnień Data Quality, Data Governance oraz Data Observability. Doświadczenie w środowiskach chmurowych (Azure, AWS, GCP). Must have: Apache Spark, PySpark, Spark, SQL, API, MongoDB, Prometheus, Jenkins, Jira Nice to have: Kubernetes, Docker, Azure, AWS, GCP