← к выдаче
разработка

Senior Platform Engineer / SRE

Москвасегодня

Описание от работодателя

Масштабный технологический проект формирует команду с нуля. Мы разрабатываем интеллектуальную геоинформационную платформу, объединяющую обработку пространственных данных, моделирование сценариев, элементы искусственного интеллекта и высоконагруженные вычисления. В проекте предстоит решать задачи, связанные с большими объемами геоданных, сложными пространственными расчетами, производительностью API и пользовательского интерфейса. Продукт уже имеет работающий MVP и используется в ежедневной деятельности. Сейчас проект активно развивается, и мы ищем Senior Platform Engineer / SRE , который будет обеспечивать надежность и доступность Kubernetes-платформы, отвечать за ее эксплуатацию и последующее развитие. Чем предстоит заниматься: — Автоматизировать и сопровождать развертывание self-managed Kubernetes на виртуальных машинах Linux; — Разбираться с неисправностями и инцидентами, связаными с работой Kubernetes, Linux, контейнерного runtime и сети; — Настраивать и сопровождать сеть платформы, доступ к Kubernetes API, сервисам и данным; — Развивать наблюдаемость, полезные алерты, SLI/SLO и процедуры безопасных изменений; — Сопровождать PostgreSQL и другие stateful-компоненты совместно с технической командой; — Развивать GitLab CI, сборку OCI-образов, Helm/GitOps и безопасные релизы; — Создавать воспроизводимые dev/test/CI окружения и стенды для проверки обновлений, отказов и восстановления; — Вести и внедрять понятную документацию и процессы автоматизации. Что мы ожидаем от кандидата: — Самостоятельный опыт развертывания и эксплуатации Kubernetes; понимание control plane, etcd, kubelet, runtime, CNI, DNS, Service и persistent storage; — Уверенные навыки администрирования Linux и практический опыт траблшутинга; — Понимание сетей Linux и Kubernetes: TCP/UDP, DNS, маршруты, NAT, MTU, Service/EndpointSlice и NetworkPolicy; — Практику автоматизации инфраструктуры: Ansible, Puppet или опыт с сопоставимыми средствами; Terraform или аналоги — при работе с API инфраструктуры; — Умение собирать и диагностировать контейнерные образы: Dockerfile, Containerfile, Docker/BuildKit, либо сопоставимые инструменты; — Опыт CI/CD и декларативной конфигурации; понимание безопасного rollout, проверки результата и ограничений rollback при изменении данных; — Опыт эксплуатации stateful-сервисов и проверок восстановления; понимание различий между репликацией, резервным копированием и восстановлением; — Участие в разборе реальных инцидентов, умение объяснять и аргументировать свои решения и действия; — Английский на уровне B1 для чтения технической документации. Будет плюсом: — Практический опыт работы с Cilium/Hubble, kube-vip или другими решениями для отказоустойчивости Kubernetes; — Опыт работы с CloudNativePG; — Опыт работы с S3-совместимыми или распределенными хранилищами; — Практика GitOps с Flux/ArgoCD, проверкой безопасности образов; — Практика on-prem инфраструктуры, BGP/ECMP и диагностики UDP-трафика. Мы готовы предложить: — Участие в создании масштабного технологического продукта и возможность влиять на его архитектуру; —​​​​​​​ Работу с нетривиальными задачами на стыке GIS, высоконагруженных вычислений и AI; — Официальное трудоустройство по ТК РФ с первого дня; — ДМС и компенсацию фитнеса; — Испытательный срок — 3 месяца; — Современную технику и полностью оборудованное рабочее место. — Офис в БЦ «Метрополис», Москва; — Возможность согласования гибридного формата работы после прохождения испытательного срока; — Конкурентный уровень дохода, обсуждаемый индивидуально.