Senior Platform Engineer / SRE
Описание от работодателя
Масштабный технологический проект формирует команду с нуля.
Мы разрабатываем интеллектуальную геоинформационную платформу, объединяющую обработку пространственных данных, моделирование сценариев, элементы искусственного интеллекта и высоконагруженные вычисления. В проекте предстоит решать задачи, связанные с большими объемами геоданных, сложными пространственными расчетами, производительностью API и пользовательского интерфейса.
Продукт уже имеет работающий MVP и используется в ежедневной деятельности. Сейчас проект активно развивается, и мы ищем Senior Platform Engineer / SRE , который будет обеспечивать надежность и доступность Kubernetes-платформы, отвечать за ее эксплуатацию и последующее развитие.
Чем предстоит заниматься:
— Автоматизировать и сопровождать развертывание self-managed Kubernetes на виртуальных машинах Linux;
— Разбираться с неисправностями и инцидентами, связаными с работой Kubernetes, Linux, контейнерного runtime и сети;
— Настраивать и сопровождать сеть платформы, доступ к Kubernetes API, сервисам и данным;
— Развивать наблюдаемость, полезные алерты, SLI/SLO и процедуры безопасных изменений;
— Сопровождать PostgreSQL и другие stateful-компоненты совместно с технической командой;
— Развивать GitLab CI, сборку OCI-образов, Helm/GitOps и безопасные релизы;
— Создавать воспроизводимые dev/test/CI окружения и стенды для проверки обновлений, отказов и восстановления;
— Вести и внедрять понятную документацию и процессы автоматизации.
Что мы ожидаем от кандидата:
— Самостоятельный опыт развертывания и эксплуатации Kubernetes; понимание control plane, etcd, kubelet, runtime, CNI, DNS, Service и persistent storage;
— Уверенные навыки администрирования Linux и практический опыт траблшутинга;
— Понимание сетей Linux и Kubernetes: TCP/UDP, DNS, маршруты, NAT, MTU, Service/EndpointSlice и NetworkPolicy;
— Практику автоматизации инфраструктуры: Ansible, Puppet или опыт с сопоставимыми средствами; Terraform или аналоги — при работе с API инфраструктуры;
— Умение собирать и диагностировать контейнерные образы: Dockerfile, Containerfile, Docker/BuildKit, либо сопоставимые инструменты;
— Опыт CI/CD и декларативной конфигурации; понимание безопасного rollout, проверки результата и ограничений rollback при изменении данных;
— Опыт эксплуатации stateful-сервисов и проверок восстановления; понимание различий между репликацией, резервным копированием и восстановлением;
— Участие в разборе реальных инцидентов, умение объяснять и аргументировать свои решения и действия;
— Английский на уровне B1 для чтения технической документации.
Будет плюсом:
— Практический опыт работы с Cilium/Hubble, kube-vip или другими решениями для отказоустойчивости Kubernetes;
— Опыт работы с CloudNativePG;
— Опыт работы с S3-совместимыми или распределенными хранилищами;
— Практика GitOps с Flux/ArgoCD, проверкой безопасности образов;
— Практика on-prem инфраструктуры, BGP/ECMP и диагностики UDP-трафика.
Мы готовы предложить:
— Участие в создании масштабного технологического продукта и возможность влиять на его архитектуру;
— Работу с нетривиальными задачами на стыке GIS, высоконагруженных вычислений и AI;
— Официальное трудоустройство по ТК РФ с первого дня;
— ДМС и компенсацию фитнеса;
— Испытательный срок — 3 месяца;
— Современную технику и полностью оборудованное рабочее место.
— Офис в БЦ «Метрополис», Москва;
— Возможность согласования гибридного формата работы после прохождения испытательного срока;
— Конкурентный уровень дохода, обсуждаемый индивидуально.