Системный инженер
Описание от работодателя
Компания КОМС является разработчиком собственной системы мониторинга и сопровождает несколько крупных продуктивных инсталляций в закрытых контурах заказчиков.
Мы в поисках Системного инженера с сильной экспертизой PostgreSQL, который станет одним из владельцев стабильности продукта и будет отвечать не только за эксплуатацию инфраструктуры, но и за системное повышение надёжности, производительности и наблюдаемости решения.
Основные задачи:
Поддержка и развитие продуктивной инфраструктуры приложения в закрытых контурах заказчиков;
Самостоятельная диагностика и устранение сложных инцидентов третьей линии;
Поиск причин деградации на уровне Linux, Docker, Kubernetes, PostgreSQL, RabbitMQ, сетевого взаимодействия и приложения;
Администрирование и тюнинг PostgreSQL, TimescaleDB, Patroni и etcd;
Анализ блокировок, соединений, медленных запросов и планов выполнения;
Подготовка требований к SQL-запросам, индексам, миграциям и структуре данных совместно с разработчиками;
Ревью потенциально тяжёлых запросов и изменений БД перед выходом в production;
Настройка репликации, резервного копирования, восстановления и процедур аварийного переключения;
Администрирование и восстановление кластеров RabbitMQ;
Развитие CI/CD и автоматизации на базе GitLab CI и Ansible;
Администрирование Docker-инфраструктуры и Kubernetes-кластеров;
Развитие мониторинга и observability на базе Prometheus, Grafana, Zabbix и ELK/OpenSearch;
Участие в проектировании архитектуры, сайзинге и подготовке требований к инфраструктурным ресурсам;
Проведение технических разборов инцидентов и формирование корректирующих мероприятий;
Автоматизация типовых операций и снижение количества ручных вмешательств.
Мы ожидаем:
Опыт работы Системным/SRE инженером в эксплуатации высоконагруженных систем от пяти лет;
Глубокое знание Linux и сетевых технологий;
Сильная практическая экспертиза PostgreSQL;
Опыт работы с репликацией, резервным копированием и восстановлением PostgreSQL;
Опыт построения кластеров PostgreSQL с Patroni и etcd;
Опыт оптимизации SQL-запросов, индексов и параметров PostgreSQL;
Опыт диагностики проблем взаимодействия приложений и БД;
Опыт администрирования RabbitMQ;
Уверенная работа с Docker;
Практический опыт эксплуатации Kubernetes-кластеров;
Умение самостоятельно диагностировать сложные production-инциденты;
Готовность глубоко погружаться в архитектуру и внутреннее устройство продукта;
Готовность участвовать в дежурствах третьей линии (предусмотрено участие в ротации третьей линии поддержки. Подключение требуется только к инцидентам, которые не смогли устранить предыдущие линии поддержки).
Желательно:
Опыт эксплуатации TimescaleDB;
Опыт работы с геораспределёнными системами и несколькими ЦОД;
Опыт работы в закрытых или государственных инфраструктурных контурах;
Опыт работы с Zabbix, ELK или OpenSearch;
Опыт работы с Prometheus;
Опыт диагностики приложений на PHP или Go;
Опыт проведения postmortem и контроля корректирующих мероприятий;
Опыт работы с FreeIPA;
Опыт работы с GitLab CI и Ansible.
Наш технологический стек :
Linux, Docker, Kubernetes, PostgreSQL, TimescaleDB, Patroni, etcd, PgBouncer, RabbitMQ, GitLab CI, Ansible, Prometheus, Grafana, Zabbix, ELK/OpenSearch, PHP, Go, Selenium/Selenoid, FreeIPA.
*Не требуется быть экспертом во всех перечисленных технологиях. Наиболее важны Linux, PostgreSQL, Docker, диагностика production-систем, автоматизация и observability.
Мы предлагаем:
Официальное трудоустройство в стабильной ИТ аккредитованной компании;
Интересные задачи и возможность влияния на процессы и стек;
Удаленный формат работы
Возможность профессионального и карьерного роста;
Работа в команде профессионалов;
Возможность получать дополнительное образование, посещать конференции за счет компании;
Возможность выбирать соц. программу (ДМС или компенсация трат на фитнес/обучение/изучение языков и многое другое).