Инженер третьей линии технической поддержки (Sber AntiFraud Platform)
Коротко
Resolves critical incidents in a 24/7 banking system, analyzes logs and metrics, coordinates response, and drives preventive measures · Needs: 3+ years in 2nd/3rd line support, operations, or SRE; experience with high-load 24/7 systems
Описание от работодателя
Мы поддерживаем высоконагруженную банковскую систему класса критичности Mission Critical+ (МС+). Это максимальный класс: система работает круглосуточно, и любой сбой сразу замечают клиенты банка.
Третья линия — последний рубеж перед разработкой. К нам приходят инциденты, которые не решились ранее, а от нас уходят задачи, после которых эти инциденты не повторяются. Мы ищем инженера, которому мало просто потушить пожар: важно понять, почему он начался, и сделать так, чтобы он не случился снова.
Обязанности Разбирать инциденты, эскалированные от бизнес пользователей, системы мониторинга и дежурной смены: не только сбои, но и деградацию производительности под нагрузкой. Находить причину по логам, метрикам, трассировкам и данным в БД.
Вести управление критичными инцидентами (процесс управления инцидентами): собирать нужных людей, координировать работу, держать бизнес и смежные команды в курсе статуса (коммуникационный план). Для системы МС+ счёт идёт на минуты.
Готовить справки по итогам инцидентов: хронология, влияние на клиентов и бизнес, первопричина, что уже сделано и что нужно сделать, чтобы инцидент не повторился.
Находить дефекты в продуктиве и подтверждать их: шаги воспроизведения, логи, запросы, ожидаемое и фактическое поведение.
Ставить задачи на исправление в разработку так, чтобы разработчику не пришлось ничего переспрашивать, и вести их до выката исправления.
Искать закономерности и повторяющиеся причины в прошедших инцидентах.
Предлагать и доводить до конца меры, которые снижают число инцидентов: исправления, изменения в процессах, автоматизацию.
Описывать новые метрики и алерты, если инцидент показал, что мониторинг не заметил проблему или заметил её поздно.
Разбирать метрики, которые срабатывают неверно (ложные срабатывания, пропуски, неверные пороги), и добиваться их исправления.
Требования Опыт от 3 лет во второй или третьей линии поддержки, в эксплуатации или SRE.
Опыт поддержки высоконагруженных систем, работающих круглосуточно.
Уверенные знания Linux: логи, процессы, сеть, базовый bash.
SQL на уровне, достаточном, чтобы самостоятельно найти и проверить данные в продуктивной БД.
Опыт работы с системами логирования и мониторинга: ELK / OpenSearch, Grafana, Prometheus, Zabbix
Понимание устройства распределённых систем: микросервисы, HTTP/REST, очереди Kafka / RabbitMQ, интеграции.
Знание процессов управления инцидентами и проблемами (ITIL или аналог).
Аккуратность в работе с продуктивными данными в рамках требований информационной безопасности.
Умение ясно писать: справка по инциденту и задача в разработку — ваш основной рабочий результат.
Спокойствие и собранность во время критичного инцидента.
Будет плюсом
Опыт работы в банке или финтехе, понимание банковских процессов: платежи, карты, расчёты.
Опыт ведения крупных инцидентов и проведения разборов в формате blameless postmortem.
Kubernetes, Docker.
Умение читать код Java / Python настолько, чтобы найти место дефекта. Писать продуктовый код не требуется.
Трассировка и APM: OpenTelemetry, Jaeger и аналоги.
Понимание SLI/SLO и практик SRE.
Скрипты автоматизации на Python или bash.
Сертификат ITIL 3/4 Foundation.
Условия Комфортный современный офис (ст.м.Кутузовская)
ежегодный пересмотр зарплаты, годовая премия
корпоративный спортзал и зоны отдыха
более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
программа адаптации и помощь руководителя на старте
расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
вознаграждение за рекомендацию друзей в команду Сбера.