Site Reliability Engineer в группу эксплуатации YT
Описание от работодателя
YTsaurus — опенсорс-платформа для хранения и обработки данных, которую в VK активно развивают и используют как основу единого дата-лейка. Система обрабатывает миллионы событий в секунду на динамических таблицах, работает с сотнями петабайт данных и обслуживает тысячи пользователей. У нас большие кластеры, сложная инфраструктура и высокие требования к надёжности. И мы ищем SRE, который поможет поддерживать и развивать всё это.
Задачи
Автоматизировать эксплуатацию YTsaurus
Интегрировать платформу с внутренними системами VK
Следить за стабильностью и производительностью
Разбираться с проблемами на уровне кода (в основном C++)
Решать задачи, которые не гуглятся
Разбираться с инцидентами в рамках дежурств
Масштабировать кластер YTsaurus до 500ПБ
Заниматься оптимизацией использования железа (CPU, диски)
Требования
Опыт работы с распределёнными системами
Знания в области сетей (TCP/IP, DNS, балансировка, ACL) и ОС Linux
Способность работать самостоятельно: формулировать цели, предлагать решения
Будет плюсом
Опыт работы с высоконагруженными системами или большими объёмами данных
Владение C++ на уровне чтения и отладки сложного кода