О ВАС
Мы ищем Operations Engineer — технически любознательного, внимательного к деталям, проактивного специалиста с сильными навыками коммуникации — в Global Technical Operations (GTO). Вам предстоит мониторить и расследовать production-проблемы глобальной платформы, улучшать обнаружение и реагирование на инциденты, анализировать trends и patterns production-данных и повышать качество коммуникации с партнёрами и стейкхолдерами.
Необходимы сильные troubleshooting-навыки, опыт observability-платформ и scripting, а также опыт SRE, DevOps, production operations или NOC с high-availability платформами игровой индустрии. Критично уметь ясно общаться на английском письменно и устно при incident updates, shift handoffs и status page communications.
Если вам нравится поддерживать критические системы, улучшать операционные процессы и доводить инциденты до решения для разработчиков и игроков по всему миру, будем рады познакомиться.
О КОМПАНИИ
Xsolla — глобальная коммерческая компания с инструментами и сервисами для игровой индустрии. От инди до AAA — компании используют Xsolla для финансирования, дистрибуции, маркетинга и монетизации игр. Xsolla выступает merchant of record и помогла более чем 1500 разработчикам охватить больше игроков и развивать бизнес по всему миру.
Подробнее: xsolla.com.
ОБЯЗАННОСТИ
- Быть основным оператором GTO Operational Dashboard в Datadog во время смены, сопоставлять APM, logs, metrics, synthetic tests и Real User Monitoring, выявлять аномалии и решать, нужен ли incident ticket.
- Проводить triage и расследование production-инцидентов: создавать JIRA Service Management tickets, анализировать traces, logs и infrastructure/application metrics в Datadog, определять blast radius и вероятный root cause domain и направлять задачу Product SRE, Infrastructure SRE или Engineering.
- Вести low-severity incidents end-to-end, выполнять runbooks и решать их без escalation, где возможно; эскалировать при превышении порогов или необходимости code-level fix.
- Поддерживать TSO Lead во время major incidents в war room: предоставлять real-time данные, вести timeline incident ticket и выполнять mitigation actions.
- Готовить под руководством TSO Lead внутренние Slack updates, stakeholder notifications и customer-facing status page updates.
- Анализировать incident trends, recurring issues и production bugs по данным Datadog, JIRA и Slack и формировать выводы для product/engineering отчётности.
- Составлять incident timelines и draft PIR, отслеживать PIR action items и сообщать о просроченных.
- Создавать operational automation — alert enrichment scripts, incident templates, Slack workflows, dashboard widgets — и развивать runbooks.
- Проводить shift handoffs, участвовать в knowledge transfer с SRE.
- Подменять TSO Lead при необходимости, включая severity classification, escalation decisions, communications и базовые функции Incident Commander.
- Периодически публиковать health reports критически важных приложений.…
Текст вакансии длинный, здесь показана его часть. Полностью — на сайте студии.
Отклик принимает студия на своём сайте. LOOTWORK только показывает вакансию.