Scopely ищет Senior Platform Engineer (Reliability) для новой уникальной multiplayer strategy game в Испании, Ирландии, Португалии или Великобритании, удалённо или гибридно. Мы можем предоставить визовую поддержку и помощь с переездом из любой страны.
В Scopely мы глубоко увлечены своей работой и хотим каждый день вдохновлять людей играть — как рядом с талантливыми коллегами, так и через тесную связь с нашими игровыми сообществами. Мы — глобальная команда любителей игр, которая разрабатывает, издаёт и развивает индустрию мобильных игр, ежедневно объединяя миллионы людей по всему миру.
Мы на раннем этапе разработки амбициозной, ещё не анонсированной Strategy/MMO и создаём команду талантливых и увлечённых разработчиков для этого захватывающего пути!
Что предстоит делать
Владение messaging systems: эксплуатировать, мониторить и постоянно улучшать messaging infrastructure с текущим фокусом на NATS cluster и NATS JetStream, обеспечивая надёжность, observability и понятность систем для зависимых команд.
Signals & Observability: проектировать и отвечать за observability layer распределённых backend systems, определяя signals — metrics, traces, logs — которые делают операционные проблемы видимыми и практичными, и продвигая их adoption там, где их ещё нет.
Кросс-функциональная диагностика: работать на пересечении infrastructure и backend engineering, сопоставляя infrastructure signals (IOPS, latency, resource saturation) с application behaviour (message throughput, consumer lag, retry storms), находить root causes и направлять нужные команды к правильным исправлениям.
SLOs & Error Budgets: определять, внедрять и поддерживать SLO frameworks для backend services и messaging pipelines, делая reliability измеримой и помогая командам принимать обоснованные компромиссы между velocity и stability.
Reliability как внутренний продукт: создавать и поддерживать reliability tooling, runbooks и operational frameworks как internal products, позволяя backend и infrastructure engineers самостоятельно решать operational concerns вместо зависимости от SRE. Сотрудничать с backend, infrastructure и product engineers, формировать reliability standards, делиться operational context и влиять на architecture decisions до появления production-проблем.
Incident Management: руководить или участвовать в incident response на уровнях messaging и backend, превращать postmortems в системные исправления и внедрять профилактические улучшения в engineering workflows.
Code Literacy & Engineering Collaboration: уверенно ориентироваться в infrastructure и backend codebases, выявлять плохо инструментированные сервисы, слабую infrastructure architecture, отсутствующий error handling или patterns, создающие operational risk, и улучшать их вместе с другими engineering teams.
Что мы ищем
Сильный опыт Site Reliability Engineering, production operations или backend engineering с существенным operational-фокусом.
Практический опыт эксплуатации NATS и/или NATS JetStream в production либо сопоставимо глубокий опыт distributed messaging systems вроде Apache Kafka, AWS Kinesis или аналогов. Независимо от системы обязателен опыт Leader Election, RAFT consensus и log replication.
Способность ориентироваться и рассуждать о application codebases (C#, Go, Python или аналоги), выявляя instrumentation gaps, operational anti-patterns и code-level root causes.
Сильный observability опыт: проектирование и реализация стратегий metrics, logs и traces в distributed systems.
Опыт debugging сложных distributed systems, особенно на границе infrastructure и application layers.
Хорошее понимание cloud infrastructure (желательно AWS) и containerized workloads (ECS, Kubernetes/EKS или аналог).
Сильная коммуникация: способность быть переводчиком между infrastructure и application engineers и объяснять operational risk нетехническим stakeholders.
Infrastructure as Code First: вы предпочитаете управлять infrastructure, SLOs, monitors, dashboards и другим в основном через code, а не manual configuration, понимаете преимущества IaC и продвигаете их.
Будет плюсом
Прямой опыт NATS JetStream: stream configuration, consumer groups, retention policies и delivery guarantees.
Опыт Datadog или аналога для observability в масштабе.
Знакомство с database-level operational concerns — query performance, connection pooling, replication lag — и data modeling.
Опыт наставничества инженеров или развития reliability culture между командами.
О Scopely
Scopely — ведущая игровая и глобальная interactive entertainment компания, в портфеле которой находятся многие из самых любимых и долгоживущих игровых проектов мира, включая две самые успешные мобильные игры всех времён — MONOPOLY GO! и Pokémon GO, а также Stumble Guys, Star Trek™ Fleet Command, MARVEL Strike Force, WWE Champions, франшизу Scrabble®, Yahtzee® With Buddies и многие другие. На mobile, web, PC и console Scopely создаёт, разрабатывает, издаёт и поддерживает в live-режиме один из самых разнообразных и отмеченных наградами портфелей в игровой индустрии, объединяя сотни миллионов игроков общей любовью к играм.…
Текст вакансии длинный, здесь показана его часть. Полностью — на сайте студии.
В этой вакансии студия требует право работать в своей стране — гражданство, вид на жительство или рабочую визу. Даже если указана удалённая работа, кандидата из другой страны обычно не рассматривают. Проверьте условия в оригинале перед откликом.
Отклик принимает студия на своём сайте. LOOTWORK только показывает вакансию.