О роли
Мы выделяем надёжность в отдельную полноценную функцию и ищем двух инженеров, которые возьмут на себя SLO, инцидент-менеджмент, CI/CD и эксплуатацию блокчейн-нод. Вы будете отвечать за то, чтобы система, работающая с деньгами, была доступна всегда — и чтобы инженеры могли деплоиться быстро и безопасно.
Чем предстоит заниматься
- Определение и внедрение SLO/SLI, error budgets, алертинг на их основе.
- Построение и развитие CI/CD, инфраструктура как код (Terraform или аналоги).
- Эксплуатация облачной инфраструктуры (AWS): отказоустойчивость, масштабирование, стоимость.
- Развёртывание, мониторинг и обновление блокчейн-нод и валидаторов; контроль синхронизации и аптайма.
- Инцидент-менеджмент: он-колл ротация, постмортемы, устранение классов проблем.
- Observability: метрики, логи, трейсинг (Prometheus/Grafana/OpenTelemetry или аналоги).
- Внутренние инструменты и самообслуживание для разработчиков.
Что мы ожидаем
- 4+ года в SRE/DevOps/Platform-роли в продуктовых компаниях.
- Сильный опыт с AWS, Kubernetes/контейнерами, Terraform.
- Опыт построения CI/CD и наблюдаемости с нуля или значительного их развития.
- Опыт он-колла и работы с инцидентами в системах с высокой ценой простоя.
- Скриптинг/разработка на Python или Go.
Будет плюсом
- Опыт эксплуатации блокчейн-нод/валидаторов (понимание рисков слэшинга, апгрейдов сети).
- Опыт в финтехе: требования к аудиту изменений, разграничению доступа.
- Практика SRE по Google-модели: error budgets, toil reduction.
Условия
- Работа над продуктом с реальной технической глубиной: собственная инфраструктура, высокие требования к безопасности и надёжности.
- Прямое влияние на архитектуру и процессы — вы будете строить функцию, а не поддерживать чужую.
- Небольшая сильная команда без бюрократии, быстрые решения.
Похожие вакансии
О роли. Вы строите фронтенд-слой регулируемой ЦФА-платформы под российских финансовых институтов. Это не очередной SaaS-лендинг — это мульти...
О роли. Нам нужен человек, который способен самостоятельно уменьшать техническую нагрузку на команду: принимать решения в условиях неполных внешних контрактов...
Ошибка может означать двойную операцию, неверный баланс или комиссию, нарушение прав доступа, потерю трассируемости либо ложный Success при фактически неизвестном...
Высшее техническое образование. — 5+ лет в информационной безопасности (application security / product security / security engineering), из них опыт в финтехе...
Экспертность: успешный подтвержденный опыт продаж автомобилей от 3 лет, глубокое понимание текущих реалий авторынка и знание продуктовых новинок.
