Компания Clearway Integration — команда архитекторов и консультантов, созданная выходцами из Microsoft Consulting Services. Мы создаём программные продукты для управления и мониторинга больших ИТ-инфраструктур.
Наши решения используются в инфраструктурах масштаба десятков тысяч серверов и рабочих станций, в том числе в крупных финансовых и промышленных организациях.
Мы ищем SRE инженера, который поможет нам сделать наши продукты более надёжными, предсказуемыми и масштабируемыми.
Чем предстоит заниматься:
• Разрабатывать и внедрять практики обеспечения надёжности продуктов: SLI/SLO, требования к отказоустойчивости, контроль рисков изменений.
• Проектировать и проверять сценарии высокой доступности, восстановления после сбоев и деградации систем.
• Проводить нагрузочное тестирование, анализировать производительность и масштабирование решений на больших инфраструктурах.
• Развивать систему наблюдаемости (monitoring, logging, alerting) и помогать командам получать объективную картину состояния продуктов.
• Участвовать в расследовании сложных инцидентов, проводить анализ первопричин (RCA) и внедрять улучшения для предотвращения повторений.
• Участвовать в архитектурных обсуждениях продуктов с фокусом на надёжность, безопасность и эксплуатацию.
• Создавать технические рекомендации и практики эксплуатации решений для внутренних команд и крупных заказчиков.
Что мы ожидаем:
• Опыт работы в роли SRE / DevOps / Platform Engineer от 3 лет.
• Понимание принципов построения отказоустойчивых систем.
• Опыт работы с Kubernetes и современными инструментами инфраструктуры.
• Практический опыт работы с Linux.
• Опыт работы с мониторингом и observability-инструментами.
• Понимание процессов эксплуатации production-систем: инциденты, RCA, postmortem.
• Опыт работы с PostgreSQL, ClickHouse или другими высоконагруженными системами хранения данных.
• Понимание сетевой инфраструктуры и вопросов безопасности.
• Умение писать техническую документацию.
Что мы предлагаем:
- возможность участвовать в проектах, которые сложно получить в обычной команде разработчиков в банке или онлайн-сервисе;
- возможность предлагать и быть услышанным;
- конкурентный уровень полностью официальных доходов и постоянное трудоустройство по ТК РФ;
- возможность официального участия во всех государственных программах поддержки ИТ-отрасли включая льготную ипотеку;
- Соцпакет включает в себя: медицинскую страховку (ДМС), доплата больничных до 100% от оклада (28 дней в году), 3 оплачиваемых day-off на случай форс-мажора; мобильную связь, полное обеспечение оборудованием (включая орг. технику); возможность бесплатного обучения (внешнее обучение и профильные конференции), регулярные корпоративные мероприятия для сотрудников и их семей, а также материальная помощь при важных событиях в жизни (заключение брака, рождение детей и другое);
- существенные годовые бонусы до 6 ЗП;
- офисный, удаленный или комбинированный вариант работы на выбор.
Похожие вакансии
Практический опыт промышленной эксплуатации ClickHouse. Понимание архитектуры ClickHouse: shards, replicas, Distributed tables, ReplicatedMergeTree и MergeTree family. Опыт диагностики replication queue...
практический опыт эксплуатации LLM-агентов: фреймворки, оркестрация многошаговых пайплайнов (LangGraph, LangChain или аналоги), жизненный цикл агентного запроса: planning → tool calling...
Опыт эксплуатации Kubernetes в production. Понимание принципов Site Reliability Engineering: SLA, SLI, SLO, Error Budget, Incident Management, Postmortem.
Имеете 5+ лет опыта эксплуатации highload-продакшена в роли SRE, DevOps или инфраструктурного инженера. Глубоко траблшутите Kubernetes в проде...
Развивать подход GitOps и совершенствовать процессы CI/CD. У вас есть опыт работы с Observability-инструментами (в частности, стек Victoria...
