обеспечивать высокую доступность, отказоустойчивость и надежность сервисов компании;
внедрять единые SRE-практики и разрабатывать рекомендации по повышению производительности и отказоустойчивости систем;
ведение проектов повышения надежности систем;
участие в принятии архитектурных решений;
анализ и разбор происходящих сбоев систем;
развитие observability;
инцидент-менеджмент: анализ инцидентов, планирование работ по их недопущению, реагирование на возникновение критических инцидентов.
Что мы ожидаем:
опыт внедрения и развития SRE-практик;
опыт внедрения метрик SLO/SLI/SLA/ и применение их в рабочем процессе;
есть уверенные знания и навыки администрирования ОС семейства Linux;
понимание принципов работы Docker, Kubernetes, Terraform, Ansible;
понимание принципов мониторинга и логирования (grafana stack, graylog);
понимание работы кластерных баз данных.
Что мы предлагаем:
официальное оформление по ТК РФ, стабильную белую заработную плату и премию;
мы не ограничиваем себя работой только из офиса, для нас главное - результат;
после успешного прохождения испытательного срока: ДМС со стоматологией, "Добросервис" с неограниченной юридической и психологической консультацией, фитнес;
оплату профильных курсов, участия в конференциях;
веселые и запоминающиеся корпоративы на природе и в офисе: играем в настолки, xbox и настольный теннис прямо в офисе. Заказываем пиццу каждую последнюю пятницу месяца;
ежедневное погружение в мир книг и неограниченный доступ ко всем электронным и аудиокнигам :)