Мы ищем специалиста, который обеспечит стабильную и предсказуемую работу наших информационных систем на базе 1С и MS SQL. Ваша главная цель — не просто «чинить», а системно повышать надёжность: внедрять метрики, автоматизировать обнаружение проблем, проектировать отказоустойчивость и устранять первопричины сбоев. Роль предполагает выделение до 10 % времени команд на задачи по надёжности и улучшению процессов.
Тебе предстоит:
Управление инцидентами и постмортемы
- Координировать участников «пожарной команды» для оперативного решения критических инцидентов.
- Собирать информацию о проблеме, контролировать заведение аварии, фиксировать хронометраж и ключевые действия.
- Писать постмортем‑отчёты (blameless postmortem): фиксировать, что произошло, как реагировали, какие уроки извлечены.
- Контролировать и ставить задачи по недопущению повторения причин инцидентов (RCA, action items).
Производительность и доступность
- Определять и поддерживать SLI/SLO для ключевых сервисов, вести учёт error budget.
- Настраивать и анализировать ключевые показатели ИС: создавать дашборды, алерты, описывать реакцию на отклонения.
- Писать инструкции (runbooks) по реакции на отклонения показателей работы от нормы.
- Анализировать аномалии: рост нагрузки, рост данных, нехарактерные паттерны поведения системы.
Анализ логов и диагностика
- Анализировать Журнал регистрации (ЖР) и Технологический журнал (ТЖ) на наличие ошибок и узких мест.
- Сопоставлять данные из разных источников (логи, метрики, трейсы) для точной локализации проблемы.
Масштабирование и отказоустойчивость
- Участвовать в проектировании и реализации отказоустойчивой архитектуры (кластеризация 1С, Always On для MS SQL, балансировка нагрузки и т. д.).
- Готовить систему к пиковым нагрузкам: нагрузочное тестирование, планирование ёмкости, проработка сценариев деградации.
Регулярное обслуживание и гигиена данных
- Выполнять и автоматизировать типовые операции обслуживания: пересчёт итогов, очистка регистров, удаление нулевых записей.
- Ставить задачи и предлагать решения, чтобы такие операции требовались реже или выполнялись автоматически.
Пожелания по опыту:
- Опыт разработки на платформе 1С: понимание архитектуры регистров, сеансов, блокировок, умение читать ЖР и ТЖ.
- Уверенная работа с MS SQL: планы запросов, блокировки, DMV, Extended Events, тюнинг производительности.
- Практический опыт работы с инструментами мониторинга и наблюдаемости: Zabbix, Prometheus, Grafana, ELK.
- Понимание SRE‑практик: SLI/SLO, error budget, incident management, blameless postmortem, runbooks.
- Умение проектировать отказоустойчивые и масштабируемые решения, опыт подготовки к пиковым нагрузкам.
- Способность формализовать процессы, писать понятные инструкции и ставить задачи смежным командам.
Будет плюсом
- Опыт внедрения автоматизации для типовых операций обслуживания.
- Знание практик Capacity Planning и Chaos Engineering на базовом уровне.
- Опыт работы в кросс‑функциональных командах и проведения ретроспектив по инцидентам.