Организация работы отдела поддержки информационных систем, распределение зон ответственности и контроль исполнения задач сотрудниками.
Обеспечение доступности, стабильности и производительности сопровождаемых информационных систем, сервисов и интеграций банка.
Организация мониторинга систем, приложений, инфраструктуры и бизнес-сервисов; развитие дашбордов, оповещений и проактивного выявления отклонений.
Руководство диагностикой и устранением инцидентов второй и третьей линии, координация действий смежных подразделений, разработчиков и внешних поставщиков.
Проведение анализа первопричин критических и повторяющихся инцидентов (RCA), подготовка корректирующих мероприятий и контроль их выполнения.
Управление заявками, инцидентами, проблемами и изменениями в соответствии с установленными процессами ITIL и требованиями SLA.
Контроль установки, настройки, обновления и сопровождения сервисов на Linux и Windows, а также автоматизация повторяющихся операций с помощью скриптов.
Организация безопасного выпуска изменений в промышленную среду: проверка планов внедрения, резервного копирования, отката и результатов тестирования.
Разработка и актуализация регламентов эксплуатации, инструкций, базы знаний, паспортов систем, схем интеграций и планов аварийного восстановления.
Организация взаимодействия с разработчиками, системными администраторами, DBA, сетевыми инженерами, информационной безопасностью и бизнес-подразделениями.
Контроль учётных записей и прав доступа в сопровождаемых системах, соблюдение требований информационной безопасности и участие в устранении замечаний аудита.
Формирование отчётности по доступности систем, инцидентам, SLA, проблемам, изменениям и результатам работы отдела; предоставление предложений по улучшению.
Планирование развития команды: подбор сотрудников, адаптация, обучение, наставничество, оценка компетенций и формирование взаимозаменяемости.
Участие в проектах внедрения новых информационных систем, приёмка решений на сопровождение и проверка их эксплуатационной готовности.
Организация дежурств и оперативного реагирования на критические сбои, включая координацию восстановительных работ и информирование заинтересованных сторон.
Требования:
Опыт работы в сопровождении информационных систем, системном администрировании или эксплуатации ИТ-инфраструктуры не менее 5 лет, в том числе не менее 2 лет на руководящей позиции.
Уверенное администрирование Linux (Oracle Linux, Red Hat, CentOS, Ubuntu): systemd, процессы, файловые системы, права доступа, пакеты, сетевые настройки, планировщики, анализ журналов и производительности.
Уверенное администрирование Windows Server: службы, Event Viewer, PowerShell, Active Directory, групповые политики, файловые ресурсы и базовая диагностика доменной инфраструктуры.
Практический опыт запуска, остановки, настройки и диагностики прикладных сервисов, API, интеграционных модулей и фоновых заданий.
Умение анализировать логи, thread dump, heap dump, core dump, метрики CPU, RAM, дисковой подсистемы и сети; находить первопричину инцидента, а не только устранять симптомы.
Опыт сопровождения Java-приложений и серверов приложений/контейнеров (WebLogic, Tomcat, Spring Boot) будет существенным преимуществом.
Навыки написания и поддержки скриптов автоматизации на Bash и PowerShell; знание Python будет преимуществом.
Опыт работы с системами мониторинга и оповещения (Zabbix, Prometheus, Grafana, ELK/OpenSearch, Graylog либо аналогичными), настройка метрик, дашбордов и триггеров.
Знание сетевых технологий: TCP/IP, DNS, DHCP, HTTP/HTTPS, TLS, VPN, NAT, балансировка нагрузки, reverse proxy; умение диагностировать соединения с помощью curl, telnet/nc, traceroute, tcpdump и аналогичных утилит.
Понимание работы баз данных Oracle и PostgreSQL на уровне сопровождения приложений: подключения, сессии, блокировки, долгие запросы, журналы и контроль доступности.
Опыт работы с Git, CI/CD и процессами развёртывания; понимание принципов контейнеризации Docker/Kubernetes будет преимуществом.
Знание процессов ITIL: управление инцидентами, проблемами, изменениями, конфигурациями, релизами и уровнем сервиса (SLA/OLA).
Умение разрабатывать эксплуатационную документацию: инструкции, регламенты, схемы взаимодействия, чек-листы, планы восстановления и база знаний.
Опыт управления командой: постановка задач, распределение нагрузки, контроль сроков и качества, наставничество, оценка сотрудников и организация дежурств.
Развитые аналитические и коммуникативные навыки, ответственность, стрессоустойчивость, инициативность и готовность участвовать в устранении критических инцидентов вне рабочего времени.