Юзтех – группа аккредитованных ИТ-компаний полного цикла разработки с многолетней экспертизой в передовых технологиях: DWH, BigData, AI/ML, Blockchain, BI, предиктивная аналитика, цифровые двойники производства и рисков.
ГК Юзтех является технологическим партнером таких компаний, как Mail.ru, 2Gis, НЛМК, Еврохим, ГоИнвест, Альфа-Банк, Сбер, ВТБ, МКБ, Самолет, Х5 retail Group, Газпромнефть, Леруа Мерлен, Ситилинк, Ланит, IBS. Также, ГК разрабатывает собственные ИТ-продукты (Юзбас, Октопус, Тил Эйчар) и флагманские проекты, которыми пользуется 70% населения страны.
Сфера:
Ищем Data Engineer / ML Engineer в команду, которая развивает систему контроля качества данных для моделирования и расчёта моделей. Основная задача - создавать статистические и ML-контроли, которые позволяют автоматически выявлять аномалии, дрейф данных, проблемы со свежестью и нарушения сезонных паттернов.
Роль находится на стыке Data Engineering и классического ML: важно уметь не только исследовать данные и строить модели, но и интегрировать решения в production-пайплайны.
Москва, офис 1 раз в неделю.
Задачи:
- Исследовать данные и прототипировать новые методы контроля их качества.
- Проектировать ML- и статистические проверки для обнаружения аномалий и дрейфа распределений.
- Выявлять деградацию свежести данных, нарушения сезонности и нетипичные комбинации метрик.
- Строить базовые ожидания по DQ-метрикам: row_count, null_rate, unique_count, freshness, доли категорий.
- Подбирать оптимальный подход под каждую задачу: от простых правил и статистических методов до ML-моделей.
- Валидировать контроли при отсутствии готовой разметки: использовать исторические данные, синтетические аномалии, shadow mode и анализ false positive.
- Интегрировать решения в production-пайплайны на Airflow, PySpark, Hive/Hadoop.
- Настраивать алертинг и сопровождать реализованные решения в production.
Мы ожидаем:
- Опыт работы в ML / Data Science от 3 лет.
- Уверенный Python: pandas, numpy, scikit-learn.
- Сильный SQL.
- Практический опыт работы с Airflow - критично.
- Опыт с PySpark, Hadoop / Hive.
- Опыт работы с MLflow или аналогичными инструментами.
- Хорошее понимание математической статистики и классического ML: линейные модели, деревья решений, бустинги.
- Опыт выявления аномалий и/или data drift.
- Опыт работы с временными рядами.
- Опыт вывода ML-моделей в production, мониторинга и версионирования.
- Умение выбирать подход к задаче: понимать, когда действительно нужен ML, а когда эффективнее использовать статистические проверки, SQL-контроли или бизнес-правила.
Мы предлагаем:
- Карьерную и профессиональную возможность в стабильной, аккредитованной ИТ-компании;
- Расширенный полис ДМС со стоматологией, корпоративный психолог;
- Необходимую технику для комфортной работы;
- Обучение, сертификацию, клуб английского языка;
- Доступ к Корпоративной библиотеке и к Корпоративному университету;
- Внутрикорпоративные профильные коммьюнити;
- Заботу о детях сотрудников: корпоративные скидки, подарки, детские дни;
- Геймифицированную программу лояльности: поверь, ты будешь восторге от нашего корпоративного магазина;
- Корпоративную жизнь: мы много работаем и классно отдыхаем.