Создавать backend-сервисы на Python для обработки данных и интеграции с внешними системами.
Инжиниренно оптимизировать ML-проекты: рефакторить и оборачивать в продакшен пайплайны обучения и инференса, обеспечивая стабильность, воспроизводимость и наблюдаемость.
Участвовать в проектировании хранилищ данных и оптимизации существующих решений.
Стек технологий: Язык и фреймворки: Python 3, PySpark, Pandas, FastAPI, Pydantic Хранилища и вычисления: PostgreSQL, ClickHouse, Greenplum, Trino, S3 Оркестрация и ML: Apache Airflow, MLflow Инфраструктура: Docker, Kubernetes, Git, GitLab CI/C
Мы ожидаем
Опыт коммерческой разработки на Python не менее 2 лет; владение стандартной библиотекой и экосистемой data-разработки.
Понимание принципов построения ETL/ELT-процессов.
Опыт работы с распределёнными СУБД (Greenplum, ClickHouse) и вычислительными движками (Apache Spark, Trino).
Оркестрация пайплайнов в Airflow.
Верхнеуровневое понимание жизненного цикла ML-моделей.
Основы CI/CD и DevOps: сборка, тестирование, деплой.
Навыки работы в командной строке Linux.
Контейнеризация (Docker).
Использование ИИ-ассистентов в разработке (opencode или аналоги) для ускорения написания и ревью кода.