На данном проекте мы реализуем сложную распределенную высоконагруженную поисково-аналитическую систему с автоматической обработкой больших объемов данных и медиа потоков, аналогов у которой практически нет.
Какие задачи необходимо решать:
- Разработка и внедрение моделей компьютерного зрения для детекции, классификации и сегментации объектов на спутниковых/аэрофотоснимках
- Обработка геопространственных данных в формате GeoTIFF: загрузка, предобработка, трансформация, извлечение признаков с использованием библиотек GDAL, Rasterio, OpenCV
- Построение мультиагентных систем, где агенты используют LLM для принятия решений, доступа к инструментам и сервисам (RAG-пайплайны, планирование, вызов внешних API)
- Интеграция ML-моделей в общий пайплайн обработки данных. Обучение моделей в высокопроизводительной среде (кластер SLURM)
- Участие в выборе архитектур и подходов, исследование новых методов
Наши ожидания:
- Высшее образование в области прикладной математики, информатики, физики или смежных инженерных специальностей
- Релевантный коммерческий или научный опыт от 3 лет в разработке ML/DL-решений
- Глубокое понимание алгоритмов машинного обучения и нейросетевых архитектур (CNN, трансформеры, etc.)
- Отличное владение Python и основными библиотеками: PyTorch, OpenCV, scikit-learn, Pandas, NumPy
- Опыт работы с геопространственными форматами (GeoTIFF) и библиотеками (GDAL, rasterio, shapely, geopandas)
- Практические навыки разработки агентов на основе LLM с использованием фреймворков (LangChain, LlamaIndex) и методов RAG (векторные БД, эмбеддинги, промпт-инжиниринг)
- Опыт работы с системами управления вычислительными ресурсами, в частности SLURM (запуск заданий, управление очередями, параллельные вычисления)