Медиалогия занимается разработкой продуктов по сбору и анализу данных из СМИ и соцмедиа.
Мы разрабатываем высоконагруженные системы, которые в режиме реального времени сканируют весь текстовый сегмент Интернета (100+ млн. сообщений в сутки, 1.7 млрд. метрик) и, используя уникальные лингвистические технологии, позволяют осуществлять мгновенный анализ упоминаний наших клиентов в социальных сетях, блогах, форумах и управлять их репутацией.
Обязанности:
- разработка и оптимизация ETL/ELT-конвейеров для обработки больших данных;
- настройка и администрирование Hadoop/Spark-инфраструктуры (HDFS, YARN, Hive, HBase);
- оптимизация распределенных вычислений и запросов;
- работа с потоковыми данными (Kafka, Spark Streaming, RabbitMQ);
- участие в проектировании и масштабировании архитектуры данных;
- автоматизация процессов с использованием DevOps-практик (Docker, CI/CD).
Требования:
- высшее (неоконченное высшее) образование;
- опыт работы с Java/Scala и Big Data-фреймворками (Apache Spark, Hadoop);
- глубокие знания Hadoop-экосистемы (YARN, HDFS, Hive, HBase, Parquet);
- опыт оптимизации производительности распределенных систем;
- работа с потоковой обработкой (Kafka, Spark Streaming);
- навыки работы с SQL/NoSQL (PostgreSQL, MS SQL, MongoDB).
Будет плюсом:
- опыт с PySpark, Flink, Airflow;
- знание Elasticsearch, ClickHouse, Vertica;
- навыки настройки кластеров и инфраструктуры.
Условия:
- удаленный или гибридный формат работы;
- заработная плата обсуждается по итогам собеседования с успешным кандидатом;
- ДМС после испытательного срока;
- специальные условия для сотрудников на страхование для членов семьи;
- скидки в компаниях-партнерах (фитнес-центры, обучающие курсы, изучение иностранных языков и многое другое);
- бесплатное онлайн-обучение на корпоративном портале и корпоративная библиотека;
- участие в сложных Big Data-проектах с высокой нагрузкой;
- офис в пешей доступности от ст. м. Дмитровская (БЦ «Савеловский Сити»).