Москва, Центральный административный округ, район Хамовники, квартал Красная Роза
Метро: Парк культурыНаша команда развивает Alice AI LLM — технологию, которая лежит в основе разных продуктов Яндекса. Главный из этих продуктов — чат с Алисой.
Мы фокусируемся на вычислительных сценариях: задачах, где модель должна писать код, рассуждать и пользоваться техническими инструментами — интерпретатором, поиском и другими.
Наша цель — научить Алису решать сложные технические запросы пользователей и грамотно подключать нужные инструменты в нужный момент.
Почему у нас классно:
Создание технических бенчмарков
Одна из главных задач — придумывать и строить сложные бенчмарки, на которых можно честно сравнивать модели между собой. Вам предстоит формулировать критерии оценки для задач с кодом и техническими рассуждениями, экспериментировать с разными подходами (от автоматических проверок до LLM-as-a-judge и экспертной разметки) и создавать стабильные метрики, по которым команда разработки сможет улучшать модель.
Оценка агентских способностей
Современные модели всё чаще решают задачи не в один проход, а через цепочки вызовов инструментов: запускают код, ищут информацию, работают с файлами. Вам предстоит придумывать, как измерять, насколько хорошо модель сама выбирает инструменты, корректно ими пользуется и доводит задачу до результата.
Сбор данных для роста качества
Хорошие данные — это очень важно. Вам предстоит работать с разными источниками: проектировать синтетические пайплайны генерации задач, ставить технические задания экспертным AI-тренерам по сложным техническим срезам, запускать краудсорсинговые разметки с системой контроля качества. Важная часть работы — формулировать критерии эталонных решений и следить за их соблюдением.
Больше об аналитике в Яндексе — в канале Yandex for Analytics
Финфрейм
Москва
Не указана