О команде Мы занимаемся независимой оценкой качества и модельных рисков Kandinsky – семейства генеративных моделей для создания и редактирования изображений, видео и аудиовизуального контента, а также моделей мира (world models).
Наша задача – находить слабые места моделей, проверять выбранные подходы к оценке и готовить рекомендации, которые помогают принимать решения о релизе и возможных сценариях применения моделей.
Мы работаем с новыми версиями Kandinsky до их выхода к пользователям. Разрабатываем собственные методологии, бенчмарки и инструменты полного цикла, объединяя автоматические метрики, human evaluation и подходы LLM/VLM-as-a-judge.
О роли Мы ищем специалиста на стыке исследований и инженерной разработки.
В этой работе не всегда существует готовая методология или универсальная метрика. Нужно определить, из чего складывается качество модели, спроектировать проверяемый эксперимент и реализовать воспроизводимый evaluation-пайплайн.
Роль охватывает весь цикл оценки: от формулирования критериев и подготовки тестовых данных до анализа результатов и рекомендаций для команды разработки. Важно не только измерить качество модели, но и понять, насколько она подходит для реальных пользовательских и бизнес-сценариев, какие ограничения критичны и что осталось непроверенным.
Обязанности
Проектировать оценку с нуля
- декомпозировать качество на измеримые критерии и собирать под них тестовые сценарии, промпты и выборки
- проектировать оценку там, где готовой методологии ещё нет.
Разрабатывать evaluation-пайплайны
- реализовывать на Python инструменты для запуска моделей, сбора результатов и расчёта метрик
- обеспечивать воспроизводимость экспериментов и развивать внутреннюю библиотеку оценки
- готовить инструкции для асессоров и контролировать качество разметки.
Строить VLM-as-a-judge
- разрабатывать судей под конкретные критерии, учитывать их bias и ограничения
- понимать, где автоматическая оценка работает, а где без человека нельзя.
Разбираться в ошибках моделей
- понимать ограничения diffusion-моделей и причины типовых артефактов
- отличать реальную проблему модели от ошибки методологии или замера.
Формировать заключение по модельному риску
- анализировать качество по отдельным сценариям, типам промптов и срезам, а не только по среднему значению
- формулировать условия релиза, ограничения и явно фиксировать то, что осталось непроверенным.
Требования
Хорошее понимание устройства генеративных моделей:
- понимание принципов работы Transformers, diffusion- и мультимодальных моделей и основных задач: T2I, Image Editing, T2V, Audio, Video-Audio.;
- понимание типовых ограничений, ошибок и артефактов моделей; способность разбираться в причинах ошибок и способах их проверки.
Способность проектировать оценку качества моделей:
- декомпозировать качество на измеримые критерии и проектировать тестовые сценарии, промпты и выборки.
- выбирать корректный подход к оценке: human evaluation, автоматические метрики, LLM/VLM-as-a-judge, а также подходящие модели для сравнения;
- проверять валидность метрик и уметь проектировать оценку для новых задач и модальностей, где ещё нет готовой методологии.
Навыки работы с LLM и VLM:
- prompt engineering, structured output, tool calling и работа с контекстом и ограничениями моделей;
- построение и валидация LLM/VLM-as-a-judge, включая проверку автоматической оценки относительно человеческой;
- понимание нестабильности, bias и галлюцинаций моделей; умение подбирать модель под конкретную исследовательскую задачу.
Понимание AI-агентов и агентных систем:
- понимать, чем агент отличается от обычного вызова LLM;
- знать основные компоненты агентной системы: роли, инструменты, контекст, память и оркестрация;
- понимать, когда агентный подход действительно полезен, а когда создаёт лишнюю сложность;
- уметь оценивать надёжность и ограничения агентных решений.
Умение проводить технический и научный ресерч:
- находить и критически разбирать актуальные статьи, бенчмарки, модели и реализации;
- сравнивать решения с актуальными подходами и оценивать достоверность результатов;
- переводить ресерч в конкретные идеи для тестирования и развития внутренних подходов.
Будет плюсом Умение работать с агентами и субагентами:
- декомпозировать задачи между агентами, задавая им чёткие роли и зоны ответственности;
- управлять контекстом и изоляцией субагентов, организовывать проверку результатов;
- собирать результаты нескольких агентов в единое решение и критически оценивать их выводы.
Навыки вайбкодинга и AI-assisted coding:
- уверенно работать с Codex, Claude Code и другими coding-агентами
- проверять и дорабатывать сгенерированный код, использовать агентов для тестирования;
- понимать архитектуру создаваемого решения
Продуктовое мышление:
- связывать тестирование с реальными пользовательскими сценариями и понимать, какие ошибки критичны для продукта;
- приоритизировать направления проверки и переводить результаты оценки в рекомендации для разработки;
- понимать влияние результатов на релиз и дальнейшее развитие модели.
Дополнительный релевантный опыт:
- оценка Image, Video, Audio и мультимодальных моделей; разработка собственных бенчмарков и методологий;
- работа с асессорами, большими массивами пользовательских запросов и построение аналитических пайплайнов/отчётов;
- понимание GPU-инфраструктуры и инференса; практический опыт построения multi-agent систем.
Условия
- комфортный современный офис рядом с м. Кутузовская
- возможность выбрать удобный график - офис / гибрид
- ежегодный пересмотр зарплаты и годовая премия
- корпоративный спортзал и зоны отдыха
- более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
- расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
- гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
- подписка Прайм с возможностью совместного использования на трёх близких
- скидки на продукты компаний-партнеров
- вознаграждение за рекомендацию друзей в команду Сбера