AI-инженер (LLM, локальные модели)

AI-инженер (LLM, локальные модели)

Описание вакансии

Ищем в команду AI-инженера на постоянную работу. Нужен человек, который по-настоящему разбирается в локальном AI и сам доводит задачи до работающего результата: поднимет у нас AI-сервер на открытых моделях и дальше будет делать на нём автоматизации под наши задачи.

Чем будете заниматься

  • Поднять и вести локальный AI-сервер: выбрать железо (Mac Studio на 128–256 ГБ или NVIDIA DGX Spark), запустить открытые модели (Qwen, Kimi, Hermes и т.п.), следить, чтобы всё работало.
  • Делать направленные автоматизации — по одной, без «комбайна на всё». Пример: сервер сам собирает данные из интернета в свою базу, держит их свежими и за секунды отдаёт другим AI-моделям (Claude, GPT) через API или MCP.
  • Настраивать агентов вроде OpenClaw под конкретные задачи — в изоляции и с минимальными правами.
  • Подсказывать, что выгодно перевести на локальные модели, а что дешевле оставить в облаке.
  • Отвечать за безопасность: сервер закрыт снаружи, секреты не утекают, текст из интернета не управляет моделью.

Кто нам нужен

  • Уже запускали модели локально (MLX, llama.cpp, Ollama, vLLM) и понимаете, какая модель на каком железе пойдёт и с какой скоростью.
  • Понимаете квантизацию, контекст и память: где модель начнёт тормозить или ошибаться и что с этим делать.
  • Строили поиск по своим данным: эмбеддинги, векторные базы, RAG.
  • Уверенно пишете на Python, умеете парсить сайты и работать с API.
  • Разбираетесь в агентах (OpenClaw и подобные) и MCP, следите за новыми открытыми моделями.
  • Делаете сами и доводите до конца: не «надо изучить», а «вот работает, вот замеры».
  • Плюсом: опыт на NVIDIA (CUDA) и проекты на GitHub, которые можно посмотреть.

Условия

  • Постоянная работа, не разовый проект. Занятость — полная, частичную можно обсудить.
  • Удалённо.
  • Железо покупаем мы, выбираем вместе.

Как откликнуться

Откликайтесь здесь, на hh, и обязательно приложите сопроводительное письмо. В нём — 2–3 своих проекта с LLM (ссылки или пара строк о том, что сделали лично вы) и короткие ответы на три вопроса:

  • Какую модель вы бы запустили на машине со 128 ГБ памяти, чтобы вытаскивать данные из веб-страниц, и какую скорость ожидаете?
  • Как сделать, чтобы другая AI-модель получала свежие данные из нашей базы быстрее, чем за секунду?
  • Что может пойти не так, если агент сам читает страницы из интернета, и как от этого защититься?

Отклики без ответов на вопросы, скорее всего, не будем рассматривать.

Навыки
  • Python
  • Машинное обучение
  • LLM
  • RAG
  • Docker
  • Linux
  • Парсинг
  • REST API
  • CUDA
  • PyTorch
  • Нейронные сети
Посмотреть контакты работодателя

Похожие вакансии

nau
  • Москва

  • Не указана

Рекомендуем
HeadHunter
  • Москва

  • Не указана

Рекомендуем
Домклик
  • Москва

  • Не указана

Рекомендуем

Applied ML / LLM Engineer (FinTech)

Фетисов Павел Александрович

  • Москва

  • от 2500 USD

Москомэкспертиза

AI Engineer

Москомэкспертиза

  • Москва

  • от 2500 USD

Альфа-Деньги
  • Москва

  • от 2500 USD

HeadHunter
  • Москва

  • от 2500 USD

СберМедИИ

Data Scientist LLM (Middle)

СберМедИИ

  • Москва

  • от 2500 USD

Урал Логистика

AI-инженер

Урал Логистика

  • Москва

  • от 2500 USD

БАНК УРАЛСИБ
  • Москва

  • от 2500 USD

Effective
  • Москва

  • от 2500 USD

Neoflex
  • Москва

  • от 2500 USD

ИК СИБИНТЕК
  • Москва

  • от 2500 USD

ВСК, САО

ML-инженер (LLM)

ВСК, САО

  • Москва

  • от 2500 USD

  • Москва

  • до 220000 RUR

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию