Мы развиваем GigaChat и ищем сильного ML-инженера в команду online RL. Это роль для человека, который умеет доводить исследовательские идеи до работающих решений: проектировать и запускать эксперименты, строить надёжные пайплайны обучения и добиваться реального роста качества модели.
Нам нужен не просто исполнитель задач, а инженер с сильным исследовательским мышлением, который способен самостоятельно разбираться в сложных проблемах, предлагать новые идеи и решения и нести ответственность за результат.
Обязанности
- разрабатывать и улучшать методы online RL
- реализовывать и дорабатывать подходы post-training и online RL
- проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты не только на уровне метрик, но и на уровне причин
- разбираться, почему модель стала лучше или хуже, насколько устойчив результат и можно ли его масштабировать на другие домены и типы задач
- следить за state-of-the-art: читать статьи, воспроизводить результаты, адаптировать лучшие подходы под наши задачи и инфраструктуру
- строить и развивать инфраструктуру обучения
- разрабатывать и поддерживать пайплайны online RL: от генерации rollout'ов и сбора reward-сигналов до обновления весов модели
- обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов, чекпоинтов, контроль деградаций
- оптимизировать throughput и эффективность использования GPU: distributed training, параллелизм, профилирование узких мест
- выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями так, чтобы новые идеи можно было быстро проверять
- работать с данными и системой оценки качества
- участвовать в проектировании и реализации reward-сигналов: rule-based верификаторы, reward-модели, LLM-as-a-judge, execution-based проверки
- строить и улучшать пайплайны подготовки данных: фильтрация, дедупликация, балансировка, контроль утечек
- анализировать ошибки модели, выявлять систематические слабые места и формировать целевые обучающие выборки для их устранения
- тесно взаимодействовать с исследователями, другими инженерами, командами данных и инфраструктуры
- брать на себя ответственность за целые куски системы: от идеи до результата в проде
- делиться знаниями, участвовать в код-ревью, помогать поднимать общую планку качества.
Требования
- отличное владение Python и PyTorch
- практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях
- опыт проведения ML-экспериментов от начала до конца: постановка гипотезы → реализация → анализ → выводы
- понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги.
- Умение писать чистый, надёжный, production-ready код
- способность разбираться в сложных системах и самостоятельно находить и устранять узкие места.
Будет плюсом:
- опыт работы с reward-моделями, process reward models, LLM-as-a-judge
- опыт построения сред исполнения, sandboxes и верификаторов для code- или STEM-задач
- опыт работы с large-scale inference и оптимизацией генерации (vLLM, Sglang и т.д.)
- понимание современных open-source стеков для обучения LLM (Verl, Megatron, TRL и др.)
- публикации, open-source вклад или сильный прикладной track record.
Условия
- возможность выбрать удобный формат работы: гибрид или офис
- ежегодный пересмотр зарплаты, годовая премия
- корпоративный спортзал и зоны отдыха
- более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
- расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
- ипотека выгоднее до 7% для каждого сотрудника
- бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
- вознаграждение за рекомендацию друзей в команду Сбера.
Похожие вакансии
Опыт работы от 3 лет в коммуникационном или графическом дизайне (digital + офлайн). Уверенное владение Figma, Photoshop, Illustrator. AI-инструментов.
Высшее образование (медицинское / фармацевтическое). Дополнительное образование в области маркетинга. Успешный опыт работы в фармацевтических компаниях на позиции продакт-менеджера от...
Фокус на результат. Опыт лидирования проектов - вы умеете составлять дорожную карту, подбирать команду, выстраивать бизнес-процессы и отвечать за результат.
Опыт работы управляющим ресторана, F&B Manager или руководителем банкетной службы от 3 лет. Опыт организации и проведения банкетов различного...
Релевантный опыт работы. Уверенный пользователь ПК и программы 1С. Опыт работы с маркированным товаром и ГИС МТ "Честный знак".
