О продукте и стеке
Мы создаём B2B-платформу автономных ИИ-агентов для рынка США. Агенты ведут многошаговые рабочие процессы с несколькими участниками — со сроками, документами и перепиской — и выполняют действия во внешних системах: электронная почта, CRM, календари, документы. Ключевые действия проходят через подтверждение человеком.
Стек платформы: Python, FastAPI, PostgreSQL, Redis, MCP. Используем managed-модели Anthropic, OpenAI и Google через API.
Сразу о главном: мы не обучаем веса моделей. Fine-tuning и post-training не входят в роль — опыт с ними приветствуется, но не является ядром. Ядро роли — превращать описание работы и опыт предметных экспертов в систему знаний, навыков, инструкций и критериев решений, по которой агент устойчиво выполняет профессиональную роль на готовой агентской архитектуре. Уровень Middle/Senior в разработке нужен, чтобы понимать устройство системы, работать с её кодом и отличать пробел в обучении от ограничения модели, инструментов или архитектуры.
Граница со смежной ролью: инфраструктура оценки — оценочный harness, evals-платформа, release gates — зона Reliability / Harness Engineer. Вы отвечаете за содержание: доменные знания, правила решений, обучающие и оценочные наборы — и работаете внутри готового оценочного harness.
Что предстоит делать
Формализовать профессиональную роль вместе с предметными экспертами: задачи, критерии решений, исключения, полномочия и условия эскалации.
Настраивать агента в рамках готовой архитектуры: навыки, структура знаний, инструкции, примеры, правила использования инструментов.
Формировать обучающий и оценочный набор из реальных кейсов, экспертных исправлений и спроектированных граничных сценариев.
Анализировать трассы выполнения, классифицировать причины ошибок и последовательно корректировать обучающие материалы или конфигурацию агента.
Определять критерии готовности роли, проводить evals и регрессионные проверки, версионировать изменения и доводить агента до устойчивого результата.
Первые 90 дней
Формализовать первую профессиональную роль вместе с предметным экспертом: задачи, критерии решений, исключения, условия эскалации.
Собрать обучающий и оценочный набор из реальных кейсов и граничных сценариев; довести агента до устойчивого прохождения evals по этой роли.
Задокументировать методику как переиспользуемый стандарт обучения ролей для платформы.
Обязательные требования
По каждому пункту на интервью спросим детали и артефакты.
- Python на уровне Middle/Senior: уверенно читаете и дорабатываете существующий код, работаете с API и данными.
- Production-опыт с LLM-приложениями или агентами: понимаете взаимодействие модели, контекста, памяти, знаний и инструментов внутри агентной системы.
- Лично и системно улучшали поведение агента на основе реальных задач, трасс выполнения и обратной связи экспертов — покажете, что именно меняли и как измеряли эффект.
- Анализ первопричин: отличаете пробел в обучении агента от проблемы данных, инструментов, модели или архитектурного ограничения.
- Проектирование evals на основе ground truth, работа с экспертной оценкой, регрессионное покрытие недетерминированного поведения.
- Умение извлекать неформализованный опыт эксперта и превращать его в точные правила, примеры и критерии решений.
- Английский B1 или выше.
Будет преимуществом
- Опыт с собственными или нестандартными агентными архитектурами.
- Подготовка синтетических данных, автоматических graders или обучающих сред для агентов.
- Опыт fine-tuning или post-training моделей.
- Обучение агентов для сложных предметных областей, long-horizon-систем или многоагентных систем.
Условия
- Полная занятость, удалённая работа. Синхронное окно команды: с 10:00–11:00 до 20:00–21:00 МСК.
- Возможность определять подходы к обучению и развитию поведения агентов на уровне всей платформы.
- Прямая связь между проведёнными экспериментами и качеством продукта; оценка по результату.
Как откликнуться
Вместо стандартного сопроводительного письма:
- Разберите один случай, когда вы обучали ИИ-агента конкретной задаче или роли: какую работу должен был выполнять агент, как формализовали знания и критерии, на каких примерах обучали, какие ошибки обнаружили и что изменили, как проверяли качество и какого результата достигли. Приложите верифицируемые артефакты: GitHub, работающие продукты, примеры инструментов для экспериментов и оценки.
- Ответьте на вопрос: возьмите профессиональную роль, которую хорошо знаете, и покажите на одном примере, как превратите неформализованное правило эксперта (вида «мы обычно так не делаем, если клиент нервничает») в проверяемый критерий решения и eval-сценарий.
- Опишите, что в этом проекте не получилось и почему.
Отклики из общих формулировок без верифицируемых артефактов не рассматриваются.
Похожие вакансии
ПК на базе Windows 10 или выше. Проводной интернет со скоростью от 30 Мбит/с. Гарнитура с микрофоном.
Имеет опыт квалификации лидов или работы в B2B‑продажах (знание юридической сферы — существенное преимущество). Умеет вести живой, естественный...
Высокий уровень самостоятельности и возможность формировать собственную систему работы.
Опыт работы в бюджетном учете от 3-х лет. Высшее финансовое (экономическое) образование. Опыт работы в бюджетном (казенном) учреждении в...
Высшее или среднее профессиональное экономическое образование. Опыт работы в бюджетном (казённом) учреждении в должности бухгалтера не менее 3 лет, связанный...
