ML-разработчик (Inference)

300,000 - 450,000 RUB

Описание роли

На позиции ML-разработчика Inference в ML-сервисах Yandex Cloud вы будете решать ключевые инженерные задачи, связанные с производительностью и масштабируемостью генерации больших языковых моделей (LLM). В первые месяцы вы сфокусируетесь на оптимизации throughput и latency при инференсе: внедрите техники speculative decoding, continuous batching и KV-cache, а также займётесь профилированием узких мест в фреймворках PyTorch, TensorRT и vLLM. Далее вы расширите свою область ответственности и приступите к дистрибуции и оркестрации: разработка распределённых систем для инференса больших моделей, интеграция с Kubernetes, настройка сервис-мешей и автоматического масштабирования под multi-node-сценарии (tensor/pipeline parallel). В разделе низкоуровневой оптимизации вас ожидает создание и отладка кастомных CUDA/Triton-ядер, управление памятью и вычислениями, а также работа с технологиями NVLink и RDMA для достижения максимальной эффективности GPU-кластеров.

Особенности вакансии

Вы получите возможность глубоко погрузиться в cutting-edge технологии инференса LLM и оказывать прямое влияние на производительность сервисов Yandex Cloud. Гибридный формат работы сочетает дни в современном офисе в Москве и дистанционную работу. Регулярные технические митапы, доступ к внутренним конференциям и взаимодействие с экспертами из разных областей обеспечат ускоренное профессиональное развитие. Масштаб проектов позволяет вам видеть результат оптимизаций в реальном времени: снижения задержек генерации до десятков миллисекунд и существенное уменьшение затрат на инфраструктуру.

О компании

Yandex Cloud — облачная платформа крупнейшей российской IT-компании, предоставляющая полный стек сервисов для разработки, аналитики и машинного обучения. Миссия Yandex Cloud — делать инновационные технологии доступными бизнесу и разработчикам. Компания ценит экспериментальный дух и открытость: инженеры самостоятельно выбирают инструменты, проводят A/B-тесты и предлагают архитектурные улучшения. Среди достижений — внедрение высоконагруженных аналитических приложений, создание сервисов для обработки триллионов запросов в сутки и развитие экосистемы AI/ML в России и за её пределами.

Оценка вакансии
6.1 / 10
Вакансия предоставляет глубокую техническую экспертизу по оптимизации LLM-инференса в Yandex Cloud с использованием CUDA и Triton. Гибридный формат и масштаб проектов обеспечивают рост навыков, однако детали о бонусах и соцпакете в описании отсутствуют.
Опубликовано:

Будьте в курсе новых вакансий

Подпишитесь на наш Telegram-канал