ML-разработчик (Inference)

250,000 - 400,000 RUB

Описание роли

На позиции ML-разработчика (Inference) в ML-сервисах Yandex Cloud вы станете ключевым экспертом по оптимизации и масштабированию инференса крупных языковых моделей (LLM). Ваша работа напрямую влияет на качество и скорость работы облачных решений, от которых зависят сотни внутренних и внешних пользователей. Вы будете заниматься:
* Оптимизацией throughput и latency при генерации ответов LLM через внедрение speculative decoding, continuous batching и эффективную работу с KV-cache.
* Тюнингом фреймворков PyTorch, TensorRT, vLLM и других, профилированием узких мест и оптимизацией вычислений на GPU и GPU-кластерах.
* Проектированием и развитием распределённых систем для инференса на Kubernetes и сервис-мешах, настройкой автоматического масштабирования и балансировщиков.
* Разработкой кастомных CUDA и Triton-ядр, оптимизацией памяти и вычислений, включая работу с NVLink и RDMA для высокопроизводительной пересылки данных.
* Созданием API, SDK и инструментов для автоматизации деплоя и обновления моделей, а также поддержки on-prem решений у клиентов.

Уникальность вакансии

Вы получите возможность работать на одном из самых крупных облачных проектов в России, погружаясь в cutting-edge задачи ML-инференса. Yandex Cloud предоставляет:
* Доступ к современным GPU-кластерам и пропускной инфраструктуре для экспериментального и продакшн-применения.
* Широкую базу пользователей и сценариев: от чат-ботов до semantic search, что позволяет глубже изучать реальные кейсы LLM.
* Гибридный формат работы с офисом в центре Москвы и возможностью частичного удалённого участия.
* Карьерный рост от Senior ML-разработчика до ведущего инженера с участием в стратегических решениях по развитию облака.

О компании Яндекс

Яндекс — ведущее IT-компания, развивающая экосистему продуктов для пользователей и бизнеса. Миссия Yandex Cloud — обеспечить надёжную и масштабируемую облачную платформу, способствующую цифровой трансформации компаний. Сегодня миллионы запросов в секунду обрабатываются ML-сервисами облака, а команда инженеров постоянно внедряет инновации в области AI и Big Data. Yandex ценит экспертизу, инициативность и открытость к новым технологиям.

Оценка вакансии
5.9 / 10
Вакансия предлагает уникальную возможность оптимизировать LLM-инференс в масштабах Yandex Cloud, работая с передовыми GPU-технологиями. Гибридный формат, насыщенные технические задачи и сильная команда делают её привлекательной для опытных ML-инженеров.
Опубликовано:

Будьте в курсе новых вакансий

Подпишитесь на наш Telegram-канал