ML-разработчик (Inference)

300,000 - 500,000 RUB
На 33% больше рынка

Описание роли

На позиции ML-разработчика (Inference) в команде ML-сервисов Yandex Cloud вы будете отвечать за оптимизацию и масштабирование процессов генерации и обслуживания больших языковых моделей (LLM). Основная цель — повышение эффективности инференса за счёт внедрения передовых методов speculative decoding, continuous batching и использования KV-cache. Вы будете работать как над высокоуровневыми API и платформенными решениями, так и заниматься низкоуровневой оптимизацией CUDA/Triton-ядер, профилированием узких мест, тюнингом PyTorch и TensorRT. В рамках дистрибуции вы реализуете и поддержите масштабируемые распределённые системы на Kubernetes, обеспечивая автоматическое масштабирование, балансировку нагрузки и отказоустойчивость в multi-node сценариях.

Уникальность вакансии

Вы получите редкую возможность сочетать платформенную и системную оптимизацию в одном проекте, работая с LLM разного масштаба — от десятков до сотен миллиардов параметров. Проект Yandex Cloud — это многопользовательская среда, где ваши решения напрямую влияют на производительность и экономику облачных сервисов. Гибридный формат работы сочетает гибкость удалёнки с командной коммуникацией в московском офисе, а междисциплинарная команда включает экспертов в области Python, C++, Go и GPU-программирования. Мы поощряем участие в профильных конференциях, внутренних хакатонах и научных публикациях, что делает роль особенно привлекательной для тех, кто хочет развиваться как инженер и исследователь.

О компании

Yandex — ведущая технологическая компания, предоставляющая инновационные облачные решения и платформы для бизнеса. Наши ML-сервисы Yandex Cloud используются тысячами корпоративных заказчиков по всему миру для анализа данных, автоматизации процессов и создания интеллектуальных продуктов. Мы ценим сотрудничество, технологический энтузиазм и стремление к качеству. В команде Yandex Cloud вы получите доступ к масштабным вычислительным ресурсам, экспериментальным лабораториям и обширной экосистеме сервисов, от хранения данных до готовых AI-решений.

Оценка вакансии
6.4 / 10
Вакансия предлагает уникальную возможность работать с технологиями LLM-инференса, оптимизировать GPU-нагрузку и развивать распределённые системы. Гибридный формат и высокая зарплата делают её привлекательной для опытных ML-инженеров. Роль в Yandex Cloud обеспечивает постоянное развитие и участие в масштабных проектах.
Опубликовано:

Будьте в курсе новых вакансий

Подпишитесь на наш Telegram-канал