ML-разработчик (Inference)
Описание роли
На позиции ML-разработчика Inference в ML-сервисах Yandex Cloud вы будете решать ключевые инженерные задачи, связанные с производительностью и масштабируемостью генерации больших языковых моделей (LLM). В первые месяцы вы сфокусируетесь на оптимизации throughput и latency при инференсе: внедрите техники speculative decoding, continuous batching и KV-cache, а также займётесь профилированием узких мест в фреймворках PyTorch, TensorRT и vLLM. Далее вы расширите свою область ответственности и приступите к дистрибуции и оркестрации: разработка распределённых систем для инференса больших моделей, интеграция с Kubernetes, настройка сервис-мешей и автоматического масштабирования под multi-node-сценарии (tensor/pipeline parallel). В разделе низкоуровневой оптимизации вас ожидает создание и отладка кастомных CUDA/Triton-ядер, управление памятью и вычислениями, а также работа с технологиями NVLink и RDMA для достижения максимальной эффективности GPU-кластеров.
Особенности вакансии
Вы получите возможность глубоко погрузиться в cutting-edge технологии инференса LLM и оказывать прямое влияние на производительность сервисов Yandex Cloud. Гибридный формат работы сочетает дни в современном офисе в Москве и дистанционную работу. Регулярные технические митапы, доступ к внутренним конференциям и взаимодействие с экспертами из разных областей обеспечат ускоренное профессиональное развитие. Масштаб проектов позволяет вам видеть результат оптимизаций в реальном времени: снижения задержек генерации до десятков миллисекунд и существенное уменьшение затрат на инфраструктуру.
О компании
Yandex Cloud — облачная платформа крупнейшей российской IT-компании, предоставляющая полный стек сервисов для разработки, аналитики и машинного обучения. Миссия Yandex Cloud — делать инновационные технологии доступными бизнесу и разработчикам. Компания ценит экспериментальный дух и открытость: инженеры самостоятельно выбирают инструменты, проводят A/B-тесты и предлагают архитектурные улучшения. Среди достижений — внедрение высоконагруженных аналитических приложений, создание сервисов для обработки триллионов запросов в сутки и развитие экосистемы AI/ML в России и за её пределами.
Подписка TalentMove
Больше,
чем вакансии
→ TalentScanAI
Узнайте стоимость вашего опыта на рынке
→ Закрытое сообщество
Нетворкинг и инсайды рынка труда
→ Топ вакансии
Лучшие вакансии с доставкой в Telegram