ML-разработчик (Inference)

350,000 - 500,000 RUB
На 6% больше рынка

Описание роли

На позиции ML-разработчика (Inference) в команде ML-сервисов Yandex Cloud вы будете отвечать за создание и поддержку высокопроизводительных систем инференса больших языковых моделей (LLM). Ваша главная задача — оптимизировать throughput и latency при генерации текста, внедряя передовые техники speculative decoding, continuous batching и эффективное кеширование (KV-cache). Вы будете работать в тесной связке с инженерами по развитию фреймворков: тюнинговать PyTorch, TensorRT, vLLM и другие библиотеки, выполнять профильное исследование узких мест и писать кастомные CUDA/Triton-ядра.

Кроме этого, в ваши обязанности войдёт разработка распределённых систем для инференса: интеграция с Kubernetes, настройка service mesh, балансировщиков и автоматического масштабирования, поддержка tensor- и pipeline-parallel подходов в multi-node сценариях. Вы будете проектировать и развивать платформенные сервисы: писать API и SDK для разработчиков, автоматизировать развёртывание и обновления моделей как в облаке, так и on-prem у клиентов, обеспечивать надёжность и отказоустойчивость ML-инфраструктуры.

Уникальность вакансии

* Гибридный формат работы из офиса в центре Москвы и удалённо — гибкость и баланс личного и рабочего времени.
* Работа с передовыми технологиями в области ИИ: вы погрузитесь в оптимизацию LLM-инференса на CUDA/Triton и Tensor Cores, научитесь ускорять модели на GPU-кластерах.
* Возможность влиять на архитектуру систем Yandex Cloud и запускать новые сервисы для тысяч клиентов.
* Развитая система менторства, внутренние технические митапы и доступ к обучающим материалам по ML и облачным технологиям.

О компании

Yandex Cloud — облачная платформа Яндекса, предоставляющая корпоративным заказчикам решения для вычислений, хранения данных и разработки на базе современных технологий машинного обучения и искусственного интеллекта. Наша миссия — сделать ИИ-возможности доступными и масштабируемыми: мы создаём сервисы, которые позволяют решать бизнес-задачи в дата-аналитике, автоматизации и персонализации.

Среди достижений Yandex Cloud — собственные разработанные языковые модели YaLM и интеграция ML-сервисов в широкий спектр продуктов компании. Команда ценит экспертизу, открытость и инициативность: мы поддерживаем идеи сотрудников и внедряем лучшие практики DevOps и SRE.

Оценка вакансии
7.2 / 10
Вакансия предлагает уникальную возможность оптимизировать LLM-инференсы в облаке Yandex Cloud с использованием современных технологий GPU. Прозрачные карьерные перспективы, гибридный формат и конкурентная зарплата делают её привлекательной для опытных ML-инженеров.
Опубликовано:

Будьте в курсе новых вакансий

Подпишитесь на наш Telegram-канал