Highload Inference Engineer (Stable Diffusion)

Описание роли

На позиции Highload Inference Engineer (Stable Diffusion) вы будете отвечать за масштабирование и оптимизацию сервиса генерации изображений на базе модели Stable Diffusion. Ваша основная задача — обеспечить производительность не менее 200 запросов в минуту (RPM) при стабильной выдаче результатов пользователям. Для этого необходимо:
• Архитектурно спроектировать распределённый inference-пайплайн на Docker и платформе RunPod.
• Устранить проблемы CUDA OOM (Out Of Memory) путём оптимизации моделей и конфигурации GPU-памяти.
• Настроить балансировку нагрузки между несколькими графическими процессорами и узлами, чтобы обеспечить равномерное распределение запросов.
• Реализовать мониторинг производительности, логирование и алертинг для своевременного обнаружения узких мест.
• Автоматизировать процессы масштабирования, запускать новые инстансы при росте трафика и оптимизировать расходы.
• Вести техническую документацию, описывать процедуры развертывания, настройки и восстановления после сбоев.

Уникальность вакансии

Это редкая возможность стать ключевым инженером в проекте, где производительность и стабильность инференса стоят на первом месте. Вы получите полный доступ к ресурсам GPU-кластеров, гибкую архитектуру на Docker/RunPod и возможность внедрять свои собственные решения для автоматического масштабирования. Формат работы полностью удалённый, что позволит вам выбирать удобное время и место. Сдельная оплата обсуждается индивидуально и напрямую зависит от результатов — чем выше эффективность вашей инфраструктуры, тем выше ваш доход. Вы сможете работать с передовыми ML-инструментами, исследовать новые методы оптимизации памяти и масштабирования, а также влиять на развитие продукта.

О компании

Наша команда — группа экспертов в области генеративного AI и высоконагруженных ML-систем. Мы создаём сервис, позволяющий тысячам пользователей в минуту генерировать качественные изображения для креативных задач, рекламы и дизайна. Компания ценит открытость, обмен знаниями и научно-исследовательский подход: у нас есть выделенный R&D-бюджет для тестирования новых моделей и алгоритмов. Мы работаем по гибкой методологии, регулярно проводим internal tech talks и поддерживаем mentorship для обмена опытом. У вас будет возможность расти как инженер, вносить предложения по улучшению архитектуры и видеть результаты своей работы в продакшене ежедневно.

Оценка вакансии
3.9 / 10
Вакансия предлагает уникальный опыт работы с высоконагруженным инференсом Stable Diffusion, где результат напрямую влияет на оплату. Основные задачи включают оптимизацию GPU-памяти, устранение OOM-ошибок и настройку масштабируемой инфраструктуры. Форма работы полностью удалённая, что обеспечивает гибкий график и возможность работать из любой точки мира. Проект позволяет внедрять собственные решения и расти в области ML-инженерии.
Опубликовано:

Будьте в курсе новых вакансий

Подпишитесь на наш Telegram-канал