Highload Inference Engineer (Stable Diffusion)
Описание роли
На позиции Highload Inference Engineer (Stable Diffusion) вы будете отвечать за масштабирование и оптимизацию сервиса генерации изображений на базе модели Stable Diffusion. Ваша основная задача — обеспечить производительность не менее 200 запросов в минуту (RPM) при стабильной выдаче результатов пользователям. Для этого необходимо:
• Архитектурно спроектировать распределённый inference-пайплайн на Docker и платформе RunPod.
• Устранить проблемы CUDA OOM (Out Of Memory) путём оптимизации моделей и конфигурации GPU-памяти.
• Настроить балансировку нагрузки между несколькими графическими процессорами и узлами, чтобы обеспечить равномерное распределение запросов.
• Реализовать мониторинг производительности, логирование и алертинг для своевременного обнаружения узких мест.
• Автоматизировать процессы масштабирования, запускать новые инстансы при росте трафика и оптимизировать расходы.
• Вести техническую документацию, описывать процедуры развертывания, настройки и восстановления после сбоев.
Уникальность вакансии
Это редкая возможность стать ключевым инженером в проекте, где производительность и стабильность инференса стоят на первом месте. Вы получите полный доступ к ресурсам GPU-кластеров, гибкую архитектуру на Docker/RunPod и возможность внедрять свои собственные решения для автоматического масштабирования. Формат работы полностью удалённый, что позволит вам выбирать удобное время и место. Сдельная оплата обсуждается индивидуально и напрямую зависит от результатов — чем выше эффективность вашей инфраструктуры, тем выше ваш доход. Вы сможете работать с передовыми ML-инструментами, исследовать новые методы оптимизации памяти и масштабирования, а также влиять на развитие продукта.
О компании
Наша команда — группа экспертов в области генеративного AI и высоконагруженных ML-систем. Мы создаём сервис, позволяющий тысячам пользователей в минуту генерировать качественные изображения для креативных задач, рекламы и дизайна. Компания ценит открытость, обмен знаниями и научно-исследовательский подход: у нас есть выделенный R&D-бюджет для тестирования новых моделей и алгоритмов. Мы работаем по гибкой методологии, регулярно проводим internal tech talks и поддерживаем mentorship для обмена опытом. У вас будет возможность расти как инженер, вносить предложения по улучшению архитектуры и видеть результаты своей работы в продакшене ежедневно.
Подписка TalentMove
Больше,
чем вакансии
→ TalentScanAI
Узнайте стоимость вашего опыта на рынке
→ Закрытое сообщество
Нетворкинг и инсайды рынка труда
→ Топ вакансии
Лучшие вакансии с доставкой в Telegram