Для ML/AI-задач стандартного планирования Kubernetes часто недостаточно: GPU-задачи конкурируют за ограниченные ресурсы, требуют очередей, приоритизации и более гибкого распределения вычислительных мощностей кластера. В докладе я покажу, зачем ML-инфраструктуре нужен отдельный планировщик GPU-задач, и разберу на примере того, как мы реализовали это в Nova AI.
Основной фокус доклада — Volcano как практический инструмент для оркестрации GPU-нагрузок. Сравню его с Kueue и Kai Scheduler, объясню, как устроен Volcano, разберу динамическое дробление видеокарт.
Покажу прикладные кейсы: как настраивать очереди для задач разной важности, как Volcano можно использовать вместе с KubeRay для запуска распределённого инференса LLM.
Специалист по данным / Специалист по машинному обучению, DevOps-инженер
Средний
MLOps-инженер, занимается развитием и поддержкой ML-платформы. Внедряет новые сервисы, развёртывает и обучает LLM-модели, интегрирует их в корпоративные системы.