Почему Kubernetes не справляется с AI-задачами: продвинутый GPU-планировщик на базе Volcano

AI/ML

Тезисы

Для ML/AI-задач стандартного планирования Kubernetes часто недостаточно: GPU-задачи конкурируют за ограниченные ресурсы, требуют очередей, приоритизации и более гибкого распределения вычислительных мощностей кластера. В докладе я покажу, зачем ML-инфраструктуре нужен отдельный планировщик GPU-задач, и разберу на примере того, как мы реализовали это в Nova AI.

Основной фокус доклада — Volcano как практический инструмент для оркестрации GPU-нагрузок. Сравню его с Kueue и Kai Scheduler, объясню, как устроен Volcano, разберу динамическое дробление видеокарт.

Покажу прикладные кейсы: как настраивать очереди для задач разной важности, как Volcano можно использовать вместе с KubeRay для запуска распределённого инференса LLM.


Аудитория

Специалист по данным / Специалист по машинному обучению, DevOps-инженер


Уровень сложности

Средний

Orion soft
Дмитрий Матушкин

MLOps-инженер, занимается развитием и поддержкой ML-платформы. Внедряет новые сервисы, развёртывает и обучает LLM-модели, интегрирует их в корпоративные системы.

Другие спикеры трека AI/ML