Внутренний ассистент для поиска по документам собирается быстро: LLM отвечает, эмбеддер и реранкер ищут фрагменты, API отдаёт ссылки на источники. На пяти тестировщиках всё работает. Потом сервис открывают на всю компанию: документы длиннее, сессий больше, сразу приходит утренний всплеск. Ответы идут медленно, люди ждут в очереди, почти вся память GPU занята, а сама карта загружена слабо. Вывод инженеров обычно один: надо докупать карты. Но у медленного сервиса четыре причины: мало памяти, мало мощности, неудачное размещение, неподходящие настройки запуска. Деньгами решаются только первые две.
На мастер-классе мы соберём сервис инференса для поиска по документам — LLM, эмбеддер и реранкер на живом кластере с двумя H100 — и разберёмся, во что он упёрся. Первую половину сделаем руками: поднимем на vLLM два одинаковых сервиса, считаем вес модели и KV-cache, оптимизируем один сервис и после каждого шага будем сравнивать со вторым. Вторую половину соберём модулями Deckhouse: ai-models доставит веса из каталога, gpu выдаст карту целиком, MIG-партицией или долей по квотам через DRA, ai-inference сам посчитает память и подберёт профиль. В финале сверим расчёт планировщика с нашим ручным.
После мастер-класса вы будете понимать, из чего складывается память сервиса инференса, какие оптимизации сколько дают, когда пора делить карту вместо покупки новой и какие числа нужны бизнесу до закупки. Все цифры посчитаем на месте.
Руководитель команды / Технический руководитель, DevOps-инженер, Технический директор / Архитектор
Экспертный
Go-разработчик в Deckhouse Platform, направление ML/AI-инфраструктуры. Занимается вопросом, как Kubernetes выдаёт и делит GPU. Разрабатывает DRA-драйвер платформы — динамическую нарезку MIG, MPS и поддержку нескольких вендоров железа, — а также модули доставки моделей в ворклоады и инференса поверх них.