В докладе разберём путь события от Tetragon через RabbitMQ, WASM-детекторы до ClickHouse. Для каждого этапа определим пропускную способность и предел. Длина очереди покажет объём накопленной «будущей» работы, но не её актуальность, поэтому основной эксплуатационной метрикой станет возраст самого старого события. Вместе с ним будем измерять сквозную задержку, долю потерь и время восстановления после шторма.
На нагрузочном стенде воспроизведём повышенный поток событий. Замеры покажут, где возникает первое узкое место: в буфере сентора, очереди RabbitMQ, пуле обработчиков или пакетной записи в ClickHouse.
Бэкенд-разработчик, DevOps-инженер, Технический директор / Архитектор
Средний
Руководитель разработки PT Container Security в Positive Technologies, специалист по безопасности контейнерных и облачных сред. За 11 лет в ИТ участвовал в создании многих продуктов Positive Technologies и частного облака Salt в X5. Создал и развивает открытый проект Runtime Radar для мониторинга угроз и реагирования на инциденты в Kubernetes. На отраслевых конференциях рассказывает о практической защите контейнерной инфраструктуры.