Трек про жизнь системы в проде: как её собирают и катят без ручного труда, как держат под нагрузкой, наблюдают, защищают и чинят, когда она падает — и во сколько это обходится.
Нужны инженеры (Senior/Lead/Principal, SRE, platform-, DevOps- и security-инженеры, техлиды, CTO), которые отвечают за инфраструктуру и надёжность целиком и готовы честно разобрать не причёсанную success-story, а реальные компромиссы, цену решений и провалы.
Platform engineering и внутренние платформы — DevEx как продукт, self-service инфраструктура, разворачивание окружения «по кнопке».
IaC и GitOps на масштабе — Terraform/Pulumi и т. д., ArgoCD/Flux и т. д.; не «мы перешли и довольны», а где ломается, дрейф стейта, цена перехода.
CI/CD и delivery как инженерная система — прогрессивные и автоматические деплои (canary, blue-green), автоматические откаты и т. д.
Auto-remediation и самовосстановление — автоматический ответ на отказ, автоскейл, автозакрытие типовых инцидентов.
Policy-as-code и автоматизация комплаенса/безопасности — OPA, автоматические проверки в пайплайне, хранение и ротация секретов.
AI/агенты в эксплуатации — автотриаж инцидентов, разбор алертов с инженерной механикой и ценой ошибки, помощь в деплое. Как правильно ограничить работу агентов в проде и роль человека в обеспечении их работы.
Kubernetes и cloud-native под ростом — где и с какими столкнулись ограничениями, что стоило по деньгам, как перепроектировали.
Сети и трафик — L2/L3, балансировка нагрузки, CDN, проксирование, шлюзы (API gateway, ingress); где сеть становится узким местом и во сколько обходится.
Экономика вычислений и FinOps — стоимость облака и его оценка/прогнозы, инференса и железа как проектное ограничение; где резали косты и что при этом сломалось.
Observability на масштабе — трейсинг, SLO (автовыставление и отслеживание), наблюдаемость распределённых и недетерминированных (LLM/агентных) систем, борьба со стоимостью телеметрии.
Постмортемы и реальные инциденты — что сломалось, сколько стоило, что поменяли в инженерной культуре, кросс-анализ инцидентов.
Устойчивость — chaos engineering, нагрузочное и стресс-тестирование, incident management (дежурства, эскалации, платформы), «цифровой двойник» пользователей, не бумажные учения (отключения сервисов, ДЦ и т. д.).
Security-by-design — безопасный по построению код, симуляция атак, риски цепочки поставок и опенсорса, какие инструменты security встроены в процесс и как, их влияние.
Безопасность в эпоху агентов — новые классы угроз с появлением AI-агентов в проде: контроль их действий и прав, prompt injection, аудит и границы доверия к автономным системам.