Автоматизация и эксплуатация

Трек про жизнь системы в проде: как её собирают и катят без ручного труда, как держат под нагрузкой, наблюдают, защищают и чинят, когда она падает — и во сколько это обходится.

Нужны инженеры (Senior/Lead/Principal, SRE, platform-, DevOps- и security-инженеры, техлиды, CTO), которые отвечают за инфраструктуру и надёжность целиком и готовы честно разобрать не причёсанную success-story, а реальные компромиссы, цену решений и провалы.

Автоматизация — как перестать делать это руками

  • Platform engineering и внутренние платформы — DevEx как продукт, self-service инфраструктура, разворачивание окружения «по кнопке».

  • IaC и GitOps на масштабе — Terraform/Pulumi и т. д., ArgoCD/Flux и т. д.; не «мы перешли и довольны», а где ломается, дрейф стейта, цена перехода.

  • CI/CD и delivery как инженерная система — прогрессивные и автоматические деплои (canary, blue-green), автоматические откаты и т. д.

  • Auto-remediation и самовосстановление — автоматический ответ на отказ, автоскейл, автозакрытие типовых инцидентов.

  • Policy-as-code и автоматизация комплаенса/безопасности — OPA, автоматические проверки в пайплайне, хранение и ротация секретов.

  • AI/агенты в эксплуатации — автотриаж инцидентов, разбор алертов с инженерной механикой и ценой ошибки, помощь в деплое. Как правильно ограничить работу агентов в проде и роль человека в обеспечении их работы.

Эксплуатация — как система живёт и падает под реальной нагрузкой

  • Kubernetes и cloud-native под ростом — где и с какими столкнулись ограничениями, что стоило по деньгам, как перепроектировали.

  • Сети и трафик — L2/L3, балансировка нагрузки, CDN, проксирование, шлюзы (API gateway, ingress); где сеть становится узким местом и во сколько обходится.

  • Экономика вычислений и FinOps — стоимость облака и его оценка/прогнозы, инференса и железа как проектное ограничение; где резали косты и что при этом сломалось.

  • Observability на масштабе — трейсинг, SLO (автовыставление и отслеживание), наблюдаемость распределённых и недетерминированных (LLM/агентных) систем, борьба со стоимостью телеметрии.

  • Постмортемы и реальные инциденты — что сломалось, сколько стоило, что поменяли в инженерной культуре, кросс-анализ инцидентов.

  • Устойчивость — chaos engineering, нагрузочное и стресс-тестирование, incident management (дежурства, эскалации, платформы), «цифровой двойник» пользователей, не бумажные учения (отключения сервисов, ДЦ и т. д.).

  • Security-by-design — безопасный по построению код, симуляция атак, риски цепочки поставок и опенсорса, какие инструменты security встроены в процесс и как, их влияние.

  • Безопасность в эпоху агентов — новые классы угроз с появлением AI-агентов в проде: контроль их действий и прав, prompt injection, аудит и границы доверия к автономным системам.