Онлайн курсы по SRE

- По популярности
- По возрастанию цены ↓
- По убыванию цены ↑
- По ближайшей дате ↓
- По поздней дате ↑
- По длительности ↓
- По длительности ↑
- По названию [А-Я]
- По названию [Я-А]
- Для всех
- Для взрослых
- Для детей
Преподаватели и эксперты
Анна Жаркова Руководитель разработки
Антон Моргунов Senior ML-инженер, Базис Центр Направление SRE
Site Reliability Engineering (SRE) направлено на обеспечение надёжности, доступности и масштабируемости сервисов в продакшене. Комбинирует практики разработки и эксплуатации: автоматизация, мониторинг, инцидент-менеджмент и оптимизация производительности. Студент получает навыки настройки инфраструктуры, наблюдаемости, автоматизации развёртываний и расследования инцидентов.
- Системным администраторам и инженерам поддержки, желающим автоматизировать операции
- Backend-разработчикам, стремящимся улучшить надёжность сервисов
- DevOps-инженерам, расширяющим практики надёжности
- Инженерам по мониторингу и инцидент-менеджменту
- Людям, не готовым работать с кодом и автоматизацией
- Специалистам, сосредоточенным исключительно на визуальном дизайне
- Тем, кто не готов к командной работе и участию в дежурствах
Программа обучения
Основные темы
- Паттерны надёжности и определение SLA/SLO/SLI
- Мониторинг, логирование и распределённые трассировки
- Инфраструктура как код и управление конфигурацией
- CI/CD и практики безопасных развёртываний
- Инцидент-менеджмент и проведение постмортемов
- Оптимизация производительности и отладки в продакшене
Инструменты
- Kubernetes
- Docker
- Prometheus
- Grafana
- Terraform
- GitLab CI / Jenkins
Практика
- Настройка мониторинга и алертинга
- Написание инфраструктуры как кода и управление конфигурацией
- Настройка CI/CD и автоматизация развёртываний
- Реагирование на инциденты и проведение постмортемов
- Проведение тестов устойчивости (chaos engineering)
Карьера в SRE
Инженер SRE отвечает за поддержание и повышение надёжности распределённых приложений и инфраструктуры, используя навыки разработки и эксплуатации. Работа включает мониторинг, автоматизацию и управление инцидентами в production.
Кем вы сможете работать:
- SRE-инженер
- DevOps-инженер
- Инженер по мониторингу и наблюдаемости
- Инженер по автоматизации инфраструктуры
- Инженер поддержки платформы
Какие задачи вы будете решать:
- Проектирование и поддержка мониторинга и алертинга
- Автоматизация развёртываний и инфраструктуры как кода
- Реагирование на инциденты и проведение расследований
- Оптимизация производительности и управление ресурсами
- Разработка процедур восстановления после сбоев
Тренды в SRE
Наблюдаемость и OpenTelemetry
Рост использования единых стандартов наблюдаемости и трассировки для более точной диагностики распределённых систем.
Инфраструктура как код и GitOps
Широкое внедрение IaC и подходов GitOps для консистентного управления конфигурацией и автоматических развёртываний.
Автоматизация инцидент-менеджмента и практики устойчивости
Автоматизация рутинных процедур реагирования на инциденты и применение chaos engineering для проверки отказоустойчивости.
Нюансы при подборе программы
На что обратить внимание
- покрытие мониторинга, IaC, CI/CD и инцидент-менеджмента
- Наличие практических заданий и доступ к тестовой инфраструктуре
- Перечень используемых инструментов и технологий
- Объём лабораторных работ и формат обратной связи
- Поддержка при выполнении заданий и проверка решений
Частые ошибки
- Выбор по маркетинговым обещаниям вместо анализа программы
- Покупка курса без проверки практических заданий и среды для отработки
- Недооценка времени и объёма практики, необходимой для навыков
- Игнорирование требований по базовым знаниям Linux и сетей
Вопросы и ответы
- Otus скидка 10%
- Слёрм скидка 7%

