Онлайн курсы по SRE

Курс SRE — обеспечение надёжности систем от Яндекс Практикум
SRE — обеспечение надёжности систем
4.6
Дата старта уже идет
Рассрочка от 4 694 ₽/мес.
Цена или сразу 115 000 ₽
Длительность 4 месяца

Изучите основы практик и подходов SRE, научитесь настраивать мониторинг инфраструктуры и приложений, а также разберетесь, как обеспечивать стабильность и надежность работы систем…

SRE Надёжность систем Инцидент-менеджмент Контейнеризация Prometheus CI/CD
Курс SRE: Observability от Слёрм
SRE: Observability
4.5
Дата старта любое время
Рассрочка от 3 250 ₽/мес.
Цена или сразу 25 000 ₽
промокод
Длительность свободная
Выдача сертификата

Ознакомитесь с ключевыми практиками наблюдаемости в SRE и научитесь агрегировать SLO и SLI в понятные метрики для контроля состояния системы…

Observability SLO SLI Трассировка Логирование Агрегация метрик Управление инцидентами
SRE практики и инструменты
4.3
Дата старта 16 декабря
Рассрочка от 13 800 ₽/мес.
Цена или сразу 138 000 ₽
промокод
Длительность 5 месяцев
Выдача сертификата

Изучите основные принципы SRE и научитесь ориентироваться в практиках и инструментах, а также разъяснять их коллегам и выстраивать эффективные SRE-процессы…

SRE Инцидент-менеджмент Monitoring Observability
Редактор раздела Дмитрий Герасимов
Дмитрий Герасимов редактор · обновлено
Сортировка:
  • По популярности
  • По возрастанию цены ↓
  • По убыванию цены ↑
  • По ближайшей дате ↓
  • По поздней дате ↑
  • По длительности ↓
  • По длительности ↑
  • По названию [А-Я]
  • По названию [Я-А]

Преподаватели и эксперты

Анна Жаркова Анна Жаркова Руководитель разработки
Антон Моргунов Антон Моргунов Senior ML-инженер, Базис Центр

Направление SRE

Site Reliability Engineering (SRE) направлено на обеспечение надёжности, доступности и масштабируемости сервисов в продакшене. Комбинирует практики разработки и эксплуатации: автоматизация, мониторинг, инцидент-менеджмент и оптимизация производительности. Студент получает навыки настройки инфраструктуры, наблюдаемости, автоматизации развёртываний и расследования инцидентов.

Кому подойдет
  • Системным администраторам и инженерам поддержки, желающим автоматизировать операции
  • Backend-разработчикам, стремящимся улучшить надёжность сервисов
  • DevOps-инженерам, расширяющим практики надёжности
  • Инженерам по мониторингу и инцидент-менеджменту
Кому не подойдет
  • Людям, не готовым работать с кодом и автоматизацией
  • Специалистам, сосредоточенным исключительно на визуальном дизайне
  • Тем, кто не готов к командной работе и участию в дежурствах

Программа обучения

Основные темы

  • Паттерны надёжности и определение SLA/SLO/SLI
  • Мониторинг, логирование и распределённые трассировки
  • Инфраструктура как код и управление конфигурацией
  • CI/CD и практики безопасных развёртываний
  • Инцидент-менеджмент и проведение постмортемов
  • Оптимизация производительности и отладки в продакшене

Инструменты

  • Kubernetes
  • Docker
  • Prometheus
  • Grafana
  • Terraform
  • GitLab CI / Jenkins

Практика

  • Настройка мониторинга и алертинга
  • Написание инфраструктуры как кода и управление конфигурацией
  • Настройка CI/CD и автоматизация развёртываний
  • Реагирование на инциденты и проведение постмортемов
  • Проведение тестов устойчивости (chaos engineering)

Карьера в SRE

Инженер SRE отвечает за поддержание и повышение надёжности распределённых приложений и инфраструктуры, используя навыки разработки и эксплуатации. Работа включает мониторинг, автоматизацию и управление инцидентами в production.

Зарплата на старте
60 000 – 120 000 ₽
С опытом 1–3 года
120 000 – 220 000 ₽
Время на обучение
6–18 месяцев

Кем вы сможете работать:

  • SRE-инженер
  • DevOps-инженер
  • Инженер по мониторингу и наблюдаемости
  • Инженер по автоматизации инфраструктуры
  • Инженер поддержки платформы

Какие задачи вы будете решать:

  • Проектирование и поддержка мониторинга и алертинга
  • Автоматизация развёртываний и инфраструктуры как кода
  • Реагирование на инциденты и проведение расследований
  • Оптимизация производительности и управление ресурсами
  • Разработка процедур восстановления после сбоев

Нюансы при подборе программы

На что обратить внимание

  • покрытие мониторинга, IaC, CI/CD и инцидент-менеджмента
  • Наличие практических заданий и доступ к тестовой инфраструктуре
  • Перечень используемых инструментов и технологий
  • Объём лабораторных работ и формат обратной связи
  • Поддержка при выполнении заданий и проверка решений

Частые ошибки

  • Выбор по маркетинговым обещаниям вместо анализа программы
  • Покупка курса без проверки практических заданий и среды для отработки
  • Недооценка времени и объёма практики, необходимой для навыков
  • Игнорирование требований по базовым знаниям Linux и сетей

Вопросы и ответы

  • Otus скидка 10%
  • Слёрм скидка 7%
Насколько полезной была информация?
Вы можете оценить пользу всей страницы в целом. Это поможет нам отслеживать актуальную информацию и улучшить взаимодействие с вами.
Всего 43 голоса