Управление надёжностью систем на основе данных (SRE)
Практический онлайн-курс учебного центра Слёрм по надёжности систем. Формат: три недели работы SRE-командой на учебном сервисе кинотеатра, который развёрнут микросервисами на Python с базой MySQL в кластере Kubernetes школы. Объём: 45 часов всего, из них 15 часов теории, 20 часов практики на стендах и 6 часов встреч со спикерами, 7 видеоуроков, 5 командных кейсов, 3 Q&A-сессии. В тариф входят подготовительный модуль по Kubernetes и видеокурс «Мониторинг в Grafana». Цена: 60 000 рублей единовременно или рассрочка на 4 месяца по 15 000 рублей в месяц; рядом на странице стоит второй ценник в 100 000 рублей без внятного описания, чем этот вариант отличается. Документ: именное свидетельство о прохождении курса при 80% пройденного материала и участии в практиках. Старт потока 26 октября.
Мнение редакции
Это узкий инженерный курс для людей, которые уже держат production, и он не притворяется чем-то другим. Школа прямо перечисляет, что от вас ждут до старта: читать код на Python, знать Linux на уровне администратора, понимать принципы работы баз данных. Опыт с Kubernetes, Grafana и Prometheus назван большим плюсом. Формулировка «без этих знаний обучаться будет трудно» стоит прямо на странице, и это честнее, чем обещание научить SRE с нуля.
Главная ценность здесь не в видеоуроках, а в постановке задачи. Учебное приложение специально сделано разговорчивым: микросервисы кинотеатра, которые агрегируют сеансы, цены и свободные места. Сначала вы формулируете для него SLI, SLO и SLA и вешаете мониторинг, потом сервис начинают портить ошибки разработчиков, отказы инфраструктуры, наплыв посетителей и DoS-атаки. Дальше падает обработка платежей, и группа работает как дежурная смена: распределяет роли, оповещает заинтересованных, расставляет приоритеты и восстанавливает сервис в жёстко ограниченное время. Заканчивается всё разбором причин и постмортемом, шаблоны которого отдают на руки.
Отдельно стоит отметить, чего на странице нет. Нет ни слова про помощь с трудоустройством, карьерный центр или стажировку: курс адресован тем, у кого работа уже есть, и школа прямо предлагает попросить оплату у работодателя. Нет условий возврата денег при отказе от обучения и нет упоминания налогового вычета, хотя на страницах других курсов Слёрма про вычет написано отдельным блоком.
Что смущает, так это цена. В блоке тарифа стоит 60 000 рублей за поток с рассрочкой по 15 000 рублей в месяц, а чуть ниже, в куске про юридических лиц, появляется ценник 100 000 рублей с тем же составом пунктов. Чем отличаются эти два варианта, страница не объясняет, и выяснять придётся у менеджера.
Плюсы
- практика идёт на учебном production-сервисе школы: микросервисы на Python с базой MySQL в кластере Kubernetes, доступ к которому дают студенту
- работа не в одиночку, а SRE-командой: группу делят на роли, дают пять командных кейсов и имитируют дежурство при аварии
- инцидент отрабатывается под давлением времени, а на выходе студент получает комплект шаблонов постмортемов для своей команды
- подготовительный модуль по Kubernetes и видеокурс «Мониторинг в Grafana» входят в тариф, их не надо докупать
- спикер практикующий: руководитель команды SRE в RWB, прежде техлид SRE в финтехе и лид observability-команды в Dodo Engineering
- цена 60 000 рублей закрывается рассрочкой на 4 месяца по 15 000 рублей в месяц, а школа отдельно объясняет, как попросить оплату у работодателя
Минусы
- документ описан на странице двумя разными способами: в одном блоке именное свидетельство за 80% курса и участие в практиках, в ответах на вопросы номерной сертификат за 80% курса и три посещённые субботние практики
- рядом с тарифом за 60 000 рублей на странице стоит второй ценник 100 000 рублей с тем же перечнем пунктов, и разница между вариантами не объяснена
- курс короткий: 45 часов и три недели, системного погружения в надёжность на уровне длинной программы ждать не стоит
- ни возврат денег при отказе от обучения, ни налоговый вычет на странице не описаны, хотя у других курсов школы про вычет есть отдельный блок
Кому подходит
DevOps-инженерам, SRE и системным инженерам
Тем, кто уже работает с production и хочет собрать разрозненные SRE-практики в систему: понять, какие метрики действительно нужны, как задавать SLO, настраивать алертинг и выстраивать работу с инцидентами.
Разработчикам с инфраструктурной ответственностью
Тем, кто отвечает не только за код, но и за то, как сервис живёт после релиза, и хочет учитывать мониторинг, надёжность и причины сбоев ещё на этапе разработки.
Тимлидам и техлидам
Тем, кому нужно выстроить в команде понятный подход к надёжности: договориться о метриках, наладить работу с инцидентами и постмортемы, чтобы каждый новый сбой не приходилось разбирать с нуля.
Кому курс не подойдёт
- новичкам в инфраструктуре: школа прямо требует Linux на уровне администратора, умение читать код на Python и понимание работы баз данных
- тем, кому нужен документ установленного образца: здесь выдают именное свидетельство школы, а не удостоверение о повышении квалификации
- тем, кто хочет учиться в своём темпе: это поток с расписанием, командными практиками и живыми встречами, а не видеокурс с доступом когда удобно
Чем отличается от других курсов направления
В направлении SRE у нас всего два соседа, и они находятся по разные стороны от этого курса. «Интенсив по погружению в SRE» самой же школы стоит 5 000 рублей и идёт семь дней: это проверка интереса и базы, школа прямо предлагает его тем, кто не уверен, что готов к полному курсу. «SRE инженер» у TeachMeSkills стоит 130 000 рублей и длится 8 месяцев: это программа с нуля, где значительную часть времени занимает база по Linux, сетям и контейнерам. Курс Слёрма стоит между ними и по деньгам, и по смыслу: 45 часов за три недели для человека, который базу уже имеет и хочет получить не введение, а рабочие практики. Внутри самой школы ближайшие родственники другие: «Мониторинг и логирование инфраструктуры в Kubernetes» закрывает наблюдаемость подробнее, а «Kubernetes: базовый уровень» даёт ту самую базу по кластеру, которую здесь ждут на входе. Главное отличие от всех соседей это командный формат с распределением ролей и отработкой аварии в жёстко ограниченное время: остальные курсы направления учат каждого поодиночке.
Обзор курса
Что именно вы делаете руками
Три практикума и пять командных кейсов идут на стендах школы, а не на слайдах. В первом вы добавляете на дашборды SLO, SLI и error budget, работаете с кластером, чините ошибки в коде и разбираете архитектуру приложения. Во втором устраняете проблемы в приложении по метрикам и получаете комплект шаблонов постмортемов. В третьем реализуете подход fail-fast и канареечные деплои через Argo Rollouts. Теория идёт вокруг этого: monitoring и observability, SLO, SLI, SLA, error budget, resilience engineering, устройство дежурной команды, инструменты варрума, health checking в Kubernetes с пробами, sidecar health server и headless probe.
Кто стоит за курсом
Спикер один, Максим Гусев, руководитель команды SRE в RWB. Строит отказоустойчивые системы больше одиннадцати лет, прошёл путь до техлида SRE в финтехе и лида observability-команды в Dodo Engineering. Школа отдельно оговаривает свою позицию: «вы получите не гугловскую теорию, а рабочий опыт инженеров из российских компаний». Для темы, где половина материала в интернете это пересказ книги Google, оговорка уместная, но и минус тут очевиден: взгляд на SRE вы получите один, а не несколько.
Как устроена нагрузка
45 часов на три недели, из них 15 теории, 20 практики и 6 часов встреч. Поток идёт по шагам: смотрим видеоуроки и читаем теорию, делаем домашние задания и получаем фидбек эксперта, выполняем практику в командах, разбираем её со спикером на встрече, задаём вопросы на Q&A. Домашние задания проверяет эксперт, у группы есть куратор и чат в Telegram. Для работающего инженера это примерно 15 часов в неделю, и разложить их на более длинный срок не получится: поток стартует 26 октября и идёт по расписанию.
Что входит в стоимость
Кроме основного материала в тариф добавлены две вещи, которые школа продаёт и отдельно: подготовительный модуль по архитектуре Kubernetes с разбором подов, репликасетов, деплойментов и сервисов, и видеокурс «Мониторинг в Grafana» с подходами к мониторингу, PromQL, дашбордами и алертингом. Для человека, который знает Kubernetes поверхностно, это заметная часть ценности: без неё третья тема про health checking читалась бы вслепую. Дальше идут виртуальные стенды, чат-группы со спикерами, поддержка куратора и проверка домашних заданий.
Где страница противоречит себе
Про документ на странице сказано дважды и по-разному. Блок с картинкой обещает именное свидетельство о прохождении при 80% курса и участии в практиках. В ответах на вопросы формулировка другая: у школы есть официальная лицензия, и номерные сертификаты получат те, кто посетил три субботние практики и прошёл 80% курса. Свидетельство и сертификат это разные бумаги, и условие про субботние практики в первом блоке не упомянуто вовсе. Второе расхождение денежное: тариф «Поток» за 60 000 рублей и ценник 100 000 рублей с тем же перечнем пунктов соседствуют на одной странице.
Кому это не нужно
Тем, кто ищет вход в профессию. Здесь нет базы по Linux, контейнерам и сетям, её ждут на входе. Тем, кто хочет корочку для отдела кадров: свидетельство школы это внутренний документ, а не удостоверение установленного образца. И тем, кто планирует учиться в своём темпе: это поток с расписанием, командными практиками и живыми встречами, а не видеокурс, который можно смотреть по вечерам полгода.
Программа курса
1Подготовительный модуль по Kubernetes (бонус)
2Видеокурс «Мониторинг в Grafana» (бонус)
3Установочная встреча и деление на команды
4Теория SRE и первый практикум
5Инцидент-менеджмент и второй практикум
6Health checking и третий практикум
7Три Q&A-сессии со спикерами
8Сдача практик и свидетельство
Чему вы научитесь
- формулировать SLI, SLO и SLA для реального сервиса и считать error budget
- настраивать мониторинг и алертинг на Prometheus, Grafana и Alertmanager, писать запросы на PromQL
- вести инцидент от обнаружения до восстановления: распределять роли, оповещать заинтересованных, расставлять приоритеты под давлением времени
- писать постмортемы и превращать разбор аварии в изменения мониторинга и автоматизации
- настраивать health check в Kubernetes: пробы, secondary health port, sidecar health server, headless probe
- реализовывать подход fail-fast и канареечные деплои через Argo Rollouts
- связывать мониторинг, SLO, отказоустойчивость и работу с инцидентами в одну рабочую картину и переносить её на свой сервис
Как проходит обучение
Три недели потока по расписанию
Старт 26 октября, весь объём 45 часов: 15 часов теории, 20 часов практики на стендах и 6 часов встреч со спикерами. Материал открывается блоками, отставать от потока нельзя.
Имитация реальной работы в командах
Студентов делят на группы и раздают роли. Работа идёт на учебном приложении кинотеатра: микросервисы на Python и база MySQL в кластере Kubernetes школы, доступ к которому выдают для разбора инцидентов.
Домашние задания с проверкой эксперта
После видеоуроков и теории идут домашние задания, их проверяет эксперт и даёт обратную связь. Отдельно есть поддержка куратора группы и чат в Telegram со спикерами.
Три Q&A-сессии и разборы кейсов
Живые встречи после каждого блока: разбор практических заданий, ответы на вопросы, обратная связь по домашним работам, обсуждение того, как SRE устроен в других компаниях.
Часто задаваемые вопросы
Какие знания нужны до старта?
Сколько это часов и как они распределены?
Какой документ выдают?
На чём идёт практика и нужен ли свой кластер?
Сколько стоит и есть ли рассрочка?
Помогают ли с трудоустройством?
Можно ли вернуть деньги, если курс не подойдёт?
Есть ли демодоступ?
Отзывы о курсе «Управление надёжностью систем на основе данных (SRE)»
Оставить отзыв о курсе
Расскажите, как проходило обучение: что понравилось, что нет, помог ли курс в работе. Публикуем после проверки, рекламные тексты и анонимные жалобы без подробностей не пропускаем.
Это отзывы о других программах школы Слёрм: они говорят о школе в целом, а не об этом курсе.
Все отзывы школы собраны на её странице.
