Инженер данных
Курс уровня PRO для тех, кто уже пишет SQL и код на Python: аналитиков, специалистов по Data Science, разработчиков и начинающих инженеров данных. За 6,5 месяца школа проводит через 10 спринтов: аналитическое хранилище и нормальные формы, витрины и оптимизация запросов, ETL в Airflow, контроль качества данных, полноценный DWH для стартапа, аналитическая СУБД Vertica, Data Lake на HDFS и Spark, потоки на Kafka, облако на Yandex Cloud с Docker, Kubernetes и Helm, а в конце пет-проект с защитой перед командой курса. В портфолио уходит 8 работ, теорию сопровождают 9 воркшопов с наставниками. На выходе диплом о профессиональной переподготовке, если есть среднее профессиональное или высшее образование. Помощь с трудоустройством школа на этом курсе не оказывает и объясняет это прямо: курс для действующих специалистов. Цена 119 500 рублей, нагрузка около 12 часов в неделю.
Мнение редакции
Первое, что нужно понять про этот курс: он не про вход в профессию. Школа держит две программы с почти одинаковым названием, и это принципиально разные продукты. Здесь, в версии PRO, на старте спрашивают операторы SELECT, GROUP BY, WHERE, HAVING и JOIN, оконные функции, комбинирование и ускорение вложенных запросов, а из Python структуры данных, ООП и базовые операции с Pandas. Перед покупкой предлагают пройти входной тест, и это не формальность: программа стартует сразу с устройства PostgreSQL и нормальных форм, разгона по синтаксису не будет. Если вы никогда не писали запросов, вам нужен курс «Инженер данных с нуля» за 169 500 рублей, а не этот.
Содержательно набор тем один из самых полных на рынке: за 10 спринтов проходят слой аналитического хранилища, витрины и оптимизацию запросов, ETL в Airflow, отдельный спринт про качество данных с мониторингом и runbook, проектирование DWH от сбора требований до тестирования и документации, колоночную Vertica для высоконагруженных систем, Data Lake на HDFS с PySpark, потоки на Kafka и Spark Structured Streaming и, наконец, облако: Yandex Cloud, Docker, Kubernetes, Helm, Redis и DataLens. Это ровно тот стек, который перечисляют в вакансиях, и главная ценность курса в том, что все куски собираются в одну инфраструктуру, а не изучаются по отдельности.
Теперь про то, чего здесь нет. Помощи с трудоустройством нет вообще, и школа не прячет это в мелкий шрифт: в ответах на вопросы написано, что курс предназначен для действующих специалистов, у которых уже есть навыки поиска работы. Нет и Мастерской, агентства с настоящими заказами, которое доступно студентам программ с нуля. То есть за 119 500 рублей вы покупаете знания и портфолио из 8 проектов, а искать работу будете сами.
С деньгами стоит разобраться отдельно. В шапке тарифа школа показывает платёж 4 878 рублей в месяц с пометкой «на 36 месяцев»: это банковский кредит, и за три года по нему набегает существенно больше цены курса. Беспроцентная рассрочка у школы тоже есть, но она другая: платежи делятся на срок обучения, то есть примерно на 7 месяцев. Ещё школа обещает выгоду до 20 % при оплате целиком и помогает оформить налоговый вычет 13 %. Зарплатная шкала на странице начинается сразу с middle: 185 000 рублей и выше, junior там просто нет, и это честно отражает то, что курс не делает из новичка джуна, а поднимает уровень уже работающего специалиста.
Плюсы
- полный инженерный стек в одной программе: DWH и витрины, ETL в Airflow, Vertica, Data Lake на HDFS и Spark, Kafka, Yandex Cloud с Docker и Kubernetes
- отдельный спринт про качество данных с разработкой проверок, мониторингом и runbook, а это то, чего в курсах по инженерии данных обычно нет
- 8 практических работ уровня рабочих задач: витрина с инкрементальной загрузкой, DWH для стартапа, хранилище на Vertica, потоковая система, облачная инфраструктура
- диплом о профессиональной переподготовке установленного образца, школа работает по государственной образовательной лицензии
- 9 воркшопов с практикующими инженерами данных плюс ответы наставников в чате, а теория и тренажёр доступны и с компьютера, и в приложении
- два формата на выбор: с дедлайнами и фиксированной датой окончания или в своём темпе, когда модули открываются по мере прохождения
Минусы
- помощи с трудоустройством нет вообще: школа прямо пишет, что курс для действующих специалистов, у которых уже есть навыки поиска работы
- вход закрыт для новичков: нужны SQL с оконными функциями и подзапросами и Python с ООП и Pandas, а перед оплатой предлагают пройти входной тест
- Мастерская с настоящими заказами от бизнеса и НКО на этой странице не упоминается, хотя студентам программы с нуля она доступна
- зарплатный блок начинается сразу с middle и содержит явную опечатку школы: у уровня lead напечатано «от 34 000 до 553 000 рублей»
Кому подходит
Аналитикам и специалистам по Data Science
Тем, кто уже достаёт данные запросами, но не умеет строить хранилища и витрины и готовить данные к машинному обучению своими силами.
Начинающим инженерам данных
Тем, кто уже работает с пайплайнами, но знает их кусками: курс систематизирует стек и добавляет в портфолио 8 законченных работ.
Разработчикам, которые смотрят в сторону данных
Python и SQL уже есть, не хватает ETL, Airflow, PySpark и облачной обвязки, а именно из этого курс и состоит.
Кому курс не подойдёт
- новичкам без опыта: на старте спрашивают оконные функции, подзапросы, индексы, структуры данных Python и ООП, а для входа с нуля у школы есть отдельная программа за 169 500 рублей
- тем, кому нужна помощь с поиском работы: на этом курсе её нет ни в каком виде, включая карьерный трек и партнёрские вакансии
- тем, у кого нет 12 часов в неделю: программа плотная, спринты идут один за другим и каждый заканчивается проектом с ревью
Чем отличается от других курсов направления
Прямая пара этому курсу внутри самой школы: «Инженер данных с нуля» за 169 500 рублей и 11 месяцев. Там первые шесть спринтов уходят на Python, алгоритмы и SQL, есть карьерный центр с месяцем подготовки и активным поиском работы, доступ к Мастерской с заказами от бизнеса и модуль по нейросетям. Здесь всего этого нет, зато и переплаты в 50 000 рублей нет, а инженерная часть начинается с первого дня: если база у вас уже есть, вы не платите за повторение основ. Вторая пара, «ML-инженер с опытом» за 145 000 рублей и 4 месяца, ведёт в соседнюю профессию: там модели, MLflow и рекомендательные системы, а не хранилища. Дороже всех «ML-инженер» за 192 000 рублей и год, но это обучение с нуля и совсем другой объём. Внешний конкурент один: «Инженер данных» TeachMeSkills за 100 000 рублей, он дешевле почти на 20 000, но у Практикума за 119 500 рублей набор технологий шире, есть Vertica, Kubernetes и Helm, и есть диплом установленного образца. «Документирование в IT-проектах: построение CJM» Нетологии за 2 900 рублей это разовый семидневный интенсив по смежной теме, а не альтернатива.
Обзор курса
Кому этот курс, а кому соседний
У Практикума две программы про инженерию данных, и путать их дорого. Эта, с меткой PRO и ценой 119 500 рублей, идёт 6,5 месяца и требует базы: SQL на уровне JOIN, подзапросов и оконных функций, Python на уровне структур данных, ООП и Pandas. Соседняя, «Инженер данных с нуля» за 169 500 рублей, идёт 11 месяцев, начинается с первого урока по Python и включает карьерный центр. Разница в цене всего 50 000 рублей, поэтому решать надо не по деньгам, а по тому, есть ли у вас база и нужна ли помощь с поиском работы. Школа сама вешает на этой странице блок со ссылкой на версию с нуля, а перед оплатой предлагает входной тест в бесплатной части.
Что внутри программы
Десять спринтов. Первый и второй про аналитическое хранилище: PostgreSQL и DBeaver, нормальные формы, OLTP и OLAP, модели данных, проектирование DWH, витрины и VIEW, план и анализ запроса, типы индексов. Третий про ETL: требования к процессу, архитектура Airflow и DAG, реализация пайплайна от источников до витрины. Четвёртый целиком отдан качеству данных: требования и контроль, технические и бизнес-качества, разработка проверок, мониторинг, runbook. Пятый и шестой это большая инженерия: сбор требований, проектирование слоёв CDM, STG, DDS, реализация DWH с транзакциями и витринами, тестирование, BI и документация, затем аналитические СУБД и Vertica с оптимизацией хранения. Седьмой и восьмой про Data Lake: HDFS, Spark с MapReduce и YARN, PySpark с DataFrame и джобами, а следом Kafka и Spark Structured Streaming. Девятый про облако: Yandex Cloud, Redis и Kafka как источники, Docker, Kubernetes и Helm, PostgreSQL в облаке, DataLens. Десятый это пет-проект: выбираете бизнес-задачу и защищаете решение перед командой курса и другими студентами.
Как устроена нагрузка
Школа называет около 12 часов в неделю. Формат на выбор: с дедлайнами, где модули открываются по расписанию и есть фиксированная дата окончания, или в своём темпе, где дедлайнов нет и курс можно закончить раньше или позже. Теория лежит в интерактивном учебнике и доступна с компьютера и в приложении, проверять понимание помогает встроенный ИИ-помощник, который пересказывает урок и объясняет непонятное другими словами. Отдельно идут 9 воркшопов с наставниками, они проходят в будни вечером или в выходные. Если нагрузка не тянется, в программе есть каникулы, а куратор помогает согласовать новый дедлайн.
Что на выходе
Восемь практических работ, среди них витрина с инкрементальной загрузкой для интернет-магазина, DWH для стартапа, аналитическое хранилище на Vertica для высоконагруженной системы, Data Lake с автоматической загрузкой, система потоковой обработки, облачная инфраструктура и итоговый пет-проект. Документ: диплом о профессиональной переподготовке установленного образца, школа работает по государственной образовательной лицензии. Важное условие: диплом выдают тем, у кого есть среднее профессиональное или высшее образование, остальным присылают сертификат о прохождении курса, а тем, кто не дошёл до итогового проекта, электронную справку об обучении с перечнем освоенных модулей.
Деньги
Цена 119 500 рублей одним платежом, и школа обещает выгоду до 20 %, если платить сразу. Платёж 4 878 рублей в месяц, который висит в тарифе, относится к графику на 36 месяцев, то есть к кредиту от банка, а не к беспроцентной рассрочке: перемножьте сами и увидите переплату. Беспроцентная рассрочка от Т-Банка делит сумму на срок обучения, первый платёж через месяц. Есть Яндекс Сплит, оплата через компанию или ИП и оплата работодателем, в том числе долями 50/50 или 75/25, а при покупке на 10 и более сотрудников скидка 10 %. Возврат: если поток не начался, вернут всю сумму, если начался, возврат частичный по седьмому пункту оферты. Ещё 13 % можно вернуть налоговым вычетом, школа подсказывает, как оформить документы.
Где программа проседает
Первое и главное: никакой карьерной поддержки. Это осознанное решение школы, но покупатель, привыкший к тому, что у Практикума есть карьерный центр, легко переносит ожидание с одной программы на другую. Второе: Мастерская, где студенты берут настоящие заказы от бизнеса и НКО, на этой странице не упомянута, а на странице версии с нуля она есть. Третье: зарплатный блок оформлен странно. Middle 185 000 - 293 000 рублей, senior 314 000 - 444 000, а у lead напечатано «от 34 000 до 553 000», в нижней границе школа потеряла цифру, по шкале там 340 000. Опираться на такую вёрстку при расчёте окупаемости нельзя, цифры стоит перепроверить у менеджера. Четвёртое: длительность гуляет. Каталог школы отдаёт в фид 6 месяцев, а на самой странице везде написано 6,5 месяца.
Итог
Если вы аналитик, дата-сайентист или разработчик, у которого SQL и Python уже в руках, а инженерная часть, DWH, Airflow, Spark, Kafka и облако, зияет дырой, курс закрывает эту дыру аккуратно и целиком. Если базы нет, входной тест это покажет, и тогда правильный выбор соседняя программа с нуля. И не рассчитывайте, что после выпуска вас поведут за руку по вакансиям: здесь такого не обещают.
Программа курса
1Аналитическое хранилище данных
2Работа с данными в хранилище
3ETL: автоматизация подготовки данных
4Проверка качества данных
5DWH и аналитические СУБД
6Организация Data Lake и потоковая обработка
7Облачные технологии
8Итоговый пет-проект
Чему вы научитесь
- проектировать DWH: собирать требования, разводить слои STG, DDS и CDM, тестировать и документировать хранилище
- строить витрины и оптимизировать запросы: читать план выполнения, подбирать типы индексов, делать инкрементальную загрузку
- автоматизировать ETL в Airflow: описывать DAG и вести данные от источников до витрины
- контролировать качество данных: формулировать требования, разрабатывать проверки, ставить мониторинг и писать runbook
- работать с колоночной Vertica и оптимизировать хранение для высоконагруженных систем
- собирать Data Lake на HDFS и обрабатывать данные в Spark и PySpark
- поднимать потоковую обработку на Kafka и Spark Structured Streaming
- разворачивать инфраструктуру в Yandex Cloud с Docker, Kubernetes и Helm и строить дашборды в DataLens
Как проходит обучение
Спринты с проектом на выходе
Программа разбита на 10 спринтов, почти каждый заканчивается практической работой, которую вручную проверяет ревьюер и пишет комментарии.
Теория в интерактивном учебнике
Материалы открыты с компьютера и в приложении, читаете урок и сразу применяете знания в тренажёре, который проверяет решение на месте.
9 воркшопов с наставниками
Проходят в будни вечером или в выходные, на них разбирают сложные темы и рабочие кейсы, между воркшопами наставники отвечают в чате.
ИИ-помощник в платформе
Практикум ИИ кратко пересказывает урок и объясняет непонятое другими словами, если формулировка учебника не зашла.
Два режима: с дедлайнами или в своём темпе
В первом модули открываются по расписанию и есть фиксированная дата окончания, во втором дедлайнов нет и курс можно закончить раньше или позже.
Бесплатная часть с входным тестом
До покупки открыты уроки про особенности профессии, типичные задачи и инфраструктуру, а входной тест показывает, хватает ли вам подготовки.
Часто задаваемые вопросы
Что нужно знать до старта?
Чем этот курс отличается от «Инженера данных с нуля»?
Помогут ли найти работу?
Какой документ выдают?
Сколько времени займёт учёба?
Какие инструменты изучают?
Сколько платить в месяц?
Можно ли вернуть деньги?
Отзывы о курсе «Инженер данных»
Все отзывы о Яндекс Практикум →
Оставить отзыв о курсе
Расскажите, как проходило обучение: что понравилось, что нет, помог ли курс в работе. Публикуем после проверки, рекламные тексты и анонимные жалобы без подробностей не пропускаем.
Это отзывы о других программах школы Яндекс Практикум: они говорят о школе в целом, а не об этом курсе.
Все отзывы школы собраны на её странице.
