сеньорчикОткрыть в Telegram
← блог
21 июля 2026 г.

Дата-инженер: чем занимается, что нужно знать и сколько платят

Дата-инженер это человек, из-за которого у аналитика вообще есть что анализировать. Данные приезжают из десятка источников, в разном формате, с опозданиями и ошибками, и кто-то должен превратить этот поток в таблицы, которым можно доверять.

Разберём профессию: что за задачи, какой стек и как туда попасть.

Чем занимается на самом деле

Три большие области.

Загрузка данных. Забрать из источников: продуктовых баз, внешних API, файлов от партнёров, потоков событий. Сделать это так, чтобы повторный запуск не создавал дубли, а падение на середине не оставляло половину загруженного.

Преобразование и хранение. Разложить сырые данные в модель, по которой удобно считать: слои, витрины, измерения и факты. Тут же решается, что считать источником правды и как хранить историю изменений.

Надёжность. Мониторинг, алерты, разбор инцидентов. Отчёт, который не обновился в понедельник утром, это проблема дата-инженера, и обычно она обнаруживается по сообщению от разгневанного руководителя.

Плюс сквозная тема: качество данных. Проверки на пропуски, дубли, аномальные значения, расхождения между источниками.

Чем отличается от смежных ролей

От аналитика тем, что аналитик отвечает на вопросы бизнеса, а инженер строит трубу, по которой к нему приезжают данные. Аналитик спрашивает «почему упала конверсия», инженер отвечает за то, чтобы цифры конверсии вообще были и были верными.

От бэкендера тем, что бэкенд работает с данными в момент запроса, а дата-инженер с большими объёмами и историей. Разные требования: там миллисекунды на ответ, тут часы на пересчёт терабайта.

От ML-инженера тем, что модель обучается на данных, которые кто-то подготовил. Часто это один и тот же человек, но по сути задачи разные.

Стек

SQL на уровне, где он становится инструментом мышления. Не «умею писать джойны», а понимание планов запросов, оконных функций, оптимизации на больших таблицах.

Python. Не веб, а работа с данными: чтение форматов, преобразования, взаимодействие с API, автоматизация.

Оркестратор. Чаще всего Airflow: DAG-и, зависимости, расписание, ретраи, бэкфилл.

Хранилища. Классические аналитические базы вроде ClickHouse и Greenplum, реже классические реляционные для витрин. Плюс понимание разницы между строковым и колоночным хранением.

Форматы и объектное хранилище. Parquet, S3-совместимые хранилища, идея разделения хранения и вычислений.

Стриминг. Kafka как минимум на уровне гарантий доставки, партиций и офсетов.

Spark. Для больших объёмов, где обычная база уже не тянет. Ключевое понимание: откуда берётся шафл и почему он дорогой.

Инфраструктура. Docker, CI, базовый Kubernetes, немного про мониторинг. Не на уровне админа, но чтобы не быть беспомощным.

Выглядит внушительно, но никто не требует всего сразу. Ядро это SQL, Python, оркестратор и одно хранилище.

Типичные задачи на собеседовании

Моделирование: спроектируйте витрину под такую-то отчётность. Ждут понимания слоёв, гранулярности, звезды и снежинки, работы с историчностью.

Идемпотентность: что произойдёт при повторном запуске загрузки и как избежать дублей. Вопрос почти обязательный, потому что отделяет тех, кто писал продакшн-пайплайны.

Оптимизация: запрос выполняется два часа, что делать. Разговор про партиционирование, индексы, распределение данных, лишние джойны.

Инциденты: данные не приехали, отчёт пустой, ваши действия. Ждут порядок разбора, а не героизм.

Стриминг: гарантии доставки, что делать с опоздавшими событиями, чем at-least-once отличается от exactly-once на практике.

Сколько платят

По открытым обзорам середины 2026 года дата-инженерия идёт примерно на уровне бэкенд-разработки, иногда выше за счёт того, что специалистов меньше. Общие ориентиры по грейдам и городам мы разбирали в обзоре зарплат в IT.

Внутри профессии вилка сильно зависит от объёмов: человек, который поддерживает три ежедневных выгрузки, и человек, который отвечает за платформу данных для сотни аналитиков, находятся в разных ценовых категориях, даже если оба называются дата-инженерами.

Как перейти

С нуля в дата-инженерию заходят редко: слишком много инфраструктурного контекста. Типичные входы другие.

Из аналитики. Самый частый путь. SQL уже есть, добавляются Python, оркестратор и понимание хранилищ. Полгода-год спокойной работы.

Из бэкенда. Тоже частый: код и инфраструктура есть, добавляется специфика данных, моделирование и аналитические базы.

Из поддержки или администрирования баз. Знание систем есть, добавляется программирование и моделирование.

Что делать конкретно: собрать свой маленький пайплайн целиком, без пропусков. Взять открытый API, настроить регулярную загрузку через Airflow, положить в базу, сделать витрину, добавить проверки качества и алерт на сбой. Такой проект отвечает сразу на половину вопросов собеседования.

С чего начать подготовку

Список тем выше конечен, и закрывается он практикой, а не чтением. На собеседовании спрашивают не определения, а поведение системы: что произойдёт при повторном запуске, при перекосе данных, при отказе узла.

В Сеньорчике есть отдельный трек дата-инженера: DWH и моделирование, ETL и оркестрация, ClickHouse и Greenplum, Kafka и стриминг, Spark, SQL и инфраструктура. Каждый вопрос с вариантами и разбором, движок возвращает темы, где вы ошибаетесь. Десять минут в день в Telegram, начать можно бесплатно.