Ты будешь подключать новые источники данных и строить интеграции, через которые данные надежно проходят путь от БД и API до сырого слоя и становятся доступными для дальнейшей обработки
Это роль для инженера, которому интересно не просто поддерживать готовые пайплайны, а проектировать интеграционную логику, работать с batch- и streaming-сценариями, API и распределенными хранилищами. Результат твоей работы напрямую влияет на то, насколько быстро продуктовые и смежные команды получают новые данные
С тебя — сильная инженерная база, самостоятельность и внимание к надежности решений, с нас — сложные интеграционные задачи, технологичная data-среда и свобода улучшать инструменты, шаблоны и подходы, которыми пользуется команда.
Подключать новые источники данных: базы данных, REST API и другие внешние системы
Разрабатывать и поддерживать ETL/ELT-пайплайны для пакетной и потоковой обработки данных
Писать интеграционную логику на Python и создавать переиспользуемые модули и компоненты для подключения новых источников
Развивать процессы в Apache Airflow: проектировать DAG, управлять очередями и пулами задач, создавать кастомные операторы и hooks
Собирать и принимать данные через REST API в batch- и real-time-сценариях
Настраивать и отлаживать пайплайны, находить причины ошибок и повышать стабильность существующих интеграций
Выполнять предварительную обработку, очистку и валидацию сырых данных перед их загрузкой в raw-слой
Настраивать мониторинг и алертинг, чтобы быстро обнаруживать сбои и предотвращать деградацию production-процессов
Реализовывать проектные интеграции по запросам внутренних и внешних команд: например, фильтровать данные и передавать их в целевые системы или внешние БД
Проводить code review и помогать повышать качество общей кодовой базы.
Ты самостоятельно умеешь не только поддерживать готовые процессы, но и с нуля разобраться в новом источнике, спроектировать подключение и довести интеграцию до production
Тебе комфортно работать в инфраструктурной среде, где одновременно есть несколько способов доставки данных, а от надежности твоего решения зависят другие команды
Ты не ограничиваешься подходом «пайплайн работает — значит, все хорошо»: думаешь о переиспользуемости, мониторинге, качестве кода и предлагаешь, как сделать новые интеграции быстрее и стабильнее.
Уверенно владеешь Python и умеешь проектировать переиспользуемые модули и компоненты для production-задач
Глубоко понимаешь Apache Airflow: работал с DAG, пулами и очередями задач, писал кастомные операторы и hooks
Есть практический опыт разработки интеграций и подключения источников через REST API
Строил и поддерживал высоконагруженные ETL/ELT и data pipelines в production
Уверенно владеешь SQL и умеешь писать сложные запросы для трансформации и проверки сырых данных
Работал с ClickHouse или другой распределенной / MPP-СУБД
Понимаешь принципы batch- и streaming-обработки данных и умеешь выбирать подходящий способ интеграции под конкретный источник
Есть опыт работы с Git и Docker в инженерной разработке
Умеешь настраивать мониторинг и алертинг, диагностировать ошибки и повышать отказоустойчивость пайплайнов
Понимаешь, как организовать очистку, валидацию и предварительную обработку данных перед их загрузкой в сырой слой
Есть опыт работы с Kafka в streaming-сценариях: понимаешь партиционирование, retention, семантику Exactly-Once и умеешь дебажить потоковые пайплайны
Умеешь проводить code review, работать с pull request и поддерживать качество общей кодовой базы.