← Усі вакансії

Principal Data Engineer

Рівень:
lead
Джерело:
djinni.co
Відгукнутись на вакансію →

Remote · Full-time · Перетин із робочими годинами ЄС · Principal level

Шукаємо досвідченого Data-інженера в технологічну компанію, що поєднує OSINT і сучасну аналітику даних, допомагаючи урядам отримувати критично важливу інформацію про технологічне та економічне середовище росії й Китаю. Наша платформа перетворює відкриті дані на практичну аналітику щодо оборонно-промислових комплексів і ширших технологічних екосистем цих країн.

Про роль

Ви приєднаєтеся до Data Processing Team, яка перетворює необроблені дані на чисті, структуровані та надійні датасети, що лежать в основі аналітики Datenna.

Ви відповідатимете за весь життєвий цикл data pipelines: від bronze-рівня з даними, отриманими нашими колекторами, через entity resolution і enrichment — до gold-датасетів, які використовуються продуктом, knowledge graph і комерційними експортами даних.

Це роль із високим рівнем відповідальності: ви проєктуватимете pipelines і data models, визначатимете технічні стандарти та підходи, на які спиратиметься команда.

Масштаб задач

Наша платформа обробляє понад 1 млрд data points, об’єднаних у knowledge graph із більш ніж 50 млн китайських компаній, людей, закупівель і зв’язків між ними.

Головний виклик — робити це правильно, повторювано, інкрементально та з оптимальними витратами. Ця роль підійде інженеру, який сприймає data modelling і pipeline design як ключові інженерні задачі та хоче відповідати за всю систему, а не лише за окремі трансформації.

Ваші завдання

Розробляти та підтримувати pipelines у межах Medallion Architecture: bronze → silver → gold.

Перетворювати необроблені дані на структуровані датасети з перевіреною якістю.

Відповідати за моделі компаній, людей і зв’язків між ними на всіх рівнях даних.

Розвивати схеми без порушення роботи продукту, аналітики та експорту даних.

Перевести обробку даних від повних оновлень до incremental processing, щоб нові дані потрапляли до користувачів протягом днів, а не наступних релізних циклів.

Створювати та підтримувати data assets і models у Dagster, dbt, Trino та Databricks.

Забезпечувати зрозумілий data lineage і належне покриття тестами.

Відповідати за gold-датасети, що використовуються продуктом, метриками та комерційними експортами.

Співпрацювати з командою, яка завантажує дані в Neo4j та Elasticsearch.

Розвивати аналітичний рівень і датасети для метрик та дашбордів у Metabase.

Покращувати якість даних, надійність, observability та вартість виконання pipelines.

Проводити змістовні code review, менторити менш досвідчених інженерів і допомагати формувати інженерну культуру команди.

Наш стек

Python · SQL · Dagster+ · dbt · Trino · Databricks · Apache Iceberg · Medallion Lakehouse · Azure Data Lake Storage · Neo4j · Elasticsearch · Metabase · Azure · GitLab CI · Grafana · Claude Code · Codex

Процес найму

4 етапи інтерв'ю англійською.

Схожі вакансії

З блогу Trackr

Усі статті →

Знайдено через trackr.help/jobs · Канал: @trackrhelp · Бот для персональних сповіщень: @trackrhelpBot