Builds and runs large scale batch data pipelines, keeping jobs fast and affordable as data volumes grow. Works with Apache Spark to build and manage large scale data processing jobs, including performance tuning to maintain efficient and reliable pipeline execution. Supports data modelling for analytics and organises data in a lakehouse so it is usable downstream. Handles automated scheduling, monitoring, and data quality checks, while working with platform and product teams on end to end data flows.
Desired Candidate Profile
Strong hands on Apache Spark including performance tuning, not Spark usage through a managed notebook only. Data modelling for analytics and organising data in a lakehouse so it is usable downstream. Automated scheduling, monitoring, and data quality checks. Works with platform and product teams on end to end data flows. Apache Iceberg or other open table formats. Trino or similar query engines. On premises or self managed cluster experience.
يبني ويُشغّل أنابيب بيانات الدفعات واسعة النطاق، مع الحفاظ على سرعة المهام وتكلفتها المناسبة مع نمو أحجام البيانات. يعمل مع Apache Spark لبناء وإدارة مهام معالجة البيانات واسعة النطاق، بما في ذلك ضبط الأداء للحفاظ على تنفيذ فعال وموثوق لأنابيب البيانات. يدعم نمذجة البيانات للتحليلات وينظم البيانات في بحيرة البيانات (lakehouse) لتكون قابلة للاستخدام في المراحل اللاحقة. يتولى الجدولة الآلية، والمراقبة، وفحوصات جودة البيانات، مع العمل مع فرق المنصات والمنتجات على تدفقات البيانات الشاملة من البداية إلى النهاية.
الملف الشخصي للمرشح المطلوب
خبرة عملية قوية في Apache Spark بما في ذلك ضبط الأداء، وليس مجرد استخدام Spark عبر دفتر ملاحظات مُدار فقط. نمذجة البيانات للتحليلات وتنظيم البيانات في بحيرة البيانات (lakehouse) لتكون قابلة للاستخدام في المراحل اللاحقة. الجدولة الآلية، والمراقبة، وفحوصات جودة البيانات. العمل مع فرق المنصات والمنتجات على تدفقات البيانات الشاملة من البداية إلى النهاية. Apache Iceberg أو غيرها من تنسيقات الجداول المفتوحة. Trino أو محركات الاستعلام المشابهة. خبرة في المجموعات (clusters) المحلية أو المُدارة ذاتياً.