ماذا ستقوم به
تصميم وصيانة خطوط بيانات مهيأة لأعباء العمل في ML/AI، بما في ذلك التعامل مع البيانات الضخمة غير المهيكلة ونصف المهيكلة. بناء خطوط ميزات ومحافظ ميزات لضمان القابلية لإعادة الاستخدام والتناسق للبيانات المستخدمة من قبل نماذج التعلم الآلي. التعاون مع علماء البيانات ومهندسي ML لفهم متطلبات البيانات للتدريب والتحقق والنشر في الإنتاج. ضمان جودة البيانات وتتبعها وحوكمتها بما يتوافق مع المعايير المطلوبة لتطبيقات AI/ML. دعم ممارسات MLOps من خلال دمج خطوط البيانات مع عمليات تدريب النماذج والمراقبة والنشر. الاستفادة من أطر المعالجة الموزعة (مثل Spark وDatabricks وAzure Synapse) لمعالجة بيانات ML على نطاق واسع.
ملف المرشح المطلوب
- أكثر من 5 سنوات من الخبرة كمهندس بيانات، العمل مع Azure وDatabricks، ويفضل أن يكون مع Exposure إلى تدفقات البيانات المرتبطة بـ ML/AI.
- درجة جامعية تبرز قدراتك التحليلية، مثل الاقتصاد القياسي، علوم الكمبيوتر، الرياضيات أو ما يماثلها؛
- مهارات تحليلية ومهارات حل المشكلات ممتازة؛
- خبرة في تجهيز البيانات لـ ML/AI: إدارة مجموعات بيانات كبيرة، هندسة الميزات، وخطوط بيانات في الوقت الفعلي أو الدفعية.
- الاطلاع على مفاهيم MLOps وكيف يدعم هندسة البيانات إدارة دورة حياة النماذج.
- خبرة مع أطر التنسيق (Airflow وPrefect أو Azure Data Factory) لسلاسل ML المعقدة.
- معرفة بمعالجة البيانات غير المهيكلة (النص، الصور، السجلات) ميزة إضافية.
- مهارات SQL وPython قوية؛ وجود خبرة مع معالجة البيانات الموزعة (PySpark، Dask، إلخ) ميزة إضافية.
What you'll be doing
Designing and maintaining data pipelines optimized for ML/AI workloads , including handling of large-scale, unstructured, and semi-structured data. Building feature pipelines and feature stores that ensure reusability and consistency of data used by machine learning models. Collaborating with Data Scientists and ML Engineers to understand data requirements for training, validation, and production deployment . Ensuring data quality, lineage, and governance meet standards required for AI/ML applications. Supporting MLOps practices by integrating data pipelines with model training, monitoring, and deployment workflows. Leveraging distributed processing frameworks (e.g., Spark, Databricks, Azure Synapse) for scalable ML data processing .
Desired Candidate Profile
- 5+ years of experience as a Data Engineer, working with Azure and Databricks, ideally with exposure to ML/AI-related data workflows .
- College degree that demonstrates your analytic abilities, such as Econometrics, Computer Sciences, Mathematics or similar;
- Excellent analytical and problem-solving skills;
- Experience with data preparation for ML/AI : managing large datasets, feature engineering, and real-time or batch data pipelines.
- Familiarity with MLOps concepts and how data engineering supports model lifecycle management.
- Experience with orchestration frameworks (Airflow, Prefect, or Azure Data Factory) for complex ML pipelines .
- Knowledge of unstructured data processing (text, images, logs) is a plus.
- Strong SQL and Python skills; experience with distributed data processing (PySpark, Dask, etc.) is a plus.