المسؤوليات
- بناء بحيرة بيانات مركزية على خدمات بيانات GCP من خلال دمج مصادر بيانات متنوعة عبر المؤسسة.
- تطوير وصيانة وتحسين خطوط أنابيب معالجة البيانات الدُفعية والتدفقية المعتمدة على Spark. استغلال خدمات بيانات GCP لمهام هندسة البيانات المعقدة وضمان التكامل السلس مع مكونات النظام الأساسي الأخرى.
- تصميم وتنفيذ تحقق من صحة البيانات وفحص جودتها لضمان الدقة والكمال والاتساق عبر سير عمل البيانات لدينا.
- العمل عن كثب مع فريق الذكاء الاصطناعي / التعلم الآلي لتمكين حالات استخدام الذكاء الاصطناعي وبخاصة تلبية احتياجات البيانات لتطوير نماذج التعلم الآلي ومراقبتها.
- التعاون مع فرق متعددة الوظائف، بما في ذلك محللي البيانات ومستخدمين تجاريين آخرين من أقسام العمليات والتسويق والتجاري، لاستخراج رؤى قيمة وتمكين اتخاذ قرارات مبنية على البيانات.
- التعاون مع فرق المنتج لتصميم وتنفيذ وصيانة نماذج البيانات للحالات التحليلية.
- الانخراط في استكشاف التكنولوجيا والبحث، وتطوير PoCs، وإجراء تحقيقات عميقة.
- تصميم وإدارة عمليات ETL/ELT، مع ضمان سلامة البيانات وتوافرها وأدائها.
- استكشاف مشكلات البيانات وإجراء تحليل السبب الجذري عند وجود تقارير عن البيانات.
- العمل على مبادرات متعلقة بالذكاء الاصطناعي التوليدي المرتبطة بأهداف الشركة.
المهارات التقنية المطلوبة
- PySpark - دفعة وتدفّق
- GCP - Dataproc, Dataflow, DataStream, Dataplex, Pub/Sub, BigQuery وCloud Storage
- NoSQL (يفضّل MongoDB)
- لغات البرمجة: Scala/Python
- Great Expectation، أو إطار جودة بيانات مشابه
- الإلمام بأدوات إدارة سير العمل مثل: Airflow، Prefect أو Luigi
- فهم حوكمة البيانات، تخزين البيانات ونمذجة البيانات
- معرفة SQL جيدة
الأعمال
- القدرة على التواصل بشكل فعال، اختزال المعرفة التقنية إلى رسائل مفهومة بشكل موجز/مرئي
- تحديد وتسريع مبادرات تطوير الفريق، ودعم الأعضاء juniors
المهارات المرغوبة
-
- Infrastructure-as-Code، ويفضّل Terraform
- Docker وKubernetes
- Looker
- معرفة في AI / ML الهندسية
- سلسلة أثر البيانات، أو أدوات ذات صلة مثل Atlan