وصف الوظيفة
الأدوار والمسؤوليات
نبحث عن مهندس منصة سحابية عالي الحافز للانضمام إلى فريق الهندسة السحابية لدينا. المرشح المثالي شغوف بموثوقية البيانات، الأداء، وخدمات الدعم القابلة للتوسع. يركز هذا الدور على الموثوقية، الأداء، التشغيل، الأتمتة، والتحسين المستمر لخدمات الدعم الحيوية مثل MySQL و PostgreSQL و MongoDB و Elasticsearch/OpenSearch و Kafka وقواعد البيانات التحليلية (مثل StarRocks و ClickHouse) وغيرها من تقنيات قواعد البيانات والرسائل عبر بيئات سحابية-محلية وهجينة. هذا ليس دور DBA تقليدي. يفهم المرشح المثالي الأنظمة الموزعة وKubernetes والمنصات السحابية، والأتمتة، والبنية كرمز، والمراقبة، وتدفقات العمل المساعدة بالذكاء الاصطناعي، ويمكنه مساعدة فرق هندسة المنتج على استخدام خدمات الدعم بشكل آمن وفعال.
ما ستفعله
موثوقية البيانات وتشغيل خدمات الدعم
- ملكية الموثوقية، الأداء، القابلية للتوسع، والصحة التشغيلية لمنصات MySQL و PostgreSQL و MongoDB و Elasticsearch/OpenSearch و Kafka و StarRocks و ClickHouse وغيرها من المنصات المماثلة.
- تحديد أفضل الممارسات لكيفية استخدام فرق هندسة المنتج للمنصات المعاملية والوثائقية وعمليات البحث والرسائل والتحليلات.
- تصميم وصيانة خدمات منصة عالية التوفر، قابلة للتوسع، ومرنة، بما في ذلك التكرار، النسخ الاحتياطي، الاسترداد، الفشل التلقائي، وتدابير استعادة الكوارث.
- إجراء تخطيط السعة، ضبط الأداء، مراجعات الأحمال، الترقيات، التحديثات، وإدارة دورة حياة خدمات المنصة.
- تحديد وحل المخاطر مثل الاستعلامات البطيئة، الأقسام الساخنة، تآخر المستهلك، تآخر النسخ، نمو الفهارس، مشاكل الاحتفاظ، وإشباع التخزين.
- استكشاف وحل قضايا الإنتاج المعقدة المتعلقة بقاعدة البيانات وأنظمة الرسائل ومنصات البحث والمنصات البيانات الموزعة.
هندسة Kubernetes والمنصة السحابية
- خبرة عملية في نشر وتشغيل وتشخيص بيئات تعمل بعبء حالة في بيئات قائمة على Kubernetes.
- فهم قوي لأساسيات Kubernetes، بما في ذلك الشبكات والتخزين وإدارة دورة حياة الأحمال ومفاهيم القابلية للتوسع والموثوقية.
- يمكنه تمكين ودعم عمليات نشر قائمة على Kubernetes لقاعدة البيانات والرسائل ومنصات البحث والتحليلات باستخدام أنماط قائمة على السحابة وممارسات تشغيلية أفضل.
الأتمتة وتمكين المنصة
- استخدام الأتمتة وInfrastructure as Code وGitOps وCI/CD لجعل خدمات الدعم قابلة لإعادة الاستخدام وموثوقة وأسهل في التشغيل.
- المساهمة في قدرات منصة ذاتية الخدمة، والحواجز الآمنة، ولوحات التحكم، والتنبيهات، وكتب التشغيل، وفحوص جاهزية الإنتاج.
- استخدام تدفقات العمل عبر الذكاء الاصطناعي عند الحاجة لفرز الحوادث، وتحليل السبب الجذري، وتحليل الاستعلام، وتوقع السعة، والتوثيق، ودعم المطورين.
- التعاون مع فرق Product Engineering، وSRE، والأمن، وهندسة البيانات، وفرق منصة السحابة لتحسين الموثوقية والأداء والتوافر وموقف الأمن.
الملف الشخصي المرغوب للمرشح
- من 4 إلى 7 سنوات خبرة في هندسة المنصة، SRE، هندسة موثوقية قواعد البيانات، هندسة منصة البيانات، DevOps، أو أدوار ذات صلة.
- خبرة عملية قوية مع MySQL و PostgreSQL و Kafka وعلى الأقل أحد MongoDB أو Elasticsearch/OpenSearch في بيئات الإنتاج.
- الخبرة في منصات البيانات التحليلية أو الموزعة مثل StarRocks و ClickHouse و Apache Doris و Druid و Pinot أو أنظمة OLAP المماثلة مرغوبة بشدة.
- خبرة عملية في تشغيل أحمال حالة في بيئات قائمة على Kubernetes.
- فهم جيد لمفاهيم التوفر العالي والتكرار والنسخ الاحتياطي والاسترداد والتخطيط السعوي وتحسين الأداء.
- الع familiarity مع مفاهيم الأنظمة الموزعة بما في ذلك التقسيم والتكرار والتجزئة والاتساق والضغط الخلفي وتآخر المستهلك وتحسين الاستعلام.
- خبرة مع منصة سحابية واحدة على الأقل (AWS، GCP، أو OCI).
- خبرة في أتمتة التوفير والنشر والتكوين والمراقبة وإدارة دورة الحياة باستخدام أدوات مثل Terraform وHelm وAnsible وGitOps أو أطر أتمتة مشابهة.
- مهارات برمجة أو كتابة سكربتات قوية في Python وBash وGo أو ما شابه.
- خبرة مع منصات الرصد مثل LTGM وPrometheus/Grafana وELK/OpenSearch وDatadog أو ما يعادلها.
- مهارات استكشاف الأخطاء وحلها، التفكير التحليلي، وتصحيح المشاكل عبر الأنظمة الموزعة.
- اتصالات ممتازة، تعاون، ومهارات التوثيق.
- فضول مُظهَر، وملكـية العمل، والقدرة على التكيّف وتوجيه فرق هندسة المنتج.
- المؤهلات المفضلة: خبرة في تصميم وتشغيل أو تحسين منصات قواعد بيانات موزعة كبيرة النطاق، رسائل، بحث أو تحليل.
- خبرة في تشغيل أو تحسين قواعد البيانات التحليلية وأنظمة OLAP مثل StarRocks وClickHouse وApache Doris وDruid وPinot.
- خبرة في منصات البث والبيانات في الوقت الحقيقي باستخدام تقنيات مثل Kafka وFlink وSpark وCDC أو بيئات مشابهة.
- التعرّف على Analytics وData Engineering ومنصات AI/ML وتطبيقات قائمة على LLM أو مشاريع بنية تحتية للذكاء الاصطناعي.
- خبرة في استخدام أدوات أو وكلاء مساعديAI لتحسين العمليات، الاستكشاف، التوثيق، أو خدمة المطورين الذاتية.
- المعرفة المعاصرة بهندسة البيانات الحديثة وتنسيقات الجدول المفتوحة مثل Apache Iceberg وDelta Lake أو Apache Hudi يعتبر ميزة قوية.
- خبرة بممارسات GitOps وخطوط CI/CD ومنهجيات هندسة المنصات الحديثة.
- شهادات ذات صلة في منصات السحابة، Kubernetes، تقنيات قواعد البيانات، أو هندسة البيانات تعتبر ميزة إضافية.
Job Description
Roles & Responsibilities
We are looking for a highly motivated Cloud Platform Engineer to join our Cloud Engineering team. The ideal candidate is passionate about data reliability, performance, and scalable backing services. This role focuses on the reliability, performance, operation, automation, and continuous improvement of critical backing services such as MySQL, PostgreSQL, MongoDB, Elasticsearch/OpenSearch, Kafka, analytical databases (e.g., StarRocks, ClickHouse), and other database and messaging technologies across cloud-native and hybrid environments. This is not a traditional DBA role. The ideal candidate understands distributed systems, Kubernetes, cloud platforms, automation, IaC, observability, and AI-assisted workflows, and can help product engineering teams use backing services safely and effectively.
What you'll do
Data Reliability & Backing Services Operations
- Own reliability, performance, scalability, and operational health of MySQL, PostgreSQL, MongoDB, Elasticsearch/OpenSearch, Kafka, StarRocks, ClickHouse, and similar platforms.
- Define best practices for how product engineering teams use transactional, document, search, messaging, and analytical platforms.
- Design and maintain highly available, scalable, and resilient platform services, including replication, backup, recovery, failover, and disaster recovery capabilities.
- Perform capacity planning, performance tuning, workload reviews, upgrades, patching, and lifecycle management for platform services.
- Identify and resolve risks such as slow queries, hot partitions, consumer lag, replication lag, index growth, retention issues, and storage saturation.
- Troubleshoot and resolve complex production issues related to databases, messaging systems, search platforms, and distributed data platforms.
Kubernetes & Cloud Platform Engineering
- Hands-on experience deploying, operating, and troubleshooting stateful workloads in Kubernetes-based environments.
- Strong understanding of Kubernetes fundamentals, including networking, storage, workload lifecycle management, scalability, and reliability concepts.
- Enable and support Kubernetes-based deployments of database, messaging, search, and analytical platforms using cloud-native patterns and operational best practices.
Automation & Platform Enablement
- Use automation, Infrastructure as Code, GitOps, and CI/CD to make backing services repeatable, reliable, and easier to operate.
- Contribute to self-service platform capabilities, guardrails, dashboards, alerts, runbooks, and production readiness checks.
- Use AI-assisted workflows where appropriate for incident triage, root cause analysis, query analysis, capacity forecasting, documentation, and developer support.
- Collaborate with Product Engineering, SRE, Security, Data Engineering, and Cloud Platform teams to improve reliability, performance, availability, and security posture.
Desired Candidate Profile
- 4-7 years of experience in Platform Engineering, SRE, Database Reliability Engineering, Data Platform Engineering, DevOps, or related roles.
- Strong hands-on experience with MySQL, PostgreSQL, Kafka, and at least one of MongoDB or Elasticsearch/OpenSearch in production environments.
- Experience with analytical or distributed data platforms such as StarRocks, ClickHouse, Apache Doris, Druid, Pinot, or similar OLAP systems is highly desirable.
- Hands-on experience operating stateful workloads in Kubernetes-based environments.
- Good understanding of high availability, replication, backup and recovery, disaster recovery, capacity planning, and performance tuning concepts.
- Familiarity with distributed systems concepts including sharding, replication, partitioning, consistency, compaction, backpressure, consumer lag, and query optimization.
- Experience with at least one major cloud platform (AWS, GCP, or OCI).
- Experience automating provisioning, deployment, configuration, monitoring, and lifecycle management using tools such as Terraform, Helm, Ansible, GitOps, or similar automation frameworks.
- Strong scripting or programming skills in Python, Bash, Go, or similar.
- Experience with observability platforms such as LTGM, Prometheus/Grafana, ELK/OpenSearch, Datadog, or equivalent.
- Strong troubleshooting, problem-solving, and debugging skills across distributed systems.
- Excellent communication, collaboration, and documentation skills.
- Demonstrated curiosity, ownership mindset, adaptability, and ability to guide product engineering teams.
- Preferred Qualifications Experience designing, operating, or optimizing large-scale distributed database, messaging, search, or analytics platforms.
- Experience operating or optimizing analytical databases and OLAP systems such as StarRocks, ClickHouse, Apache Doris, Druid, or Pinot.
- Experience with streaming and real-time data platforms leveraging technologies such as Kafka, Flink, Spark, CDC, or similar ecosystems.
- Exposure to Analytics, Data Engineering, AI/ML platforms, LLM-based applications, or AI infrastructure projects.
- Experience using AI-assisted tooling or agents to improve operations, troubleshooting, documentation, or developer self-service.
- Familiarity with modern data architectures and open table formats such as Apache Iceberg, Delta Lake, or Apache Hudi is a strong plus.
- Experience with GitOps practices, CI/CD pipelines, and modern platform engineering methodologies.
- Relevant certifications in Cloud Platforms, Kubernetes, Database Technologies, or Data Engineering are a plus.