مهندس بيانات رئيسي
نبذة عن الدور: تبحث شركة Intellias عن مهندس بيانات رئيسي للانضمام إلى مبادرة رعاية صحية رقمية واسعة النطاق تركز على بناء أسس البيانات والذكاء الاصطناعي التي تدعم تجارب الرعاية الصحية الشخصية. هذا دور مساهم فردي على مستوى رئيسي لمهندس يجمع بين الخبرة العميقة في هندسة البيانات والتفكير في الأنظمة الموزعة، وتطوير الواجهات الخلفية، والقيادة التقنية. ستقوم بتصميم وبناء بنية تحتية للبيانات قابلة للتوسع، وحل تحديات هندسية معقدة عبر المنصات، وإنشاء أنماط ومعايير تقنية يتم اعتمادها عبر فرق هندسية متعددة. الدور عملي للغاية مع تطلبه أيضًا القدرة على تقديم التوجيه التقني، وتوجيه المهندسين ذوي الخبرة، والتأثير على الهندسة المعمارية عبر المنصة الأوسع.
نظرة عامة على المشروع: يقوم المشروع ببناء منصة بيانات رعاية صحية قائمة على معيار FHIR تدمج البيانات من السجلات الصحية الإلكترونية، وتطبيقات الرعاية الصحية، والأجهزة القابلة للارتداء، والبوابات، ومصادر أخرى لتمكين تجارب رعاية صحية متصلة وشخصية. تدعم المنصة: معالجة البيانات في الوقت الفعلي وعلى دفعات، وأعباء العمل التشغيلية والتحليلية، وقابلية التشغيل البيني للرعاية الصحية، وقدرات المنتجات كثيفة البيانات، وحالات استخدام تعلم الآلة والذكاء الاصطناعي، وبنية تحتية للبيانات سحابية قابلة للتوسع.
تتضمن البيئة التكنولوجية Python وPySpark وApache Spark وKafka وDuck DB وPrefect/Airflow وFast API وMongo DB وDocker وKubernetes والبنية التحتية السحابية الأصلية. التحدي الهندسي الأساسي هو بناء أسس بيانات آمنة وموثوقة وقابلة للتوسع قادرة على معالجة بيانات الرعاية الصحية غير المتجانسة مع دعم هندسة المنتج والتحليلات وتعلم الآلة وقدرات الذكاء الاصطناعي الناشئة.
ما ستفعله: تصميم وتنفيذ حلول لتحديات هندسة البيانات والأنظمة الموزعة واسعة النطاق والغامضة. هندسة وبناء وتطوير بنية تحتية للبيانات في الوقت الفعلي وعلى دفعات لدعم أعباء العمل التشغيلية والتحليلية والذكاء الاصطناعي/تعلم الآلة. تصميم وتوسيع نطاق خطوط أنابيب البيانات المستندة إلى الأحداث باستخدام تقنيات مثل Kafka وSpark وPySpark. بناء خدمات الواجهة الخلفية للإنتاج وواجهات برمجة التطبيقات باستخدام Python وFast API لدعم قدرات البيانات والمنصة. تحديد مناهج قابلة للتوسع لاستيعاب البيانات وتحويلها ونمذجتها والتحقق منها وتخزينها وتسليمها. تصميم معماريات بيانات تعالج تطور المخطط، وجودة البيانات، وتكامل البيانات غير المتجانسة، وقابلية التوسع، والموثوقية التشغيلية. إنشاء ودعم المعايير التقنية، والأنماط المعمارية، وأفضل الممارسات الهندسية، ومكونات المنصة القابلة لإعادة الاستخدام. العمل كمرجع تقني عبر الفرق لأنظمة البيانات، والمعالجة الموزعة، وخطوط الأنابيب، ومعمارية المنصة. تحسين الموثوقية وقابلية التوسع والأداء وكفاءة التكلفة للبنية التحتية للبيانات. تنفيذ مراقبة وتسجيل وتنبيه قوي عبر أنظمة البيانات الموزعة. تصميم أنظمة مع وضع الأمن والخصوصية والامتثال للرعاية الصحية وقابلية التوسع في الاعتبار منذ البداية. تحسين سير العمل الهندسي، وخطوط CI/CD، والاختبار الآلي، وممارسات النشر في الإنتاج. التعاون الوثيق مع فرق المنتج، والذكاء الاصطناعي/تعلم الآلة، والمنصة، والبنية التحتية، وفرق هندسة التطبيقات لتطوير قدرات البيانات المشتركة. توفير التوجيه التقني من خلال مراجعات الهندسة المعمارية، ومناقشات التصميم، والاقتران، وتبادل المعرفة. تقييم تقنيات البيانات والذكاء الاصطناعي الناشئة وإدخالها حيث توفر تحسينات ملموسة لقدرات المنصة أو الكفاءة الهندسية. البقاء على اتصال بهندسة الإنتاج، والتحقق من القرارات المعمارية من خلال التنفيذ والخبرة التشغيلية.
ما تجلبه: المؤهلات المطلوبة: 5+ سنوات من الخبرة المهنية في هندسة البرمجيات والبيانات، بما في ذلك 3 سنوات على الأقل في العمل مع أنظمة البيانات الموزعة واسعة النطاق. خبرة عميقة في تصميم وبناء منصات بيانات قابلة للتوسع، وخطوط أنابيب، وأنظمة معالجة موزعة. كفاءة عملية قوية في Python، مع خبرة في الإنتاج باستخدام تقنيات ومكتبات مثل PySpark وPandas وFast API. خبرة قوية مع Apache Spark/PySpark ومعالجة البيانات الموزعة على نطاق واسع. خبرة في تصميم وتنفيذ خطوط أنابيب البيانات في الوقت الفعلي وعلى دفعات باستخدام Kafka أو Spark أو تقنيات معالجة موزعة مماثلة. فهم قوي لمعمارية البيانات، ونمذجة البيانات، وتطور المخطط، وجودة البيانات، وتكامل البيانات غير المتجانسة. خبرة في تقنيات تنسيق سير العمل مثل Prefect أو Apache Airflow أو ما يعادلها. خبرة في بناء خدمات الواجهة الخلفية للإنتاج وواجهات برمجة التطبيقات التي تدعم قدرات البيانات والمنصة. مهارات SQL قوية وخبرة عملية مع تقنيات تخزين البيانات الحديثة، بما في ذلك قواعد البيانات العلائقية وNoSQL مثل Mongo DB. فهم قوي لمبادئ الأنظمة الموزعة، بما في ذلك القابلية للتوسع، والموثوقية، وتحمل الأخطاء، والاتساق، والأداء. خبرة في تصميم وتنفيذ المراقبة والتسجيل والتنبيه لأنظمة البيانات الموزعة. خبرة هندسية قوية في السحابة الأصلية، بما في ذلك Docker وKubernetes وCI/CD وممارسات النشر في الإنتاج. قدرة مثبتة على تصميم حلول بشكل مستقل لمشاكل هندسية غامضة وواسعة النطاق تمتد عبر أنظمة وفرق متعددة. خبرة مثبتة في إنشاء المعايير التقنية، والأنماط الهندسية، وممارسات التطوير، وقدرات المنصة القابلة لإعادة الاستخدام. مهارات قيادة تقنية قوية، بما في ذلك خبرة في توجيه المهندسين كبار السن، وإجراء مراجعات التصميم، والتأثير على الهندسة المعمارية دون سلطة رسمية لإدارة الأفراد. فهم قوي لمبادئ الأمن والخصوصية وحماية البيانات لمنصات بيانات الإنتاج. إجادة اللغة الإنجليزية المهنية الكافية للتعاون المباشر مع فرق الهندسة والمنتج والذكاء الاصطناعي والمنصة في الولايات المتحدة. درجة البكالوريوس في علوم الكمبيوتر أو الهندسة أو مجال ذي صلة.
مؤهلات إضافية: خبرة مع FHIR أو HL7 أو C-CDA أو معايير التشغيل البيني للرعاية الصحية الأخرى. خبرة سابقة في الرعاية الصحية أو تكنولوجيا الصحة أو بيئة بيانات منظمة أخرى. فهم متطلبات HIPAA أو HITECH أو متطلبات خصوصية وامتثال البيانات المماثلة. خبرة في نشر أو دعم نماذج اللغات الكبيرة (LLMs) أو نماذج تعلم الآلة أو منتجات البيانات التي تدعمها الذكاء الاصطناعي أو الأنظمة المستندة إلى الاسترجاع. خبرة في بناء بنية تحتية للبيانات تدعم أعباء عمل تعلم الآلة/الذكاء الاصطناعي واستنتاج الإنتاج. خبرة عملية مع تقنيات المراقبة مثل Open Telemetry أو Datadog أو Prometheus أو منصات مماثلة. خبرة مع Duck DB أو تقنيات معالجة البيانات التحليلية الحديثة. خبرة مع أدوات الهندسة المدعومة بالذكاء الاصطناعي مثل Claude Code أو Git Hub Copilot أو Cursor أو حلول مماثلة. مساهمات في مشاريع مفتوحة المصدر أو مبادرات هندسية متاحة للجمهور.
لماذا تنضم إلى هذه المبادرة؟ يوفر هذا الدور الفرصة لتشكيل أسس البيانات والذكاء الاصطناعي لمنصة رعاية صحية حديثة تعمل على نطاق واسع. ستعمل على تحديات تقنية معقدة تشمل: معالجة البيانات الموزعة، والهندسة المعمارية المستندة إلى الأحداث، وخدمات الواجهة الخلفية، والبنية التحتية السحابية الأصلية، وقابلية التشغيل البيني للرعاية الصحية، ومعمارية منصة البيانات، وتمكين الذكاء الاصطناعي/تعلم الآلة. بصفتك مساهمًا فرديًا على مستوى رئيسي، سيمتد تأثيرك إلى ما هو أبعد من الخدمات أو خطوط الأنابيب الفردية. ستنشئ أنماطًا معمارية، وتؤثر على القرارات التقنية عبر الفرق، وتوجه المهندسين ذوي الخبرة، وتساعد في تحديد كيفية بناء وتشغيل المؤسسة الهندسية الأوسع للأنظمة كثيفة البيانات. في الوقت نفسه، يعد هذا دورًا هندسيًا عمليًا في الأساس. ستقوم بتصميم الأنظمة، وبناء المكونات المهمة، والتحقق من القرارات المعمارية من خلال الكود، والبقاء على اتصال وثيق بكيفية عمل الأنظمة في الإنتاج. هذا المنصب مناسب بشكل خاص لمهندس يرغب في الجمع بين الخبرة التقنية العميقة والتأثير الهندسي على مستوى المؤسسة مع بناء بنية تحتية للبيانات تمكن بشكل مباشر من منتجات رعاية صحية أفضل وقدرات ذكاء اصطناعي ناشئة.
Staff Data Engineer
About the Role Intellias is looking for a Staff Data Engineer to join a large-scale digital healthcare initiative focused on building the data and AI foundations that power personalized healthcare experiences. This is a Staff-level Individual Contributor role for an engineer who combines deep data engineering expertise with distributed systems thinking, backend development, and technical leadership. You will design and build scalable data infrastructure, solve complex cross-platform engineering challenges, and establish technical patterns and standards adopted across multiple engineering teams. The role is highly hands-on while also requiring the ability to provide technical direction, mentor experienced engineers, and influence architecture across the broader platform.
Project Overview The project is building a FHIR-based healthcare data platform that integrates data from EHRs, healthcare applications, wearables, portals, and other sources to enable connected and personalized healthcare experiences. The platform supports:Real-time and batch data processing Operational and analytical workloads Healthcare interoperability Data-intensive product capabilities Machine learning and AI use cases Scalable, cloud-native data infrastructure
The technology landscape includes Python, PySpark, Apache Spark, Kafka, Duck DB, Prefect/Airflow, Fast API, Mongo DB, Docker, Kubernetes, and cloud-native infrastructure. The core engineering challenge is to build secure, reliable, and scalable data foundations capable of processing heterogeneous healthcare data while supporting product engineering, analytics, machine learning, and emerging AI capabilities.
What You’ll DoDesign and implement solutions for large-scale, ambiguous data engineering and distributed-systems challenges. Architect, build, and evolve real-time and batch data infrastructure supporting operational, analytical, and AI/ML workloads. Design and scale event-driven data pipelines using technologies such as Kafka, Spark, and PySpark. Build production backend services and APIs using Python and Fast API to support data and platform capabilities. Define scalable approaches to data ingestion, transformation, modeling, validation, storage, and delivery. Design data architectures that address schema evolution, data quality, heterogeneous data integration, scalability, and operational reliability. Establish and champion technical standards, architectural patterns, engineering best practices, and reusable platform components. Serve as a cross-team technical authority for data systems, distributed processing, pipelines, and platform architecture. Improve the reliability, scalability, performance, and cost efficiency of data infrastructure. Implement robust observability, logging, monitoring, and alerting across distributed data systems. Design systems with security, privacy, healthcare compliance, and scalability built in from the beginning. Improve engineering workflows, CI/CD pipelines, automated testing, and production deployment practices. Collaborate closely with Product, ML/AI, Platform, Infrastructure, and application engineering teams to develop shared data capabilities. Provide technical mentorship through architecture reviews, design discussions, pairing, and knowledge sharing. Evaluate emerging data and AI technologies and introduce them where they provide measurable improvements to platform capabilities or engineering efficiency. Remain hands-on with production engineering, validating architectural decisions through implementation and operational experience.
What You Bring Required Qualifications5+ years of professional software and data engineering experience, including at least 3 years working with large-scale distributed data systems. Deep expertise designing and building scalable data platforms, pipelines, and distributed processing systems. Strong hands-on proficiency in Python, with production experience using technologies and libraries such as PySpark, Pandas, and Fast API. Strong experience with Apache Spark/PySpark and distributed data processing at scale. Experience designing and implementing real-time and batch data pipelines using Kafka, Spark, or comparable distributed processing technologies. Strong understanding of data architecture, data modeling, schema evolution, data quality, and heterogeneous data integration. Experience with workflow orchestration technologies such as Prefect, Apache Airflow, or equivalent. Experience building production backend services and APIs supporting data and platform capabilities. Strong SQL skills and hands-on experience with modern data storage technologies, including relational and NoSQL databases such as Mongo DB. Strong understanding of distributed systems principles, including scalability, reliability, fault tolerance, consistency, and performance. Experience designing and implementing observability, logging, monitoring, and alerting for distributed data systems. Strong cloud-native engineering experience, including Docker, Kubernetes, CI/CD, and production deployment practices. Proven ability to independently design solutions for ambiguous, large-scale engineering problems spanning multiple systems and teams. Demonstrated experience establishing technical standards, engineering patterns, development practices, and reusable platform capabilities. Strong technical leadership skills, including experience mentoring senior engineers, conducting design reviews, and influencing architecture without formal people-management authority. Strong understanding of security, privacy, and data protection principles for production data platforms. Professional English proficiency sufficient for direct collaboration with U. S.-based engineering, product, ML, and platform teams. Bachelor's degree in computer science, Engineering, or a related field.
Nice to Have Experience with FHIR, HL7, C-CDA, or other healthcare interoperability standards. Previous experience in healthcare, Health Tech, or another regulated data environment. Understanding of HIPAA, HITECH, or comparable data privacy and compliance requirements. Experience deploying or supporting LLMs, ML models, AI-enabled data products, or retrieval-based systems. Experience building data infrastructure supporting ML/AI workloads and production inference. Hands-on experience with observability technologies such as Open Telemetry, Datadog, Prometheus, or similar platforms. Experience with Duck DB or modern analytical data-processing technologies. Experience with AI-assisted engineering tools such as Claude Code, Git Hub Copilot, Cursor, or comparable solutions. Contributions to open-source projects or publicly available engineering initiatives.
Why Join This Initiative? This role offers the opportunity to shape the data and AI foundations of a modern healthcare platform operating at significant scale. You will work on technically complex challenges spanning:Distributed data processing Event-driven architectures Backend services Cloud-native infrastructure Healthcare interoperability Data platform architecture AI/ML enablement
As a Staff-level Individual Contributor, your impact will extend well beyond individual services or pipelines. You will establish architectural patterns, influence technical decisions across teams, mentor experienced engineers, and help define how the broader engineering organization builds and operates data-intensive systems. At the same time, this is fundamentally a hands-on engineering role. You will design systems, build critical components, validate architectural decisions through code, and remain closely connected to how systems behave in production. This position is particularly well suited for an engineer who wants to combine deep technical expertise with organization-wide engineering influence while building data infrastructure that directly enables better healthcare products and emerging AI capabilities.