وصف الوظيفة
الأدوار والمسؤوليات
كجزء من تعزيز فرق البيانات لدينا، نبحث عن ملفات تعريف قادرة على تصميم وتطوير وتبسيط منصات البيانات (دفعات وبث حي) ضمن بيئات موزعة تعتمد على Cloudera.
مسؤولياتك:
- التطوير والتصنيع
- تطوير خطوط معالجة بيانات ضخمة في PySpark (وضعيات الدُفعات والبث المباشر).
- إعداد تدفقات حية عبر Kafka (المواضيع، الأقسام، المخططات، الإزاحات) وضمان الالتقاط باستخدام NiFi.
- تصميم وتحسين مخططات NoSQL، وخاصة على Cassandra (الجداول، المفاتيح، التجميع، النسخ المتماثل) و Hive.
- دمج وتحويل البيانات من مصادر متعددة ( APIs، قواعد البيانات، التدفقات، الملفات).
- الجودة، الأداء والاعتمادية
- نشر آليات جودة البيانات (الضوابط، المراقبة، التنبيه).
- تحسين معالجة Spark (التقسيم، الضبط، تنسيقات البيانات) خصيصًا للهياكل الموزعة.
- لضمان الإشراف وحل الحوادث في بيئة الإنتاج.
- CI/CD والحوكمة
- تصنيع التطورات عبر سلاسل CI/CD (اختبار آلي، نشر).
- توثيق التدفقات والنماذج وأفضل الممارسات.
- التعاون بين الحين والآخر مع فرق طرف ثالث في مواضيع Dataviz والتعاون مع علماء البيانات (خصوصًا في خوارزميات تقسيم العملاء).
- المساهمة في حوكمة البيانات (الفهرس، أثر التتبع، الأمان).
الملف المرشح المطلوب
- الخبرة: حوالي 4 سنوات من الخبرة في بيئات موزعة وهندسة البيانات الكبيرة.
- العمارة: اهتمام قوي وخبرة كبيرة في بنى تحتية On-Premise.
- Spark / PySpark: إجادة أساسية في المعالجة بالدفعات والبث.
- NoSQL: خبرة مؤكدة في Cassandra و/أو Hive
- التدفق والالتقاط: إجادة جيدة جدًا لـ Kafka و NiFi
- مفضل/إضافي: فهم جيد لنظام Hadoop/HDFS. إتقان Cloudera يعد ميزة ولكنه ليس مطلوبًا. معرفة في علم البيانات (نماذج التجميع/تقسيم العملاء) وأدوات تصور البيانات.
- الأدوات وDevOps: مهارات في Git، CI/CD (GitLab CI) وأداة تنظيم (Airflow، Luigi، Prefect).