تكامل القابضة تعلن عن وظيفة مهندس موثوقية المواقع أول في الرياض
Senior Site Reliability Engineer Specialist
تفاصيل الوظيفة
شركة تكامل القابضة تعلن عن وظيفة Senior Site Reliability Engineer Specialist في مدينة الرياض.
المهام والمسؤوليات
- تقديم الدعم لحوادث التطبيقات عبر المنصات الرقمية بالتعاون مع فرق هندسة المنصات وتطوير التطبيقات والدعم الفني لضمان الحل وفقاً لمستويات الخدمة وإجراءات التصعيد.
- تشغيل ومراقبة مجموعة Elastic Observability بما في ذلك صحة Elasticsearch وKibana وFleet Server وAPM Server وElastic Agent المُدارة عبر ECK على OKE.
- المساعدة في عمليات Elasticsearch اليومية مثل إدارة دورة حياة المؤشر (ILM) وإدارة دورة حياة اللقطات (SLM) وصيانة مستويات البيانات (Hot, Warm, Cold, Frozen) ومراقبة السعة.
- استكشاف مشكلات استيعاب بيانات القياس عن بُعد عبر السجلات والمقاييس والتتبعات والمراقبة الاصطناعية، وضمان جمع بيانات متسق من جميع المنصات.
- صيانة وتحديث لوحات معلومات Kibana وقواعد التنبيه والعناصر المحفوظة تحت إشراف مدير SRE.
- إجراء تحليل السبب الجذري والمشاركة في مراجعات ما بعد الحوادث الخالية من اللوم لتحسين موثوقية النظام وتقليل التكرار.
- التعاون مع هندسة المنصات لأتمتة المهام المتكررة وتحسين خطوط النشر وتوسيع تغطية المراقبة باستخدام Terraform وHelm charts والبرمجة النصية.
- تطوير وصيانة وثائق الدعم ودفاتر التشغيل ومقالات قاعدة المعرفة بما يتوافق مع إجراءات الاستجابة الموحدة للحوادث.
- إدارة وترتيب أولويات الحوادث والطلبات عبر نظام التذاكر (Jira/ServiceNow) وضمان توثيق جميع الحوادث والطلبات والحلول في نظام إدارة الخدمات.
- المشاركة في جدول المناوبات والمساعدة في تقليل الأعباء التشغيلية من خلال الأتمتة والأدوات.
- مراقبة مقاييس الأداء الرئيسية المتعلقة بإدارة الحوادث والإبلاغ عنها بما في ذلك متوسط وقت الكشف (MTTD) ومتوسط وقت الحل (MTTR).
- التعاون مع الفرق متعددة الوظائف وشركاء البائعين لتحسين موثوقية النظام الإجمالية ونضج المراقبة والوضع الأمني.
الشروط والمتطلبات
- درجة البكالوريوس في علوم الحاسب أو تقنية المعلومات أو الهندسة أو مجال ذي صلة (أو خبرة معادلة).
- خبرة من 1 إلى 3 سنوات في عمليات تقنية المعلومات أو إدارة الأنظمة أو دعم التطبيقات أو DevOps أو SRE.
المهارات المطلوبة
- الإلمام بأدوات المراقبة مثل Elastic Stack (Elasticsearch, Kibana وغيرها) بما في ذلك الاستعلامات الأساسية واستخدام لوحات المعلومات.
- معرفة أنظمة Linux والبرمجة النصية (Bash, Python, أو Go).
- فهم مفاهيم المراقبة والتسجيل والتنبيه.
- خبرة في أدوات ITSM (ServiceNow, Jira, Zendesk) وممارسات ITIL.
- فهم قوي لإدارة الحوادث والمشكلات والتغيير.
- خبرة أساسية مع البيئات السحابية الأصلية والحاويات مثل Docker وKubernetes.
- مهارات قوية في التفكير النقدي واستكشاف الأخطاء والتواصل.
عرض النص الأصلي للإعلان
Job Description
Job description :
Job description :
- Provide support for application incidents across digital platforms, working closely with Platform Engineering, Application Development, and customer support teams to ensure timely resolution according to established SLAs and escalation procedures.
- Operate and monitor the Elastic Observability stack - including Elasticsearch cluster health, Kibana, Fleet Server, APM Server, and Elastic Agent - deployed and managed via ECK on OKE.
- Assist with day-to-day Elasticsearch operations such as index lifecycle management (ILM), snapshot lifecycle management (SLM), data tier housekeeping (hot, warm, cold, frozen), and capacity monitoring.
- Troubleshoot telemetry ingestion issues across logs, metrics, traces, and synthetic monitors, ensuring consistent data collection from all platforms.
- Maintain and update Kibana dashboards, alerting rules, and saved objects under the guidance of the SRE Manager.
- Perform root cause analysis and participate in blameless post-incident reviews to improve system reliability and reduce recurrence.
- Collaborate with Platform Engineering to automate repetitive tasks, improve deployment pipelines, and enhance observability coverage using Terraform, Helm charts, and scripting.
- Develop and maintain support documentation, runbooks, and knowledge base articles aligned to standardized incident response procedures.
- Manage and prioritize incidents and requests via the ticketing system (Jira/ServiceNow), ensuring all incidents, requests, and resolutions are documented in the service management system.
- Participate in an on-call rotation and help reduce operational toil through automation and tooling.
- Monitor and report on key performance metrics related to incident management, including mean time to detect (MTTD) and mean time to resolve (MTTR).
- Collaborate with cross-functional teams and vendor partners to improve overall system reliability, observability maturity, and security posture.
- Bachelor’s degree in Computer Science, IT, Engineering, or related field (or equivalent experience).
- 1-3 years of experience in IT operations, system administration, application support, DevOps, or SRE.
- Familiarity with Observbility tools such as Elastic Stack (Elasticsearch, Kibana, etc.), including basic querying and dashboard usage.
- Knowledge of Linux systems and scripting (Bash, Python, or Go).
- Understanding of monitoring, logging, and alerting concepts.
- Experience with ITSM tools (ServiceNow, Jira, Zendesk) and ITIL practices.
- Strong grasp of incident, problem, and change management.
- Basic experience with cloud native enviroments and containers such as Docker and Kubernetes.
- Strong critical thinking, troubleshooting, and communication skills.
المصدر: LinkedIn - أُضيفت للموقع في 28 سبتمبر 2026
رقم الإعلان لدى المصدر: 4472708734
رقم الإعلان لدى المصدر: 4472708734