📍 المملكة العربية السعودية تحديث مستمر على مدار الساعة وظائف تناسب سيرتك الذاتيةمجاناً قناة تيليجرام

وظيفة مهندس ميداني لضمان الذكاء الاصطناعي شاغرة لدى Systems Limited في السعودية

Forward Deployed Engineer - AI Assurance
🕒 نُشرت: (منذ 8 أيام) 📍 السعودية وظائف الهندسة والتقنية

تفاصيل الوظيفة

Systems Limited تعلن عن وظيفة Forward Deployed Engineer - AI Assurance في السعودية.

نبذة عن الوظيفة

يتولى شاغل هذه الوظيفة مسؤولية جودة التطبيقات المعتمدة على الذكاء الاصطناعي (AI-native)، بما في ذلك الاختبارات الوظيفية والتقييم الخاص بالذكاء الاصطناعي (الدقة، الانحراف، الهلوسة).

المهام والمسؤوليات

  • بناء خطط اختبار وأتمتة لميزات التطبيقات المعتمدة على الذكاء الاصطناعي (وظيفي + خاص بالذكاء الاصطناعي).
  • تصميم أدوات تقييم لمخرجات النماذج/العوامل من حيث الدقة، والثبات، ومعدل الهلوسة.
  • إجراء اختبارات الانحدار عبر تغييرات النموذج/الموجه/الإعدادات لاكتشاف الانحراف الصامت في الجودة.
  • اختبار ميزات الذكاء الاصطناعي من منظور الفريق الأحمر (Red Teaming) للحالات الحدودية والمدخلات الخصومية عند الاقتضاء.
  • بناء خطوط تقييم آلية مدمجة في CI/CD.
  • التعاون مع مهندسي الذكاء الاصطناعي لتحديد متطلبات قابلية الاختبار قبل بدء البناء.
  • امتلاك بوابة الجودة قبل إطلاق أي ميزة ذكاء اصطناعي إلى الإنتاج.
  • إبلاغ قادة التسليم بمخاطر الجودة بلغة قابلة للتنفيذ.
  • تدريب فرق التسليم على ممارسات اختبار الذكاء الاصطناعي المتخصصة.
  • امتلاك إطار التقييم للممارسة - مجموعات بيانات ذهبية، معايير تسجيل، معايرة LLM-as-judge، ومراجع معيارية مُرقَّمة لكل حالة استخدام.
  • تحديد عتبات قبول التقييم لكل تعاقد وربط إصدارات المنتج بها.
  • بناء أدوات هندسة التقييم - تنظيم مجموعة البيانات، التقاط التتبع، تشغيل تقييمات غير متصلة/متصلة، ولوحات معلومات تستطيع فرق التسليم قراءتها.
  • تقييم الإنتاج ومراقبة الانحراف، مع تغذية حالات الفشل مرة أخرى في مجموعات البيانات الذهبية.

الشروط والمتطلبات

  • خبرة 5-9 سنوات في اختبار/هندسة الجودة، منها أكثر من سنتين في اختبار الميزات المعتمدة على الذكاء الاصطناعي/التعلم الآلي تحديداً.
  • مهارات قوية في أتمتة الاختبار (أطر عمل قائمة على بايثون، تكامل مع CI/CD).
  • فهم أنماط الفشل الخاصة بالذكاء الاصطناعي - الهلوسة، الانحياز، الانحراف، اللاحتمية - وتصميم اختبارات لها.
  • إلمام إحصائي كافٍ لتفسير مقاييس تقييم النموذج (وليس فقط نتائج نجاح/فشل).
  • دراية بمنهجيات اختبار الفريق الأحمر لأنظمة الذكاء الاصطناعي.
  • مُخاطِب واضح وحازم - مستعد لعرقلة إصدار بسبب قلق جودة.
  • دقيق في التفاصيل ومنهجي تحت ضغط مواعيد التسليم.
  • متَعاون لكن مستقل - لا يمرر الأمور تحت ضغط التسليم.
  • يشرح مخاطر الجودة بلغة تأثير الأعمال، وليس مجرد مصطلحات تقنية.
  • خبرة عملية في هندسة التقييم - بناء وصيانة مجموعات تقييم باستخدام أطر مثل OpenAI Evals, Ragas, DeepEval, LangSmith, Azure AI Foundry evaluations.
  • تصميم مجموعات بيانات ذهبية ومعايير تسجيل، ومعايرة تسجيل LLM-as-judge مقابل المراجعة البشرية.
  • فهم مقاييس تقييم RAG والوكلاء (الاستناد، دقة/استدعاء الاسترجاع، إتمام المهمة، صحة استدعاء الأداة، التكلفة/زمن الاستجابة).
  • خبرة في توصيل التقييم ومراقبة الانحراف مع CI/CD ومراقبة الإنتاج.
عرض النص الأصلي للإعلان

ABOUT:

Owns quality for AI-native applications - functional testing plus the AI-specific evaluation (accuracy, drift, hallucination).


KEY RESPONSIBILITIES

  • Build test plans and automation for AI-native application features (functional + AI-specific)
  • Design evaluation harnesses for model/agent outputs - accuracy, consistency, hallucination rate
  • Run regression testing across model/prompt/config changes to catch silent quality drift
  • Red-team AI features for edge cases and adversarial inputs where relevant
  • Build automated eval pipelines integrated into CI/CD
  • Partner with AI Architects to define testability requirements before build starts
  • Own the quality gate before any AI feature ships to production
  • Communicate quality risk to delivery leadership in terms they can act on
  • Train delivery teams on AI-specific testing practices
  • Own the evals framework for the practice - golden datasets, scoring rubrics, LLM-as-judge calibration, and versioned benchmarks per use case
  • Define eval acceptance thresholds per engagement and gate releases on them
  • Build eval engineering tooling - dataset curation, trace capture, offline/online eval runs, and dashboards delivery teams can read
  • Instrument production evals and drift monitoring, feeding failures back into the golden datasets


REQUIREMENTS & SKILLS

  • 5-9 yrs QA/test engineering, with 2+ yrs testing AI/ML-powered features specifically
  • Strong test automation skills (Python-based frameworks, CI/CD integration)
  • Understands AI-specific failure modes - hallucination, bias, drift, non-determinism - and designs tests for them
  • Statistically literate enough to interpret model evaluation metrics, not just pass/fail results
  • Familiarity with red-teaming methodologies for AI systems
  • Clear, assertive communicator - willing to block a release over a quality concern
  • Detail-oriented and methodical under delivery-timeline pressure
  • Collaborative but independent - doesn't rubber-stamp under delivery pressure
  • Explains quality risk in business-impact terms, not just technical jargon
  • Hands-on evals engineering - builds and maintains eval suites with frameworks such as OpenAI Evals, Ragas, DeepEval, LangSmith, Azure AI Foundry evaluations
  • Designs golden datasets and rubrics, and calibrates LLM-as-judge scoring against human review
  • Understands RAG and agent eval metrics - groundedness, retrieval precision/recall, task completion, tool-call correctness, cost/latency
  • Experience wiring evals and drift monitoring into CI/CD and production observability


المصدر: LinkedIn - أُضيفت للموقع في 2 سبتمبر 2026
رقم الإعلان لدى المصدر: 4462171417