وظيفة مهندس ميداني لضمان الذكاء الاصطناعي شاغرة لدى Systems Limited في السعودية
تفاصيل الوظيفة
Systems Limited تعلن عن وظيفة Forward Deployed Engineer - AI Assurance في السعودية.
نبذة عن الوظيفة
يتولى شاغل هذه الوظيفة مسؤولية جودة التطبيقات المعتمدة على الذكاء الاصطناعي (AI-native)، بما في ذلك الاختبارات الوظيفية والتقييم الخاص بالذكاء الاصطناعي (الدقة، الانحراف، الهلوسة).
المهام والمسؤوليات
- بناء خطط اختبار وأتمتة لميزات التطبيقات المعتمدة على الذكاء الاصطناعي (وظيفي + خاص بالذكاء الاصطناعي).
- تصميم أدوات تقييم لمخرجات النماذج/العوامل من حيث الدقة، والثبات، ومعدل الهلوسة.
- إجراء اختبارات الانحدار عبر تغييرات النموذج/الموجه/الإعدادات لاكتشاف الانحراف الصامت في الجودة.
- اختبار ميزات الذكاء الاصطناعي من منظور الفريق الأحمر (Red Teaming) للحالات الحدودية والمدخلات الخصومية عند الاقتضاء.
- بناء خطوط تقييم آلية مدمجة في CI/CD.
- التعاون مع مهندسي الذكاء الاصطناعي لتحديد متطلبات قابلية الاختبار قبل بدء البناء.
- امتلاك بوابة الجودة قبل إطلاق أي ميزة ذكاء اصطناعي إلى الإنتاج.
- إبلاغ قادة التسليم بمخاطر الجودة بلغة قابلة للتنفيذ.
- تدريب فرق التسليم على ممارسات اختبار الذكاء الاصطناعي المتخصصة.
- امتلاك إطار التقييم للممارسة - مجموعات بيانات ذهبية، معايير تسجيل، معايرة LLM-as-judge، ومراجع معيارية مُرقَّمة لكل حالة استخدام.
- تحديد عتبات قبول التقييم لكل تعاقد وربط إصدارات المنتج بها.
- بناء أدوات هندسة التقييم - تنظيم مجموعة البيانات، التقاط التتبع، تشغيل تقييمات غير متصلة/متصلة، ولوحات معلومات تستطيع فرق التسليم قراءتها.
- تقييم الإنتاج ومراقبة الانحراف، مع تغذية حالات الفشل مرة أخرى في مجموعات البيانات الذهبية.
الشروط والمتطلبات
- خبرة 5-9 سنوات في اختبار/هندسة الجودة، منها أكثر من سنتين في اختبار الميزات المعتمدة على الذكاء الاصطناعي/التعلم الآلي تحديداً.
- مهارات قوية في أتمتة الاختبار (أطر عمل قائمة على بايثون، تكامل مع CI/CD).
- فهم أنماط الفشل الخاصة بالذكاء الاصطناعي - الهلوسة، الانحياز، الانحراف، اللاحتمية - وتصميم اختبارات لها.
- إلمام إحصائي كافٍ لتفسير مقاييس تقييم النموذج (وليس فقط نتائج نجاح/فشل).
- دراية بمنهجيات اختبار الفريق الأحمر لأنظمة الذكاء الاصطناعي.
- مُخاطِب واضح وحازم - مستعد لعرقلة إصدار بسبب قلق جودة.
- دقيق في التفاصيل ومنهجي تحت ضغط مواعيد التسليم.
- متَعاون لكن مستقل - لا يمرر الأمور تحت ضغط التسليم.
- يشرح مخاطر الجودة بلغة تأثير الأعمال، وليس مجرد مصطلحات تقنية.
- خبرة عملية في هندسة التقييم - بناء وصيانة مجموعات تقييم باستخدام أطر مثل OpenAI Evals, Ragas, DeepEval, LangSmith, Azure AI Foundry evaluations.
- تصميم مجموعات بيانات ذهبية ومعايير تسجيل، ومعايرة تسجيل LLM-as-judge مقابل المراجعة البشرية.
- فهم مقاييس تقييم RAG والوكلاء (الاستناد، دقة/استدعاء الاسترجاع، إتمام المهمة، صحة استدعاء الأداة، التكلفة/زمن الاستجابة).
- خبرة في توصيل التقييم ومراقبة الانحراف مع CI/CD ومراقبة الإنتاج.
عرض النص الأصلي للإعلان
ABOUT:
Owns quality for AI-native applications - functional testing plus the AI-specific evaluation (accuracy, drift, hallucination).
KEY RESPONSIBILITIES
- Build test plans and automation for AI-native application features (functional + AI-specific)
- Design evaluation harnesses for model/agent outputs - accuracy, consistency, hallucination rate
- Run regression testing across model/prompt/config changes to catch silent quality drift
- Red-team AI features for edge cases and adversarial inputs where relevant
- Build automated eval pipelines integrated into CI/CD
- Partner with AI Architects to define testability requirements before build starts
- Own the quality gate before any AI feature ships to production
- Communicate quality risk to delivery leadership in terms they can act on
- Train delivery teams on AI-specific testing practices
- Own the evals framework for the practice - golden datasets, scoring rubrics, LLM-as-judge calibration, and versioned benchmarks per use case
- Define eval acceptance thresholds per engagement and gate releases on them
- Build eval engineering tooling - dataset curation, trace capture, offline/online eval runs, and dashboards delivery teams can read
- Instrument production evals and drift monitoring, feeding failures back into the golden datasets
REQUIREMENTS & SKILLS
- 5-9 yrs QA/test engineering, with 2+ yrs testing AI/ML-powered features specifically
- Strong test automation skills (Python-based frameworks, CI/CD integration)
- Understands AI-specific failure modes - hallucination, bias, drift, non-determinism - and designs tests for them
- Statistically literate enough to interpret model evaluation metrics, not just pass/fail results
- Familiarity with red-teaming methodologies for AI systems
- Clear, assertive communicator - willing to block a release over a quality concern
- Detail-oriented and methodical under delivery-timeline pressure
- Collaborative but independent - doesn't rubber-stamp under delivery pressure
- Explains quality risk in business-impact terms, not just technical jargon
- Hands-on evals engineering - builds and maintains eval suites with frameworks such as OpenAI Evals, Ragas, DeepEval, LangSmith, Azure AI Foundry evaluations
- Designs golden datasets and rubrics, and calibrates LLM-as-judge scoring against human review
- Understands RAG and agent eval metrics - groundedness, retrieval precision/recall, task completion, tool-call correctness, cost/latency
- Experience wiring evals and drift monitoring into CI/CD and production observability
رقم الإعلان لدى المصدر: 4462171417