Systems Limited تعلن عن وظيفة مهندس نشر أمامي - LLMOps في السعودية
تفاصيل الوظيفة
تعلن شركة Systems Limited عن توفر وظيفة Forward Deployed Engineer - LLMOps في السعودية.
نبذة عن الوظيفة
- يتولى مسؤولية عمليات الإنتاج لأحمال عمل LLM والعملاء الوكلاء (Agentic Workloads) - بما يشمل الخدمة والتكلفة والمراقبة، وذلك لنظام يعد أقل قابلية للتنبؤ بشكل جوهري من أنظمة التعلم الآلي التقليدية.
المهام والمسؤوليات
- المسؤولية عن الإنتاج والتوسع لأحمال عمل LLM والعملاء الوكلاء (البنية التحتية للاستدلال، موازنة التحميل، التخزين المؤقت).
- مراقبة تكاليف الاستدلال والتحكم فيها - استخدام التوكنات (Tokens)، وتكاليف إعادة المحاولة والحلقات، وقرارات توجيه النماذج.
- بناء أنظمة مراقبة لأنماط الفشل الخاصة بـ LLM: معدل التخيل (Hallucination Rate)، وارتفاع زمن الاستجابة (Latency Spikes)، وانحراف المطالبات (Prompt Drift).
- إدارة استراتيجية طرح إصدارات النماذج (الإصدارات التجريبية Canary Releases، ونماذج الاحتياط، والاختبار A/B).
- المسؤولية عن الاستجابة للحوادث (Incident Response) للمشكلات الإنتاجية في LLM والعملاء الوكلاء.
- التعاون مع مهندسي GenAI ومهندسي العمارة الذكية للوكلاء (Agentic AI Architects) في مراجعات الجاهزية للإنتاج.
- شرح ديناميكيات تكلفة التوكنات لأصحاب المصلحة المالية والتجارية لدى العميل.
- التعاون الوثيق مع مهندسي GenAI دون وجود خط فاصل صارم بين مرحلتي البناء والتشغيل (Build and Run).
- دعم الفريق في وضع سياسات حوكمة التكلفة لأحمال عمل LLM.
المتطلبات والمهارات
- خبرة من 4 إلى 6 سنوات في هندسة المنصات أو MLOps مع خبرة عملية في إنتاج LLM وGenAI.
- فهم عميق لاقتصاديات استدلال LLM: تكاليف التوكنات، والتجميع (Batching)، والتخزين المؤقت (Caching)، وتوجيه النماذج (Model Routing).
- خبرة في أدوات مراقبة LLM (التتبع Tracing، خطوط التقييم Eval Pipelines، إدارة المطالبات وإصدارات النماذج).
- الإلمام بعدة منصات استضافة نماذج والمفاضلة بين التكلفة والأداء لها: Microsoft Azure AI Foundry، وAWS Bedrock، وGoogle Vertex AI، بالإضافة إلى الخيارات مفتوحة المصدر المستضافة ذاتيًا (مثل vLLM وTGI) كمهارة إضافية مرغوب فيها.
- خبرة في بناء استراتيجيات الإصدار التجريبي (Canary) والتراجع (Rollback) للأنظمة الاحتمالية (Probabilistic Systems).
- الارتياح لارتفاع مستوى عدم القدرة على التنبؤ في أحمال العمل الوكلاء مقارنة بخدمة التعلم الآلي التقليدية.
- القدرة على التواصل بشكل واضح بشأن التكاليف - شرح ارتفاع تكلفة التوكنات لأصحاب المصلحة المالية لدى العميل.
- التعاون الوثيق مع مهندسي GenAI دون الحاجة إلى خط فاصل صارم بين مرحلتي البناء والتشغيل.
- الهدوء تحت الضغط أثناء الحوادث المباشرة التي تؤثر على الأنظمة المواجهة للعميل.
عرض النص الأصلي للإعلان
ABOUT
Owns production operations for LLM and agentic workloads - serving, cost, and observability for a fundamentally less predictable class of system than classical ML.
KEY RESPONSIBILITIES
- Own production serving and scaling for LLM/agentic workloads (inference infra, load balancing, caching)
- Monitor and control inference cost - token usage, retry/loop cost, model routing decisions
- Build observability for LLM-specific failure modes: hallucination rate, latency spikes, prompt drift
- Manage model/version rollout strategy (canary releases, fallback models, A/B testing)
- Own incident response for LLM/agent production issues
- Partner with GenAI Engineers and Agentic AI Architects on production-readiness reviews
- Explain token-cost dynamics to client finance/business stakeholders
- Collaborate closely with GenAI Engineers without needing a hard line between build and run
- Support the practice in setting cost governance policy for LLM workloads
REQUIREMENTS & SKILLS
- 4-6 yrs platform/MLOps engineering with hands-on LLM/GenAI production experience
- Deep understanding of LLM inference economics - token costs, batching, caching, model routing
- Experience with LLM observability tooling (tracing, eval pipelines, prompt/version management)
- Familiarity with multiple model hosting platforms and their cost/performance tradeoffs - Microsoft Azure AI Foundry, AWS Bedrock, and Google Vertex AI, plus self-hosted open-source options (vLLM, TGI) as a good-to-have
- Experience building canary/rollback strategies for probabilistic systems
- Comfortable with the higher unpredictability of agentic workloads vs. classical ML serving
- Cost-conscious communicator - can explain a token-cost blowup to a client's finance stakeholder
- Collaborates closely with GenAI Engineers without needing a hard line between “build” and “run”
- Calm under pressure during live incidents affecting client-facing systems
رقم الإعلان لدى المصدر: 4462175564