نمط التوسع التشغيلي-الإيقافي لأعباء عمل AI ومعالجة الفيديو
كانت منصة معالجة الفيديو المدعومة بـ AI بحاجة إلى التعامل مع أعباء عمل متغيرة للغاية — من صفر مهام خلال ساعات خارج أوقات الذروة إلى مئات من مهام معالجة الفيديو واستنتاج AI المتزامنة خلال أوقات الذروة — دون دفع تكاليف موارد GPU و compute الخاملة.
ناقش مشروعك
التحدي
تتسم أعباء عمل AI ومعالجة الفيديو بطبيعتها بالتقطع وارتفاع التكلفة:
- تعد مثيلات GPU باهظة الثمن سواء كانت تعالج المهام أو كانت في وضع الخمول
- يتطلب ترميز الفيديو والنسخ واستنتاج AI ملفات تعريف موارد مختلفة
- كانت نسبة الذروة إلى القاع 50:1 — أكثر من 200 مهمة خلال الذروة، وشبه صفرية خلال الليل
- كان التوسع التلقائي التقليدي بطيئًا جدًا (5-10 دقائق للبدء البارد) لطلبات المستخدمين الحساسة للوقت
- البنية التحتية الثابتة المخصصة للذروة كانت تعني أكثر من 80% هدرًا خلال ساعات خارج أوقات الذروة
حلنا
لقد طبقنا نمط التوسع التشغيلي-الإيقافي (On-Off scaling pattern) — وهو بنية هجينة يتم فيها توفير موارد compute في الوقت المناسب لأعباء العمل النشطة وتفريغها بالكامل عند الخمول، مع وجود مجموعات دافئة (warm pools) للمهام الحساسة للكمون ومجموعات باردة (cold pools) لمهام الدُفعات.
البنية
- Job Queue (قائمة انتظار المهام): قائمة انتظار مهام مدعومة بقاعدة بيانات مع تصنيف حسب الأولوية
- Orchestrator (المنسق): خدمة تدير دورة حياة الموارد وتوجيه المهام
- GPU Workers (عاملو GPU) (AI): حاويات GPU السحابية لـ inference (اكتشاف الكائنات، النسخ، اكتشاف المتحدث)
- CPU Workers (عاملو CPU) (فيديو): Cloud VMs لترميز الفيديو وعرضه
- Warm Pool (المجموعة الدافئة): مثيلات مهيأة مسبقًا للمهام الحساسة للكمون (بدء تشغيل < 30 ثانية)
- Cold Pool (المجموعة الباردة): مثيلات عند الطلب لمعالجة الدُفعات/الكميات الكبيرة (بدء تشغيل مقبول من 2-5 دقائق)
تنفيذ نمط التشغيل-الإيقاف
حالات دورة حياة الموارد
تنتقل الموارد عبر دورة حياة محددة: من الإلغاء الكامل للتخصيص (تكلفة صفرية)، مرورًا بالتوفير والتهيئة (تحميل النماذج، فحوصات السلامة)، إلى حالات الجاهزية والمعالجة، ثم عبر نافذة تهدئة قبل العودة إلى حالة الإلغاء الكامل للتخصيص.
استراتيجية المجموعة الدافئة (Warm Pool)
للمعالجة الحساسة للكمون (التي يبدأها المستخدم، ويتوقع نتائجها في دقائق):
- الحفاظ على حد أدنى من مجموعة دافئة من المثيلات خلال ساعات العمل
- تحميل نماذج AI مسبقًا عند بدء تشغيل الحاوية
- توجيه المهام الواردة إلى المثيلات الدافئة أولاً
- توسيع نطاق المثيلات الدافئة الإضافية عندما يتجاوز عمق قائمة الانتظار الحد الأقصى
- مؤقت تهدئة قابل للتكوين يحافظ على المثيلات نشطة بين المهام المتفرقة
استراتيجية المجموعة الباردة (Cold Pool)
لمعالجة الدُفعات (مهام الكميات الكبيرة الليلية، عمليات إعادة الترميز غير العاجلة):
- صفر مثيلات تعمل افتراضيًا
- تقوم Job queue بتشغيل التوفير عند تقديم مهام الدُفعات
- مثيلات مُحسّنة للكميات الكبيرة لزيادة الإنتاجية على حساب الكمون
- الإنهاء فورًا بعد اكتمال الدفعة
- استخدام مثيلات spot/preemptible لتحقيق وفورات كبيرة في التكلفة
تصنيف المهام وتوجيهها
يتم تصنيف المهام تلقائيًا حسب الأولوية والنوع، ثم توجيهها إلى المجموعة المناسبة:
- مهام AI عالية الأولوية التي يبدأها المستخدم توجه إلى مجموعات GPU الدافئة
- المهام الحرجة في الوقت الفعلي توجه إلى مثيلات مخصصة تعمل دائمًا
- مهام الترميز متوسطة الأولوية توجه إلى مجموعات CPU الدافئة أو الباردة
- مهام الدُفعات منخفضة الأولوية توجه إلى مثيلات spot/preemptible الباردة
منطق المنسق (Orchestrator)
مشغلات التوسع (Scale-Up)
- عمق قائمة الانتظار يتجاوز الحد الأدنى القابل للتكوين
- متوسط وقت الانتظار يتجاوز SLA لمستوى الأولوية
- زيادة مجدولة قبل ساعات الذروة المعروفة
- تشغيل يدوي عبر admin API لارتفاعات حركة المرور المتوقعة
مشغلات التخفيض (Scale-Down)
- لم تتم معالجة أي مهام طوال مدة نافذة التهدئة
- إيقاف تشغيل مجدول بعد ساعات الذروة
- اكتملت جميع المهام في قائمة الانتظار دون تقديم أي مهام جديدة
- تم الوصول إلى عتبة التكلفة للفترة الفواتيرية
الصحة والاسترداد
- فحوصات صحة منتظمة على جميع المثيلات النشطة
- يتم استبدال المثيلات غير الصحية تلقائيًا
- المهام الفاشلة تتم إعادة إدراجها في قائمة الانتظار مع عدد مرات إعادة المحاولة وتوجيهها إلى مثيل مختلف
- Dead letter queue للمهام التي تتجاوز الحد الأقصى لعدد مرات إعادة المحاولة
تأثير التكلفة
حققت نمط التشغيل-الإيقاف (On-Off pattern) تقريبًا 70% خفضًا في التكلفة مقارنة بالبنية التحتية الثابتة التي تعمل دائمًا، وذلك عن طريق التخلص من موارد compute الخاملة خلال ساعات خارج أوقات الذروة، وتحديد حجم الموارد المناسب لكل نوع من المهام، والاستفادة من مثيلات spot لأعباء عمل الدُفعات.
الميزات الرئيسية
- تكلفة خمول صفرية — يتم إلغاء تخصيص الموارد بالكامل عندما لا تعالج مهام
- Warm Pools (مجموعات دافئة) — مثيلات مهيأة مسبقًا لأعباء العمل الحساسة للكمون
- Cold Pools (مجموعات باردة) — توفير عند الطلب لمهام الدُفعات بأقل تكلفة
- تصنيف المهام — توجيه تلقائي بناءً على الأولوية والنوع ومتطلبات الكمون
- Cooldown Windows (نوافذ التهدئة) — مهلة خمول قابلة للتكوين تمنع التخفيض المبكر للنطاق بين الارتفاعات المفاجئة
- دعم Spot/Preemptible — توجيه مهام الدُفعات إلى مثيلات بأسعار مخفضة لتحقيق وفورات كبيرة
- الصحة والاسترداد — الاستبدال التلقائي للمثيلات غير الصحية مع إعادة إدراج المهام في قائمة الانتظار
- التوسع المجدول — توقع أنماط حركة المرور المعروفة باستخدام قواعد التوفير القائمة على الوقت
النتائج
المكدس التقني
caseStudyDetail.more دراسات الحالة
استكشف المزيد من تطبيقاتنا التقنية
الاستفادة من RunPod لاستدلال الذكاء الاصطناعي القابل للتوسع والفعال من حيث التكلفة
احتاجت منصة لتحليل الفيديو مدعومة بـ AI إلى قدرة حوسبة عالية الأداء على GPU لاكتشاف الكائنات والاستدلال في الوقت الفعلي عبر تدفقات فيديو متزامنة متعددة — دون التكلفة الباهظة لخوادم GPU المخصصة التي تعمل على مدار الساعة طوال أيام الأسبوع.
Kickly: منصة مشاريع مدعومة بـ AI للشركات الناشئة
Kickly هي منصة لإدارة المشاريع مدعومة بـ AI ومصممة خصيصًا للشركات الناشئة — تجمع بين أتمتة المهام الذكية، والتعاون الفريقي، وتتبع التقدم في الوقت الفعلي في منتج واحد.
مستعد لتحويل عملك؟
دعنا نناقش كيف يمكننا تطبيق حلول مشابهة لتحدياتك.