من فضلك تسجيل الدخول أو تسجيل لتفعل ذلك.

نواجه جميعًا تحدي إدارة الموارد المحدودة، وهذا ينطبق بشكل خاص على وحدات معالجة الرسوميات (GPUs) التي تُعد عصب تدريب نماذج الذكاء الاصطناعي الكبيرة. مؤخرًا، شاركت Ai2، وهي مؤسسة بحثية رائدة في مجال الذكاء الاصطناعي، تجربتها حول كيفية تحسين جدولة موارد GPU الخاصة بها، وذلك بالتحول من نظام أولوية بسيط إلى نهج أكثر تطوراً يعتمد على ميزانيات الوقت وتخصيص حصص عادلة هرمية.

مشاكل الجدولة التقليدية لموارد GPU

كانت Ai2 تدير آلاف وحدات NVIDIA H100 و B200 و B300 GPU عبر مجموعات تتراوح أحجامها من 88 إلى 1024 وحدة، تخدم حوالي 150 باحثًا داخليًا يعملون على تدريب نماذج اللغات الكبيرة (LLM) والرؤية الكبيرة (VLM)، ومحاكاة التعلم المعزز للروبوتات، وحالات الاستخدام العلمي للوكلاء. لكنها كانت تواجه طلبًا على وقت GPU يفوق العرض بمقدار 2 إلى 3 مرات.

النظام القديم القائم على الأولوية أدى إلى مشكلات عديدة، منها «احتلال» وحدات GPU حيث كان الباحثون يوقفون أحمال عمل غير فعالة لمجرد حجز الموارد، و«تضخم الأولوية» حيث أصبحت جميع المهام تُحدد بأولوية «HIGH» مما أضر بالمهام ذات الأولوية الأقل. كما تسبب عدم إمكانية الإلغاء الاختياري لبعض أحمال العمل في إعاقة مهندسي الدعم، إذ كانوا يقضون معظم وقتهم في التفاوض على إغلاق المهام غير القابلة للإلغاء لحل مشكلات الصيانة. كل هذه المشاكل أظهرت مثالًا كلاسيكيًا على «مأساة المشاع».

حلول مبتكرة: الميزانيات والمشاركة العادلة

بدلاً من تخصيص وحدات GPU مادية للفرق، قررت Ai2 تخصيص حصص من «وقت GPU» كميزانيات زمنية. هذا النهج سمح للقيادة بالعمل كـ«مستثمرين»، حيث يتم تحديد ميزانية وقت GPU لكل مشروع بحثي مقدمًا بناءً على تقديرهم للتأثير المحتمل للمشروع. يضمن هذا النظام الهرمي أن كل مشروع يعرف نصيبه من سعة GPU الكلية، بغض النظر عن عدد المشاريع الأخرى المنتظرة.

أي طلب لوقت GPU يجب أن يُمول من الميزانية المخصصة، وإلا فلن يكون محميًا من الإلغاء. هذا يمنع ممارسات مثل «احتلال» وحدات GPU، لأنها ستستهلك من ميزانية الفريق دون فائدة حقيقية. نرى أن هذا الحل يجعل «التحايل على الجدولة» أكثر تكلفة من طلب ميزانية أكبر بشكل صريح وشفاف.

إلى جانب نظام الميزانيات، قامت Ai2 ببناء جدولة للمشاركة العادلة الهرمية التي تدير الاستغلال الفعلي للموارد على مدار شباك زمني متحرك (سبعة أيام افتراضياً). هذا يضمن حصول كل مجموعة على وقت GPU المخصص لها طالما أنها تقدم أحمال عمل كافية. وكما وصفها أحد الباحثين، كريس كلارك، فإن الجدولة الجديدة «تجعل الأمر يبدو وكأن لدينا 30% إضافية من قوة الحوسبة»، حيث يمكن للفرق تجاوز حدود التخصيص مؤقتًا واستعادة الحوسبة غير المستخدمة سابقًا.

ماذا يعني هذا للمطورين ومصممي المنتجات؟ توفر تجربة Ai2 نموذجًا قيمًا للمنظمات الأخرى التي تدير موارد GPU الكبيرة لمشاريع الذكاء الاصطناعي. إن التحول إلى نظام تخصيص قائم على الميزانية والمشاركة العادلة يمكن أن يزيد من شفافية استخدام الموارد، ويقلل من هدرها، ويضمن أن المشاريع ذات التأثير الأكبر تحصل على الأولوية التي تستحقها، مما يعزز الإنتاجية والابتكار في بيئات الذكاء الاصطناعي التي تعتمد على هذه الموارد الحيوية.

المصدر: huggingface.co

كيف يغير تدريب الذكاء الاصطناعي الموزع شبكات مراكز البيانات؟
Google AI Edge Foresight: مساعد اجتماعات يعمل محلياً

Reactions

0
0
0
0
0
0
بالفعل كان رد فعل لهذا المنصب.

ردود الفعل