من فضلك تسجيل الدخول أو تسجيل لتفعل ذلك.

في مقابلة حصرية مع The Register، يوضح ركيش شوبرا من سيسكو أن التدريب على أكبر نماذج الذكاء الاصطناعي لم يعد يقتصر على إضافة المزيد من وحدات معالجة الرسوميات داخل مركز بيانات واحد. نقص الطاقة والقيود المادية يدفع الفرق إلى التفكير في تشغيل حملات التدريب عبر مراكز بيانات متعددة.

لماذا تحتاج نماذج الذكاء الاصطناعي إلى أكثر من مركز بيانات

مع تزايد حجم النماذج إلى مئات المليارات من المعاملات، يصبح استهلاك الطاقة والحرارة عائقًا حقيقيًا. عندما لا يستطيع مركز بيانات واحد تزويد جميع الـ GPUs بالطاقة المطلوبة، يلجأ المهندسون إلى توزيع العقد على مواقع جغرافية متعددة لتجنب اختناقات الطاقة وتوفير تكاليف البنية التحتية.

كيف يغير ذلك متطلبات الشبكة

نقل البيانات بين مراكز متعددة يفرض متطلبات شبكة تختلف تمامًا عن ربط مراكز بيانات تقليدية. التدريب الموزع يحتاج إلى تدفقات متزامنة هائلة، خسارة حزم قليلة جدًا، وتنسيق دقيق بين الـ GPUs. أي تأخير أو تجمد في أحد المواقع قد يبطئ كامل العملية.

  • أوبتيمازيشن للاتصالات عبر ألياف طويلة المسافة باستخدام بصريات متماسكة عالية السرعة.
  • استخدام تقنيات التخزين المؤقت (buffering) لتقليل تأثير تأخير الشبكة.
  • دمج MACsec و IPsec لتأمين تدفق البيانات بين المواقع.
  • اعتماد معمارية Silicon One و Intelligent Collective Networking لإدارة الانفجارات المتزامنة للمرور.

ما يعنيه ذلك للمطورين

برأينا، سيحتاج مطورو نماذج الذكاء الاصطناعي إلى تعديل أطر التدريب (مثل PyTorch Distributed أو TensorFlow Multi‑Worker) لتأخذ في الحسبان زمن الاستجابة المتزايد بين المراكز. كما سيصبح اختيار مزودي السحابة الذين يقدمون ربطًا عالي الأداء بين المناطق أمرًا حاسمًا لتقليل تكلفة التدريب وتحسين زمن الانتهاء.

المصدر: theregister.com

مكتب الضرائب الهولندي يتخلى عن Microsoft 365 للسيادة
WordPress كمصدر للحقيقة: تكامل مع AI في عمل الوكالات

Reactions

0
0
0
0
0
0
بالفعل كان رد فعل لهذا المنصب.

ردود الفعل