من فضلك تسجيل الدخول أو تسجيل لتفعل ذلك.

أعلنت شركة مايكروسوفت أن خطأً في نظامها الآلي لطلبات صيانة الشبكة كان السبب وراء الانقطاع الكبير الذي شهدته خدمات Azure و Microsoft 365 يوم الخميس، وذلك بإزالة مسارات IP عن طريق الخطأ من أجهزة أكثر مما هو مقصود.

بدأ الانقطاع في تمام الساعة 10:44 صباحًا بالتوقيت الشرقي يوم الخميس الموافق 23 يوليو، وأثر بشكل أساسي على العملاء الذين يصلون إلى خدمات Microsoft 365 عبر البنية التحتية لشبكة منطقة غرب الولايات المتحدة Azure التابعة للشركة.

في الساعة 11:11 صباحًا بالتوقيت الشرقي، سجل موقع Downdetector 2,403 تقارير عن انقطاع الخدمة، وهو رقم يتجاوز بكثير خط الأساس الطبيعي البالغ 29 تقريرًا. وشكل SharePoint 78% من الشكاوى، تلاه Excel بنسبة 11% ومركز إدارة Microsoft 365 بنسبة 6%.

قامت مايكروسوفت بتتبع انقطاع Microsoft 365 تحت معرف الحادث MO1437424، وأكدت تأثر العديد من خدماتها:

  • مايكروسوفت ون درايف: كان الوصول إلى OneDrive متقطعًا.
  • شيربوينت أون لاين: تلقى المستخدمون رسائل خطأ.
  • فرق مايكروسوفت (Microsoft Teams): تدهورت وظيفة الدردشة، بما في ذلك عدم تحميل الصور.
  • مركز إدارة مايكروسوفت 365: كان يتم تحميل المركز ببطء أو لا يتم تحميله على الإطلاق.
  • أتمتة الطاقة (Power Automate): لم يتم تحميل التدفقات الآلية.
  • دردشة مساعد الطيار (Copilot chat): واجه المستخدمون تأخيرات أو حالات فشل متقطعة عند تنفيذ الإجراءات والاستعلامات.
  • حلقة مايكروسوفت (Microsoft Loop): لم يتمكن المستخدمون من فتح أو تحميل صفحات الحلقة.

شملت الخدمات الأخرى المتأثرة Fabric و Power BI و Power Apps و Copilot Studio و Windows 365 و Microsoft Defender. واجه بعض عملاء Defender تأخيرات في تلقي الردود من خبراء مايكروسوفت ديفندر، وقد تفشل التحقيقات ومهام سير العمل وإجراءات المعالجة التي يتم تشغيلها عبر Threat Explorer و Advanced Hunting.

حاولت مايكروسوفت في البداية التخفيف من حدة الانقطاع عن طريق إعادة توجيه حركة المرور عبر مسارات شبكة بديلة، وهو ما ساعد بعض العملاء، لكن العديد من الخدمات ظلت متأثرة.

قبل تحديد سبب الانقطاع، حذرت مايكروسوفت العملاء من أنهم قد يحتاجون إلى مراجعة خطط استمرارية الأعمال والتعافي من الكوارث واتخاذ الإجراءات المناسبة لبيئاتهم.

حددت الشركة لاحقًا أن تغييرًا حديثًا في الشبكة هو السبب وبدأت في التراجع عنه. أكملت مايكروسوفت عملية الإرجاع في الساعة 2:26 مساءً بالتوقيت الشرقي، وأكدت من خلال بيانات الخدمة وتقارير العملاء أنه تم حل حادث Microsoft 365.

خطأ في الصيانة: تفاصيل السبب الجذري لانقطاع الخدمة

في المراجعة الأولية لما بعد حادث Azure، قالت مايكروسوفت إن الانقطاع حدث أثناء صيانة روتينية للأجهزة في منطقة Azure بغرب الولايات المتحدة، حيث تم عزل مسارات شبكة محددة. أوضحت مايكروسوفت أن عملية الصيانة الخاصة بها تحول هذه الأنواع من الطلبات إلى تعليمات قابلة للقراءة بواسطة النظام وتتحقق من أن واحدًا على الأقل من المسارين الزائدين يظل سليمًا قبل بدء العمل.

ومع ذلك، أدى خطأ في نظام تحويل الطلب إلى وضع علامة غير صحيحة على أجهزة شبكة إضافية كجزء من حدث الصيانة. ونتيجة لذلك، تمت إزالة مسارات IP من أجهزة أكثر مما هو مقصود بين مركز بيانات مايكروسوفت في غرب الولايات المتحدة وشبكتها واسعة النطاق.

أدت المسارات التي تمت إزالتها إلى تعطيل حركة مرور الشبكة التي تدخل منطقة غرب الولايات المتحدة أو تخرج منها. ومع ذلك، قالت مايكروسوفت إن حركة المرور المتبقية بالكامل داخل المنطقة لم تتأثر.

تسببت حادثة Azure في فشل الاتصال وزيادة زمن الاستجابة ومشكلات في الوصول إلى العديد من الخدمات السحابية، بما في ذلك Azure App Service و Application Gateway و Azure AD B2C و Azure AI Search و Azure API Management و Azure Cosmos DB و Azure Databricks و Azure Firewall و Azure Kubernetes Service و Azure Monitor و Azure Virtual Desktop و ExpressRoute و Log Analytics و Microsoft Graph و Microsoft Sentinel و Power BI Embedded و Virtual WAN و VPN Gateway.

قالت مايكروسوفت إن مهندسيها بدأوا التحقيق في المشكلات فورًا بعد بدء الانقطاع في الساعة 10:44 صباحًا بالتوقيت الشرقي. قدمت المشكلة نفسها في البداية على أنها تغيير مسار واسع النطاق في شبكة WAN الخاصة بشركة مايكروسوفت. قام المهندسون لاحقًا بتتبع عمليات إزالة المسار إلى مركز بيانات في منطقة غرب الولايات المتحدة وربطوها بنشاط الصيانة الأخير.

بدأت مايكروسوفت التراجع عن تغيير الصيانة في الساعة 1:45 مساءً بالتوقيت الشرقي، والذي اكتمل في الساعة 2:26 مساءً بالتوقيت الشرقي. أدى هذا التراجع إلى استعادة البنية التحتية للشبكة المتأثرة والسماح لخدمات Microsoft 365 بالتعافي. استمرت بعض خدمات Azure في التعافي بعد تنفيذ الإصلاح، حيث أبلغت مايكروسوفت أن جميع الخدمات المتأثرة قد تعافت بالكامل بحلول الساعة 3:41 مساءً بالتوقيت الشرقي.

تجري مايكروسوفت الآن مراجعة داخلية كاملة تركز على فحوصات السلامة والعمليات الآلية المستخدمة لتنفيذ طلبات الصيانة. أوضحت مايكروسوفت أنها ستجري تحليلاً كاملاً يركز على فحوصات السلامة، وعملية تغيير طلب الصيانة الآلي، والمزيد مع تقدمها في مراجعتها الداخلية بعد التخفيف. وقالت الشركة إنها ستنشر مراجعة نهائية لما بعد الحادث بعد الانتهاء من تحقيقاتها، والتي عادة ما تكون في غضون 14 يومًا.

يُعد هذا الحادث بمثابة تذكير بأهمية الدقة والتدقيق المستمر في الأنظمة الآلية، خاصة تلك التي تدير البنى التحتية الحيوية للخدمات السحابية. وتؤكد مايكروسوفت التزامها بتعزيز مرونة خدماتها وتجنب تكرار مثل هذه الأعطال في المستقبل.

كاميرا Razer Kiyo V2: جودة فيديو استثنائية مع ميزات ذكاء اصطناعي غير مؤثرة
أداة تحديد الأغاني من سبوتيفاي: منافسة قوية لآبل ميوزك وشازام

Reactions

0
0
0
0
0
0
بالفعل كان رد فعل لهذا المنصب.

ردود الفعل