أخبار الاستضافة · قراءة 4 دقيقة

عطلان بسبب الإعدادات يفصل بينهما عام: CloudFront و1.1.1.1

يوم الخميس الماضي، 16 يوليو، بدأ AWS CloudFront يعيد أخطاء 5xx لأي توزيع يستخدم VPC Origins، واستمر من الساعة 07:45 حتى 11:18 بتوقيت UTC: ثلاث ساعات وثلاث وثلاثون دقيقة. وأرجعت AWS السبب الجذري إلى «قيد داخلي في الأسطول الذي يدير الاتصالات بالخوادم الأصلية الخاصة داخل VPC»، ما جعل ذلك الأسطول عاجزًا عن تحميل إعدادات الشبكة المحدَّثة لديه. 1 ولم تتأثر التوزيعات التي تستخدم أنواعًا أخرى من الخوادم الأصلية، لكن CloudFront يقف أمام جزء كبير من الإنترنت لدرجة أن تعطّل خاصية واحدة كسر أو أضعف خدمات منها Canvas وBlackboard وHugging Face وUbiquiti. 2

وقبل ذلك بيومين، في 14 يوليو، مرّت دون اهتمام يُذكر الذكرى الأولى لعطل بالشكل نفسه. ففي 2025 اختفى محلل DNS العام 1.1.1.1 التابع لـ Cloudflare مدة 62 دقيقة. إذ رُبطت خدمة ما قبل الإنتاج من Data Localization Suite بالخطأ ببادئات 1.1.1.1 في مطلع يونيو، وظل الخطأ كامنًا حتى أضاف تغيير ثانٍ موقع اختبار غير متصل وأطلق تحديثًا عالميًا للإعدادات، فسحب تلك البادئات من كل مراكز بيانات Cloudflare دفعة واحدة. ورغم التكهنات حينها، لم يكن اختطافًا لـ BGP. وتحليل Cloudflare صريح: الذي سحب المسارات هو أتمتتها هي. 3

لم يُقطع أي كابل، ولم يحترق أي مركز بيانات. في الحالتين كانت الآلات بخير وكانت التعليمات خاطئة.

الجزء الهش اليوم هو مستوى التحكم

كتبنا هذا العام عن أعطال مادية: أحداث AWS في الشرق الأوسط في مارس، وقطع ألياف Zayo الذي أضعف نصف تطبيقات الويب في 22 يونيو، والكابلات البحرية عمومًا. وهي سهلة الفهم، وتبعث بطريقة غريبة على الطمأنينة: فالكابل شيء مادي، والأشياء المادية يمكن تكرارها.

أما توزيع الإعدادات فأصعب، لأسباب بنيوية لا لأسباب تتعلق بالكفاءة.

فهو عالمي بحكم التصميم. وكل قيمة مستوى الإعدادات الموزع أن يصل التغيير إلى كل مكان بسرعة، وهي بالضبط الخاصية التي تجعل التغيير السيئ يصل إلى كل مكان بسرعة.

وهو كذلك مسار التعافي. فإن كان نظام إعداداتك معتلًّا، فالآلية التي تُصلح بها الأمور عادةً هي نفسها الآلية المعطوبة. ولا ينفع التكرار المادي هنا: لديك خوادم سليمة كثيرة، وكلها تفعل الشيء الخطأ بطاعة.

ولا حدود طبيعية لنطاق انفجاره. فالمناطق ومناطق التوفر تحدّ العطل المادي. لكن أسطولًا واحدًا داخل CloudFront أخفق في تحميل إعداد واحد، وكانت الأخطاء عالمية. فدفع الإعدادات لا يحترم تلك الحدود ما لم يصممه أحد كذلك، والنشر التدريجي من ذلك النوع من الانضباط الذي يتآكل بصمت تحت ضغط التسليم.

وDNS القصة نفسها بطبقة أعلى. فسحب مسار هو إعلان إعدادات. كان المحلل سليمًا؛ وتوقف عن كونه قابلًا للوصول لأن الشبكة أُبلغت بأنه غير موجود.

خمس عادات تستحق النقل

المزعج أن هاتين من أنضج المؤسسات تشغيليًا على الإنترنت. فإن كانت الإعدادات الموزعة تعضّهما، فتشغيل Ansible لدى فريق عادي في الخامسة من عصر الجمعة ليس أكثر أمانًا.

انشر كل شيء تدريجيًا، والإعدادات من ضمنه. فإن وصل تغيير إلى 100% من أسطولك دفعة واحدة، فنطاق انفجارك عالمي مهما بلغ عدد مناطقك.

احتفظ بمسار تعافٍ لا يمر عبر مستوى الإعدادات: كونسول، أو بديل ثابت، أو ملف يُحرَّر يدويًا؛ شيء يعمل حين لا تعمل الأتمتة.

لا تشترِ DNS الموثوق من المزوّد الذي تخفي خلفه خادمك الأصلي. فحين يمر ذلك المزوّد بيوم سيئ، يسلبك بالحركة نفسها المشكلة وقدرتك على الالتفاف عليها.

اضبط محللًا تعاوديًا ثانيًا، للعامة وللداخل. ويوليو 2025 خير حجة: فقد يكون المحلل سليمًا تمامًا وغير قابل للوصول، والثاني لا يكلّف شيئًا، وإن فشل تحويل الأسماء فلا قيمة لكل ما بنيته سواه.

واعرف زمن التراجع لديك، مقيسًا لا مقدَّرًا. فـ «نستطيع التراجع» ليست خطة حتى يقيسها أحد بالساعة.

مدخل حين تتعطل الأتمتة

نحن مزود صغير ولن ندّعي أن مستوى إعداداتنا أعقد من مستوى Cloudflare. هو أصغر، وهذا يغيّر الموازنات لا يحسمها، وأحيانًا يصب في مصلحتنا: أجزاء متحركة أقل، ومواضع أقل يمكن فيها لدفعة عالمية أن تصير عالمية فعلًا.

وما نمنحه للعملاء هو ما يهم تحديدًا في عطل بهذا الشكل: مدخل لا يتوقف على سلامة أتمتتنا.

فكل خادم VPS وVDS في كتالوجنا الحالي لديه كونسول noVNC من منطقة العملاء، مستقل عن شبكة النظام الضيف نفسه. فحين تكون إعدادات الشبكة خاطئة، أو يكون جدار الحماية قد أقفل عليك الباب، أو لا يُكمل الجهاز إقلاعه، تحصل على شاشة ولوحة مفاتيح. دون SSH ودون تذكرة ودون إرسال أي بيانات اعتماد لأحد.

ومحاكاة KVM الكاملة بصلاحية root تعني أنك تستعيد الجهاز بنفسك، دون انتظار أن يدفع مزوّد إصلاحًا إلى لوحة لا تستطيع تجاوزها. ويتيح لك looking glass التحقق من توجيهنا بعينيك، من تيرانا وسكوبيه وأمستردام ودبلن، بدل تصديق صفحة حالة.

ثم تأتي نصيحتنا الدائمة التي نكررها لأنها تثبت نفعها مرارًا: ضع خادم VPS بـ €5 شهريًا في مكان لا يتشارك مستوى التحكم مع موقعك الأساسي. لا منطقة أخرى لدى المزوّد نفسه، بل مزود آخر في بلد آخر. في كلا ذينك اليومين، كان ذلك الجهاز هو ما بقي قادرًا على إخبار مستخدميك بما يجري.

الاتجاه الجدير بالمتابعة

كان معظم أخبار الأعطال هذا العام ماديًا: عطل AWS في الشرق الأوسط في مارس، وقطع ألياف Zayo في يونيو. أما عطل الخميس فلم يكن هذا ولا ذاك، ولا كان كذلك العطل الذي كاد يشاركه ذكراه. فقد أمضى القطاع عشرين عامًا يتقن النجاة من أعطال العتاد، وبذل جهدًا أقل بكثير في النجاة من تعليماته هو.

وصار نمط فشل النظام الموزع جيد التصميم أقل فأقل أن ينكسر، وأكثر فأكثر أن يعمل بإتقان، في كل مكان، على مدخلات خاطئة.

المصادر

  1. AWS CloudFront outage serves errors instead of websites، The Register
  2. The July 2026 AWS CloudFront Outage: VPC Origins, Cascade Impact, and What Broke، IncidentHub
  3. Cloudflare 1.1.1.1 incident on July 14, 2025، Cloudflare

العودة إلى أخبار الاستضافة