Dy ndërprerje nga konfigurimi, me një vit larg njëra-tjetrës: CloudFront dhe 1.1.1.1
Të enjten e kaluar, më 16 korrik, AWS CloudFront nisi të kthente gabime 5xx për çdo shpërndarje që përdorte VPC Origins, dhe vazhdoi ta bënte nga ora 07:45 deri në 11:18 UTC: tre orë e tridhjetë e tre minuta. AWS-ja e vendosi shkakun rrënjësor te „një kufizim i brendshëm te flota që menaxhon lidhjet me origjina private VPC“, i cili e la atë flotë të paaftë ta ngarkonte konfigurimin e vet të përditësuar të rrjetit. 1 Shpërndarjet që përdornin lloje të tjera origjinash mbetën të paprekura, por CloudFront-i rri para aq shumë internetit sa dështimi i një veçorie të vetme prishi ose degradoi shërbime si Canvas, Blackboard, Hugging Face dhe Ubiquiti. 2
Dy ditë para kësaj, më 14 korrik, kaloi pa shumë koment përvjetori i parë i një dështimi me të njëjtën formë. Në vitin 2025, resolver-i publik DNS 1.1.1.1 i Cloudflare-it u fik për 62 minuta. Një shërbim para-prodhimi i Data Localization Suite ishte lidhur gabimisht me prefikset e 1.1.1.1 në fillim të qershorit, dhe gabimi rri në gjumë derisa një ndryshim i dytë shtoi një vendndodhje testimi jashtë linje dhe nxiti një rifreskim global konfigurimi, duke i tërhequr ato prefikse nga çdo qendër të dhënash e Cloudflare-it njëherësh. Përkundër spekulimeve të asaj kohe, nuk ishte rrëmbim BGP-je. Analiza e Cloudflare-it është e qartë se rrugët i tërhoqi automatizimi i vet. 3
Asnjë fibër nuk u këput. Asnjë qendër të dhënash nuk u dogj. Në të dyja rastet makinat ishin mirë dhe udhëzimet ishin të gabuara.
Plani i kontrollit është tani pjesa e brishtë
Këtë vit kemi shkruar për dështime fizike: ngjarjet e AWS-së në Lindjen e Mesme në mars, këputja e fibrës së Zayo-s që degradoi gjysmën e aplikacioneve të uebit më 22 qershor, kabllot nënujore në përgjithësi. Ato janë të lehta për t'u kuptuar dhe, në një farë mënyre të çuditshme, ngushëlluese. Një kabllo është send, dhe sendeve mund t'u vihet tepricë.
Shpërndarja e konfigurimit është më e vështirë, për arsye strukturore e jo si çështje kompetence.
Është globale nga vetë dizajni. Gjithë vlera e një plani konfigurimi të shpërndarë është që një ndryshim të mbërrijë kudo shpejt, çka është pikërisht vetia që e bën një ndryshim të keq të mbërrijë kudo shpejt.
Është gjithashtu rruga e rimëkëmbjes. Nëse sistemi juaj i konfigurimit është i sëmurë, mekanizmi që normalisht do të përdornit për të rregulluar gjërat është mekanizmi që është prishur. Redundanca fizike nuk ndihmon këtu; keni plot serverë që punojnë, të gjithë duke bërë bindshëm gjënë e gabuar.
Dhe nuk ka kufi natyror të rrezes së shpërthimit. Rajonet dhe zonat e disponueshmërisë e kufizojnë dështimin fizik. Një flotë e vetme brenda CloudFront-it nuk arriti të ngarkonte një konfigurim të vetëm, dhe gabimet ishin mbarëbotërore. Një shtytje konfigurimi nuk i respekton ata kufij, veç nëse dikush e ka projektuar kështu, dhe shpalosja me faza është ai lloj disipline që gërryhet në heshtje nën presionin e dorëzimit.
DNS-ja është e njëjta histori një shtresë më lart. Tërheqja e një rruge është pohim konfigurimi. Resolver-i ishte i shëndetshëm; pushoi së qeni i arritshëm sepse rrjetit iu tha se nuk ishte aty.
Pesë zakone që ia vlen të kopjohen
Pjesa e sikletshme është se këto janë dy nga organizatat operacionalisht më të sofistikuara në internet. Nëse konfigurimi i shpërndarë i kafshon ato, ekzekutimi i Ansible-it të një ekipi të zakonshëm në orën 17:00 të një të premteje nuk është më i sigurt.
Shpalosni me faza gjithçka, përfshirë konfigurimin. Nëse një ndryshim mbërrin te 100% e flotës suaj njëherësh, keni rreze shpërthimi globale, pavarësisht sa rajone mbani.
Mbani një rrugë rimëkëmbjeje që nuk e përdor planin e konfigurimit: akses në konsolë, një rezervë statike, një skedar që redaktohet me dorë — diçka që punon kur automatizimi nuk punon.
Mos e blini DNS-në tuaj autoritative nga ofruesi pas të cilit e fshihni origjinën. Kur ai shitës ka një ditë të keqe, jua heq me të njëjtën lëvizje edhe problemin edhe aftësinë për ta anashkaluar.
Konfiguroni një resolver të dytë rekursiv, publikisht dhe brenda. Korriku 2025 është argumenti për këtë: një resolver mund të jetë krejtësisht i shëndetshëm dhe prapë i paarritshëm, një i dytë nuk kushton asgjë, dhe nëse zgjidhja e emrave dështon, atëherë asgjë tjetër që keni ndërtuar nuk ka rëndësi.
Dhe njihni kohën tuaj të rikthimit, të matur e jo të vlerësuar me sy. „Mund të bëjmë rollback“ nuk është plan derisa dikush ta ketë kohëmatur.
Një hyrje kur automatizimi dështon
Jemi një ISP i vogël dhe nuk do të pretendojmë se plani ynë i konfigurimit është më i sofistikuar se ai i Cloudflare-it. Është më i vogël, çka i ndryshon kompromiset e nuk i zgjidh, dhe herë pas here punon në favorin tonë: më pak pjesë lëvizëse, më pak vende ku një shtytje globale të shkojë globale.
Ajo që u japim klientëve është gjëja që ka rëndësi gjatë një incidenti të kësaj forme: një hyrje që nuk varet nga shëndeti i automatizimit tonë.
Çdo VPS dhe VDS aktualisht në katalogun tonë ka akses në konsolë noVNC përmes zonës së klientit, i pavarur nga rrjetëzimi i vetë guest-it. Kur konfigurimi i rrjetit është i gabuar, kur muri i zjarrit ju ka mbyllur jashtë ose kur makina nuk e mbaron dot ndezjen, ju merrni një ekran dhe një tastierë. Pa nevojë për SSH, pa tiketë, pa kredencial të dërguar askujt.
KVM i plotë me akses si root do të thotë se mund ta rimëkëmbni vetë makinën, pa pritur që një shitës të shtyjë një rregullim te një panel kontrolli që nuk mund ta anashkaloni. Dhe looking glass ju lejon ta kontrolloni vetë Routing-un tonë, nga Tirana, Shkupi, Amsterdami dhe Dublini, në vend që t'i besoni fjalës së një faqeje statusi.
Pastaj ka këshillën e përhershme që vazhdojmë ta përsërisim sepse vazhdon të dalë e dobishme. Vendoseni një VPS me 5 €/muaj diku ku nuk ndan plan kontrolli me atë kryesorin tuaj. Jo një rajon tjetër të të njëjtit ofrues, por një ofrues tjetër në një shtet tjetër. Në të dyja ato ditë, ajo makinë do të kishte qenë ajo që ende mund t'u tregonte përdoruesve tuaj se çfarë po ndodhte.
Prirja që ia vlen të ndiqet
Pjesa më e madhe e lajmeve për ndërprerje këtë vit ka qenë fizike: prishja e AWS-së në Lindjen e Mesme në mars, këputja e fibrës së Zayo-s në qershor. Ajo e së enjtes së kaluar nuk ishte as njëra, as tjetra — dhe as ajo përvjetorin e së cilës thuajse e ndau. Industria ka kaluar njëzet vjet duke u bërë e mirë në mbijetesën ndaj dështimit të harduerit, dhe relativisht pak përpjekje në mbijetesën ndaj udhëzimeve të veta.
Mënyra e dështimit të një sistemi të shpërndarë e të projektuar mirë gjithnjë e më shumë nuk është se prishet. Është se punon në mënyrë të përsosur, kudo, mbi hyrjen e gabuar.