ఒక ప్రాంతీయ క్లౌడ్ అవుటేజ్ దీర్ఘ పునర్నిర్మాణ పనిగా మారుతుంది
మధ్యప్రాచ్యంలో ఉన్న తన రెండు క్లౌడ్ ప్రాంతాల్లోని వినియోగదారులు సాధారణ సేవలు తిరిగి పొందడానికి ఇంకా కొన్ని నెలలు వేచి ఉండాల్సి రావచ్చని Amazon Web Services హెచ్చరించింది, ఎందుకంటే ఆ ప్రాంతంలో జరిగిన సంఘర్షణ సమయంలో యునైటెడ్ అరబ్ ఎమిరేట్స్ మరియు బహ్రెయిన్లోని సదుపాయాలు దెబ్బతిన్నాయి. ఏప్రిల్ 30న విడుదలైన కంపెనీ స్థితి నవీకరణ ప్రకారం UAE మరియు బహ్రెయిన్ ప్రాంతాలు నష్టపోయి, ఇంకా కస్టమర్ అప్లికేషన్లను మద్దతు ఇవ్వలేని స్థితిలో ఉన్నాయి; దీంతో మొదట ఒక తీవ్రమైన అవుటేజ్గా కనిపించినది, ఇప్పుడు చాలా దీర్ఘమైన పునరుద్ధరణ ప్రయత్నంగా మారింది.
కాలక్రమం ముఖ్యమైనది. డ్రోన్ దాడులు సుమారు రెండు నెలల క్రితం జరిగాయి, మరియు AWS ఇప్పుడు పూర్తిస్థాయి పునరుద్ధరణకు మొత్తం మీద సగం సంవత్సరం వరకు పట్టవచ్చని సూచిస్తోంది. ఇది కథనాన్ని తాత్కాలిక అంతరాయం దాటి, కంప్యూటింగ్, స్టోరేజ్, మరియు అప్లికేషన్ లభ్యత కోసం ఆ ప్రాంతాలపై ఆధారపడే కంపెనీలకు మరింత కీలకమైన మౌలిక సదుపాయ ఘటనగా మారుస్తోంది.
పునరుద్ధరణ కొనసాగుతున్నప్పుడు బిల్లింగ్ నిలిపివేశారు
నష్ట తీవ్రతకు స్పష్టమైన సంకేతాల్లో ఒకటి AWS తీసుకున్న బిల్లింగ్ నిర్ణయం. సాధారణ కార్యకలాపాలను పునరుద్ధరించేందుకు పని చేస్తున్న సమయంలో సంబంధిత బిల్లింగ్ కార్యకలాపాలను నిలిపివేసినట్లు కంపెనీ తెలిపింది. ప్రభావిత ప్రాంతాల్లో మార్చి 2026కి సంబంధించిన అన్ని వినియోగ ఆధారిత ఛార్జీలను AWS ఇప్పటికే మాఫీ చేసిందని Ars Technica నివేదించింది, దీని అంచనా వ్యయం $150 million. తాజా నవీకరణ ప్రకారం పునరుద్ధరణ పనులు పూర్తి కానంతవరకు ఏదో ఒక రకమైన బిల్లింగ్ ఉపశమనం కొనసాగుతుంది.
ఇది సాధారణ కస్టమర్-సేవ చర్య కాదు. ప్రధాన సేవలు ఇంకా దెబ్బతిన్న స్థితిలో ఉన్నప్పుడు, సాధారణ వాణిజ్య ఛార్జీలు విధించడం సమర్థించుకోవడం కష్టమయ్యేంత ప్రభావం ఉంటుందని AWS భావిస్తున్నట్లు ఇది సూచిస్తుంది. వినియోగదారుల కోసం నిలిపివేసిన బిల్లింగ్ ఆర్థిక భారాన్ని కొంత తగ్గించవచ్చు, కానీ వ్యవస్థలను తరలించడం లేదా చేరుకోలేని వర్క్లోడ్లను పునరుద్ధరించడానికి అవసరమైన సాంకేతిక, కార్యాచరణ ఖర్చులను తొలగించదు.
ప్రభావిత ప్రాంతాలను ఇప్పటికైనా వదిలి వెళ్లాలని వినియోగదారులకు సూచిస్తున్నారు
వినియోగదారులు తమ వనరులను ఇతర క్లౌడ్ ప్రాంతాలకు తరలించి, చేరుకోలేని వ్యవస్థలను పునరుద్ధరించడానికి రిమోట్ బ్యాకప్లను ఉపయోగించాలని AWS బలంగా సిఫారసు చేస్తోంది. ఈ మార్గదర్శనం పెద్ద ఎత్తున అవుటేజ్లకు సంబంధించిన మౌలిక వాస్తవాన్ని చూపిస్తుంది: భౌతిక నష్టం జరిగినప్పుడు, చాలాసార్లు వేగవంతమైన సాఫ్ట్వేర్ పరిష్కారం ఉండదు. తిరిగి సాధారణ స్థితికి రావడంలో హార్డ్వేర్ మార్పిడి, సదుపాయాల మరమ్మతులు, తనిఖీలు, మరియు దశలవారీ పునరుద్ధరణ ఉంటాయి.
కొన్ని కంపెనీలు ఆ అత్యవసర ప్రతిస్పందన ఎలా ఉంటుందో ఇప్పటికే చూపించాయి. దుబాయ్ ఆధారిత super app Careem, రైడ్-హైలింగ్తో పాటు గృహ, ఆహారం, మరియు కిరాణా సేవలు అందిస్తుంది; అది ఇతర సర్వర్లకు రాత్రికి రాత్రే మైగ్రేషన్ అనంతరం మళ్లీ ఆన్లైన్కి వచ్చింది. ఆ ఉదాహరణ క్లౌడ్ వినియోగదారులు తమ కార్యకలాపాల్లో ఎంత స్థాయి స్థితిస్థాపకతను నిర్మించగలరో, అలాగే ప్రాంతీయ వైఫల్యానికి సిద్ధమైన సంస్థలు మరియు సిద్ధం కాని సంస్థల మధ్య ఉన్న పదునైన తేడాను చూపిస్తుంది.
ఇటీవలి రిమోట్ బ్యాకప్లు, నకిలీ మౌలిక సదుపాయాలు, లేదా పరీక్షించిన మైగ్రేషన్ ప్రణాళికలు లేని సంస్థలకు, ఈ అంతరాయం మరింత బాధాకరంగా ఉండే అవకాశం ఉంది. AWS నవీకరణ itself చేరుకోలేని వనరులను సూచిస్తోంది, ఇది క్లౌడ్ లభ్యత ఇంకా భౌతిక ప్రదేశాలు, విద్యుత్ వ్యవస్థలు, నెట్వర్క్ పరికరాలు, మరియు పునరుద్ధరణ విధానాలపై ఆధారపడి ఉంటుందని గుర్తుచేస్తోంది; ఇవన్నీ ఘర్షణ ప్రాంతంలో ఒకేసారి దెబ్బతినవచ్చు.
నష్టం ఎలా కనిపిస్తోందో నివేదికలు చెప్పినట్లు
మరమ్మతుల కాలవ్యవధి, ఆధారభూత నష్టం వర్ణనకు అనుగుణంగా ఉంది. Ars Technica ఒక ముందు నివేదించబడిన అంతర్గత పత్రాన్ని ఉదహరించింది, అందులో ఒక ప్రభావిత డేటా సెంటర్లో 14 EC2 server racks ఆఫ్లైన్ అయ్యాయని, మరో ఐదు ప్రభావితమయ్యాయని, అలాగే అగ్నిమాపక వ్యవస్థల కారణంగా వరదలు మరియు నీటి నష్టం జరిగినట్లు పేర్కొంది. ప్రతి సైట్ గురించి విస్తృత ప్రజా వివరాలు లేకపోయినా, ఈ వివరణ పునరుద్ధరణ కాలం రోజుల్లో కాకుండా నెలల్లో ఎందుకు కొలుస్తున్నారో అర్థం చేస్తుంది.
క్లౌడ్ అవుటేజ్లను తరచుగా zones, regions, failover, resilience వంటి సారాంశ పదాలలో చర్చిస్తారు. ఈ ఘటన ఆ సారాంశంలో కొంత భాగాన్ని తొలగిస్తుంది. ప్రతి region వెనుక భవనాలు, కూలింగ్ వ్యవస్థలు, అగ్ని నియంత్రణ, racks, మరియు networking పరికరాలు ఉంటాయి; ఇవన్నీ యుద్ధం వల్ల భౌతికంగా అచేతనమవుతాయి. అది జరిగాక, ప్రపంచంలోని అతిపెద్ద cloud operator అయినా నిర్మాణ కాలపట్టికలు, బదలాయింపు లాజిస్టిక్స్, మరియు దెబ్బతిన్న ప్రదేశాల చుట్టూ ఉన్న భద్రతా పరిస్థితులచేత పరిమితం అవుతుంది.
భూరాజకీయంగా బహిర్గతమైన మార్కెట్లలో cloud resilienceకు stress test
AWS అంతరాయం cloud strategy భూరాజకీయ ప్రమాదం నుంచి వేరుగా ఉండదని కూడా గుర్తుచేస్తోంది. మధ్యప్రాచ్యంలో పనిచేసే లేదా అక్కడ సేవలు అందించే వినియోగదారులకు, తక్కువ-లేటెన్సీ ప్రాంతీయ మౌలిక సదుపాయం ఆకర్షణీయంగా లేదా అవసరంగా ఉండవచ్చు. కానీ నిర్దిష్ట ఒక regionలో workloads కేంద్రీకరించడం వలన, సంఘర్షణ పౌర మరియు వాణిజ్య మౌలిక సదుపాయాల్లోకి వ్యాపించినప్పుడు, బహిర్గతం కూడా పెరుగుతుంది.
ఈ ఘటన regional cloud deployment డిఫాల్ట్గా తప్పు ఎంపిక అని సూచించదు. అయితే ఒక regionను ఉపయోగించడం మరియు పూర్తిగా దానిపైనే ఆధారపడడం మధ్య తేడాను హైలైట్ చేస్తుంది. Multi-region architectures, cross-region backups, పరీక్షించిన recovery playbooks, మరియు స్పష్టంగా ప్రాధాన్యత ఇవ్వబడిన workloads, ప్రమాదం ఒక software bug లేదా power failure కాకుండా నేరుగా జరిగే physical damage అయినప్పుడు మరింత ముఖ్యమైనవిగా మారతాయి.
AWSకు ప్రతిష్ఠ పరమైన కోణం కూడా ఉంది. ఇక్కడ కంపెనీపై అవుటేజ్కు కారణమైందని ఆరోపణ లేదు, మరియు బిల్లింగ్ నిలిపివేయడం నమ్మకాన్ని కాపాడటానికి సహాయపడవచ్చు. అయినప్పటికీ, ఈ ఘటన hyperscale providers కూడా ప్రాంతీయ సంఘర్షణ ఫలితాల నుంచి వినియోగదారులను పూర్తిగా రక్షించలేరని చూపిస్తుంది. వారు చేయగలిగేది, recovery మార్గాలను స్పష్టంగా చేయడం, migrationsకు మద్దతు ఇవ్వడం, మరియు వినియోగదారులు ఇతరచోట కార్యకలాపాలను స్థిరపరిచే సమయంలో వాణిజ్య భారాన్ని తగ్గించడం.
విస్తృత పాఠం
క్లౌడ్ ఒక కనిపించని utility కంటే వ్యూహాత్మక మౌలిక సదుపాయంలా కనిపించే క్షణాల్లో ఇది ఒకటి. నెలల పాటు కొనసాగే regional outage అంతర్గత IT కార్యకలాపాలనే కాదు, cloud platforms పైన నడిచే transportation apps, commerce systems, logistics tools, మరియు consumer servicesను కూడా ప్రభావితం చేస్తుంది. మౌలిక సదుపాయాలు దెబ్బతిన్నప్పుడు, resilience ఇక సిద్ధాంతపరమైన architecture diagram కాదు. ఏ కంపెనీలు వినియోగదారులకు సేవలు కొనసాగించగలవు, ఏవీ చీకటిలోకి వెళ్లిపోతాయో నిర్ణయించే కార్యాచరణ క్రమశిక్షణగా అది మారుతుంది.
ప్రస్తుతం ప్రధాన వాస్తవం సులభం: AWS తన UAE మరియు Bahrain ప్రాంతాల్లో సాధారణ కార్యకలాపాలను పునరుద్ధరించడానికి ఇంకా కొన్ని నెలలు పడుతుందని చెబుతోంది. అంటే ఇది కేవలం ఒక service incident కాదు, వినియోగదారులు, cloud planning, మరియు తమ డిజిటల్ కార్యకలాపాల్లో geopolitical exposureను కంపెనీలు ఎలా అంచనా వేస్తాయనే దానిపై ప్రభావం చూపే దీర్ఘకాలిక infrastructure disruption.
ఈ వ్యాసం Ars Technica నివేదిక ఆధారంగా రూపొందింది. మూల వ్యాసాన్ని చదవండి.
Originally published on arstechnica.com








