A Amazon Web Services (AWS), unidade de serviço de nuvem da Amazon, sofreu uma grande interrupção na madrugada desta segunda-feira (20). A pane derrubou plataformas como ChatGPT, Snapchat, Reddit, Fortnite e a própria Amazon.
Segundo a empresa, tudo começou às 4h11 no horário de Brasília. “Estamos investigando o aumento nas taxas de erro e latências em diversos serviços da AWS na região US-EAST-1”, relatou, se referindo ao seu principal data center localizado em Northern Virginia, nos Estados Unidos.
Duas horas depois, informou que identificou uma possível causa raiz: “Com base em nossa investigação, o problema parece estar relacionado à resolução de DNS do endpoint da API do DynamoDB na região US-EAST-1. Estamos trabalhando em vários caminhos paralelos para acelerar a recuperação. Esse problema também afeta outros serviços da AWS na região US-EAST-1. Serviços ou recursos globais que dependem de endpoints US-EAST-1, como atualizações do IAM e tabelas globais do DynamoDB, também podem estar apresentando problemas. Durante esse período, os clientes podem não conseguir criar ou atualizar casos de suporte. Recomendamos que os clientes continuem tentando novamente quaisquer solicitações com falha”.
Após aplicar medidas de mitigação iniciais, a AWS observou os primeiros sinais de recuperação para alguns serviços a partir das 6h22 no horário de Brasília. “Embora as solicitações comecem a ser bem-sucedidas, pode haver latência adicional e alguns serviços terão um acúmulo de trabalho a ser concluído, o que pode levar mais tempo para serem totalmente processados”, acrescentou.
Em sua última atualização, às 8h08, salientou que continuava trabalhando para “a recuperação completa dos erros de inicialização do EC2, que podem se manifestar como um Erro de Capacidade Insuficiente” e para “mitigar os atrasos elevados de polling para o Lambda, especificamente para os Mapeamentos de Fontes de Eventos do Lambda para o SQS”.
Em artigo publicado no Inc., Jason Aten, especialista em tecnologia, pontuou que o que começou em uma única região da AWS rapidamente se tornou global, impactando grandes plataformas de consumo e corporativas – além das citadas no início desta matéria, entram na lista Coinbase e outros serviços bancários/de criptomoedas.
“Essa interrupção ilustra uma verdade que muitos usuários não reconhecem: a internet é mais frágil do que parece”, disse ele, complementando que muitos serviços que parecem independentes operam a mesma infraestrutura básica.
Para empresas individuais, a vantagem de usar provedores de computação em nuvem como a AWS é que não precisam criar sua própria infraestrutura – o que lhes gera economia de tempo e dinheiro. Contudo, quando há falhas como a que ocorreu nesta segunda-feira, elas e seus clientes saem prejudicados.
Mas ainda assim, Aten destaca que a AWS é confiável, com disponibilidade superior a 99,99%. Outro ponto a seu favor é que, assim que detectou a falha, informou e explicou o que estava fazendo para mitigar os efeitos.
“A lição principal aqui é que a comunicação em si faz parte do processo de recuperação”, enfatizou o autor. “A AWS considera a visibilidade de suas operações tão essencial quanto sua infraestrutura. Todo o negócio de nuvem da Amazon depende da confiança de desenvolvedores, startups , governos e empresas da Fortune 500 que administram seus negócios essenciais na AWS”, complementou.
E Aten finalizou: “A longo prazo, essa franqueza pode ser o que impede os clientes de procurarem em outro lugar – porque, se o seu trabalho é ser a espinha dorsal da internet, a confiança pode ser o ponto mais frágil de todos. Na era da nuvem, o que você mais perde em caso de falha pode não ser apenas o acesso por alguns minutos – pode ser a confiança de que você ainda pertence à espinha dorsal da internet”.






