Pular para o conteúdo

Cloudflare Detalha a Grande Interrupção que Tirou ChatGPT e Outros da Web: O Que Aconteceu?

Cloudflare Detalha a Grande Interrupção que Tirou ChatGPT e Outros da Web: O Que Aconteceu?
Cloudflare Detalha a Grande Interrupção que Tirou ChatGPT e Outros da Web: O Que Aconteceu?

Na última terça-feira, uma falha significativa na Cloudflare causou uma paralisação em vasta parte da internet, impactando serviços como o ChatGPT, X (antigo Twitter) e o popular monitor de status Downdetector. Considerado o pior incidente da empresa desde 2019, o ocorrido levantou preocupações sobre a centralização dos serviços online. Matthew Prince, cofundador e CEO da Cloudflare, divulgou um relatório detalhado explicando a causa raiz.

Contrariando suspeitas iniciais de ciberataque, ataques DDoS de grande escala ou problemas de DNS, a interrupção foi atribuída a uma falha no sistema de Gerenciamento de Bots da Cloudflare. Este sistema, que protege cerca de 20% da web, é responsável por identificar e controlar rastreadores automatizados que acessam os sites que utilizam a CDN da empresa.

O problema surgiu de uma alteração no comportamento de uma consulta (query) subjacente no banco de dados ClickHouse da Cloudflare. Essa consulta gera um arquivo de configuração crucial para o modelo de machine learning do Gerenciamento de Bots, que por sua vez, atribui pontuações aos pedidos de tráfego na rede para diferenciar entre bots e usuários legítimos.

Painel de controle do sistema de Gerenciamento de Bots da Cloudflare
Visão do painel de controle do sistema de Gerenciamento de Bots da Cloudflare.

A mudança na consulta resultou na geração de um grande número de linhas duplicadas de ‘recursos’ no arquivo de configuração. Este arquivo cresceu rapidamente, excedendo os limites de memória predefinidos e, consequentemente, derrubou o sistema de proxy central que processa o tráfego para os clientes que dependiam do módulo de bots. Isso levou a falsos positivos, bloqueando o tráfego legítimo para muitas empresas, enquanto clientes da Cloudflare que não usavam a pontuação gerada pelo módulo de bots permaneceram online.

É interessante notar que a Cloudflare tem desenvolvido tecnologias avançadas para combater bots, incluindo o “AI Labyrinth” – uma abordagem que utiliza conteúdo gerado por IA para confundir e esgotar os recursos de rastreadores de IA que ignoram as diretivas de ‘não rastrear’. Paradoxalmente, o incidente não foi causado por essa tecnologia de IA generativa, mas sim por uma falha operacional no sistema que deveria protegê-la.

Para evitar que problemas semelhantes ocorram no futuro, a Cloudflare apresentou quatro planos de ação específicos:

* Reforçar a ingestão de arquivos de configuração: Tratar os arquivos de configuração gerados internamente com a mesma rigorosidade aplicada às entradas geradas por usuários.
* Ativar mais chaves de interrupção global: Implementar mais ‘kill switches’ globais para funcionalidades críticas.
* Eliminar sobrecarga por relatórios de erros: Garantir que despejos de memória e outros relatórios de erros não sobrecarreguem os recursos do sistema.
* Revisar modos de falha: Analisar exaustivamente os modos de falha para condições de erro em todos os módulos de proxy centrais.

Este episódio ressalta a complexidade e a interconexão da infraestrutura da internet moderna, onde uma única falha em um componente crítico pode ter um efeito cascata em inúmeros serviços globais. A busca por sistemas mais resilientes e menos centralizados continua sendo um desafio fundamental para a estabilidade da web.

Conheça os planos de hospedagem Eqsam

Saiba mais →

Avalie este artigo

Seja o primeiro a avaliar!

HTML Snippets Powered By : XYZScripts.com