+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

O Facebook autoexcluiu-se da internet. Seis horas.

O Facebook remove o seu próprio endereço da internet e, quando os seus engenheiros chegam para o recolocar, os leitores de crachás também estão inoperantes, porque funcionam no Facebook.

O Facebook remove o seu próprio endereço da internet e, quando os seus engenheiros chegam para o recolocar, os leitores de crachás também estão inoperantes, porque funcionam no Facebook. 4 de outubro de 2021, 15:40 UTC: um comando de manutenção de rotina da backbone desativa todas as ligações entre os centros de dados do Facebook; a ferramenta de auditoria criada para o bloquear tem um erro; os servidores de nomes do Facebook, incapazes de aceder aos centros de dados, retiram as suas próprias rotas BGP por design — e facebook.com, Instagram, WhatsApp e Messenger desaparecem do DNS por quase seis horas. Ferramentas internas, acesso fora de banda e os crachás de escritório utilizam a mesma rede, pelo que a correção requer pessoas nos bastidores.

Ler a edição escrita (Inglês) ↗

O que este vídeo aborda

  • O Facebook remove o seu próprio endereço
  • Os comprovativos: Meta Engineering, Cloudflare, Hacker News
  • Isto é The Daily Diff, post-mortem
  • Cronologia: comando 15:39 → retirado 15:40 → de volta 21:20
  • Mecanismo: a verificação de saúde que te apaga, a tempestade DNS 30×, as portas

Transcrição traduzida

Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.

O Facebook remove o seu próprio endereço

0:00 O Facebook remove o seu próprio endereço da internet, e quando os seus engenheiros chegam para o recolocar, os leitores de crachás também estão inoperantes, porque funcionam no Facebook. O próprio post-mortem da Meta, no dia seguinte: um comando de manutenção de rotina desativa todas as ligações da backbone, e a ferramenta criada para bloquear comandos desse tipo tem um erro.

Os comprovativos: Meta Engineering, Cloudflare, Hacker News

0:16 Cloudflare, de fora: às 15:40 UTC as rotas para os servidores de nomes do Facebook desaparecem, e dig facebook.com retorna SERVFAIL em todo o planeta. Como acontece, por que uma funcionalidade de segurança piora, e quem leva a culpa. Isto é The Daily Diff, post-mortem. Início da tarde, UTC.

Isto é The Daily Diff, post-mortem

0:34 Um comando destinado a verificar a capacidade livre da backbone desativa todas as ligações entre os centros de dados do Facebook, e a ferramenta de auditoria construída para detetar exatamente isto

Cronologia: comando 15:39 → retirado 15:40 → de volta 21:20

0:41 deixa-o passar. 15:40. O feed BGP da Cloudflare enche-se de retiradas; os prefixos DNS do Facebook saem da tabela de encaminhamento. Dentro de um minuto, os engenheiros da Cloudflare estão numa sala a perguntar-se se estragaram o 1.1.1.1. 15:45, Hacker News, dois mil e seiscentos pontos. 16:07, o porta-voz do Facebook, no Twitter de todos os lugares: algumas pessoas estão com problemas para aceder às nossas aplicações. Algumas pessoas são três mil e quinhentos milhões.

1:06 18:51, o New York Times: funcionários trancados fora dos seus edifícios, crachás inoperantes. 19:52, o CTO pede desculpas. 21:00, cinco horas depois, as rotas voltam; 21:20, facebook.com resolve. Por que é que uma falha da backbone apaga o Facebook da internet?

Mecanismo: a verificação de saúde que te apaga, a tempestade DNS 30×, as portas

1:20 Os seus servidores de nomes têm uma regra: se não conseguirem chegar aos centros de dados, declaram-se não saudáveis, param de anunciar o seu endereço. Sensato quando um site avaria. Quando toda a backbone avaria, todos os servidores de nomes o fazem de uma só vez. Os servidores estão ativos. Ninguém os consegue encontrar. Uma funcionalidade de segurança transforma uma falha de rede numa falha de existência. Depois a internet agrava a situação: as aplicações tentam novamente, os utilizadores recarregam,

1:39 e o resolvedor da Cloudflare vê trinta vezes a sua carga normal, para um site que não existe. E as portas. Ferramentas, acesso fora de banda, crachás: mesma rede. Engenheiros conduzem até aos centros de dados, não conseguem entrar, depois encontram racks reforçados contra qualquer pessoa com acesso físico. Construído para atrasar um atacante, também atrasa o proprietário. A backbone retorna; eles aumentam o tráfego lentamente, de propósito.

1:59 Cada centro de dados desligou dezenas de megawatts, e reverter isso num só passo é uma segunda interrupção.

git blame — a divisão

2:05 git blame. Facebook, cinquenta e cinco por cento: o comando foi auditado, o auditor tinha o erro, um comando atingiu todos os routers. O design DNS, vinte e cinco: uma verificação de saúde sem sentido de proporção. Uma rede, quinze: ferramentas, fora de banda, crachás. Os racks, cinco, por fazerem o seu trabalho. Raio de impacto: três mil e quinhentos milhões de utilizadores, quase seis horas. As ações fecham em baixa de cinco por cento, seis mil milhões de Zuckerberg,

Raio de impacto

2:27 no papel. O Telegram afirma setenta milhões de inscrições nesse dia. Veredito, post-mortem: NEEDS REVIEW. Declaração na mesma noite, post-mortem de autor nomeado dentro de um dia, erro da ferramenta de auditoria admitido em linguagem simples.

Veredito + a linha de segunda-feira

2:38 A lista de correções: fortalecer testes e simulações. Nada sobre tirar as portas da rede de produção. Segunda-feira: coloque o seu acesso fora de banda, e a sua porta, numa rede que não opera. Envie-me o incidente sobre o qual ainda não lhe é permitido falar, nos comentários, ou em the daily diff dot dev. E este é o diff para hoje. Sou o Niko da Axrisi.

2:58 Faça a fusão com responsabilidade.

Fontes

  1. Meta Engineering, "More details about the October 4 outage" (Santosh Janardhan, Oct 5, 2021)engineering.fb.com
  2. Meta Engineering, "Update about the October 4th outage" (Oct 4, 2021)engineering.fb.com
  3. Cloudflare, "Understanding how Facebook disappeared from the Internet" (Oct 4, 2021)blog.cloudflare.com
  4. Mark Zuckerberg, note to employees (Oct 5, 2021)www.facebook.com
  5. Andy Stone (Facebook), 16:07 UTCtwitter.com
  6. Sheera Frenkel (NYT), 18:51 UTC, the badgestwitter.com
  7. Mike Schroepfer (Facebook CTO), 19:52 UTCtwitter.com
  8. Hacker News (2,589 points)news.ycombinator.com
  9. The New York Times, "Gone in Minutes, Out for Hours"www.nytimes.com
  10. Forbes, "Zuckerberg Loses $5.9B in a Day" (estimate)www.forbes.com
  11. Reuters, Telegram's 70 million sign-ups (Durov's figure)www.reuters.com
  12. Krebs on Securitykrebsonsecurity.com

Vídeos relacionados