авария

Один из крупнейших и самый дешевый CDN на свете Cloudflare испытывает проблемы с сетью.

Многие сайты могут быть недоступны. Я лично помогал включить Cloudflare десятку медиа, у RAWG отвалились картинки.

Сохраняйте спокойствие, это не блокировки, скоро все починят. Отвечая на вопрос, который вы задаёте своим программистам: да, от этого можно защититься, но для большинства сайтов польза будет меньше вложенных сил.

Статус тут.

Github на прошлой неделе опубликовал postmortem, почему они лежали сутки. Язык тяжелый и перегружен жаргоном, executive summary отсутствует как класс, куча воды про «вы для нас очень важны». Текст — 3/5. Были бы на самом деле важны — сделали бы учения нормальные. Тоже мне engineering excellence.

Пока мы спали, фейсбук с инстаграмом заболели и до сих пор не до конца здоровы. Последнее обновление статуса от фб - 12 часов назад «разбираемся, до сих пор проблемы».

Жалко, что искусство менеджить кризисные ситуации и искусство постмортема так не развиты. Недавно чуть ломался Gmail (очень редко бывает) и думаю, что мы никогда не узнаем, что же там произошло.

Вот пример идеального поведения в похожей ситуации от Basecamp и DHH.

Лично я люблю разруливать кризисные ситуации. Думаю, что это чувство, которое есть у гонщиков на высокой скорости и у спортсменов. Когда высоки ставки, высокие риски и благодаря профессионализму и удаче получается сделать красиво. Или удача отвернулась в этот раз, но ты сделал все, что мог и это все равно красиво.

Чтобы не создать ложное впечатление: лучше строить стабильные системы и процессы, чем постоянно тушить пожары. Если ваши программисты каждую неделю героически чинят сайт - возможно, стоит разобраться с настоящей проблемой, а не ставить заплатки.

Cloudflare падал; если не могли открыть сайт или глючило приложение в последние 4 часа — скорее всего из-за этого.

CF — главный CDN/анти-дидос на свете, он стоит между пользователями и серверами, которые оберегает от лишних нагрузок. Поэтому когда падает CF, то это как если сломался удлинитель — не важно, что электричество в розетке есть, до нас оно не дойдет.

Интересно, что во время аварии не работала и панель управления администратора, так что нельзя было выключить его хотя бы на время.

Кстати, российские сайты это задело мало. РКН регулярно блокирует Cloudflare, так что все, кому важны пользователи из РФ, уже давно перешли на другие решения. Такая вот устойчивость интернета.

Прямо сейчас часть корневых серверов .io вместо правильных NS-ответов (списка серверов, на которых вы хостите свои DNS-записи) возвращает тыкву.

Из-за этого могут не открываться сайты в зоне .io, например, meduza.io

Всего два месяца назад у них обнаружили уязвимость, через которую можно было сделать MitM атаку на все домены зоны, а теперь вот это. Руки бы поотрывать и передать зону в управление Verisign.

Обсуждение вот тут https://news.ycombinator.com/item?id=15293578

Проснулся сегодня утром в 03:00 ночи, в Манчестере взрыв и конечно же, именно в этот момент упал интернет в редакции. Кажется, что это же зааффектило моего телефонного провайдера, так что обычные телефонные звонки тоже не проходили.

Думаю о покупке аварийного телефона с двумя симками — передавать его между «компьютерщиками», чтобы всегда был гарантированный телефон для связи с технарями.

Чего делать точно не стоит — это пытаться выдать аварию за штатную профилактику.

Так, на прошлой господрядчик пытался скрыть аварию в государственной системе, на которую завязана вся фарм отрасль России.

Зрелость инженерной организации проявляется не только в том, как редко случаются аварии — они бывают у всех. Зрелость в том, КАК компания реагирует на аварии. Но не буду повторятся, про это я уже писал подробно ранее: жемчужина от cloudflare и пример stackoverflow.

Прошлой ночью по Москве у гугла прилегла сеть в Штатах. 4 с половиной часа, с 12 до 17 PT. Проблемы затронули как собственные сервисы Gmail, YouTube и прочие так и клиентов облака: Snapchat и другие.

Гугл потерял «три девятки» (99.99% доступности сервисов) в этом квартале.

С нетерпением ждём постмортем. Ожидаемо, что надёжность сети - последняя нерешенная проблема облаков. Интересно, как они её в результате решат и решат ли в принципе.

Мои сочувствия ребятам из России, у которых пользователи/клиенты в штатах (обычно я им завидую:). У вас была горячая ночь.

Ну и это хорошее напоминание нам всем, что для критических сервисов имеет смысл посчитать стоимость резервирования хостингов.