Массовый сбой, из-за которого 8 октября перестали открываться сайты крупнейших российских СМИ, произошёл из-за человеческой ошибки в сети Curator. Компания признала проблему с собственной инфраструктурой и объявила о полном восстановлении работы.
Авария началась в 15:30 по московскому времени, когда специалисты Curator меняли конфигурацию сетевого оборудования. Ошибка при выполнении технических работ привела к временной недоступности одного из сегментов сети и нарушила работу инфраструктуры части клиентов. По утверждению компании, неисправность удалось локализовать в течение получаса, а в 16:04 сеть полностью восстановила работоспособность. Таким образом, от начала аварии до восстановления прошло 34 минуты.
Перебои совпали с массовым сбоем в Рунете, затронувшим сотни популярных сайтов. Страницы крупных изданий не загружались или открывались с большими задержками. Проблемы с доступом к информационным ресурсам связали с неполадками в защитной инфраструктуре Curator. При этом точное количество пострадавших клиентов и полный перечень затронутых сайтов компания пока не раскрыла.
Curator специализируется на защите от DDoS-атак. Согласно схеме работы сервиса, пользовательский трафик сначала проходит через фильтрующие узлы, которые отсеивают подозрительные обращения, а затем направляется на серверы клиентов. Такая архитектура позволяет отражать атаки, однако неисправность в промежуточной сети способна одновременно нарушить доступ к нескольким независимым ресурсам, даже если их собственные серверы продолжают исправно работать.
В Curator утверждают, что после устранения ошибки новых перебоев не наблюдают, сетевая инфраструктура функционирует штатно, а доступность клиентских сервисов восстановлена. Компания также пообещала компенсировать затронутым заказчикам время недоступности инфраструктуры в соответствии с действующими соглашениями об уровне обслуживания SLA. Размер компенсаций и количество клиентов, которые смогут их получить, пока не уточняются.
Причины человеческой ошибки компания намерена изучить в ходе дополнительного расследования. После завершения проверки клиентам предоставят подробный отчёт с разбором произошедшего и перечнем мер, призванных снизить вероятность повторения аварии. Параллельно специалисты Curator пересматривают процедуры реагирования на инфраструктурные сбои и сценарии восстановления сети. Какие именно изменения внесут в порядок технических работ, пока неизвестно.
Ситуацию осложнило совпадение сразу двух крупных инфраструктурных инцидентов в один день. Утром 8 октября после атаки беспилотников произошёл пожар в дата-центре «Яндекса» в Сасово Рязанской области. Работа площадки полностью остановилась, а часть сервисов столкнулась с перебоями. Однако Curator назвала самостоятельную причину своей аварии, связанную с изменением сетевой конфигурации. Подтверждений технической связи между двумя происшествиями нет.
Признание человеческой ошибки проясняет причину одной из крупнейших групп отказов, зафиксированных в Рунете 8 октября, но не объясняет автоматически все жалобы на работу банков, маркетплейсов, операторов связи и других платформ. Для установления полной картины потребуются результаты расследований отдельных инфраструктурных провайдеров. Инцидент с Curator при этом наглядно показал, насколько сильно доступность крупных сайтов зависит не только от их собственных серверов, но и от исправности внешних систем защиты сетевого трафика.