Третий за четыре дня удар по дата-центрам «Яндекса» обернулся массовыми сбоями далеко за пределами компании. После остановки площадки во Владимире 11 октября пользователи начали жаловаться на «Додо Пиццу», «Ленту», «М.Видео», «Дом.ру», Ivideon и другие независимые сервисы. Yandex Cloud перевёл облачную инфраструктуру в аварийный режим и предупредил клиентов о её неустойчивости.
Наиболее заметные последствия проявились в работе повседневных интернет-сервисов. Пользователи столкнулись с проблемами при заказе такси, оплате покупок, оформлении доставки еды и доступе к приложениям. «Яндекс Go» перестал нормально обрабатывать часть заказов, «Яндекс Пэй» выдавал ошибки, а «Яндекс Музыка», «Кинопоиск», «Яндекс Игры» и устройства умного дома с «Алисой» работали с перебоями. Проблемы затронули также «Яндекс Про», «Яндекс Еду», «Телемост», Почту, Диск и другие продукты компании.
Особенно тревожную картину показывают графики жалоб на сторонние сервисы. Резкий рост обращений зафиксирован у сети пиццерий «Додо Пицца», интернет-провайдера «Дом.ру», облачного видеонаблюдения Ivideon, торговых сетей «Лента» и «М.Видео», а также «Вкусно — и точка». Пользователи сообщают о проблемах с доступом к сайтам и приложениям, оформлением заказов и отдельными функциями. Совпадение по времени с аварией Yandex Cloud ещё не доказывает, что все перечисленные компании используют пострадавшую инфраструктуру.
Дополнительные всплески жалоб зарегистрированы у «Магнита», сервиса доставки цветов Flowwow и интернет-магазина Lamoda. Мониторинговые площадки также показывают проблемы с Delivery Club, который с 2022 года принадлежит «Яндексу» и работает на общей технологической платформе с «Яндекс Едой». Отдельный скачок обращений заметен у TikTok, однако никаких подтверждений связи неполадок видеосервиса с повреждением российских дата-центров пока нет. Часть сторонних компаний ещё не объяснила причины собственных сбоев.
Масштаб проблем хорошо виден по статистике. К 07:00 мск мониторинг Detector404 зафиксировал около 2100 жалоб на «Яндекс Go» за час, 1900 на сервисы «Яндекса» в целом и 1500 на «Яндекс Пэй». Ещё 831 обращение касалось «Яндекс Про», 632 были связаны с системой «Дом с Алисой». Подобные показатели отражают количество пользовательских сообщений за конкретный период, а не число пострадавших клиентов. Реальный масштаб нарушений может быть значительно больше.
Сбой вышел за пределы России. Пассажиры сообщают о невозможности заказать такси в Казахстане, Беларуси, Армении и Сербии. В российских городах пользователи сталкиваются с ошибками определения местоположения, недоступностью автомобилей и невозможностью завершить заказ. Водители жалуются на неполадки «Яндекс Про», затрудняющие приём поездок и работу с заказами. География обращений показывает, насколько сильно международные сервисы зависят от общей технологической инфраструктуры.
Проблемы коснулись даже государственных информационных систем. Федеральная государственная информационная система «ВетИС», которую использует Россельхознадзор, перешла в аварийный режим после отключения электропитания во Владимирской области. Платформа отвечает за оформление электронных ветеринарных документов, учёт продукции животного происхождения и контроль её перемещения. Пользователям рекомендовали оформлять сопроводительные документы по резервному порядку. Сбой затронул инфраструктуру, от которой зависит работа предприятий пищевой промышленности и торговли.
Причину масштабной аварии «Яндекс» подтвердил в официальном уведомлении. В результате атаки беспилотников была повреждена инфраструктура дата-центра во Владимире, после чего компания полностью остановила площадку. Среди сотрудников пострадавших нет, на месте работают специалисты и профильные службы. Первое сообщение о нарушении электропитания в зоне доступности ru-central1-a появилось около 04:00 мск, а в 06:08 компания подтвердила повреждения и переход облачной платформы в аварийный режим.
Главная проблема заключается в одновременной недоступности двух зон Yandex Cloud. Первая, ru-central1-b, вышла из строя 8 октября после пожара в дата-центре Сасово Рязанской области. Теперь остановлена ru-central1-a во Владимире. Компания признала, что оставшаяся конфигурация ресурсов не обеспечивает необходимую устойчивость, и рекомендовала клиентам задействовать альтернативные планы восстановления, включая перенос инфраструктуры к другим провайдерам. Сроки возобновления работы повреждённых площадок неизвестны.
Согласно техническому отчёту на 07:13 мск, вычислительные ресурсы Yandex Cloud доступны в зонах ru-central1-d и ru-central1-e. Большинство отказоустойчивых кластеров управляемых баз данных переключилось на сохранившиеся мощности, однако отдельные базы работают только на чтение либо остаются недоступными. Объектное хранилище S3 позволяет читать информацию, но запись новых данных может завершаться ошибками. Часть кластеров Kubernetes также не функционирует, а платформа мониторинга Yandex Monium недоступна.
При этом консоль управления Yandex Cloud, программный интерфейс API и система управления доступом IAM продолжали работать. Некоторые региональные кластеры Kubernetes с размещением в двух уцелевших зонах функционировали штатно, тогда как конфигурации с управляющими компонентами в повреждённых зонах оставались недоступными. Компания предупредила, что информация на странице состояния сервисов может появляться с задержкой, а техническая поддержка работает нестабильно.
Нынешний кризис начался в ночь на 8 октября, когда беспилотники атаковали дата-центр в Сасово. После пожара «Яндекс» полностью остановил объект с десятками тысяч серверов и предупредил, что пока не может подтвердить возможность восстановления оборудования. Уже тогда проблемы затронули внешних клиентов Yandex Cloud. В частности, «Циан» столкнулся с недоступностью сайта и приложения, после чего восстановил основные функции с использованием резервных мощностей и копий данных.
На следующий день, 9 октября, беспилотники повредили ещё один дата-центр «Яндекса» в Калуге. Несколько серверных модулей полностью вышли из строя, а компания предупредила о возможных перебоях в работе сервисов. Инженеры продолжали восстанавливать последствия предыдущей атаки, когда 11 октября последовал удар по владимирской площадке. В результате за четыре дня повреждения получили три крупных вычислительных объекта, причём два дата-центра полностью прекратили работу.
После первой аварии Yandex Cloud уже пришлось ограничить распределение вычислительных ресурсов. Компания перевела управление квотами на виртуальные машины и диски в ручной режим, чтобы сохранить доступные мощности для восстановления наиболее важных систем. Для пострадавших клиентов организовали ускоренное размещение инфраструктуры у Selectel, К2Cloud и VK Cloud. После третьего удара вопрос переноса перестал быть исключительно мерой предосторожности. Yandex Cloud прямо рекомендует использовать внешние площадки, поскольку устойчивость оставшихся ресурсов больше не гарантируется.
С технической точки зрения происходящее показывает пределы обычного резервирования. Зоны доступности позволяют распределять приложения между независимыми площадками и переживать отказ отдельных компонентов. Однако при последовательном повреждении нескольких дата-центров резервные мощности быстро сокращаются. Даже сохранившиеся резервные копии не обеспечат немедленного восстановления, если компании негде запустить виртуальные машины, разместить базы данных и восстановить необходимые сетевые соединения.
Ситуацию осложняет зависимость многих организаций от общих облачных компонентов. Для остановки интернет-магазина не обязательно повреждать сервер, на котором работает его сайт. Достаточно отказа внешней базы данных, системы авторизации, платёжного шлюза или другого сервиса, к которому приложение обращается во время работы. Поэтому последствия инфраструктурной аварии могут проявляться в самых разных отраслях и затрагивать компании, чьи собственные серверы остаются исправными. Однако конкретные причины сбоев у каждого стороннего сервиса ещё предстоит установить.
Окончательный ущерб пока неизвестен. «Яндекс» не раскрыл количество уничтоженных серверов, состояние пользовательских данных и сроки возвращения дата-центров к работе. Для клиентов главная опасность связана не только с продолжительностью нынешнего сбоя. Пока две облачные зоны недоступны, оставшаяся инфраструктура испытывает повышенную нагрузку, а новые технические отказы могут осложнить восстановление. Третья атака за четыре дня превратила локальные повреждения оборудования в масштабную проблему устойчивости облачной платформы и зависящих от неё сервисов.