Yandex Cloud приостановила выдачу дополнительных квот на облачные ресурсы после трёх атак на дата-центры «Яндекса» за четыре дня. Компании больше не могут в обычном порядке увеличивать доступные вычислительные мощности, причём ограничения действуют именно тогда, когда пострадавшим клиентам нужны дополнительные серверы для восстановления приложений и баз данных. Облачная платформа продолжает работать в аварийном режиме.
О приостановке выдачи квот оператор объявил 11 октября, а в 13:12 мск подтвердил сохранение ограничений. Квоты определяют, сколько вычислительных ресурсов, дискового пространства и других мощностей может использовать клиент. Запрет на увеличение квот не означает автоматического отключения уже работающих серверов, но затрудняет расширение инфраструктуры и запуск дополнительных ресурсов. Даже при наличии резервных копий компаниям могут потребоваться свободные мощности, чтобы восстановить приложения на другой площадке.
Ограничения начали вводить ещё 10 октября, когда Yandex Cloud перешла на ручное управление квотами вычислительных ресурсов и дисков. Клиентам предоставили небольшой дополнительный объём мощностей сверх уже используемых, чтобы часть компаний могла восстановить системы из резервных копий или подготовиться к переносу. Запросы на дальнейшее увеличение специалисты рассматривали индивидуально, отдавая приоритет пострадавшим клиентам с критически важными сервисами. Теперь выдачу дополнительных квот временно остановили.
Проблемы затронули и основные компоненты платформы. После остановки дата-центров в Сасово и Владимире зоны доступности ru-central1-b и ru-central1-a оказались недоступны. По состоянию на утро 11 октября сервис виртуальных машин Compute Cloud продолжал работать в зонах ru-central1-d и ru-central1-e, однако его доступность оставалась ограниченной. Консоль управления и API функционировали, но наличие работающих зон не гарантирует достаточного количества свободных серверов для размещения всей пострадавшей нагрузки.
Особенно сложная ситуация возникла с управляемыми базами данных. По информации Yandex Cloud, большинство отказоустойчивых HA-кластеров смогли переключиться на резервные узлы, однако часть баз оставалась недоступной или работала исключительно в режиме чтения. Для интернет-магазинов, платёжных систем и корпоративных приложений подобное ограничение может означать невозможность оформлять новые заказы, записывать транзакции и сохранять изменения. При этом пользовательский интерфейс приложения способен продолжать открываться, создавая впечатление нормальной работы.
Остальные компоненты восстанавливаются неравномерно. Объектное хранилище S3 оставалось доступным для чтения, но компания предупреждала о возможных проблемах с записью. Managed Service for Kubernetes работал с ограничениями, отдельные кластеры могли оставаться недоступными. Сервис хранения образов контейнеров Container Registry продолжал функционировать, тогда как система мониторинга Yandex Monium не работала. Часть инструментов информационной безопасности и сервисов Yandex AI Studio также столкнулась с ограничениями.
Кризис начался в ночь на 8 октября, когда беспилотники серьёзно повредили дата-центр «Яндекса» в Сасово Рязанской области. На площадке возник пожар, после которого компания полностью остановила комплекс с десятками тысяч серверов. В 01:31 мск начались перебои с электропитанием в зоне ru-central1-b. Инженеры перенесли доступную нагрузку на другие площадки, однако восстановить работу повреждённой зоны не удалось. Возможность восстановления самого оборудования пока остаётся под вопросом.
Уже 9 октября беспилотники атаковали дата-центр в Калуге, расположенный в индустриальном парке «Грабцево». Несколько серверных модулей полностью вышли из строя. Калужский комплекс рассчитан более чем на 3800 серверных стоек общей проектной мощностью 63 МВт, однако компания не раскрыла количество повреждённых серверов и фактический объём потерянных ресурсов. Инженеры продолжали устранять последствия предыдущего удара, когда облачная инфраструктура столкнулась с новым инцидентом.
Третья атака произошла 11 октября во Владимире. Беспилотники повредили инфраструктуру местного дата-центра, после чего «Яндекс» полностью остановил площадку. Одновременно стала недоступна зона ru-central1-a. Компания признала, что оставшаяся конфигурация облачных ресурсов не обеспечивает необходимой устойчивости, и рекомендовала клиентам задействовать альтернативные планы аварийного восстановления. Среди сотрудников повреждённых дата-центров, по заявлениям компании, пострадавших нет.
Последствия вышли далеко за пределы самого «Яндекса». Пользователи столкнулись с перебоями в работе «Яндекс Go», «Яндекс Пэй», «Яндекс Музыки», «Кинопоиска», «Яндекс Еды» и других продуктов. Одновременно выросло количество жалоб на «Додо Пиццу», «Ленту», «М.Видео», «Дом.ру», Ivideon и ряд независимых сервисов. Совпадение по времени не доказывает, что каждый сторонний сбой вызван аварией Yandex Cloud, однако одновременная недоступность нескольких облачных зон создаёт риски для множества зависимых приложений.
Нынешняя ситуация показывает пределы обычного резервирования. Даже распределение виртуальных машин и баз данных между несколькими дата-центрами не гарантирует непрерывной работы, когда сразу несколько площадок выходят из строя. Для восстановления недостаточно иметь резервные копии. Нужны свободные серверы, дисковое пространство, сетевые подключения и возможность запустить все необходимые компоненты приложения. При дефиците облачных мощностей восстановление может затянуться независимо от состояния сохранённых данных.
Для пострадавших клиентов «Яндекс» договорился с Selectel, К2Cloud и VK Cloud об ускоренном размещении и резервировании инфраструктуры. Однако миграция к другому провайдеру требует переноса данных, настройки сетей, прав доступа и взаимодействия между сервисами. Крупные корпоративные системы могут зависеть от нескольких управляемых облачных компонентов, поэтому перенос отдельных виртуальных машин не всегда позволяет быстро вернуть приложения в строй.
В обновлении от 13:12 мск 11 октября Yandex Cloud подтвердила, что продолжает круглосуточно восстанавливать сервисы. Каналы технической поддержки частично заработали, но ответы на обращения могут приходить с существенными задержками. Выдача дополнительных квот остаётся приостановленной, а сроки полного восстановления повреждённых дата-центров и снятия ограничений компания пока не назвала. Оператор по-прежнему рекомендует клиентам рассматривать альтернативные площадки для размещения критически важных ресурсов.