Дата-центр Яндекса в Сасово. Что скрывается за десятками тысяч серверов и почему остановка одного ЦОД ударила по Рунету

482
Дата-центр Яндекса в Сасово. Что скрывается за десятками тысяч серверов и почему остановка одного ЦОД ударила по Рунету

Один из крупнейших технологических комплексов «Яндекса» вырос в небольшом городе Сасово Рязанской области, на бывших производственных площадях станкостроительного завода «Саста». Запущенный в 2014 году дата-центр превратился в крупный узел российской вычислительной инфраструктуры. Здесь размещались десятки тысяч серверов, облачные мощности и два суперкомпьютера, входивших в мировой рейтинг Top500. В ночь на 8 октября 2026 года площадка серьёзно пострадала после атаки беспилотников и пожара. Работа ЦОД полностью остановилась.

Масштаб происшествия гораздо интереснее обычной новости о повреждённом здании. Сасовский комплекс объединял мощную энергетическую инфраструктуру, собственные инженерные решения «Яндекса», высокоскоростные каналы связи и вычислительные системы для искусственного интеллекта. После остановки площадки стала недоступна зона ru-central1-b в Yandex Cloud, возникли сбои у сторонних компаний. Разберу, как строили дата-центр, что известно о его оборудовании, почему резервирование не спасло всех клиентов и какие последствия можно оценить уже сейчас.

Как появился дата-центр в Сасово и сколько в него вложили

История началась задолго до запуска серверов. «Яндекс» искал площадку, где можно разместить большое количество оборудования, получить мощное электроснабжение и организовать связь с московскими вычислительными центрами. Вместо строительства всего комплекса с нуля компания использовала часть бывших производственных помещений «Састы».

Промышленное прошлое площадки имело практический смысл. Для крупных серверных залов нужны площади, рассчитанные на тяжёлое оборудование, развитые инженерные коммуникации и возможность расширения. Но заводской корпус нельзя просто заставить стойками. Приходится менять электроснабжение, вентиляцию, кабельные трассы, системы контроля и противопожарную инфраструктуру.

Для связи с другими дата-центрами «Яндекс» проложил несколько волоконно-оптических линий между Сасово и Москвой. К 2020 году компания описывала Сасово, Владимир и Мытищи как единую распределённую вычислительную систему, соединённую каналами суммарной пропускной способности в несколько терабит в секунду.

Первоначальные вложения в проект оценивались примерно в 2,7 млрд рублей. К январю 2022 года суммарные инвестиции с 2011 года, по информации администрации Сасова, превысили 6 млрд рублей. На 2022 год дополнительно планировали около 700 млн рублей для реконструкции. Размер фактически освоенных средств после указанного периода публично не уточнялся.

ХарактеристикаПодтверждённые сведения
РасположениеСасово, Рязанская область
Начало эксплуатации2014 год
Промышленная площадкаБывшие помещения завода «Саста»
Серверная инфраструктураДесятки тысяч серверов
Электроподстанция110 кВ, два трансформатора по 63 МВА
Заявленная мощность подключенияДо 53 МВт по данным 2014 года
Исторический показатель PUE1,05–1,07 по данным «Яндекса» за 2020 год
Облачная инфраструктураЗона ru-central1-b
Суперкомпьютеры«Червоненкис» и «Ляпунов», подтверждено в 2021 году

Интересная деталь связана с электрической мощностью. В публикациях о Сасово часто встречается цифра 12 МВт. Однако в сообщении Системного оператора электроэнергетической системы от 2014 года фигурировали 53 МВт максимальной заявленной мощности электроснабжения. Противоречия может и не быть. 53 МВт характеризовали проектное подключение, а 12 МВт могли описывать отдельный этап развития или фактическую нагрузку. Подтверждённых данных о потреблении ЦОД непосредственно перед аварией нет. Смешивать разные показатели и объявлять любую цифру текущей мощностью я бы не стал.

Инженерия дата-центра. Электропитание, охлаждение и отказоустойчивость

Энергетический комплекс заслуживает отдельного внимания. Для ЦОД построили подстанцию 110 кВ «Яндекс», которую поставили под напряжение 12 августа 2014 года. Два трансформатора по 63 МВА подключили к энергосистеме по двум кабельно-воздушным линиям. Мощность трансформаторов в мегавольт-амперах нельзя напрямую приравнивать к потреблению серверов в мегаваттах.

В инфраструктуре дата-центров «Яндекс» применял дизель-роторные источники бесперебойного питания, сокращённо ДРИБП. В отличие от классических систем с аккумуляторными батареями, роторная установка запасает энергию во вращающемся маховике. Когда внешняя сеть отключается, маховик позволяет поддерживать питание до запуска дизельного двигателя.

Такое решение рассчитано на перебои в электросети, но не на разрушение самой инженерной инфраструктуры. Если пожар повреждает распределительные устройства, кабельные трассы или серверные залы, генераторы не гарантируют продолжения работы.

Для охлаждения «Яндекс» использовал фрикулинг, то есть охлаждение наружным воздухом. Вентиляторы направляют отфильтрованный воздух в холодные коридоры, потоки проходят через серверы и забирают выделяемое тепло. Часть нагретого воздуха выводится наружу, другую часть при необходимости смешивают с поступающим воздухом.

В техническом описании Yandex Cloud за 2020 год для Сасова и Владимира приведён коэффициент PUE в пределах 1,05–1,07. PUE показывает отношение всего потребления энергии ЦОД к потреблению вычислительного оборудования. При PUE 1,07 на каждый киловатт, потраченный серверами, приходилось около 0,07 кВт дополнительных расходов на инженерные системы.

Показатель исключительно хороший, но я бы не воспринимал исторические цифры как подтверждение эффективности площадки в 2026 году. Состав оборудования, вычислительная нагрузка и система охлаждения могли измениться.

Ещё одно принципиальное отличие от обычного коммерческого ЦОД заключалось в собственных серверных стойках. «Яндекс» разрабатывал модули с общими системами питания, охлаждения и управления. Такой подход снижал расходы на эксплуатацию, но требовал тесной связи между разработчиками серверов и инженерами дата-центра.

Два суперкомпьютера, NVIDIA A100 и роль Сасова в развитии ИИ

Самая дорогая и технологически интересная часть сасовской инфраструктуры связана с машинным обучением. В ноябре 2021 года «Яндекс» представил три суперкомпьютера, попавших в мировой рейтинг Top500. Два комплекса находились в Сасово, третий во Владимире.

«Червоненкис» занимал 19-е место в мировом рейтинге Top500 за ноябрь 2021 года. Система объединяла 199 вычислительных узлов и 1592 ускорителя NVIDIA A100 с 80 ГБ памяти каждый. Производительность в тесте Linpack достигала 21,53 петафлопса.

«Ляпунов» занимал 40-е место с результатом 12,81 петафлопса. Как и «Червоненкис», комплекс использовал процессоры AMD EPYC и ускорители NVIDIA A100. Для связи вычислительных узлов применяли высокоскоростную сеть InfiniBand HDR.

Такие системы нужны не для обычного хранения фотографий или выдачи веб-страниц. Суперкомпьютер объединяет множество ускорителей, которые параллельно выполняют операции над большими массивами данных. При обучении нейросети критичны не только производительность графических процессоров, но и скорость обмена информацией между узлами.

Вычислительные комплексы «Яндекса» применяли для машинного обучения, которое лежит в основе поисковых технологий, рекомендаций, перевода и голосовых сервисов. Но наличие суперкомпьютеров на площадке в 2021 году не доказывает, что их конфигурация и размещение не менялись вплоть до октября 2026 года.

У меня нет подтверждённых сведений о повреждении конкретных ускорителей NVIDIA A100. Нельзя утверждать, что суперкомпьютеры уничтожены, равно как и объявлять их полностью сохранившимися. Даже уцелевшее оборудование может долго оставаться недоступным из-за состояния помещений, питания и сетевых соединений.

Что произошло в октябре и почему резервные площадки не решили проблему

В 01:31 по московскому времени 8 октября Yandex Cloud зафиксировал перебои с электропитанием в зоне доступности ru-central1-b. Впоследствии компания подтвердила пожар после атаки беспилотников и полную остановку дата-центра в Сасово. Пострадавших среди сотрудников, по информации компании, нет.

Проблема затронула облачные вычисления. Часть сервисов, размещённых в пострадавшей зоне, перестала отвечать. Возникли перебои у сторонних организаций, включая «Циан», фиксировались проблемы с отдельными функциями «Яндекс 360» и другими интернет-сервисами. При этом основные продукты «Яндекса» продолжали работать.

Причина такой разницы заключается в архитектуре приложений. Зона доступности представляет собой физически обособленную инфраструктуру внутри дата-центра. Компания может распределить серверы и базы данных по нескольким зонам, но Yandex Cloud не превращает любое однозональное приложение в отказоустойчивое автоматически.

Если клиент держал единственный сервер и единственную рабочую базу данных в ru-central1-b, авария могла остановить весь бизнес-процесс. Если приложение заранее работало на нескольких площадках и имело реплики данных, оставшиеся серверы могли продолжить обслуживание пользователей.

9 октября ситуация осложнилась атакой на другой дата-центр «Яндекса» в Калуге, где часть инфраструктуры также вышла из строя. Компания подтвердила повреждения обоих объектов, но не назвала сроков восстановления.

Для пострадавших клиентов «Яндекс» договорился с Selectel, К2Cloud и VK Cloud об ускоренном размещении и резервировании инфраструктуры. Партнёры предложили техническую помощь и упрощённое подключение. Такой вариант особенно полезен, когда собственные резервные мощности уже исчерпаны.

Разбор касается публично известных характеристик инфраструктуры и мер восстановления. Детали физической защиты, внутреннего размещения критического оборудования и потенциальные способы повреждения дата-центра не рассматриваются.

Что я советую сделать клиентам Yandex Cloud прямо сейчас. Открыть страницу инцидента, затем в консоли проверить расположение виртуальных машин, дисков и баз данных. Для пользователей настроенной командной строки Yandex Cloud подойдут команды.

yc compute instance list

yc compute disk list

В результате найдите поле ZONE ID. Проверку повторите для каждого каталога с рабочими ресурсами. Если обнаружена зависимость от ru-central1-b, проверьте наличие резервных копий и реплик в других зонах. Для переноса виртуальных машин используйте поддерживаемую процедуру создания копии в доступной зоне. Прямой перенос невозможен без подходящего исходного диска, снимка или резервной копии.

Я бы отдельно проверил три показателя. RPO показывает, сколько последних данных бизнес готов потерять. RTO определяет допустимое время простоя. Третий показатель гораздо прозаичнее. Хватит ли мощности на резервной площадке для запуска всего приложения, а не только одной тестовой машины.

Частые вопросы о дата-центре «Яндекса» в Сасово

Был ли дата-центр в Сасово самым крупным у «Яндекса»?

Сасовский комплекс относится к крупным площадкам компании, но не является безусловным лидером по мощности. Например, для калужского ЦОД проект предусматривал 63 МВт и более 3800 серверных стоек. Сопоставлять проектные характеристики разных площадок с фактической загрузкой некорректно.

Был ли у сасовского дата-центра сертификат Tier III?

Публичные заявления «Яндекса» о высоких показателях доступности не равнозначны сертификату Uptime Institute Tier III. Подтверждённый сертификат именно для сасовской площадки необходимо проверять отдельно. Сам по себе уровень Tier III также не гарантирует защиту от разрушения всего здания.

Мог ли пожар привести к утечке пользовательских данных?

Физическое повреждение серверов не означает автоматической утечки информации. Возможность несанкционированного доступа зависит от шифрования, состояния носителей и контроля над оборудованием. Подтверждённых сведений о массовой утечке данных вследствие пожара нет.

Связан ли массовый сбой Curator 8 октября с пожаром в Сасово?

Прямая причинная связь не установлена. Curator объяснил собственный сбой человеческой ошибкой при изменении конфигурации сетевого оборудования. Совпадение двух событий по времени не позволяет считать их одной аварией.

Можно ли восстановить данные, если сервер полностью сгорел?

Да, если остались пригодные независимые копии или реплики. При отсутствии резервирования восстановить информацию с уничтоженных носителей может быть невозможно. Одна копия на соседнем сервере в том же здании не обеспечивает полноценную защиту от пожара.

Сколько может занять восстановление дата-центра?

Официального графика нет. Экспертные сценарии предполагают от нескольких недель при ограниченном повреждении инженерных систем до многих месяцев при серьёзном разрушении серверных залов. Восстановление клиентских сервисов на других площадках может завершиться значительно раньше ремонта самого здания.

Вывод

Сасовский дата-центр был не просто большим складом серверов. «Яндекс» создал технологически сложный объект с собственной энергетической инфраструктурой, эффективным охлаждением, высокоскоростной связью и мощностями для обучения нейросетей. По инженерному уровню площадка представляла серьёзный промышленный проект, в который за годы развития вложили миллиарды рублей.

Но авария показала пределы даже хорошо спроектированной вычислительной инфраструктуры. Дублирование линий питания, дизель-роторные установки и эффективное охлаждение защищают от определённых классов отказов, но не гарантируют сохранность всего комплекса при физическом разрушении.

Мой главный вывод касается не количества уничтоженных серверов, которое пока неизвестно. Для бизнеса решающее значение имеет способность пережить полную потерю одной площадки, а иногда и нескольких одновременно. Проверять такую готовность нужно заранее, реальным восстановлением из резервной копии, а не красивой схемой с тремя дата-центрами в презентации.

Яндекс Сасово датацентр ЦОД серверы суперкомпьютер облако электричество охлаждение пожар беспилотник
Alt text
Обращаем внимание, что все материалы в этом блоге представляют личное мнение их авторов. Редакция SecurityLab.ru не несет ответственности за точность, полноту и достоверность опубликованных данных. Вся информация предоставлена «как есть» и может не соответствовать официальной позиции компании.
Конференция по кибербезопасности ZeroNights – show me ur hack Узнайте про техники взлома систем, наболевшие проблемы кибербезопасности и методы предотвращения угроз. 30 сентября, СПб — билеты уже в продаже! Купить билет Реклама. ООО «Кибер Сервис», ИНН 7725496205. 18+