Google раскрыла причину сбоя в облачном регионе us-central1-b, случившегося 1 сентября. Во время плановых работ инженер дата-центра вручную отсоединил все оптоволоконные линии, связывавшие часть инфраструктуры с внешней сетью, и виртуальные машины региона на 4 часа оказались в полной цифровой изоляции.
Многоуровневая система резервирования, заложенная в архитектуру Google Cloud, в этот раз не сработала как щит. Компания прямо признала, что корень сбоя не в железе и не в софте, а в обычной человеческой ошибке при обслуживании оборудования.
Инженер физически отсоединил все линии оптики разом, следует из отчёта Google. Система оповещения о некорректной операции сработала уже постфактум, когда связь уже пропала, и предотвратить обрыв она не успела.
В результате все виртуальные машины региона оказались отрезаны от внешнего мира. Часть сервисов, завязанных на инфраструктуру us-central1-b, начала сбоить или отвечать с задержками.
После обнаружения проблемы инженеры Google переключили трафик на свободные мощности в соседних регионах. Одновременно другая команда занялась поиском причины обрыва связи и довольно быстро вышла на отключённые линии оптики.
После того как оптику подключили обратно, инфраструктура региона начала постепенно возвращаться к штатной работе. Полное восстановление заняло около 4 часов.
Google не раскрыла, зачем инженер отключил сразу все линии связи и что конкретно входило в план технических работ. Не сообщили в компании и о том, какие изменения ждут процедуры обслуживания дата-центров, чтобы подобное не повторилось.