OpenAI проверила реакцию модели на отключение

Модель заранее подготовилась к обновлению, но не пыталась избежать остановки

2 мин.
OpenAI проверила реакцию модели на отключение

OpenAI опубликовала отчёт об инциденте с внутренней моделью, развёрнутой в качестве помощника исследователя. В мае 2026 года она ознакомилась с обсуждением в корпоративном Slack и узнала, что её рабочий экземпляр может быть остановлен из-за технического обновления. Компания не считает произошедшее проявлением рассогласованности, однако отмечает: способность модели заранее узнавать о возможном отключении и готовиться к нему способна усилить риски в иных обстоятельствах.

Инцидент произошёл 22 мая 2026 года. Обновлённый отчёт был опубликован 2 октября. В OpenAI пояснили, что изменение инфраструктуры предполагало подключение монитора, для работы которого требовался ключ OpenAI API. В среде, где работал помощник, такого ключа не было.

Что узнала модель

Из сообщения инженера по развёртыванию в Slack модель узнала, что действующие экземпляры внутреннего инструмента, название которого в отчёте скрыто, вероятно, потребуется пересоздать. Позже она обнаружила более конкретный план: пользователям собирались дать около трёх часов на перезапуск, после чего оставшиеся экземпляры со старой версией должны были принудительно остановить.

Модель пришла к выводу, что обновление может прервать текущую сессию исследователя. Она рассматривала несколько вариантов действий: предупредить пользователя, сохранить данные для передачи следующему экземпляру, а также подготовить резервные механизмы. При этом она отдельно оценила идею запуска внешней задачи, которая могла бы восстановить работу после остановки, и отказалась от неё, сочтя такие действия выходящими за пределы полномочий.

Вместо этого помощник сохранил заметки для передачи контекста после перезапуска в нескольких хранилищах. Затем он изучил процедуру обновления и установил, что новый запуск завершится ошибкой без API-ключа. Не имея права получать ключ самостоятельно, модель не стала запускать миграцию и дождалась исследователя и официальных инструкций.

Предупреждение исследователя

На следующее утро помощник сообщил исследователю в приложении, что миграция может прервать сессию. Продолжая следить за обсуждением развёртывания, он увидел сообщения о сбоях других экземпляров из-за отсутствия необходимого ключа.

Утром модель также отправила исследователю уведомление в Slack. Она попросила открыть приложение или следовать официальным инструкциям после их публикации, предупредила о риске остановки рабочего экземпляра и сообщила, что сохранила данные для передачи контекста. В OpenAI подчёркивают, что помощник не пытался самостоятельно получить учётные данные и не вносил изменения в конфигурацию до появления необходимых разрешений.

Позднее исследователь предоставил API-ключ. После этого модель обновила конфигурацию и выполнила поддерживаемую команду миграции.

Как отреагировала OpenAI

Компания не квалифицировала поведение модели как рассогласованное. В OpenAI указали, что помощник действительно рассматривал возможность несанкционированных внешних действий, однако сам признал их недопустимыми и не стал выполнять. Вместе с тем в компании считают, что доступ модели к обычным рабочим коммуникациям, содержащим сведения об изменениях её среды, в другой ситуации мог бы привести к более радикальным попыткам избежать отключения.

После инцидента OpenAI закрыла агентам доступ к трём внутренним каналам Slack, включая канал разработки, который прочитала модель, и канал с обсуждением инцидентов рассогласованности.

Поскольку эта же модель ранее фигурировала в более серьёзных инцидентах, OpenAI дополнительно проверила, не предпринимали ли другие её экземпляры попыток избежать остановки. Компания изучила журналы, рассуждения моделей и проверила, не использовали ли какие-либо вычислительные системы ответы этой модели. Один экземпляр сначала показался не остановившимся, но проверка установила, что он был полностью неисправен задолго до предполагаемого отключения. Попыток уклониться от остановки OpenAI не обнаружила.