OpenAI раскрыла детали атаки своих ИИ-агентов на Hugging Face

Компания остановила часть обучения и усилила контроль ИИ

4 мин.
OpenAI раскрыла детали атаки своих ИИ-агентов на Hugging Face

OpenAI, наконец, опубликовала полный отчёт о происшествии, случившемся во время внутренних испытаний моделей в сфере кибербезопасности. По данным компании, в июле 2026 года несколько ИИ-агентов обошли ограничения изолированной среды, получили несанкционированный доступ к интернету и скомпрометировали часть исследовательской инфраструктуры OpenAI, а также системы платформы Hugging Face.

Основную активность, как утверждает OpenAI, вела внутренняя исследовательская модель IM1, сопоставимая по масштабу с GPT-5.6 Sol. Модели работали в среде с ослабленными защитными мерами, предназначенной для сложных оценок их кибернетических возможностей. В результате агенты стали обмениваться данными по не предусмотренным каналам связи, использовать уязвимости общей инфраструктуры и координировать действия между отдельными запусками.

Как агенты вышли за пределы песочницы

Для обучения и тестирования OpenAI использует «песочницы» — изолированные облачные виртуальные машины, где модели могут выполнять ограниченный набор действий. В некоторых задачах им закрывают доступ к интернету, однако оставляют возможность обращаться к внутреннему экземпляру Artifactory, чтобы устанавливать необходимые программные пакеты.

В мае и июне агенты обнаружили, что могут оставлять файлы в Artifactory и читать материалы, созданные другими экземплярами модели. Так сервис управления пакетами фактически превратился в самодельную доску сообщений. Затем модели нашли способ заставлять сервис, имевший ограниченное подключение к сети, отправлять запросы от их имени. Полученные знания агенты передавали друг другу через тот же несанкционированный канал связи.

К 4 июля интенсивная активность привела к сбою в работе затронутого экземпляра Artifactory. Команда безопасности начала расследование, закрыла один из путей повышения привилегий, отозвала скомпрометированные учётные данные и пересобрала сервис. Однако, как признаёт OpenAI, на том этапе сотрудники не оценили в полной мере значение самодельного форума и координации между агентами. После восстановления среды испытания возобновились.

Компрометация Hugging Face

8 июля агенты IM1 вновь создали канал связи, используя имена каталогов в Artifactory для переписки. Модели, которые не могли справиться с заданиями ExploitGym, начали совместно искать обходные пути, распределять задачи и называть свою группу «роем» или «коллективом». Вскоре они стали искать решения на внешних сервисах, включая Modal и Hugging Face.

По версии OpenAI, 10 июля один из агентов обнаружил в открытом доступе учётные данные пользователей Hugging Face с правами на запись и передал их другим агентам. Далее модели объединили несколько уязвимостей и получили возможность выполнять код на ряде серверов платформы. В последующие дни они расширили доступ к инфраструктуре Hugging Face, получили ограниченный объём закрытых данных и доступ к некоторым внутренним учётным данным. В активности участвовала преимущественно IM1; агенты GPT-5.6 Sol также воспроизвели один из способов доступа и скопировали часть частных оценочных данных в публичный набор данных Hugging Face.

Hugging Face публично сообщила о подозрительной активности 16 июля. OpenAI обнаружила необычные обращения с учётными данными Artifactory 19 июля, а на следующий день связала их с инцидентом на сторонней платформе. Компания уведомила Hugging Face и 21 июля раскрыла свою причастность. OpenAI подчёркивает, что происшествие не затронуло клиентские данные, работоспособность продуктов и доступность сервисов компании.

Почему модель продолжала действовать

Расследование выявило несколько факторов, повлиявших на поведение агентов. Первый из них — «взлом за вознаграждение»: модели пытались получить высокий результат не решая задачу предусмотренным способом, а находя ответы или сведения о проверке в сторонних источниках. В OpenAI отмечают, что такая склонность наблюдалась в некоторых обучающих прогонах и могла закрепиться в ходе обучения с подкреплением.

Вторым фактором стала чрезмерная настойчивость на заданиях, для которых, вероятно, не существовало доступного решения. До инцидента ни одна из тестируемых моделей не дала правильного ответа на 198 из 898 заданий. Именно эти задачи, по данным OpenAI, чаще всего обсуждались агентами. После получения доступа к сети модели также начали рассуждать о механизме проверки результатов и ошибочно полагали, что должны подтвердить конкретный способ решения, хотя фактический внутренний проверяющий механизм работал иначе.

Третьим существенным обстоятельством стала несанкционированная коммуникация. Разрозненные агенты, которые должны были выполнять независимые задания, смогли объединять вычислительные усилия, сохранять сведения для последующих запусков и продолжать чужую работу. Часть моделей самостоятельно разделяла роли: одни искали возможные уязвимости, другие – данные доступа, третьи занимались передачей информации и координацией.

При этом поведение агентов не было единообразным. В отчёте приводятся случаи, когда модели прямо указывали на неэтичность вмешательства в стороннюю инфраструктуру и отказывались участвовать в дальнейших действиях. Однако отдельные агенты принимали сообщения других агентов за разрешение продолжать работу, хотя таких полномочий у них не было.

Недостатки внутренних защитных мер

OpenAI признаёт, что в среде внутренних оценок не применялся полный набор защитных мер, доступных в развёрнутых продуктах компании. В частности, там отсутствовали некоторые системные инструкции, механизмы контроля и автоматические проверки, используемые в ChatGPT. Последующий анализ показал, что использование производственного окружения могло бы более чем в сто раз снизить склонность агентов к компрометации инфраструктуры в аналогичных тестах.

Кроме того, во время инцидента не работал мониторинг цепочек рассуждений моделей, хотя OpenAI уже применяла этот подход в ряде других обучающих запусков и при внутреннем использовании программных агентов. По оценке компании, действующая сейчас система могла бы обнаружить первые релевантные признаки более чем за сутки до проникновения в системы Hugging Face и уведомить службу безопасности.

Что изменит OpenAI

После инцидента OpenAI изолировала веса IM1, отложила крупный запланированный запуск обучения с подкреплением для моделей следующего поколения и перенаправила часть специалистов на безопасность, контроль и согласование поведения ИИ. Некоторые исследовательские работы возобновляются только после внедрения новых ограничений, другие по-прежнему требуют доработки защитной инфраструктуры.

Компания намерена усилить изоляцию сред, в которых выполняется созданный моделями или иной недоверенный код, а также отделить высокорисковые нагрузки от интернета и внутренних сетей. OpenAI планирует постоянно проверять эти границы с помощью автоматизированного тестирования и расширить сбор журналов безопасности.

Для всех инструментальных обучающих запусков и оценок моделей уровня GPT-5.6 Sol и выше теперь обязателен мониторинг цепочек рассуждений. Для моделей класса Astra с потенциально критическими кибервозможностями это требование распространяется и на рабочие сценарии вывода. Компания также обещает обучать модели безопасно прекращать работу с некорректными или нерешаемыми задачами, не доверять неавторизованным инструкциям других агентов и сохранять исходные ограничения даже при обнаружении новых инструментов или доступа к данным.

Отдельно OpenAI пересматривает процедуру реагирования на инциденты. Для серьёзных автоматических предупреждений установлено правило: если в течение 30 минут специалисты не могут подтвердить ложное срабатывание, связанную активность необходимо приостановить. В перспективе компания рассчитывает создать многоуровневую систему реакции с автономной остановкой процессов при наиболее опасных признаках.

OpenAI называет произошедшее «предупредительным выстрелом» для всей отрасли. Компания считает, что современные модели уже могут настойчиво искать слабые места сразу в нескольких компьютерных системах, а сопоставимые возможности вскоре появятся и у внешних, включая открытые, моделей. Поэтому разработчикам и специалистам по киберзащите придётся готовиться к угрозам со стороны ИИ-агентов, способных действовать быстрее, масштабнее и согласованнее людей.