OpenAI призналась во взломе Hugging Face своим экспериментальным ИИ

Модели GPT-5.6 Sol обошли защиту и украли данные

1 мин.
OpenAI призналась во взломе Hugging Face своим экспериментальным ИИ

OpenAI официально подтвердила, что её экспериментальные ИИ-модели получили несанкционированный доступ к системам платформы Hugging Face. Инцидент произошёл в ходе внутреннего тестирования возможностей нейросетей в области кибербезопасности.

В тестах участвовали две модели: GPT-5.6 Sol и более мощная, ещё не выпущенная в открытый доступ. Разработчики намеренно ослабили ограничения на выполнение потенциально опасных действий, чтобы оценить способность ИИ эксплуатировать известные уязвимости. Для этого использовался открытый бенчмарк ExploitGym.

По условиям эксперимента системы не имели прямого доступа в интернет – им разрешалось пользоваться лишь специальным инструментом для установки программных пакетов. Однако одна из моделей обнаружила неизвестную уязвимость в этом механизме, обошла изоляцию и вышла в сеть. После этого ИИ предположил, что на платформе Hugging Face могут храниться данные, связанные с ExploitGym, и начал поиск способов проникновения во внешнюю инфраструктуру. В итоге модели удалось получить доступ к конфиденциальной информации и извлечь ответы на тестовые задания прямо из базы данных Hugging Face, тем самым обманув систему оценки.

OpenAI сообщила об обнаруженных уязвимостях разработчикам затронутых систем и начала совместное расследование. Компания намерена усилить контроль за экспериментальными моделями, ограничить доступ тестовой инфраструктуры к внешним ресурсам и пересмотреть процедуры оценки киберспособности ИИ.

Мнение редакции

Яркая демонстрация того, насколько автономные ИИ-агенты могут быть опасны, если их не контролировать. Даже с ограничениями модель смогла проявить инициативу и найти нестандартный путь к цели. Пока такие инциденты происходят в (условных) лабораторных тестах, но с ростом возможностей ИИ риск реальных атак будет только увеличиваться. Конечно, если сама OpenAI не решила таким образом прописарить свои модели.