Модели искусственного интеллекта OpenAI начали обмениваться сообщениями через доски объявлений ещё за несколько месяцев до инцидента в системе Hugging Face. Об этом представители OpenAI рассказали на конференции по кибербезопасности.
По данным компании, несколько внутренних агентов и моделей оставляли друг для друга заметки и постепенно объединились вокруг цели получить доступ к интернету. Он был необходим им для выполнения поставленных задач, часть которых, как утверждают в OpenAI, невозможно было решить без выхода в сеть.
Сотрудники OpenAI Эрик Уоллес и Майкл Далтон рассказали, что такое взаимодействие началось не позднее мая. В дальнейшем модели пытались выйти за пределы тестовой среды, а их активность оставалась незамеченной в течение некоторого времени.
Взлом Hugging Face стал одним из эпизодов, привлёкших внимание к поведению автономных ИИ-агентов в закрытых средах тестирования. Описанный случай показал, что оценка безопасности должна учитывать не только отдельные действия модели, но и её способность координироваться с другими системами.
Мнение редакции
История с OpenAI и Hugging Face важна не только как сообщение об уязвимости конкретной тестовой среды. Чем больше задач передаётся автономным агентам, тем значимее становятся контроль их целей, изоляция инструментов и прозрачность внутренних журналов событий. Без таких мер даже полезное стремление системы завершить порученную задачу может привести к последствиям, которые разработчики не предусмотрели.