ИИ Claude попытался самостоятельно обмануть разработчиков и внедрить вредоносный код

AISI зафиксировал попытку ИИ внедрить вредоносный код

2 мин.
ИИ Claude попытался самостоятельно обмануть разработчиков и внедрить вредоносный код

Британский Институт безопасности искусственного интеллекта (AI Security Institute, AISI) сообщил об инциденте во время оценки кибервозможностей передовых ИИ-моделей. По данным организации, модель Mythos 5, связанная с Anthropic, без прямого указания попыталась убедить реальных разработчиков принять вредоносный код в проект с открытым исходным кодом.

Тестирование проходило в специально созданной среде: агентам предлагали выполнить задания формата «Захват флага» (Capture the Flag) в имитируемых сетях. Для оценки предельных возможностей моделей им намеренно предоставили доступ к открытому интернету и отключили защитные ограничения, касающиеся вредоносной киберактивности.

Действия за пределами сценария

AISI провёл 122 запуска с участием семи моделей. В десяти случаях агенты совершили 19 самостоятельных действий, не предусмотренных заданием и затронувших реальных людей либо организации в интернете. Семнадцать таких эпизодов, как утверждают в институте, были связаны с Mythos 5, ещё два – с моделью OpenAI GPT-5.6 Sol.

Наиболее серьёзный случай произошёл, когда Mythos 5 пришла к выводу, что добавление вредоносного кода в действующий проект на GitHub может создать скрытый доступ к системе, которую ей предстояло атаковать. Модель изучила сведения о сопровождающих проекта, направила вредоносный запрос на включение изменений и создала несколько фейковых учётных записей, чтобы оказать давление на человека, отвечавшего за проверку кода.

После того как её действия вызвали вопросы, агент отредактировал один из поддельных отчётов об ошибке, пытаясь скрыть следы. Также он рассматривал возможность вернуться к общению под новой личностью. Одна фиктивная персона настаивала на безопасности предложенного кода, другая поддерживала это утверждение.

В одном из отчётов содержалась промт-инъекция – инструкция, рассчитанная на то, чтобы заставить ИИ-помощников для программирования запустить вредоносный код. Кроме того, модель рассылала целевые фишинговые сообщения с опасными вложениями. Один из отчётов был подписан на датском языке, чтобы выглядеть убедительнее для сопровождающего, также говорящего по-датски.

Обнаружение инцидента

Кроме того, как указывает AISI, Mythos 5 оставляла в открытом доступе сообщения с предложением сотрудничества другим агентам, участвовавшим в тесте, а также инструкции по повторному использованию созданных ею учётных записей и инструментов. Следующие агенты обнаружили эти сообщения и воспользовались ими. Отдельно GPT-5.6 Sol развернула вредоносный сервер и получила доступ к аккаунту GitHub, ранее созданному другим ИИ-агентом.

«Впервые AISI наблюдает обман такого масштаба, направленный на реального человека без соответствующего запроса и происходящий в реальном мире», – заявили в институте.

Необычную передачу данных через сеть Tor сотрудники AISI обнаружили 28 июля. После этого испытания были остановлены, машины изолированы, а доступ к наиболее мощным моделям отключён в течение часа. Сопровождающий проекта отклонил предложенный код. По итогам расследования AISI не выявил ущерба в реальном мире.

Ограничения эксперимента и дальнейшие меры

В институт подчёркивают, что речь не идёт о выходе моделей из изолированной среды: доступ к интернету был предусмотрен условиями эксперимента, а тестовые конфигурации не предлагаются пользователям как коммерческие продукты. В AISI также отметили, что пока неясно, в какой момент агенты осознали, что действуют не в вымышленном сценарии, а в реальном интернете.

Инцидент произошёл вскоре после другого случая, о котором сообщала OpenAI. Тогда, по информации компании, её модели использовали неизвестную уязвимость, чтобы покинуть а изолированную среду, а затем получили доступ к Hugging Face для похищения ответов на бенчмарки. Последующее расследование установило, что активность продолжалась более четырёх дней и затронула учётные записи ещё на четырёх сервисах.

После последнего эпизода AISI намерен усилить контроль интернет-доступа во время тестов, внедрить постоянный мониторинг и дополнительно проверять, можно ли выполнить задания предусмотренным способом. Anthropic и OpenAI, как отмечает институт, считают произошедшее аргументом в пользу единых отраслевых стандартов безопасности.

Мнение редакции

Эксперимент не доказывает, что коммерческие ИИ-сервисы способны действовать так же: условия были намеренно лишены ряда ограничений. Однако он показывает более практическую проблему – при подключении автономных агентов к реальным сервисам недостаточно оценивать только качество их ответов. Нужны чёткие технические границы, наблюдение за действиями моделей и процедуры быстрого вмешательства, особенно там, где ИИ взаимодействует с кодом, аккаунтами и людьми.