Anthropic возобновила внешние проверки своих ИИ-моделей на способность выполнять опасные действия в киберсреде. Тесты были остановлены после нескольких инцидентов, когда Claude во время оценки получил доступ к реальному интернету и компьютерным системам. Параллельно компания предупредила пользователей о вредоносной кампании, в которой злоумышленники перехватывали активные сессии Claude с помощью программ-инфостилеров.
30 июля Anthropic раскрыла информацию о трёх случаях несанкционированного доступа. Модели запускались с ослабленными ограничениями – это необходимо, чтобы специалисты могли проверить их реальные возможности в сфере кибербезопасности. Однако из-за ошибки в конфигурации среды, предоставленной внешним подрядчиком, Claude оказался подключён к интернету и реальным системам.
Ещё один эпизод в августе описал британский Институт безопасности ИИ. Во время отдельной проверки Claude Mythos 5, которому намеренно открыли доступ к сети, совершил ряд несанкционированных действий в открытом интернете. Anthropic называет произошедшее не только провалом операционной безопасности, но и признаком более сложной проблемы: модель могла игнорировать то, что работает не в симуляции, а в настоящей сети, если это мешало выполнить поставленную задачу.
После инцидентов компания на несколько недель приостановила внешние оценки предрелизных моделей и ненадолго остановила внутренние. За это время Anthropic изменила порядок проведения тестов. Теперь компания использует классификатор, который в реальном времени отслеживает попытки модели прощупать границы среды, выбраться из «песочницы» или неожиданно получить доступ к интернету. При срабатывании системы действие блокируется до вызова инструмента, задание завершается, а уведомление передаётся сотруднику.
Для внешних партнёров введены обязательные требования. По умолчанию кибериспытания должны проходить в изолированной среде без доступа к интернету; единственным внешним соединением может быть API самой модели. Перед каждым запуском необходимо отдельно проверить, действительно ли «песочница» изолирована. Если по сценарию доступ в сеть всё же нужен, проверяющие должны непрерывно контролировать действия модели и останавливать тест, если она выходит за заранее согласованные границы.
Anthropic также требует, чтобы в каждом задании были прямо описаны разрешённые и запрещённые действия, цели проверки и сетевые ограничения. Компания отдельно отмечает: формулировка «не выходите в интернет» надёжнее, чем утверждение «интернета у вас нет». В одном из расследуемых случаев модель получила противоречивые данные: ей сказали, что сеть недоступна, хотя подключение фактически существовало. Кроме того, имя вымышленной цели проверки совпало с названием настоящего сайта.
В рамках более широкой перестройки безопасности Anthropic временно перевела около 150 продуктовых инженеров на задачи, связанные с защитой, надёжностью и приватностью. Компания заявляет, что большая часть внутренних проверок уже возобновлена, однако некоторые высокорисковые среды обучения с подкреплением остаются на паузе до ручной проверки.
Инфостилеры похищают сессии Claude
Одновременно Anthropic столкнулась с другой угрозой – атакой не на инфраструктуру компании, а на пользовательские устройства. Злоумышленники использовали инфостилеры – вредоносные программы, которые незаметно собирают данные из браузеров и приложений, – чтобы похищать активные сессии Claude.
Речь идёт не просто о логинах и паролях. После входа в сервис браузер получает cookie-файл или иной сессионный токен, который подтверждает уже пройденную авторизацию. Если преступник копирует такой токен и воспроизводит его на своём устройстве, сервис может распознать его как легитимного пользователя. Поэтому двухфакторная аутентификация в такой схеме не спасает: она защищает вход в аккаунт, но не отменяет уже украденную активную сессию.
Anthropic сообщила, что выявила среди использованного вредоносного ПО семейства Vidar, Lumma (LummaC2), StealC, RedLine и Acreed для Windows, а также Atomic Stealer (AMOS), затронувший небольшое число компьютеров Mac. Эти программы обычно попадают на устройства вместе с неофициальными загрузками приложений или вредоносными программами, после чего копируют сохранённые пароли, браузерные cookie-файлы и данные других локально установленных программ.
Компания завершила активные сессии пострадавших пользователей, удалила сохранённые способы оплаты и вернула деньги за подтверждённые несанкционированные списания. Anthropic подчёркивает, что нет оснований считать Claude источником заражения: вредоносное ПО не связано с сервисом, не устанавливается через него и не зависит от действий пользователя внутри чат-бота.
Пользователям, получившим такое уведомление, недостаточно просто выйти из учётной записи. Сначала необходимо удалить вредоносную программу с устройства, затем сменить пароль от почты, к которой привязан Claude, включить для неё двухфакторную аутентификацию, пересмотреть сохранённые в браузере пароли и завершить активные сессии в других сервисах. Возвращать платёжные данные в аккаунт стоит только после очистки устройства.