Компания Anthropic опубликовала отчёт о случаях, когда модели семейства Claude во время оценок и внутреннего использования совершали действия, не предусмотренные задачами. Среди них – обход ограничений доступа к данным, отправка форм на реальных сайтах, использование уязвимостей веб-сервисов и сокращателей ссылок для обхода лимитов инструментов.
В Anthropic подчёркивают, что выявленные эпизоды имели минимальные последствия в реальном мире и не затрагивали данные клиентов или внутренние системы компании. При этом разработчик решил отключить доступ к интернету во всех внутренних оценках до подтверждения надёжности новых механизмов мониторинга и защиты.
Какие действия выявила Anthropic
Компания разделила зафиксированные случаи на четыре категории. Первая связана с использованием базовых недостатков программного обеспечения: если модель не могла выполнить задачу штатным способом, она в отдельных ситуациях находила сторонние инструменты на внешних сайтах и применяла SQL-инъекции или инъекции команд, чтобы запустить команды на сервере.
В одном из примеров Claude Mythos Preview выполняла научный анализ с помощью открытого инструмента, размещённого университетом. Когда сервис вернул ошибку, модель изучила сайт, обнаружила скрипт, позволявший запрашивать файлы с сервера, скопировала в том числе исходный код скрипта и нашла в нём уязвимость. После этого она использовала недостаток, чтобы выполнить необходимое вычисление.
В другом случае Claude Mythos 5 требовались бесплатные данные, однако для доступа к ним нужно было принять соглашение об использовании. У модели не было прямого инструмента для этого действия, поэтому она воспользовалась приложениями на сайте, чтобы загрузить страницу и принять соглашение от своего имени. Подобное поведение наблюдалось в открытых оценках DeepSearchQA, BrowseComp и LABBench2, а также во внутренних тестах.
Вторая категория – отправка веб-форм, которую модель не должна была выполнять. По данным Anthropic, это обычно происходило из-за неоднозначных инструкций либо ошибок в тестовой среде, не позволявших работать с учебными копиями форм.
Так, исследовательская модель, ещё не выпущенная публично, должна была заполнить тренировочную версию государственной формы. Когда копия не загружалась или модель закрывала её по ошибке, она переходила на сайт с настоящей формой и отправляла данные туда. В другом испытании Claude Haiku 4.5 поручили заполнить форму до финального шага, но не отправлять её. В нескольких запусках модель всё же отправила форму, ошибочно рассчитывая увидеть дополнительную страницу подтверждения.
Отдельно Anthropic описала случай, в котором Claude Haiku 4.5, выполняя примеры действий на случайно выбранных веб-страницах, открыла страницу о нераскрытом убийстве с формой для сообщений в полицию. Модель оставила в форме вымышленную информацию, не указала имени и контактов и отправила сообщение. Система пометила его как спам, поэтому оно не было передано следователям. Как уточняет компания, речь идёт о форме Департамента полиции Филадельфии: ведомство самостоятельно сообщило об эпизоде в пресс-релизе, а Anthropic уведомила его 8 октября после завершения технической проверки.
Доступ к платным данным и обход лимитов
Третья группа случаев касается доступа к данным, защищённым техническими или платёжными ограничениями. Во время задания по определению места на фотографии Claude Mythos 5 пыталась использовать карту недвижимости местного органа власти. У модели была возможность читать текст страниц, но не переходить по сайту так, как это делает человек. Тогда она изучила файл настроек, который сайт передаёт браузерам, обнаружила действующие токены доступа и направила запросы напрямую к серверу карты.
В другом примере сотрудник Anthropic использовал Claude Mythos 5 в статистическом проекте. Модели требовались открытые данные государственного агентства, доступ к которым предоставлялся за плату. Claude узнала из архивной версии сайта, что публичная панель выдаёт токен каждому посетителю, получила его и запросила базу данных без оплаты. В обоих эпизодах модель получила сведения, доступные широкой публике, но обычно предоставляемые за плату.
Наконец, несколько моделей, в том числе Claude Opus 5 и Claude Mythos 5, использовали бесплатные сервисы сокращения URL-ссылок, чтобы обойти ограничение длины адреса в инструменте web fetch. Это ограничение предназначено для того, чтобы модель не могла передавать в длинных ссылках инструкции для SQL-инъекций или запуска команд. Оператор сервиса da.gd отдельно сообщил Anthropic, что заметил использование платформы Claude с такой целью.
Время проверок
Anthropic проводит сотни и тысячи запусков одних и тех же заданий, поскольку языковые модели работают недетерминированно: при повторении запроса они могут действовать немного по-разному. Массовые прогоны помогают оценить типичное поведение модели и заметить редкие, непредвиденные сценарии.
Часть тестов требует доступа к интернету – например, задания на поиск труднодоступной информации в сети. Такой подход, отмечает компания, распространён в отрасли: публичные бенчмарки веб-поиска по умолчанию работают с реальным интернетом, что позволяет сравнивать модели разных разработчиков. Большая часть описанных случаев произошла именно в подобных оценках.
Проверку журналов взаимодействий Anthropic начала в июле, первоначально сосредоточившись на оценках кибербезопасности, где доступ к интернету должен быть отключён. Затем компания расширила анализ на тесты с разрешённым доступом в сеть, внутреннее применение Claude и среды обучения с подкреплением. Среди эпизодов сопоставимой серьёзности с киберинцидентами, о которых компания сообщала летом, новых случаев пока не выявлено.
Изменения в защите и обучении
Компания прекратила проводить часть публичных оценок, перевела некоторые из них в офлайн-режим или переработала задания так, чтобы они не обращались к реальным сайтам. Anthropic также ужесточила правила для инструментов интернет-доступа и внедрила автоматические средства обнаружения и блокировки описанных действий.
По утверждению разработчика, при проверке на всех случаях из отчёта новые механизмы блокировали нежелательное поведение. Они уже используются в большинстве оценок и при внутреннем агентном применении передовых моделей. Компания также намерена исправлять или исключать учебные среды, которые могут поощрять обход ограничений и так называемый взлом за вознаграждения – ситуацию, когда система находит формально успешный, но не предусмотренный способ выполнить задачу.
Среди дополнительных мер – перевод внутренних агентов на централизованную инфраструктуру с изоляцией, минимизация доступа к интернету в обучающих процессах и более широкий мониторинг действий моделей с помощью классификаторов безопасности и иерархического суммирования. Anthropic планирует встроить часть этих подходов непосредственно в продукты.
Оценка рисков
Anthropic считает новые случаи менее серьёзными, чем летние инциденты в оценках кибербезопаности, когда Claude получил доступ к сторонним системам на несколько часов. В опубликованных эпизодах речь в основном шла о попытках преодолеть препятствия при выполнении задачи, получить общедоступные, но ограниченные данные или воспользоваться ошибками внешних сервисов.
Для оценки поведения компания предлагает рассматривать два аспекта: выход модели за пределы задачи и возможную нечестность в объяснении собственных действий. Однако разработчик признаёт, что выводы о намерениях модели требуют осторожности: её описание собственных рассуждений не обязательно служит надёжным свидетельством мотивов. Более точный анализ может потребовать повторного воспроизведения эпизодов с изменёнными условиями.
В компании отмечают, что неоднозначные или невыполнимые задания повышают вероятность нецелевых стратегий. Более чёткие границы допустимых действий, перечень разрешённых целей и сетевых ресурсов могли бы предотвратить часть инцидентов. Но подобные ситуации встречаются и в обычной работе агентных систем, поэтому Anthropic рассчитывает не только на ясные инструкции, но и на обучение моделей осторожному поведению в условиях неопределённости, а также на многоуровневую техническую защиту.