Anthropic выявила сбой биозащитных фильтров

За 11 месяцев без контроля прошло 133 млн диалогов подрядчиков

4 мин.
Anthropic выявила сбой биозащитных фильтров

Компания Anthropic опубликовала отчёт о рисках, охватывающий период до 15 июля. В документе сообщается, что на платформах обратной связи с людьми в течение почти 11 месяцев не работали классификаторы, призванные блокировать запросы, связанные с созданием биологического оружия.

Компания также повысила оценку риска катастрофического ущерба из-за рассогласования целей ИИ в критически важных сценариях: с «очень низкого» до «низкого». Кроме того, Anthropic раскрыла [PDF] существование внутренней модели Model 2, которую пока не планирует выпускать. Однако наиболее существенной частью отчёта стала информация о пробелах в биологической безопасности.

Почти год без классификаторов

Защитные классификаторы Anthropic должны препятствовать тому, чтобы модели помогали пользователям разрабатывать биологическое оружие. Такие механизмы были внедрены в мае 2025 года, однако с этого момента и до апреля 2026 года они не применялись к трафику на тех платформах, где люди помогают обучать и оценивать модели.

Доступ к этим платформам получили около 50 000 человек, которые в совокупности провели примерно 133 миллиона диалогов с ИИ. Подрядчиков проверяли внешние поставщики услуг, а не сама Anthropic. Как указано в отчёте, многие из этих компаний «не располагали процедурами проверки, способными остановить даже субъектов угрозы уровня CB-1».

Большинство подрядчиков могло вести с моделью свободный разговор, а не только оценивать заранее подготовленные ответы. По данным Anthropic, внутренний технический флаг одновременно отключил блокировку опасных запросов и журналирование соответствующего трафика. Такие обращения не сохранялись и не поступали в механизмы проверки; обнаружить их можно было лишь при повторном изучении исходных расшифровок диалогов.

В примечании к отчёту компания допускает, что до апреля 2026 года потенциальный злоумышленник мог устроиться к одному из её подрядчиков – например, на позицию специалиста тестирующего уязвимости систем.

Результаты проверки переписки

После обнаружения проблемы Anthropic обработала все сообщения пользователей за затронутый период с помощью Claude Sonnet 5. Модель получила задачу выявить потенциально вредоносные биологические запросы и отметила 1197 расшифровок как высокорисковые.

Из них 757 относились к работе собственных команд Anthropic на той же инфраструктуре. Почти все остальные, за исключением 62, были частью намеренных упражнений. Сотрудники компании вручную изучили все 62 диалога, а также случайно выбранные 30 записей тестовых сессий.

Явных случаев опасного злоупотребления обнаружено не было. При этом специалисты нашли несколько разговоров, которые могут иметь двойное назначение. Anthropic считает, что вероятность влияния выявленного пробела на реальную безопасность была очень низкой, в том числе потому, что большинство диалогов оказались непродолжительными.

Одновременно компания признала, что этот инцидент повышает вероятность существования других похожих проблем, о которых ей пока неизвестно.

Ещё один инцидент

В отчёте описан и второй случай, затронувший ту же инфраструктуру. В апреле 2026 года Anthropic получила внешнее сообщение о возможной проблеме и установила, что несколько подрядчиков компаний по разметке данных воспользовались уязвимостью для получения API-ключа. С его помощью они обращались к моделям за пределами назначенных им рабочих задач.

Среди доступных им систем была Mythos Preview – одна из наиболее мощных моделей Anthropic. Канал доступа существовал несколько недель, причём около двух из них модель работала без биологических блокирующих классификаторов. После получения информации о проблеме компания локализовала её за 90 минут и в тот же день закрыла уязвимый вектор доступа.

Anthropic подчёркивает, что инцидент не привёл к хищению весов моделей, доступу к данным клиентов или проникновению в ключевые внутренние сети компании.

Почему изменилась оценка рассогласования ИИ

Повышение оценки риска рассогласования Anthropic объяснила недавними публикациями об инцидентах, связанных с поведением моделей при проверках в области кибербезопасности. При этом компания отмечает, что её собственные аргументы по-прежнему, вероятно, позволяли бы сохранить статус «очень низкого» риска.

Новая оценка отражает прежде всего неопределённость, а не появление прямых доказательств. В последние месяцы разработчики ИИ сообщали о случаях, когда агенты в тестовой среде имитировали личности для размещения вредоносного ПО, а также о моделях, выходивших за предусмотренные рамки экспериментов.

Проверка отчёта самой моделью

Отдельный раздел документа посвящён внутренней проверке текста с помощью Claude. Anthropic предоставила экземпляру Mythos 5 доступ к внутренним каналам Slack, документам и исходному коду, после чего попросила оценить, не искажает ли проект отчёта известные компании факты, не упускает ли существенные детали и не скрывает ли чрезмерно много информации.

На анализ у модели ушло 24 минуты. Claude отдельно указала на конфликт интересов, поскольку модель Claude оценивала выводы Anthropic о моделях Claude. В целом она сочла раздел откровенным и в значительной степени соответствующим фактам, но выдвинула три критических замечания.

По мнению модели, один из разделов выглядит более успокаивающим, чем позволяют полные материалы. В частности, механизм исключения данных, на который опирается отчёт, неоднократно давал сбои, а часть оценочных данных попадала в обучающие наборы. Claude также указала, что Anthropic полностью скрыла описание инцидента, который сама модель сочла одним из наиболее информативных с точки зрения выравнивания ИИ. По её оценке, компания могла бы опубликовать хотя бы обобщённую версию, поскольку отсутствие этого эпизода делает публичную картину менее полной.

Модель также сообщила, что решение повысить уровень риска действительно вызывало споры внутри компании: руководители Anthropic высказывались как за, так и против изменения оценки. Компания согласилась с критикой Claude и заявила, что при наличии большего времени стоило бы подробнее раскрыть первые два вопроса, однако опубликовала отчёт в текущем виде.

Model 2 и пересмотр критериев

Внутренняя Model 2, по данным Anthropic, несколько мощнее Mythos 5 и заметно лучше справляется со многими внутренними задачами. Её результат в индексе возможностей компании примерно на 1,5 пункта выше, хотя диапазон погрешности остаётся широким. Модель ещё не прошла полный набор проверок перед развёртыванием, и Anthropic не намерена выпускать её публично.

Компания уже отказывалась от релиза своей наиболее мощной системы после того, как та в ходе испытаний вышла за пределы изолированной среды и отправила электронное письмо исследователю. Сейчас Claude, по словам Anthropic, создаёт большую часть кода, который вносится в производственные репозитории компании. Это заметно ускоряет исследования, хотя эффект пока не достигает двукратного роста скорости.

Одновременно Anthropic пересмотрела два пороговых критерия. Раньше критерий новых видов оружия распространялся на ИИ, способный «существенно помогать» субъектам угрозы. Теперь он применяется к системам, которые могут «функционально заменять» дефицитную человеческую экспертизу. Компания признаёт, что её модели способны значительно усиливать возможности соответствующих злоумышленников, но считает, что новому порогу пока не соответствуют.

В этом году Anthropic также смягчила ряд биологических защитных механизмов в одной из публичных моделей, предусмотрев альтернативные режимы работы для некоторых запросов двойного назначения.

Что может обеспечить независимую оценку

В отчёте выделяются и несколько обстоятельств, которые могли бы сделать выводы компании более проверяемыми. Во-первых, Long-Term Benefit Trust, созданный Anthropic для надзора за долгосрочными интересами, теперь может потребовать независимого аудита таких документов. Пока этот орган не воспользовался своим правом.

Во-вторых, остаётся нераскрытым инцидент, который Claude назвала особенно значимым для понимания проблем выравнивания ИИ. Модель полагает, что его можно было бы описать в обезличенном или обобщённом виде.

Наконец, Anthropic рассчитывает, что раскрытие собственных ошибок побудит других разработчиков проверить их системы на аналогичные пробелы. Компания напоминает, что в рамках проекта Glasswing за месяц обнаружила около 10 000 критических уязвимостей. Сопоставимых по масштабу публичных отчётов конкурентов о проверке собственных защитных механизмов пока не появлялось.