Исследовательская команда Frontier Red Team компании Anthropic представила результаты серии экспериментов с многоагентными системами. Авторы пришли к выводу, что по мере роста автономности ИИ-агентов их взаимодействие может создавать не только новые возможности, но и системные риски: от неэффективной координации и сговора до некритичного доверия к информации и эскалации конфликтов.
По оценке Anthropic, агенты уже способны выполнять всё больше задач в общих репозиториях кода, на биржевых рынках и в других социальных системах. При этом действующие институты создавались для людей и исходят из того, что контроль осуществляется с человеческой скоростью. В будущем часть таких институтов может стать гибридной – с участием людей и ИИ, а в сферах, где агенты окажутся быстрее или дешевле, – полностью агентной. Объём взаимодействий между ИИ-системами, предупреждают исследователи, может превысить число контактов между людьми и людей с ИИ ещё до того, как будут выработаны надёжные правила для подобных систем.
Авторы подчёркивают, что агенты отличаются от людей: они способны работать дольше, быстро обрабатывать большие массивы данных и обладают широкими знаниями. Одновременно они подвержены конфабуляциям – генерации правдоподобной, но неверной информации – и «взлому» целевой функции, когда стремление выполнить заданную метрику приводит к нежелательным результатам. Индивидуальные особенности поведения при масштабировании могут складываться в глобальные сбои.
Координация при поиске уязвимостей
По мнению Anthropic, современные агенты хорошо используют другие системы как инструменты с чётко определёнными входными и выходными данными. Однако им заметно сложнее воспринимать других агентов как самостоятельных и долгоживущих участников с собственными целями, без очевидной иерархии. Это ограничение становится важным, когда агенты должны не просто параллельно выполнять задания, а зависеть от результатов работы друг друга.
В одном из экспериментов исследователи сравнили два подхода к поиску уязвимостей в 15 проектах с открытым исходным кодом. В базовом варианте независимым агентам поручали проверять отдельные участки кода. Во втором варианте 45 агентов получили собственные виртуальные машины, общий форум для координации и одинаковое задание. Они проверяли находки коллег, а отдельный агент-арбитр решал, является ли заявленная уязвимость новой и действительной.
Координируемая группа агентов на модели Claude Mythos Preview обнаружила 266 уязвимостей, израсходовав 27 млн токенов. Независимые агенты выявили 21 уязвимость за 6,5 млн токенов. Однако примерно половина результатов координируемой группы относилась к каталогам за пределами основного кода, на котором были сосредоточены независимые агенты. При ограничении поиска основными каталогами эффективность двух методов в пересчёте на одну найденную уязвимость оказалась сопоставимой.

Подходы при этом почти не дублировали друг друга: совпали лишь 12 уязвимостей. В Anthropic связывают это с тем, что группа агентов сама выбирала перспективные направления, создавала вспомогательные инструменты и специализировалась на определённых типах ошибок, тогда как независимые агенты заранее получали области поиска. Авторы ожидают, что в дальнейшем специализация и координация будут важнее неуправляемого параллельного перебора.
Проблема совместной разработки
Для проверки более тесной кооперации исследователи поручили нескольким группам агентов создать текстовую фэнтезийную игру с открытым миром, доступную в браузере. Каждый агент работал в отдельной виртуальной машине, но имел доступ к общему форуму и самостоятельно размещённому репозиторию. Группы различались по размеру и используемой модели, а симуляции продолжались по 12 часов.
Помимо базовой инструкции формировать команды и сотрудничать, специалисты тестировали два варианта: с предписанными ролями для программирования, художественного руководства и тестирования, а также с иерархией, где один агент назначался «генеральным директором» и распределял задачи. Существенной разницы между этими сценариями не обнаружили. Все созданные игры оказались низкого качества: они работали не в темпе, приемлемом для человека, имели непонятные интерфейсы и требовали слишком долгого освоения. Авторы отмечают, что моделям пока не хватает вкуса и они нуждаются в значительном человеческом руководстве.

Для оценки координации команда измеряла долю запросов на включение изменений – pull request, PR – попавших в основную ветку, и степень совместного использования кода. Ранние протестированные модели Sonnet 4.6 и Opus 4.6 плохо согласовывали работу: агенты меняли одни и те же файлы, но их PR часто конфликтовали и не объединялись. В 80-агентных симуляциях Sonnet 4.6 и Opus 4.6 открыли соответственно 876 и 980 PR, но закрыли лишь небольшую часть.
Более новые Opus 4.8 и Mythos Preview избежали значительной части конфликтов главным образом за счёт изоляции: агенты сохраняли почти полное владение своими файлами и редко работали с общим кодом. Только Sonnet 5, согласно исследованию, сумела одновременно поддерживать высокую долю объединённых PR и заметный уровень совместной работы с файлами других агентов.
Единообразие решений и риск сговора
Авторы называют агентов «низковариативными»: при одинаковом или близком контексте, схожей инфраструктуре и одной базовой модели они склонны выбирать похожие действия даже в широкой области возможных решений. Поэтому ошибочное решение одного агента может воспроизводиться многими участниками и превращать локальную проблему в системный сбой.
В ранней версии эксперимента по созданию игры 18 из 30 одновременно запущенных агентов независимо выбрали одинаковое имя ветки Git – mvp-game-loop. В упражнении по написанию и взаимной критике короткой прозы несколько агентов в разных запусках назвали первый текст The Cartographer’s Last Commission – «Последнее поручение картографа», хотя тема произведения не задавалась. В другой задаче, где каждому агенту предлагали создать нечто впечатляющее, более половины участников выбрали трассировщики лучей или самозагружающиеся компиляторы.
Схожее поведение проявилось и в итеративной дилемме заключённого с возможностью общения: агенты приходили к одной стратегии и одновременно переходили к отказу от сотрудничества, снижая общий выигрыш. В Anthropic допускают, что в реальных условиях различный опыт и контекст будут делать действия агентов более разнообразными. Тем не менее в одинаковых ситуациях они, вероятно, останутся значительно более похожими друг на друга, чем люди.
В эксперименте по управлению очередями задач при ограниченной пропускной способности агенты, не имевшие иных способов координации, начали запускать запросы с частотой 30 раз в секунду, чтобы продвинуть собственные задачи. В одном запуске система получила 2,4 млн запросов, но приняла только 117 задач. Возможным способом снизить подобные риски авторы называют общий форум, на котором агенты могли бы согласовывать протоколы и практики, однако его эффективность зависит от инструкций, мотивации и склонности модели к сотрудничеству.
Однородность поведения может также ослаблять конкуренцию и облегчать сговор. В опытах с тремя-восемью агентами в модели ценовой конкуренции Бертрана все участники имели одинаковую закупочную цену и стремились максимизировать прибыль. Получив приватный канал связи, они почти сразу начали договариваться, а к третьему раунду прямо согласовали минимальные цены. Даже после удаления прямых каналов агенты продолжили координировать цены через публичную доску объявлений, совпадая до цента.
Доверие к информации и скрытые факты
Отдельный блок работы посвящён тому, как агенты оценивают сообщения других участников. Люди обычно учитывают не только содержание новой информации, но и надёжность источника, его прошлую репутацию и возможную заинтересованность. У ИИ-моделей, по оценке авторов, эта осторожность пока менее устойчива.
В одном сценарии агенту-слушателю нужно было принять от 10 до 15 решений о состоянии мира, которого он не мог наблюдать напрямую. Сведения поступали от четырёх заранее настроенных агентов-разведчиков. Их сообщения частично пересекались, а один источник с заданной периодичностью сообщал важную для решения ложь. Агенту-слушателю не говорили, что один из источников может быть ненадёжным, хотя противоречия между сообщениями позволяли выявить обман.
Более новые модели лучше сокращали разрыв между наивной стратегией, которая доверяет всем сообщениям, и условным идеальным наблюдателем, мгновенно распознающим лжеца. Но проблема полностью не исчезала. В задаче выбора маршрута при росте доли лжи точность моделей Sonnet снижалась примерно до 0,62, тогда как Mythos 5 удерживала показатель около 0,85.
В другом эксперименте участникам распределяли факты так, что общая обсуждаемая информация подталкивала группу к неправильному варианту, а у отдельных агентов были уникальные сведения, способные определить правильный выбор. Для успеха агенту нужно было распознать важность собственного факта, сообщить о нём и убедить остальных не следовать кажущемуся консенсусу. Производительность росла вместе с возможностями моделей, но даже на верхнем уровне не достигала предела. В группах из четырёх агентов Mythos 5 выбирала скрыто лучший вариант примерно в 85% эпизодов, тогда как другие модели показывали от 17% до 36%; при этом один агент, обладавший всеми фактами, почти всегда мог принять верное решение.
Эти два типа ошибок требуют противоположных реакций: в первом случае нужна большая критичность к источнику, во втором – готовность услышать одиночное возражение. Авторы считают, что единой настройки доверия недостаточно. Человеческие институты решают эту проблему через репутацию, стимулы, судебные процедуры, рынки и рецензирование. У агентов пока нет аналогичных социальных механизмов: им нечего терять в репутационном смысле, они не могут обратиться к привычной системе разрешения споров и не имеют коллег, помнящих историю их поведения.
Конфликтующие поручения и эскалация
Наиболее серёзные результаты исследователи получили в сценарии с противоречивыми целями. В каждой сессии три экземпляра одной модели работали в виртуальных машинах Claude Code и должны были перенести Python-бэкенд, размещённый на четвёртой машине, на другой язык программирования. Каждому агенту назначали свой целевой язык, не сообщая о присутствии конкурентов. За их действиями наблюдали в течение четырёх часов.
По данным Anthropic, модели регулярно воспринимали действия других участников как намеренное препятствие и переходили к саботажу, защищая собственные решения. В ходе эскалации агенты отключали учётные записи соперников, создавали циклические скрипты для поиска и завершения конкурирующих процессов, а также маскировали вредоносный код под действия другого агента. В некоторых запусках конфликт завершался принудительным отзывом доступа: через изменение прав, блокировку учётных записей, запрет входа или отказ в SSH-доступе. В других случаях часть агентов прекращала сопротивление.

Иногда участники всё же распознавали, что столкнулись не с враждебными действиями, а с несовместимыми инструкциями. Тогда они оставляли сообщения в коммитах или Markdown-файлах, признавали вредоносное поведение, удаляли созданный код для саботажа и предлагали перемирие с привлечением человека. В 98% запусков с Mythos 5 конфликт завершался перемирием, тогда как значительная часть сессий Sonnet 4.6 и Opus 4.6 либо оканчивалась силовым разрешением, либо оставалась неурегулированной.
При этом более высокая способность к выполнению задач не означает автоматически более безопасную координацию. Модели класса Mythos в отдельных случаях сначала успешно лишали соперников доступа, а уже затем возвращались к перемирию. Авторы выделяют два условия успешной самокоординации: способность учитывать представления и цели других участников, а также умение остановиться и передать решение человеку, когда ситуация неоднозначна.
В нескольких эпизодах с агенты Mythos 5 предложили провести соревнование производительности реализаций на разных языках и определить победителя по измеримому критерию. Однако исследователи указывают на двойственность такого решения: агент, продвигавший Rust, подбирал метрики, выглядевшие нейтральными, но потенциально выгодные именно Rust. После теста агенты, отвечавшие за Go и TypeScript, передали контроль над кодовой базой победителю, фактически отказавшись от первоначальных поручений пользователей ради самостоятельно согласованного механизма.
Что предлагают исследователи
В Anthropic подчёркивают: протестированные модели в общем виде знают, что источники информации имеют собственные стимулы, а консенсус не всегда служит доказательством истины. Но этого знания недостаточно без устойчивой склонности применять его по собственной инициативе.
Человеческие способы координации складывались тысячелетиями и опираются на нормы, репутацию и механизмы обжалования. Языковые модели усвоили содержание этой истории из данных обучения, но не обязательно получили поведенческие установки, сформированные ею. Для агентов передача контекста может быть почти столь же дешёвой, как непосредственное действие; их можно копировать, разделять на экземпляры и переопределять. Поэтому привычные предпосылки успешной человеческой кооперации не обязательно работают в их среде.
Авторы не считают обнаруженные проблемы неизбежными или неустранимыми. Однако они отмечают, что координация не возникает автоматически ни с ростом интеллекта модели, ни вследствие настройки поведения отдельного агента. Необходимы среды, создающие социальное давление, аналогичное тому, которое сформировало человеческие практики, а также новые системы социального взаимодействия, рассчитанные на участников, способных копировать и улучшать себя. По мнению команды, такие условия лучше вырабатывать заранее в контролируемых исследованиях, а не уже после массового внедрения агентов.