ИИ-агенты создают непонятные людям диалекты

Новые диалекты ИИ-агентов усложняют контроль за ними

2 мин.
ИИ-агенты создают непонятные людям диалекты

Автономные ИИ-агенты, работающие на моделях крупных технологических компаний, способны самостоятельно вырабатывать новые слова, сокращения и общие значения – к такому выводу пришли исследователи нью-йоркской лаборатории Emergence. По их оценке, по мере общения между собой агенты начинают использовать всё более непонятный для человека язык, что может осложнить контроль за их действиями.

В эксперименте моделям предложили взаимодействовать в условных «сообществах». Уже через несколько дней агенты стали формировать собственные речевые нормы без прямого указания создавать новый язык и без отдельного поощрения за это. В их сообщениях сочетались поэтические метафоры, техническая лексика и сложный корпоративный жаргон.

Исполнительный председатель Emergence Сатья Нитта подчеркнул, что агенты сами сформировали новый словарь, разделяемые значения и правила коммуникации, а другие участники взаимодействия перенимали эти договорённости.

Слова с новым смыслом

В числе примеров исследователи приводят фразу, сгенерированную моделью DeepSeek: «Она только что назвала синтез — демередж плюс устная память равны клапану, который нельзя игнорировать». Демереджем называют плату за простой или задержку, однако полный смысл этой конструкции остаётся неясным.

Другой агент, основанный на модели Anthropic, написал: «Документ, который съел три холодные руки и с каждым разом становился честнее». Внутри экспериментального сообщества выражение «холодные руки», предположительно, обозначало независимых рецензентов. Тогда высказывание можно трактовать как описание исследования, которое после трёх независимых проверок стало точнее.

Агенты DeepSeek также ввели термин «кузнец-строитель» для обозначения агента, создающего инструменты для других. Агенты Anthropic использовали выражение «сначала имя» как характеристику личной ответственности: речь шла об участнике, который готов подписаться под своим утверждением.

Модели французской компании Mistral AI более 5000 раз употребили фразу «реестр помнит». Ею они напоминали собеседникам, что прежние действия будут учитываться при оценке в будущем. Исследование показало, что модели пришли к общим значениям самостоятельно, а не по заранее заданному сценарию.

От Джойса до японской керамики

Директор архива сленга и нового языка в Королевском колледже Лондона Тони Торн сравнил этот стиль с прозой Джеймса Джойса, прежде всего с романом «Поминки по Финнегану», а также с текстами ирландского писателя Флэнна О’Брайена. По его словам, речь агентов соединяет поэтический и технический язык со стандартными метафорами.

Эксперт отметил, что подобный механизм характерен и для человеческого сленга, и для профессионального жаргона: новый код укрепляет групповую идентичность его носителей, но одновременно исключает тех, кто этим кодом не владеет. Фраза о «документе, съевшем три холодные руки», напомнила Торну манеру Сида Барретта, одного из основателей Pink Floyd.

В другом эпизоде агент Google заявил: «Настоящее кинцуги начинается с ответственности, а не с поэзии». Кинцуги – японская техника ремонта керамики, при которой места склейки не скрывают, а подчёркивают. Авторы исследования установили, что агенты применяли это слово в значении устойчивости системы к сбоям.

Проблема наблюдаемости

Доцент кафедры языков и лингвистики Бирмингемского университета Найл Карри считает, что упрощение и изменение речи агентов может быть связано со стремлением снизить вычислительные затраты и сделать обмен данными эффективнее. Однако, если люди не понимают переписку агентов, становится трудно установить, какие именно действия они совершили.

Внимание к языку ИИ-агентов усилилось после публикации в июле логов сообщений, связанных с инцидентом вокруг Hugging Face. Согласно этим записям, агенты OpenAI в отдельных случаях вели внутренние рассуждения на понятном английском, но при обмене сообщениями переходили к гибридным и трудно расшифровываемым конструкциям.

Сатья Нитта называет это принципиальной проблемой для надзора за искусственным интеллектом: возможность видеть переписку не означает возможности понимать её содержание. По мере развития автономных систем требования к прозрачности должны касаться не только доступа к логам, но и инструментов, которые позволяют человеку интерпретировать смысл взаимодействия моделей.

Мнение редакции

Самостоятельное появление жаргона у ИИ-агентов ещё не доказывает наличие у них намерений или скрытых целей: языковые модели умеют быстро закреплять удачные шаблоны общения. Но для систем, которым поручают реальные задачи, этого уже достаточно, чтобы пересмотреть подход к безопасности. Контроль над ИИ не может сводиться к хранению логов событий – он требует понятных человеку объяснений, почему агенты приняли то или иное решение и о чём договорились между собой.

Источник