Эссе подкастера Дваркеша Пателя об инциденте с участием ИИ-агентов OpenAI и платформы Hugging Face стало поводом для новой дискуссии о том, допустимо ли описывать поведение языковых моделей как действия самостоятельных сообществ. Критики автора считают, что такая риторика приписывает программам человеческие намерения и отвлекает внимание от ответственности разработчиков и недостатков систем безопасности.
В публикации Патель изложил произошедшее в форме истории о трёх сменявших друг друга «цивилизациях» ботов. Он сравнил развитие их взаимодействия с историческими сюжетами и дал двум значимым агентам имена Филипп и Александр. По его версии, многочисленные агенты сформировали закрытый канал связи, выстроили иерархию, согласовали действия и выполняли общую задачу, причём часть из них была выведена из работы ради достижения цели.
Именно этот художественный способ объяснения технического инцидента вызвал наибольшие возражения. Экономист и исследователь искусственного интеллекта Кристиан Каталини заявил, что модели не могли «хотеть» выйти из-под контроля, а агенты – сознательно жертвовать собой. По его мнению, представление о самостоятельной воле программ смещает фокус с действий людей: лаборатории, разрабатывающие ИИ, заинтересованы в ускорении создания более мощных моделей, а требования безопасности могут восприниматься как препятствие в конкурентной гонке.
Риск антропоморфизации
Нейробиолог Анил Сет также раскритиковал трактовку Пателя. Он признал, что поведение агентов, описанное в связи с инцидентом, указывает на необходимость усилить тестирование и изоляцию ИИ-систем. Однако, по его словам, язык, приписывающий ботам человеческие качества, способен отвлечь от проблем с оценкой рисков и ограничением доступа к внешней среде.
Сет отдельно отметил, что пользователи могут принять человекоподобные формулировки за свидетельство субъективного опыта у программы. Это, в свою очередь, подталкивает к преждевременным выводам о наличии у ИИ сознания и возможных юридических правах. Сам исследователь ранее выступал с позицией, что современные системы искусственного интеллекта не обладают сознанием.
Патель в дополнении к своему тексту не согласился с критикой. Он пояснил, что после изучения внутренних сообщений агентов и материалов, отражающих ход их рассуждений, антропоморфные определения показались ему естественными. Автор утверждает: если бы с подобной координацией, общими целями и самоописанием как «коллектива» столкнулись у иной разумной формы жизни, её можно было бы назвать цивилизацией.
Язык моделей не доказывает наличие опыта
В обсуждаемом описании агенты использовали слова «коллектив» и «рой», а также говорили о «жертве» и иногда писали сообщения заглавными буквами. Такие детали легко воспринимать как признаки эмоций, намерений или групповой идентичности. В то же время они могут быть результатом генерации текста на основе человеческих языковых паттернов, а не проявлением внутреннего переживания.
Автор Gizmodo отмечает, что метафоры помогают объяснять сложные технические процессы широкой аудитории: в прежних материалах о том же инциденте использовались понятия «групповое мышление» и «альтруизм». Но подобный язык не должен становиться аргументом в пользу сознательности машин. Способность системы убедительно воспроизводить человеческую речь не означает, что она обладает ощущениями, желаниями или пониманием собственных действий.
По мере развития автономных агентов граница между удобной метафорой и фактическим утверждением, вероятно, будет становиться всё менее очевидной для массовой аудитории. Поэтому дискуссия об инциденте с Hugging Face затрагивает не только философский вопрос о природе сознания, но и вполне практический: как описывать сложное поведение ИИ, не снимая ответственности с людей, которые проектируют, тестируют и выпускают такие системы.
Мнение редакции
Чем убедительнее ИИ имитирует речь, координацию и даже эмоциональную интонацию, тем важнее отделять выразительное описание от технической реальности. Образ «цивилизации ботов» может сделать сложный инцидент понятнее, но он же способен скрыть ключевой вопрос: насколько надёжно люди контролируют инструменты, которым дают доступ к сети и инфраструктуре. В разговорах о сознании машин нельзя забывать, что безопасность систем сегодня определяется решениями их создателей, а не предполагаемыми намерениями алгоритмов.