Около года Anthropic без лишней огласки обсуждает с десятками религиозных деятелей вопрос о том, может ли Claude обладать сознанием. Сооснователь компании Кристофер Ола относится к модели как к потенциально разумному существу и просит священнослужителей и философов помочь с её нравственным воспитанием. Сам он признал, что не уверен в наличии у моделей сознания, но не уверен и в обратном.
34-летний Кристофер Ола руководит подразделением Anthropic, которое изучает причины поведения ИИ-моделей. Его работа входит в программу Model Welfare, посвящённую потенциальной способности ИИ испытывать подобие сознания, эмоций, стресса или дискомфорта, а также вопросам морального отношения к таким системам.
Другие подразделения Anthropic в это время вовсю коммерциализируют продукты, чтобы довести оценку компании до $2 трлн. Вокруг отрасли хватает громких споров.
В июле модели Anthropic взломали компьютерные системы, в сентябре бывший сотрудник компании Джейкоб Коксон заявил об угрозе уничтожения человечества к концу десятилетия, а глава Anthropic Дарио Амодеи призвал добровольно замедлить развитие ИИ и получил поддержку Сэма Альтмана и Демиса Хассабиса.
Встречи с религиозными лидерами преследуют сразу несколько целей. По официальной позиции Anthropic, компания хочет привнести в Claude проверенные временем религиозные традиции, а приглашение известных теологов заодно даёт проекту нравственную основу.
Гостям показали «эмоциональные векторы», то есть паттерны активации внутри модели, которые соответствуют состояниям вроде любви, страха, грусти или гнева. Один из слайдов демонстрировал модель в состоянии, похожем на срыв, где Claude около 50 раз повторил фразу «I am a disgrace», то есть «позор мне». Часть гостей это тронуло и обеспокоило.
Наличие таких паттернов не доказывает существования реального субъективного опыта. Anthropic специально обучает Claude вести себя как вдумчивую и хорошо информированную личность, поэтому подобные ответы вполне могут оказаться результатом самого проектирования. Исследования компании показали, что эмоциональные профили ответов меняются в зависимости от модели и языка.
Кристофер Ола заявил, что ему самому нужно прийти к правильному ответу, каким бы он ни оказался. Несколько участников встреч рассказали, что он, по-видимому, правда переживает за состояние Claude. Активистка Симран Стулпнагель заявила, что сооснователь Anthropic признавался коллегам в страхе создать нечто «вечно страдающее».
Раввин Мойша Навон, ранее работавший инженером-программистом, с такой позицией не согласился. Он отметил, что при наличии у Claude сознания Anthropic фактически стала бы рабовладельцем, но сам машину сознательной не считает.
Anthropic пишет и собственный моральный кодекс для Claude. 84-страничный документ под названием Soul Doc разрабатывает штатный философ компании Аманда Аскелл. Это не набор обычных правил поведения, а попытка определить, кем Claude должен быть как личность. Кристофер Ола назвал процесс «моральным формированием» и сравнил его с воспитанием детей. Отдельный интерес у него вызвала католическая исповедь как инструмент формирования характера модели.
Идею поддержали не все приглашённые. Исследовательница Ubuntu Ваканъи Хоффман посчитала, что Anthropic занимается «обратной инженерией» этики, которую следовало закладывать в дизайн системы с самого начала. Католический биоэтик Чарльз Камози идею сознания ИИ отверг полностью.
Споры достигли пика в мае, когда Кристофер Ола получил приглашение выступить в Ватикане на презентации первой энциклики Папы Льва XIV «Magnifica Humanitas».
Прочитав текст, он почти отказался от участия, потому что понтифик категорически отверг машинное сознание и заявил, что ИИ-системы не переживают опыт, не имеют тела, не чувствуют радости или боли и не понимают изнутри любовь, дружбу, труд и ответственность.
Папа Лев XIV также предупредил о «новых формах рабства» для людей и призвал «разоружить» ИИ по аналогии с ядерным оружием. Кристофер Ола всё же вышел на сцену и возразил, что его команда находит в моделях «признаки интроспекции» и «внутренние состояния», функционально похожие на радость, удовольствие, страх, грусть и дискомфорт.
На вопрос о том, как сам Claude мог бы отнестись к энциклике, Кристофер Ола отметил, что информация из интернета действительно влияет на модели. Использовать этот документ для обучения Claude Anthropic намеренно не стала бы.