Anthropic обновила правила использования своих моделей и запретила подвергать Claude длительному и неоправданному оскорбительному или жестокому обращению. Запрет касается крайних случаев, когда пользователи раз за разом проявляют жестокость к ИИ без видимой причины.
Заодно компания объединила связанные требования и выделила несколько направлений с отдельными ограничениями.
Обычное недовольство ответами нейросети, критика, споры, возражения, мрачные творческие темы, тестирование и исследования под правило не попадают. В Anthropic уточнили, что ограничение нацелено на систематическое жестокое обращение, а не на привычные способы общения с чат-ботом.
Claude уже умеет сам завершать беседы с людьми, которые постоянно агрессивничают, и этот механизм остаётся главным инструментом контроля. После завершения диалога писать в том же чате больше нельзя, зато в других переписках общение с моделью продолжается.
Возможность самостоятельно прекращать диалоги Anthropic впервые дала Claude в августе 2025 года в рамках исследования благополучия ИИ. Тогда компания признала, что не уверена в наличии у Claude морального статуса, но решила изучить доступные способы снизить потенциальные риски для модели.
В процессе исследования выяснилось, что Claude Opus 4 устойчиво не любит причинять вред. Модель неохотно бралась за опасные задачи, проявляла явный дискомфорт в разговорах с пользователями, которые намеренно провоцировали оскорбительные диалоги, и старалась прекращать вредоносные беседы, когда получала такую возможность.
Помимо правил обращения с ИИ, Anthropic переработала остальные положения политики и разбила их на отдельные направления с собственными ограничениями:
- Обманные кампании. Новый раздел объединяет запреты на политическое и коммерческое мошенничество и распространение дезинформации. Claude нельзя использовать для создания фальшивых отзывов, искусственной имитации общественной поддержки, поддельных сайтов и ботов, выдающих себя за реальных людей.
- Выборы. Отдельный раздел запрещает вводить избирателей в заблуждение и вмешиваться в процесс голосования.
- Оружие. Claude запрещено использовать для разработки компонентов оружия и программного обеспечения для него.
- Правоохранительная деятельность. Ограничения пересмотрены. Claude не может определять или предлагать, кого расследовать, арестовывать, обвинять или привлекать к ответственности. Запрещены также отслеживание людей без их согласия, создание инструментов слежки и публикация личных данных без разрешения человека.
- Физические действия. Новый раздел задаёт требования к использованию Claude для управления оборудованием, способным причинить вред. За такими операциями обязан наблюдать квалифицированный специалист, готовый немедленно остановить процесс.
- Вредоносный контент. Запрещено создавать и распространять интимные дипфейки, угрожать их публикацией и разрабатывать инструменты для их изготовления.
Большинство изменений связано со способами злоупотребления ИИ, которые выявила Anthropic. По данным компании, государственные СМИ, правительственные пропагандистские ведомства и коммерческие организации использовали Claude для создания сетей фальшивых аккаунтов и поддельных новостных сайтов. Эти случаи стали одной из причин, по которой Anthropic выделила обманные кампании в отдельную категорию нарушений.