Компания Anthropic объявила, что в будущих версиях Claude появятся водяные знаки для текстов, сгенерированных искусственным интеллектом. Как пояснила компания, видимых меток, скрытых символов или дополнительных данных в тексте не будет: признак происхождения будет формироваться за счёт выбора слов. По мнению автора 404 Media Джейсона Кёблера, такой подход показывает, что разработчики языковых моделей рассматривают слова как взаимозаменяемые элементы, недооценивая значение авторского выбора и контекста.
В Anthropic объяснили, что механизм будет случайно менять источник, который модель использует при выборе следующего слова. Если несколько вариантов статистически одинаково подходят по смыслу, Claude сможет выбирать между ними по схеме, связанной с секретным ключом. Затем компания или иной владелец ключа сможет проверить последовательность слов и оценить вероятность того, что текст создан с помощью ИИ.
Разработчик утверждает, что для читателя тексты с такой маркировкой будут неотличимы от немаркированных, а внутренние тесты не выявили влияния на содержание, творческий уровень или читаемость ответов.
Почему метод вызвал критику
В качестве упрощённого примера Anthropic предлагает продолжить фразу «Сегодня было холодно и…» словами «серо» или «пасмурно». Компания отмечает, что в большинстве ситуаций смысл почти не изменится, поэтому выбор между такими вариантами может определяться случайным числом. Водяной знак использует именно подобные «малозначимые» развилки, повторяющиеся в тексте.
Кёблер возражает, что слова «серо» и «пасмурно» не являются полностью тождественными. Их выбор способен задавать ритм, настроение, степень конкретности и интонацию фразы. По его оценке, автор может предпочесть одно слово другому по множеству причин – от требований жанра и аудитории до личного опыта и стилистической привычки. Алгоритм же, как считает журналист, допускает внешнее вмешательство в выбор формулировки, поскольку признаёт варианты равноценными.
Похожую позицию высказали публицист Джон Грубер, автор Daring Fireball, и исследователь журналистики Джефф Джарвис. Последний написал, что подобный подход обесценивает письмо: выбор слов представляется случайным, а язык – набором взаимозаменяемых единиц.
Как Anthropic оценивает качество ответов
Anthropic ссылается на исследования технологии SynthID, разработанной Google для маркировки ИИ-контента. В одной из проверок исследователи сравнивали реакцию пользователей Gemini на ответы с водяными знаками и без них. Часть запросов случайным образом направляли в маркированную версию модели, а затем анализировали оценки «нравится» и «не нравится». По данным исследования, разница в доле положительных оценок составила 0,01%.
Кроме того, участникам предлагали сопоставлять варианты текста и оценивать их качество. Авторы работы не зафиксировали значимого предпочтения одной версии перед другой. Однако Кёблер считает, что такие методики позволяют оценить лишь общую полезность ответа для пользователя чат-бота, но не качество письма в редакторском или литературном смысле. Два текста могут одинаково выполнять практическую задачу, оставаясь разными по точности, стилю, звучанию и смысловым оттенкам.

Журналист обращает внимание, что в примерах из приложения к исследованию отдельные медицинские формулировки заменяются другими: например, «дыхательная недостаточность» – на «остановку дыхания». Эти выражения не идентичны, хотя система может считать их близкими в контексте. Причина конкретного выбора остаётся следствием вероятностного расчёта и внутренних правил модели, недоступных внешнему наблюдателю.
Маркировка и природа языковых моделей
По мнению автора 404 Media, проблема выходит за пределы самих водяных знаков. Большие языковые модели не принимают осознанных решений при создании фразы, а предсказывают наиболее вероятное продолжение на основе статистических закономерностей в данных обучения. В этом смысле маркировка лишь делает заметнее принцип работы систем: при наличии нескольких подходящих вариантов они выбирают слово не так, как это делает человек, работающий с замыслом, опытом и адресатом текста.
Anthropic отдельно противопоставляет текст программному коду, где часто требуется строго определённый результат. Для письма компания допускает существование нескольких одинаково хороших вариантов. Кёблер считает такое разделение чрезмерно упрощённым: точность формулировок бывает принципиальна и в художественном, и в деловом, и в журналистском тексте, особенно в цитатах, сообщениях о фактах и юридически значимых документах.
Автор также указывает на сервисы, которые переписывают сгенерированные материалы с помощью синонимов, чтобы сделать их менее шаблонными или затруднить определение их происхождения. Такие инструменты часто называют «гуманизаторами». Их использование может не только ухудшать стиль, но и искажать исходные утверждения. В новостных текстах это способно привести к неточному воспроизведению цитат, фактическим ошибкам или рискам для репутации упомянутых людей и организаций.
Anthropic связывает внедрение маркировки с новыми требованиями Европейского союза в сфере искусственного интеллекта. Кёблер признаёт, что дополнительные способы выявления ИИ-материалов могут быть полезны, в частности для борьбы с вводящим в заблуждение контентом. Однако он полагает, что заявленная безразличность к замене слов ставит более широкий вопрос: достаточно ли оценивать машинный текст только по формальной понятности и пользовательским реакциям, если смысл и качество часто складываются из трудноизмеримых языковых решений.