Исследователи из Samsung и Варшавского университета обнаружили, что большие языковые модели регулярно создают одни и те же имена несуществующих людей. Эти «персонажи» уже появляются в сгенерированных научных статьях, книгах и других материалах, а их работы попадают в академические репозитории и поисковые системы.
Авторы препринта The Ghost Couple: Correlated LLM Name Priors and Their Haunting of the Web and Academic Publishing называют таких персонажей «призраками». Среди наиболее часто встречающихся имён – Елена Васкес и Маркус Чен. По данным исследования, эти имена использовались в сотнях независимо созданных ИИ-документов: в них они фигурировали как специалисты по вулканам, астронавты, ведущие подкастов, герои триллеров и соавторы научных работ.
Речь не идёт о конкретных людях: модели воспроизводят эти имена из-за статистических закономерностей, сформировавшихся в обучающих данных. Исследователи также выявили «связанные наборы персонажей»: некоторые имена с повышенной вероятностью возникают рядом друг с другом. Например, Claude часто генерировал имя Елена Амара Окафор, Gemini – Арис Торн и Лена Петрова, а ChatGPT – Элара Восс.
Как вымышленные авторы попадают в научную инфраструктуру
Руководитель исследования Михал Бжозовский рассказал 404 Media, что поиск этих имён в интернете позволил обнаружить и другие сгенерированные ИИ личности. Так, имя Елены Васкес ранее фигурировало на сайте компании Research Gold, предлагавшей медицинские исследования, якобы написанные людьми. После публикации компания удалила упоминание этого человека.
Исследователи проверили академические базы на наличие типичных для моделей имён. В репозитории Zenodo, который поддерживается CERN и присваивает реальные идентификаторы (DOI), они нашли 1655 записей с «призрачными» авторами. В этих материалах заявлялось о публикациях в несуществующих журналах, а даты выхода работ были сфабрикованы или не совпадали с датой загрузки файлов.
DOI – это цифровой идентификатор, который используется для учёта и поиска научных публикаций. На Zenodo зарегистрировать такой идентификатор может любой пользователь с бесплатной учётной записью. Поэтому даже полностью сгенерированные тексты способны получить атрибуты, внешне похожие на признаки академической работы, а затем быть собранными научными агрегаторами.
Риск для поисковой выдачи и проверки исследований
Авторы препринта предупреждают, что записи с настоящими DOI могут автоматически попадать в другие системы. «Призрачные» имена уже встречаются на ResearchGate, где формируют синтетические исследовательские группы с якобы существующими соавторами, а Google Scholar и Semantic Scholar индексируют такие материалы без предварительной верификации. По мнению исследователей, инфраструктура для масштабного загрязнения научного массива уже существует.
Повторяемость имён потенциально может стать инструментом выявления ИИ-контента. Например, Елена Васкес особенно часто появлялась в текстах, созданных Claude Sonnet 4, поэтому её присутствие в списке авторов может указывать на происхождение материала. Однако Бжозовский считает, что такой метод может быстро потерять точность: сгенерированные тексты уже публикуются в интернете и способны попасть в будущие обучающие наборы моделей.
Мнение редакции
Проблема использования генеративного ИИ в академической среде обсуждается не первый год. Научные журналы уже публиковали тексты с признаками машинной генерации, а рецензенты сталкиваются с последствиями массового применения чат-ботов. Репозиторий препринтов arXiv, в частности, ввёл правило о годовом запрете на подачу работ для авторов, уличённых в отправке сгенерированных с помощью ИИ материалов.
Академическим платформам потребуется проверять не только формат публикаций, но и реальность журналов, авторов и исследовательских групп – иначе технический след будет всё чаще подменять собой доказательства качества работы.