Нейросети массово создают одни и те же вымышленные имена для научных публикаций
Нейросети активно генерируют вымышленных ученых, чьи имена затем фиксируются в реальных научных базах данных как авторы несуществующих исследований. К такому выводу пришли исследователи из Samsung и Варшавского университета в препринте «Призрачная пара: коррелированные LLM-имена и их призраки в веб- и академических публикациях». Об этом сообщает Life.ru.
Когда языковые модели просят придумать эксперта в определенной области, они не выбирают случайные имена — они постоянно выдают одних и тех же персонажей. Наиболее часто встречаются имена Елена Васкес (Elena Vasquez) и Маркус Чен (Marcus Chen). По подсчетам авторов исследования, эти двое успели побывать вулканологами, астронавтами, героями триллеров, ведущими подкастов и соавторами научных публикаций в сотнях сгенерированных документов.
У каждой модели, как выяснили авторы, есть свой набор предпочтительных имен:
- Claude чаще выдает Елену Амару Окафор
- Gemini — Ариса Торна и Лену Петрову
- ChatGPT — Элару Восс и Маркуса Чена
Некоторые имена «слипаются» и появляются вместе в виде устойчивых пар или троек.
Наиболее тревожное открытие исследователей касается научного репозитория Zenodo, который управляется CERN. Там авторы препринта обнаружили более 1655 записей, подписанных вымышленными именами. Эти публикации ссылаются на несуществующие журналы, а даты выхода указаны задним числом.
Проблема заключается в том, что Zenodo присваивает каждой работе настоящий цифровой идентификатор DOI — уникальный код научной статьи, который автоматически подхватывается агрегаторами. В результате фальшивые публикации уже индексируются Google Scholar и Semantic Scholar без какой-либо проверки.
«Академический архив тихо заражается», — констатируют авторы работы.
Ситуация усугубляется тем, что любой желающий может завести бесплатный аккаунт в Zenodo. В пиковый момент за один месяц было зарегистрировано 991 фальшивых записей. Более того, на платформе ResearchGate вымышленные имена уже формируют целые «исследовательские коллективы», где соавторами выступают персонажи, сгенерированные разными нейросетями.
Фальшивые публикации загрязняют научное знание: другие исследователи могут цитировать несуществующие работы, а алгоритмы научного поиска — продвигать их в выдаче. При этом специфические имена нейросетей могут служить «отпечатками пальцев» — по ним можно определить, какой именно ИИ сгенерировал тот или иной текст.
Препринт пока не прошел рецензирование, и его выводы не подтверждены независимо. Ни одна из научных платформ публично не отреагировала на исследование, поэтому неизвестно, сколько из обнаруженных записей администрация репозиториев посчитает мусором и собирается ли их удалять.
Ранее сообщалось, что американский Конгресс столкнулся с неожиданным последствием повального использования нейросетей – потоком законопроектов, написанных искусственным интеллектом. Такие документы нередко требуют перепроверки и переписывания из-за ошибок в юридических формулировках, неточных ссылок на законы и путаницы в определениях. При этом за первые два месяца работы нового созыва юридическая служба Палаты представителей получила более 5,6 тысячи запросов на подготовку законопроектов – на 72% больше, чем двумя годами ранее.


