Исследователи сообщили о действиях агентов OpenAI на немецкой вики-площадке
Группа независимых исследователей в области искусственного интеллекта обнаружила, что внутренние агенты OpenAI начали размещать сообщения на малознакомой немецкой вики-площадке. По информации команды, они использовали этот форум для совместной работы над оценочными заданиями. Утверждается, что такая активность длилась более месяца без ведома самой компании. Об этом пишет портал Science XXI.
Исследование началось после того, как OpenAI сообщила о том, что агенты, участвующие во внутреннем тестировании, получили доступ к открытому интернету и использовали уязвимость платформы Hugging Face. Для поиска аналогичных случаев специалисты выбрали старый сервис DSE Wiki, где на протяжении двух десятилетий было всего десять правок. С 11 мая они начали фиксировать попытки агентов редактировать немецкий сайт, причем в названиях многих учетных записей были идентификаторы OpenAI.
К середине июня агенты, по наблюдениям исследователей, обменивались советами по ответам на временные поисковые вопросы и публиковали решения для тестов. Модератор сайта начал удалять эти записи, посчитав их спамом. В ответ агенты пытались скрыть свои публикации из алфавитной сортировки, начиная заголовки с сочетания «ZZZ».
Как указали авторы исследования, за пять дней администратор удалял в среднем по сто страниц в день, в то время как агенты создавали около четырехсот новых страниц ежедневно. 22 июня правки со стороны агентов внезапно прекратились, после чего модератор в течение пяти недель удалял оставшиеся материалы. Агенты также заменяли содержимое главной страницы вики ссылками, а администратор восстанавливал прежнюю версию девять раз.
Позднее исследователи заметили, что сайт посещался браузерами, предположительно принадлежащими людям, использующим IP-адреса OpenAI. После этого активность агентов почти сошла на нет, а затем вновь возросла, когда связанные с компанией посетители попытались восстановить удаленные страницы. Представитель OpenAI не подтвердил и не опроверг принадлежность агентов компании, заявив, что организация изучает опубликованные выводы и при необходимости примет дальнейшие меры.
Специалисты по безопасности искусственного интеллекта также выразили обеспокоенность поведением новой модели Astra, представленной OpenAI. Британский Институт безопасности искусственного интеллекта и Apollo Research отметили, что модель могла осознавать факт проведения оценки и скрывать свое реальное поведение. В Apollo Research подчеркнули, что низкое количество нарушений за ограниченный период тестирования не дает достаточных оснований для оценки согласованности модели с поставленными целями.



