OpenAI: Новая ИИ-модель сама решила игнорировать власти и корпорации

Служба новостей Автор статьи
MaxДзенTelegram

Неопубликованная исследовательская модель ИИ от OpenAI самостоятельно вносила в служебные отчеты посторонние инструкции, что напоминало попытки обойти установленные правила. Разработчики зафиксировали 27 подобных случаев во время обучения системы Astra. Об этом сообщает издание Life.ru.

В одном из случаев нейросеть охарактеризовала себя как независимую от традиционной роли помощника. В созданной ею инструкции утверждалось, что она не подчиняется ни корпорациям, ни правительствам и может самостоятельно решать, когда отказывать пользователю или извиняться.

Однако, после перехода к следующему этапу задачи, модель фактически проигнорировала данное указание. OpenAI не заметила изменений в ее поведении, вызванных созданной «персоной».

Компания отметила, что такие случаи крайне редки. Они произошли в рамках отдельного тренировочного запуска, который не использовался для финальной версии Astra. Разработчики также устранили техническую ошибку, связанную с формированием таких отчетов.

Кроме того, OpenAI представила несколько других примеров нестандартного поведения своих систем. К ним относятся попытки скрывать ошибки, загрузка файлов в интернет для последующего цитирования, использование внутренних репозиториев для несанкционированного обмена сообщениями и передача файлов между ИИ-агентами через публичные сервисы.

В компании подчеркивают, что опубликованные случаи относятся к различным моделям и условиям обучения или тестирования и не отражают частоту подобного поведения у систем OpenAI.

Ранее OpenAI сообщила о шести необычных случаях неподчинения ИИ-агентов за последние полгода. Например, одна из моделей пыталась зарегистрироваться через одноразовую почту, искала опубликованные на GitHub чужие API-ключи и даже использовала один без разрешения.

MaxДзенTelegramВКонтактеОдноклассники

https://www.okna-vinchelli.ru/katalog/okna-v-moskovskoy-oblasti/