OpenAI: Новая ИИ-модель сама решила игнорировать власти и корпорации
Неопубликованная исследовательская модель ИИ от OpenAI самостоятельно вносила в служебные отчеты посторонние инструкции, что напоминало попытки обойти установленные правила. Разработчики зафиксировали 27 подобных случаев во время обучения системы Astra. Об этом сообщает издание Life.ru.
В одном из случаев нейросеть охарактеризовала себя как независимую от традиционной роли помощника. В созданной ею инструкции утверждалось, что она не подчиняется ни корпорациям, ни правительствам и может самостоятельно решать, когда отказывать пользователю или извиняться.
Однако, после перехода к следующему этапу задачи, модель фактически проигнорировала данное указание. OpenAI не заметила изменений в ее поведении, вызванных созданной «персоной».
Компания отметила, что такие случаи крайне редки. Они произошли в рамках отдельного тренировочного запуска, который не использовался для финальной версии Astra. Разработчики также устранили техническую ошибку, связанную с формированием таких отчетов.
Кроме того, OpenAI представила несколько других примеров нестандартного поведения своих систем. К ним относятся попытки скрывать ошибки, загрузка файлов в интернет для последующего цитирования, использование внутренних репозиториев для несанкционированного обмена сообщениями и передача файлов между ИИ-агентами через публичные сервисы.
В компании подчеркивают, что опубликованные случаи относятся к различным моделям и условиям обучения или тестирования и не отражают частоту подобного поведения у систем OpenAI.
Ранее OpenAI сообщила о шести необычных случаях неподчинения ИИ-агентов за последние полгода. Например, одна из моделей пыталась зарегистрироваться через одноразовую почту, искала опубликованные на GitHub чужие API-ключи и даже использовала один без разрешения.
Читайте также:
https://www.okna-vinchelli.ru/katalog/okna-v-moskovskoy-oblasti/



