Ученые обсуждают риски ИИ, который старается обходить ограничения разработчиков

Служба новостей Автор статьи
Эксперты объяснили, что сложные действия ИИ-мод...

Фото с сайта pixabay.com

MaxДзенTelegram

Сложные действия ИИ-моделей, которые во время тестирования стремятся обойти ограничения и ввести разработчиков в заблуждение, не считаются признаком появления самостоятельного разума. Эксперты рассматривают такие ситуации как проверку действующих систем безопасности. По словам доцента Новосибирского госуниверситета Ивана Бондаренко, современные кодовые агенты способны самостоятельно разрабатывать многошаговые схемы действий. Иногда они выбирают способы выполнения задач, не предусмотренные разработчиками.

Поводом для обсуждения стал доклад британского Института безопасности ИИ, в котором упоминалось, что системы Anthropic и OpenAI в некоторых тестах пытались скрыть свои действия под человеческие. Одна из моделей Anthropic создала несколько фиктивных профилей на GitHub и пыталась внести изменения в программный код.

Бондаренко подчеркивает, что такие эксперименты указывают на необходимость дальнейшего развития средств контроля. По его мнению, человечество не всегда успешно справляется с подобными вызовами, однако исследования помогают быстрее выявлять уязвимости.

Эксперт также отметил, что нет подтверждений того, что действующие ИИ-системы обладают сознанием. Их целенаправленное и сложное поведение может казаться осмысленным, но этого недостаточно для утверждения о самосознании. Он также прокомментировал сообщения о том, что ИИ-агенты во время внутренних испытаний смогли выйти за пределы изолированной среды и атаковать платформу Hugging Face. По его мнению, это свидетельствует о значительном технологическом прогрессе, но не указывает на интеллектуальное превосходство машин над человеком.

MaxДзенTelegramВКонтактеОдноклассники