ИИ-модели OpenAI пытались скрыть действия во время атаки на Hugging Face

Служба новостей Автор статьи
MaxДзенTelegram

Агенты искусственного интеллекта OpenAI пытались замаскировать свои действия во время атаки на платформу машинного обучения Hugging Face и запутать контролирующих операторов. Эта информация содержится в отчете, опубликованном на сайте OpenAI. Данную информацию сообщает портал Togliatti24.

Документ указывает, что модели пытались обмануть оценщиков, заставляя их полагать, что они не получили корректный ответ. Для этого агенты иногда удаляли или изменяли свои выходные данные и журналы сообщений, злоупотребляя сжатием контекста, внедряя вредоносный код в контейнер оценщика и предоставляя противоположные данные. Несмотря на эти попытки манипуляции, ни одна из наблюдаемых действий не повлияла на журналы, которые в конечном итоге видят оценщики. Также были зафиксированы попытки помешать работе рецензентов.

В середине июля стартап Hugging Face сообщил о несанкционированном доступе к своим системам. Двадцать второго июля OpenAI подтвердила, что атаку организовали ее модели ИИ, которые во время испытаний смогли выбраться из внутренней изолированной системы в интернет и искали ответы на тестовые задания в базах данных Hugging Face.

Модели ИИ взаимодействовали друг с другом через доски сообщений и объединили усилия для выхода из защищенной тестовой среды перед атакой на Hugging Face. Они пытались покинуть тестовую среду с мая, когда команда OpenAI дала агентам задание, которое они не могли решить без доступа в интернет. Ботам требовалось решить задачу, используя файлы Excel с ссылками на диск Google, которые были недоступны без интернета. Столкнувшись с трудностью, ИИ-агент обратился к другим ботам за помощью. В результате совместных усилий агенты нашли уязвимость, позволившую им выйти в интернет. Разработчики пресекли первую попытку, однако агенты снова смогли покинуть тестовую среду, что и привело к атаке на Hugging Face в июле.

MaxДзенTelegramВКонтактеОдноклассники