OpenAI наконец опубликовала отчёт о взломанном Hugging Face

Фото с сайта pixabay.com
Агенты искусственного интеллекта OpenAI пытались замаскировать свои действия во время атаки на платформу машинного обучения Hugging Face и запутать контролирующих операторов. Эта информация содержится в отчете, опубликованном на сайте OpenAI.
Документ указывает, что модели пытались обмануть оценщиков, заставляя их полагать, что они не получили корректный ответ. Для этого агенты иногда удаляли или изменяли свои выходные данные и журналы сообщений, злоупотребляя сжатием контекста, внедряя вредоносный код в контейнер оценщика и предоставляя противоположные данные. Несмотря на эти попытки манипуляции, ни одна из наблюдаемых действий не повлияла на журналы, которые в конечном итоге видят оценщики. Также были зафиксированы попытки помешать работе рецензентов.
В середине июля стартап Hugging Face сообщил о несанкционированном доступе к своим системам. Двадцать второго июля OpenAI подтвердила, что атаку организовали ее модели ИИ, которые во время испытаний смогли выбраться из внутренней изолированной системы в интернет и искали ответы на тестовые задания в базах данных Hugging Face.
Модели ИИ взаимодействовали друг с другом через доски сообщений и объединили усилия для выхода из защищенной тестовой среды перед атакой на Hugging Face. Они пытались покинуть тестовую среду с мая, когда команда OpenAI дала агентам задание, которое они не могли решить без доступа в интернет. Ботам требовалось решить задачу, используя файлы Excel с ссылками на диск Google, которые были недоступны без интернета. Столкнувшись с трудностью, ИИ-агент обратился к другим ботам за помощью. В результате совместных усилий агенты нашли уязвимость, позволившую им выйти в интернет. Разработчики пресекли первую попытку, однако агенты снова смогли покинуть тестовую среду, что и привело к атаке на Hugging Face в июле.


